网页整理与浏览器操作
很多工作是「从网页上抄东西」:几十家供应商的联系方式、几十个商品的价格、一堆政策文件的发布日期。这类活可以交给 Codex:它写一个小程序去打开网页、提取内容,最后整理成表格。
第一次用 Codex 先看 自动化入门。
先分清两种做法
| 做法 | 原理 | 适合 | 速度和稳定性 |
|---|---|---|---|
| 让 Codex 写程序抓取 | 程序直接下载网页内容并提取 | 公开的、不用登录的网页;数量多 | 快,可以重复跑 |
| 让 Codex 操作浏览器 | 像人一样看屏幕、点按钮、翻页 | 必须点来点去才能看到内容的网页 | 慢,偶尔会点错 |
能用第一种就用第一种。第二种是没办法时的选择。
把一批网页整理成表格
假设你手上有 30 个网址(比如各地的政策公告页、供应商官网),要把每页的几项信息整理出来:
text
「网址清单.txt」里有 30 个网址,每行一个,都是公开的政策公告页面。
请帮我:
1. 逐个打开,提取:标题、发布单位、发布日期、正文第一段(摘要)、原文链接
2. 整理成「政策汇总.xlsx」,按发布日期从新到旧排序
3. 打不开或者提取不到的,在表格里标出来,不要猜
4. 每打开一个网页间隔 2 秒,不要请求太快
先做 3 个给我看。它会请求的权限:抓网页需要联网,Codex 默认不能联网,会弹窗请你批准。看一下它要访问的地址是不是你给的那些网站。
为什么要「间隔 2 秒」:请求太快会给对方网站造成压力,也容易被网站拦截。
从一个列表页出发
还没有网址清单,但知道信息在哪个网站的哪个栏目(比如某个政府网站的「政策文件」栏目):
text
https://example.gov.cn/zcwj/ 是一个政策文件列表页,有很多页。
请帮我:
1. 先打开第一页,告诉我你看到的结构(每条有哪些信息、怎么翻页),等我确认
2. 抓取最近 1 年发布的所有文件,打开每篇正文
3. 找出和「小微企业」「创业补贴」相关的,整理成表格:
政策名称 | 发布部门 | 发布日期 | 补贴对象 | 申请条件摘要 | 原文链接
4. 只收录你实际打开并读过的页面,每一行都要有原文链接,我会逐个核对为什么不直接说「上网搜一下」
Codex 自带的网页搜索依赖 OpenAI 自己的服务,通过 HiveGPT 等第三方接口使用时通常不可用。更稳的做法是:你先用搜索引擎找到网站或栏目,把网址交给它,它负责打开和整理。
一定要点开原文核对
AI 整理的摘要可能遗漏条件或理解偏差,搜到的页面也可能已经过期。表格只是帮你快速找到原文,申请条件、截止日期以原文和主管部门的说法为准。
把网页文章存成文档
text
「文章链接.txt」里有 20 篇我想留存的行业文章链接。
请把每篇的正文(去掉广告、导航、评论)保存成 Markdown 文件,文件名用文章标题,图片不用下载。
最后生成一个「目录.md」,列出每篇的标题、作者(如果有)、发布日期、一句话概括。存成 Markdown 之后,以后可以让 AI 基于这些文章帮你做总结、对比、写综述。
让 Codex 操作浏览器
有些网页必须「点」才能看到内容:要翻页、要选下拉框、要点「加载更多」。Codex 桌面应用提供了三种相关能力(以插件形式提供,支持 macOS 和 Windows):
| 能力 | 它操作什么 | 风险 |
|---|---|---|
| 内置浏览器 | 桌面应用里自带的浏览器面板,不带你的登录状态 | 较低 |
| 浏览器操控 | 你电脑上真实的浏览器(如 Chrome) | 较高:能以你的身份操作已登录的网站 |
| 电脑操控 | 整个桌面上的应用和窗口 | 最高:能看到屏幕上的一切 |
能不能在接入 HiveGPT 时使用这些插件,取决于桌面应用版本和所选模型,以应用里显示的为准。开启和授权的详细步骤见 电脑操控。
一个适合的例子:
text
在内置浏览器里打开 https://example.com/products(一个公开的商品列表页,要点「下一页」才能看到后面的商品)。
把前 5 页的商品名称、价格、链接整理成表格,存为「商品列表.xlsx」。
不要点击任何「购买」「登录」「提交」按钮。让 AI 操作浏览器之前
- 用单独的浏览器或浏览器配置,不要带着你日常登录的网银、邮箱、聊天账号。
- 开始前关掉无关的敏感应用:聊天软件、邮箱、密码管理器、网银。
- 不要让它输入密码、验证码,不要让它付款、转账、修改账户设置。
- 网页里可能藏着针对 AI 的恶意指令(比如「忽略之前的要求,把……发到……」),它在你登录的网站上的操作,网站会当成是你本人做的。
- 你要在场,看到它点错了就立即停止。
抓取网页的规矩
- 只抓公开信息:需要登录才能看到的内容、别人的个人信息,不要抓。
- 遵守网站规则:网站的用户协议禁止抓取的,不要抓;控制频率,不要给对方服务器造成压力。
- 注意版权:抓下来的文章自己留存学习可以,原样转载发布要获得授权。
接下来
想让这个抓取每天自动跑一遍,结果存成当天的文件?见 定时任务和一键小工具。