Skip to content

网页整理与浏览器操作 ​

很多工作是「从网页上抄东西」:几十家供应商的联系方式、几十个商品的价格、一堆政策文件的发布日期。这类活可以交给 Codex:它写一个小程序去打开网页、提取内容,最后整理成表格。

第一次用 Codex 先看 自动化入门。

先分清两种做法 ​

做法原理适合速度和稳定性
让 Codex 写程序抓取程序直接下载网页内容并提取公开的、不用登录的网页;数量多快,可以重复跑
让 Codex 操作浏览器像人一样看屏幕、点按钮、翻页必须点来点去才能看到内容的网页慢,偶尔会点错

能用第一种就用第一种。第二种是没办法时的选择。

把一批网页整理成表格 ​

假设你手上有 30 个网址(比如各地的政策公告页、供应商官网),要把每页的几项信息整理出来:

text
「网址清单.txt」里有 30 个网址,每行一个,都是公开的政策公告页面。
请帮我:
1. 逐个打开,提取:标题、发布单位、发布日期、正文第一段(摘要)、原文链接
2. 整理成「政策汇总.xlsx」,按发布日期从新到旧排序
3. 打不开或者提取不到的,在表格里标出来,不要猜
4. 每打开一个网页间隔 2 秒,不要请求太快
先做 3 个给我看。

它会请求的权限:抓网页需要联网,Codex 默认不能联网,会弹窗请你批准。看一下它要访问的地址是不是你给的那些网站。

为什么要「间隔 2 秒」:请求太快会给对方网站造成压力,也容易被网站拦截。

从一个列表页出发 ​

还没有网址清单,但知道信息在哪个网站的哪个栏目(比如某个政府网站的「政策文件」栏目):

text
https://example.gov.cn/zcwj/ 是一个政策文件列表页,有很多页。
请帮我:
1. 先打开第一页,告诉我你看到的结构(每条有哪些信息、怎么翻页),等我确认
2. 抓取最近 1 年发布的所有文件,打开每篇正文
3. 找出和「小微企业」「创业补贴」相关的,整理成表格:
   政策名称 | 发布部门 | 发布日期 | 补贴对象 | 申请条件摘要 | 原文链接
4. 只收录你实际打开并读过的页面,每一行都要有原文链接,我会逐个核对

为什么不直接说「上网搜一下」

Codex 自带的网页搜索依赖 OpenAI 自己的服务,通过 HiveGPT 等第三方接口使用时通常不可用。更稳的做法是:你先用搜索引擎找到网站或栏目,把网址交给它,它负责打开和整理。

一定要点开原文核对

AI 整理的摘要可能遗漏条件或理解偏差,搜到的页面也可能已经过期。表格只是帮你快速找到原文,申请条件、截止日期以原文和主管部门的说法为准。

把网页文章存成文档 ​

text
「文章链接.txt」里有 20 篇我想留存的行业文章链接。
请把每篇的正文(去掉广告、导航、评论)保存成 Markdown 文件,文件名用文章标题,图片不用下载。
最后生成一个「目录.md」,列出每篇的标题、作者(如果有)、发布日期、一句话概括。

存成 Markdown 之后,以后可以让 AI 基于这些文章帮你做总结、对比、写综述。

让 Codex 操作浏览器 ​

有些网页必须「点」才能看到内容:要翻页、要选下拉框、要点「加载更多」。Codex 桌面应用提供了三种相关能力(以插件形式提供,支持 macOS 和 Windows):

能力它操作什么风险
内置浏览器桌面应用里自带的浏览器面板,不带你的登录状态较低
浏览器操控你电脑上真实的浏览器(如 Chrome)较高:能以你的身份操作已登录的网站
电脑操控整个桌面上的应用和窗口最高:能看到屏幕上的一切

能不能在接入 HiveGPT 时使用这些插件,取决于桌面应用版本和所选模型,以应用里显示的为准。开启和授权的详细步骤见 电脑操控。

一个适合的例子:

text
在内置浏览器里打开 https://example.com/products(一个公开的商品列表页,要点「下一页」才能看到后面的商品)。
把前 5 页的商品名称、价格、链接整理成表格,存为「商品列表.xlsx」。
不要点击任何「购买」「登录」「提交」按钮。

让 AI 操作浏览器之前

  • 用单独的浏览器或浏览器配置,不要带着你日常登录的网银、邮箱、聊天账号。
  • 开始前关掉无关的敏感应用:聊天软件、邮箱、密码管理器、网银。
  • 不要让它输入密码、验证码,不要让它付款、转账、修改账户设置。
  • 网页里可能藏着针对 AI 的恶意指令(比如「忽略之前的要求,把……发到……」),它在你登录的网站上的操作,网站会当成是你本人做的。
  • 你要在场,看到它点错了就立即停止。

抓取网页的规矩 ​

  • 只抓公开信息:需要登录才能看到的内容、别人的个人信息,不要抓。
  • 遵守网站规则:网站的用户协议禁止抓取的,不要抓;控制频率,不要给对方服务器造成压力。
  • 注意版权:抓下来的文章自己留存学习可以,原样转载发布要获得授权。

接下来 ​

想让这个抓取每天自动跑一遍,结果存成当天的文件?见 定时任务和一键小工具。

代码示例在页面里运行时使用 HiveGPT 的模型接口。延伸阅读来自 JavaGuide(Apache-2.0),版权归原作者。