Agent 与 ChatGPT 网页端之间的自动化循环,无需人工执行

分享一套让所有 Agent 免费「调用」5.6 Sol 的省额度方法,适合拥有自己的付费 ChatGPT 账户的朋友。

我们知道 ChatGPT 网页端进行对话时,是不消耗 Codex 的额度的。我们经常在网页上让 ChatGPT 去帮我们做网络检索、深度思考等工作,然后可能把它给出的方案再转发给 Agent。其实这么一套机械的操作是完全可以自动化的

如果使用同一个 ChatGPT 网页端账号和 Codex 账号,那你可以直接在 Codex 里面 @ 聊天 来实现上下文的快速转移。但很可惜,我自己使用的 Codex 并不是网页端的账号,网页端只是一个 Team 账号。我在想,在这样的情况下,有没有什么办法可以快速地实现上面的要求呢?

于是,我找到了 Oracle 这个项目。

在古希腊罗马,oracle 指传达神谕的场所或人物。人类无法掌握的信息,通过它获得答案。

它可以用浏览器自动化的方式,帮我们在网页端问 ChatGPT,然后返回结构化的回复。支持把本地的代码、截图等文件作为「附件」上传,选择模型和思考程度(没错,如果你比较壕,也可以直接选择问 5.6 Pro)。

安装这个项目的 CLI,然后再搭配 Skill,我们就可以教会任何Agent 如何把 5.6 Sol 这个高级模型作为一个工具来进行调用,还能让它获得你的上下文和联网等各类外部信息。

配置方式

注:此类自动化操作可能导致潜在的账号封禁。如果您特别担心这类风险,不建议这样操作。

如果你使用 MacOS,可以用下面的命令一键安装:

1
brew install steipete/tap/oracle

也可通过 NPM 安装(通用):

1
npm install -g @steipete/oracle

让你的 Agent 阅读 https://github.com/steipete/oracle 安装配套的 Skill。

接下来你可以根据自己的偏好,在官方的 Skill 基础上做一些修改。下面是我使用的方式:

首先需要一个 Chrome 浏览器,并在上面登录你的 ChatGPT 账号。

两种对话保存方式

由于是在网页端模拟进行对话,因此我推荐下面两种对话的保存方式。一种是使用 Temporary Chat 模式,这样的话每次都会开一个临时的对话,优点是完全不干扰你的使用,阅后即焚,缺点是无法找回对话,也无法接着对话继续说。

另外一种是专门创建一个 Project 给 Agent 使用,也是我推荐的方式。在你的 ChatGPT 中创建一个独立的 Project 专门给它使用,把这个 Project 的链接(类似 https://chatgpt.com/g/id/project)告诉你的 Agent。这样既把 Agent 发起的提问集中起来,同时需要的时候也可以自己点开查看。

为 Agent 专用的 ChatGPT Project(Oracle Chat)

配置 config.json

接下来让 Agent 配置 ~/.oracle/config.json。下面是我的配置去掉了个人信息后的通用版,可以直接参考:

1
2
3
4
5
6
7
8
9
10
11
{
"engine": "browser",
"model": "gpt-5.6-sol",
"browser": {
"chromePath": "/path/to/oracle-chrome",
"chatgptUrl": "https://chatgpt.com/g/<你的ProjectID>/project",
"thinkingTime": "extra-high",
"archiveConversations": "never",
"hideWindow": true
}
}

几个可选项的说明:

  • chatgptUrl:如果是 Temporary Chat 模式,改成 https://chatgpt.com/?temporary-chat=true
  • chromePath:指向 wrapper,注入 --proxy-server=,适合需要通过代理访问的朋友。
  • hideWindow: true:Oracle 启动 Chrome 后窗口自动隐藏,不干扰你的工作。
  • archiveConversations: "never":不归档对话,避免 Project 里堆积无关会话。

国内用户没有全局代理怎么办?

如果你的网络访问不了 ChatGPT(比如国内用户没有开全局代理),也不用放弃这套方案。思路是写一个 Chrome wrapper 脚本,让 Oracle 启动 Chrome 时自动注入本地代理。

我的 ~/.oracle/oracle-chrome 脚本大概做这几件事:先把 Oracle 传来的 --proxy-server 参数过滤掉(避免和我们要注入的重复),再在启动参数里自动加上 --proxy-server=http://127.0.0.1:7890,最后用 exec 拉起真正的 Chrome。

然后在 config.json 里把 chromePath 指向这个脚本,而不是 Chrome 本体:

1
2
3
4
5
{
"browser": {
"chromePath": "/Users/你的用户名/.oracle/oracle-chrome"
}
}

这样 Oracle 每次拉起 Chrome 都会自动带上本地代理,ChatGPT 网页端就能正常访问了,无需手动开启全局代理。

接着让 Agent 在 Skill 里补充超时,我这边设置的是 20 分钟,对绝大多数任务应该够了。

最后可以让 Agent 实测一下是否 Work。可以的话就完美地接入你的工作流啦~

实测效果

下面是我的一个例子,我在 Oh My Pi 中使用 Deepseek V4 Flash 这样的廉价模型,实测可以让它求助外部的 GPT 5.6 Sol 大人,用时 5 分钟左右。

Oh My Pi 中 Deepseek V4 Flash 驱动外部 GPT 5.6 Sol 的实测

至此,我们实际上实现了外部高性能模型指导、廉价模型驱动的工作流闭环。搭建好 Skill 和 CLI 之后,完全不需要人类再当内容的搬运工。在 Agent 的时代,我们就是要用这样的思路来尽可能把人类的注意力资源从这类繁琐、重复的搬运工作中解放出来,转而投向其他更有价值的事情。