让 AI 帮你填一张网页表单,以前常见的结果是一段文字:这里填什么,那里选什么。你再切回网页,一项项操作。
GPT-6 Astra 引人关注的一个方向,是把后面这段操作也交给 AI。借助 Computer Use,它可以查看界面、点击按钮、输入内容,再检查页面发生了什么变化。OpenAI 的桌面端文档已经将这类能力用于 ChatGPT Work 和 Codex,并推荐在复杂视觉任务中选择可用的 Astra。官方功能说明
对普通人来说,值得关注的是:交代完一件事后,究竟还有多少复制、切换和点击需要自己完成。
想体验这个变化,可以从一个有明确终点的小任务开始:把几张活动网页里的信息整理出来,再填进指定的表单草稿。
它怎么知道该点哪里
可以把一次界面操作理解成这样的过程:看到当前页面,决定下一步,执行点击或输入,再查看新页面。按钮没有生效、弹窗挡住了内容,下一步就需要根据新状态调整。
OpenAI 的 Computer Use 开发文档描述了这种“观察、行动、再次观察”的循环。模型提出动作,工具环境执行,再把结果交回模型。来源:Computer use 开发文档
这也解释了为什么任务通常需要时间。填完“城市”之后才出现“场馆”选项,就得等页面更新;表单提示格式错误,就得回来改。
评价这类 AI,要看最后留下了什么结果。鼠标动得热闹,只能说明它正在操作;信息是否完整、表单是否填对,还需要看交付。
用一次活动整理,体验“交代目标”怎么写
假设你正在给朋友整理周末活动。手头有三个活动详情页,需要记下名称、时间、地点、费用和报名截止时间,再填进自己的活动收集表。
这类练习有一个好处:原网页和表单字段都在眼前,结果很容易核对。它也比一句“帮我安排好周末”更清楚。
实际使用时,可以把下面的方括号替换成自己的链接和日期:
请使用浏览器,打开这三个活动详情页:[链接一]、[链接二]、[链接三]。整理适用于 [具体日期] 的活动名称、开始时间、地点、费用和报名截止时间,每条信息保留来源链接。页面没写的字段标记“未找到”。
把结果填入 [我的活动收集表链接],保持为尚未提交的草稿。完成后逐项核对,并告诉我哪些信息还缺失。停在提交前,让我检查。
这里写了四件事:去哪里找、找哪些信息、填到哪里、在哪里停。以后换成课程、展览、会议报名,仍然可以用这个结构。
如果还没有合适的表单,先让 AI 在对话里给出整理表格即可。第一次不必把任务拉得很长。
能操作浏览器,和能操作整台电脑有什么区别
网页任务可以从应用内置浏览器开始。它能打开网站、操作页面,并让你一起查看结果。需要使用平时已经登录的浏览器标签页时,再考虑连接对应的浏览器扩展。
内置浏览器有自己的登录环境,不会自动继承日常浏览器里的账号状态。所以“我明明已经登录了,它为什么还看到登录页”可能只是用的浏览器不同。来源:官方 Browser 文档
操作本地桌面软件,则涉及 Computer Use 插件、操作系统权限和允许访问的应用。这也是“在网页里填资料”和“打开电脑上的某个软件”需要分别交代的原因。
| 任务在哪发生 | 开始时怎么说 |
|---|
| 一个公开网页 | “用内置浏览器打开这个链接……” |
| 平时浏览器里的已登录页面 | “使用已连接的浏览器,打开这个标签页……” |
| 本地桌面软件 | “使用 Computer Use,在这个应用窗口中……” |
如果相应软件有专用插件,也可以让 AI 使用插件完成适合的操作。没有必要为了看它点鼠标,要求每项工作都通过界面完成。
普通用户从哪里开始
根据截至 2026 年 9 月 7 日的官方说明,在支持的地区,可从 ChatGPT 桌面应用的 Work 或 Codex 进入,安装并启用 Computer Use 插件;在设置中确认允许使用的应用。macOS 还需按提示授予屏幕录制和辅助功能权限。设置说明
接着看模型列表中是否已有 GPT-6 Astra,再交代一个目标明确的小任务。有关 Astra 的模型说明可查看 官方模型页。
建议第一条要求先写成:“打开指定页面,告诉我你看到了哪些需要填写的字段。”确认它进入了正确位置,再让它继续填写。
这样遇到问题时,也容易区分到底卡在哪里:是没看到应用入口、没有获得操作权限,还是任务本身没有说清楚。
刚接触这类工作方式,可以先看 Codex 使用指南。需要订阅方案时再查看 PayForChat 套餐页,价格以页面实时信息为准。PayForChat 是独立第三方订阅服务,具体模型和功能是否可用,应以 OpenAI 及目标账号显示为准。
别只说“帮我弄好”,把结束条件写进去
任务越具体,越容易让 AI 把工作停在你想要的位置。
“帮我看看这些活动”没有说明要比较什么;“填到表单里”也没说明是否可以提交。可以这样改:
| 容易含糊的要求 | 更容易执行和检查的要求 |
|---|
| “找几个适合周末的活动” | “只比较这三个链接,筛选周六下午开始的活动,列出费用和地点” |
| “把信息填进去” | “填写名称、时间、地点三项,其余空着,停在提交前” |
| “帮我整理一下结果” | “每个活动一行,每个字段保留对应来源,缺失信息单列” |
| “再检查一遍” | “按原网页逐项核对日期、费用和地点,列出不一致的地方” |
不用告诉它每一次点击,但要告诉它什么样的结果才算完成。
还可以加上任务中最重要的例外。例如:“付费活动单独列出”“日期写的是往年就跳过”“需要登录时停下来”。这些说明直接影响结果,比在提示词开头写一大段角色设定更有用。
AI 干活的时候,我能继续用电脑吗
这取决于使用的操作方式和系统。
官方说明中,Windows 的桌面 Computer Use 会使用当前桌面的鼠标和键盘。它操作期间,同一桌面不适合再由你同时输入。需要接手时先停止任务。macOS 支持部分后台操作场景,具体仍要看当前任务和设置。来源:系统行为说明
因此,第一次体验可以留一小段专门的时间,看完它怎样完成一个任务,再决定要不要把更长的流程交出去。
如果正在操作已登录的网站,还应把“提交”“购买”“删除”等动作写进结束条件。以活动收集为例,“填好草稿,等我检查”已经能省掉录入步骤,最后一次提交留给自己就很清楚。
怎么判断这次真的帮上忙了
回到活动整理任务,验收可以很简单。
先打开最终表格或草稿,确认三个活动有没有遗漏。再抽查日期、地点和费用能否对应原网页。最后看缺失信息有没有被老实标出来,是否按要求停在提交之前。
如果这些都完成了,下次就可以沿用这条要求,替换链接和日期。碰到新情况,再补一条规则。
如果表格看起来很齐,但日期抄错、链接打不开,或者表单内容根本没保存,就需要返工。可以直接指出差异:
第二个活动的时间与原网页不一致。请重新打开来源,核对日期和开始时间,只修正这一项,再检查表单里对应字段是否已经更新。
真正省下来的工作,是搜集、录入、核对这些步骤的总和。一件平时自己几十秒就能完成的小事,不一定值得专门交给 AI;那些需要来回切页面、重复搬运信息的任务,更适合拿来比较。
常见问题
Q: GPT-6 控制电脑,是在普通聊天框里就能直接用吗?
A: 能否操作取决于当前产品入口和工具权限。网页操作可使用相应浏览器能力;本地桌面软件操作需要支持的桌面环境及 Computer Use 设置。单纯选择模型,不等于已连接电脑上的所有应用。
Q: 必须懂代码才能用吗?
A: 日常界面任务可以用自然语言交代。更重要的是给出目标页面、需要处理的内容和结束条件,以及能够核对的结果。
Q: 为什么它看不到我已经登录的网站?
A: 先检查是否使用了内置浏览器。它与日常浏览器的登录环境分开;可以在任务使用的浏览器中登录,或使用支持的浏览器扩展连接现有标签页。
Q: 能让它在 Windows 后台干活,我同时做别的事吗?
A: 当前 Windows 桌面 Computer Use 使用活动桌面的输入,不能按互不干扰的后台操作来安排。同一桌面需要人工接手时,先停止 AI 的操作。
Q: 第一次适合交给它什么任务?
A: 选择页面明确、结果容易核对的小任务,例如从指定活动页提取时间和地点,或者把已有信息填写到尚未提交的表单。跑通后再逐步增加步骤。
延伸阅读
参考来源
更新记录
2026-09-07:依据官方文档整理桌面及浏览器操作入口,补充活动信息整理提示词、结束条件和结果检查方法;明确 Windows 前台操作限制。