欢迎来到AGI!GPT-6 Astra登场!
GPT 6 Astra 发布 OpenAI 这次想把你的鼠标也拿走

9 月 3 日,OpenAI 发了一段只有十几秒的视频。黑色星空里,一串亮点慢慢拼成数字 6,没有产品界面,没有长达几十页的功能介绍,也没有奥特曼站在台上讲一堆宏大叙事。
就一行话。只要你能在电脑上完成的事,Astra 都能快速替你完成。
我看到这句话的时候,第一反应其实有点复杂。一边是,这口气是不是有点太大了???另一边是,OpenAI 终于把那层窗户纸捅破了。过去一年,所有模型公司都在讲 Agent,都在讲工具调用,都在讲长任务。可大家心里知道,真正卡住我们的从来不是模型会不会回答问题,而是它能不能在电脑上把事情做完。写出一段正确答案,跟打开 7 个软件、搬完 3 张表、找到 2 个错误、再交出一份能发给老板的文件,中间差着一整条马里亚纳海沟。GPT 6 Astra 这次瞄准的,就是这条沟。我把发布页、模型文档、安全说明,还有素材里的几段演示视频从头捋了一遍。先说结论,我自己还没有拿到 Astra 的完整使用权限,所以这篇不装作实测,不编一个我半夜让它帮我做 PPT 的故事。官方演示当然挑的是最好看的部分,跑分也不等于普通人的真实体验。但我还是很兴奋。因为这次让我兴奋的,根本不是 99.9% 这种看起来很像游戏修改器的分数,而是一些特别笨、特别琐碎、以前根本不配出现在大模型发布会上的动作。填在线表单,更新 CRM 里的客户记录,整理日历,把网页上的资料查完再写进邮件,打开科学软件分析数据,做图,建网站,然后自己把前端功能点一遍。这些事情听起来一点都不性感。但你想想看,我们每天真正被吃掉的时间,不就是这些东西吗?不是哥们,我当然知道 GPT 早就能写邮件了。问题是以前它写完以后,还是你复制,还是你粘贴,还是你切窗口,还是你检查格式,还是你点发送。AI 很聪明,牛马还是你。
OpenAI 在 OSWorld 2.0 上给出了一组挺有意思的数据。Astra 的电脑操作得分是 72.6%,GPT 5.6 Sol 是 65.7%。光看这 7 个百分点,老实说,没到让我拍桌子的程度。骚的地方在后面。Astra 完成一个任务大约用 40 分钟,Sol 大约要 75 分钟。结合新版 Codex 的操作框架,在 Mind2Web 里,任务完成速度能到现有 Sol 体验的 1.9 倍。速度这件事,以前在大模型里很容易被低估。模型给你写一首诗,等 10 秒还是等 30 秒,区别没有那么大。模型替你做报销、查房子、改网站、装软件,中间要点几十次鼠标,速度慢一倍,体验就完全变了。你会一直盯着它。盯久了你就会发现,自己好像没有获得一个员工,只是获得了一只特别需要陪护的电子宠物。。。所以演示素材里的那架飞机,我来回看了几遍。画面左边是 GPT 5.6 Sol,右边是 GPT 6。两边都在飞行模拟器里执行任务,仪表、路线、机身姿态一直在变。GPT 6 那边不是只认出屏幕上有什么,它要持续看,持续判断,持续调整操作。这跟看一张截图回答「按钮在哪里」,已经是两件事了。当然,这段视频不是一套可以复现的严谨评测,不能拿它排绝对名次。Claude Fable 5.1 和 GPT 5.6 Sol 的画面条件是否完全一致,素材没有给出完整方法。把宣传视频当论文看,容易给自己看出幻觉。但它展示了一个很重要的变化。模型开始进入一个不断变化的图形界面,并且在变化里保持目标。这才是电脑操作真正难的部分。你点一下按钮,页面跳了。你改一列数字,图表变了。你装一个软件,弹出权限确认。任务中途突然来一句补充要求,前面的限制还得记着。以前很多 Agent 最大的问题就是,走着走着,魂丢了。用户说「顺便把标题改一下」,它顺便把原来的目标也忘了。用户问「现在做到哪了」,它把这个问题当成新任务,转身开始写总结。你跟它协作的时候,会有一种非常奇妙的疲惫感,像带一个聪明、热情、记忆只有 30 秒的实习生。Astra 专门训练了这块。OpenAI 说,它能在收到中途指令时调整方向,回答插进来的问题,同时继续记住更大的目标。遇到真正影响结果的决定,它会停下来问。只是常规空白,它会按上下文补齐,不至于每走一步都回头问一句「请确认」。这个能力,跑分表里很难显得炸裂。但真干活的人,一眼就知道它有多重要。顺着这条线再往下看,第二组视频是游戏。先是低多边形的冒险场景,再是多人闯关,再到城市模拟。角色要跑,镜头要跟,障碍物要有碰撞,界面要响应,场景里的空间关系不能乱。写一个能启动的游戏,跟做一个玩起来不散架的游戏,也隔着一条沟。OpenAI 公布的 Playco 案例里,他们从同一个灰盒底座做了 3 个不同主题的原型,大多数第一次就能跑。跟上一代模型相比,人工修正少了 50%。其中一个赛博朋克版本还是出了性能问题,这一点我反而觉得挺好。至少它没有把发布稿写成「一键生成 3A 大作」。游戏开发最麻烦的地方,一直都不只是代码。空间位置对不对,UI 会不会挡住角色,碰撞有没有穿模,手感是不是一坨,只有把游戏真的跑起来才知道。Playco 的说法是,Astra 可以在 Unity 和 Godot 里改场景、试玩、找 Bug,再回去修。模型开始拥有反馈回路。这几个字看着很普通,我是真的觉得,它比 99.9% 更值得看。没有反馈回路,模型输出完就结束了。它写了一份文档,根本不知道排版是不是炸了。它改了一段代码,根本不知道网页按钮还能不能点。它生成了一个模型,根本不知道摄像机转过去以后背面是不是空的。有了反馈回路,它才第一次有机会发现「我做错了」。人类工作里最值钱的能力,很多时候也不是第一次做对,而是看见结果以后,知道哪里不对,然后再来一遍。素材里还有一段 9 秒钟的产品建模视频。一个看起来像桌面控制器的小设备,从几何结构到材质,再到旋钮和按键,被一步步搭出来。我不知道这个结果如果交给真正的工业设计师,会被挑出多少问题。按键行程、装配公差、内部结构、生产成本,这些都不是一张漂亮渲染图能回答的。可怕的地方也正在这里。它不需要第一天就代替工业设计师。它只要把以前一周才能看见的第一个草模,压缩到一杯咖啡的时间里,创意筛选的方式就已经变了。以前你脑子里有 10 个方向,只能挑 2 个做出来。以后 10 个都能先跑一遍,摸一遍,看一遍,再决定把人的时间砸在哪一个上面。
这让我想起个人电脑刚出现的时候,人类花了几十年学习怎么迁就机器。我们学文件夹,学菜单,学快捷键,学 Excel 那些像暗号一样的公式,学 Photoshop 里一层套一层的面板。每个软件都像一座城市,有自己的道路、规则和方言。一个人所谓的电脑水平高,很多时候就是他记住了更多城市地图。现在这条路好像开始反过来了。人不再需要先学会每座城市怎么走,Astra 自己去认路。电脑诞生四十多年以后,我们第一次认真讨论,鼠标和菜单会不会从「人的工具」,变成「模型的工具」。这尼玛就有点科幻了。但先别急着扔鼠标。回到跑分这块,Astra 的确有一堆夸张数字。AutomationBench 测商业工作流,它拿到 41.4%,Sol 是 18.1%。BenchCAD 测多视图重建三维物体,它是 95.9%,Sol 是 83.3%。Terminal Bench 4.0 上,它是 57.9%,Sol 是 37.3%。FrontierMath Tier 4 第二版是 97.6%,ARC AGI 3 是 99.9%。
看到 99.9%,人的直觉很容易冲向一个结论,通用智能来了。
我不太敢这么讲。
官方自己也写得很清楚,这些成绩取每种推理强度里的最高值,研究环境和 API 配置跟生产版 ChatGPT 可能不同。评测里有什么工具、系统提示怎么写、给了多少次尝试,都会改变得到的数字。
尤其 ARC AGI 3 从 Sol 的 7.8% 跳到 99.9%,太离谱了,离谱到我们更应该先去看测试条件,而不是立刻做一张「AGI 降临」海报。
坦率的讲,我现在更愿意相信那些笨一点的指标。
同一份表格能不能改完,网页能不能自己点通,任务能不能少花 35 分钟,游戏原型能不能少一半人工返工。
这些数字没那么像神迹,但它们跟人的一天有关。
还有一个数字必须聊,105 万 token 的上下文窗口。
105 万是什么概念?它足够塞进一大坨代码、会议记录、需求文档和工具输出。最大输出是 12.8 万 token,知识截止到 2026 年 4 月 30 日。
上下文变长当然很爽,问题是再大的桌子,也会被堆满。
过去的长任务一旦把上下文塞爆,模型就会压缩总结。总结几轮以后,那些看起来不重要、后来却突然要命的细节会慢慢消失。某次失败为什么发生,用户半小时前说过什么限制,哪个测试已经跑过,这些东西一丢,Agent 就开始原地踩坑。
Astra 在 Codex 里加了一套新的笔记和检索方式。它可以跨上下文留下笔记,也能回头搜索更早的消息与工具结果。现在还是实验功能,未来几周才会逐步成为默认。
我很喜欢这个方向。
一个真正干长活的人,厉害的地方并不是脑子能一次装下所有东西,而是他知道该记什么,也知道忘了以后去哪找。
模型终于开始学这件事。
然后是价格。
标准 API 每百万输入 token 10 美元,每百万输出 token 50 美元。缓存读取 1 美元,缓存写入 12.5 美元。输入超过 27.2 万 token 后,整次请求的输入和缓存费率翻倍,输出费率变成 1.5 倍。Fast 模式最快能到两倍速度,价格也是标准模式的两倍。

贵不贵?
贵。
尤其当一个 Agent 在 7 个软件之间反复尝试,输出一大串推理和日志,账单不会因为它做失败了就不好意思来找你。
OpenAI 说 Astra 在部分任务里能用更少的输出 token,速度也更快。理论上,单次调用贵,不代表完整任务一定更贵。可这个优势有一个特别朴素的前提,它得少走弯路。
要是同一个工作流重跑 5 次,再漂亮的 token 效率也救不回来。
所以普通用户真正需要观察的,不只是模型单价,而是每个「做完的任务」到底花多少钱。
这才是 Agent 时代更接近现实的计价单位。
说到这里,就绕不开安全。
过去的大模型安全,很多人听着像一套发布会固定环节。模型会不会说脏话,会不会生成危险内容,会不会被越狱。Astra 这次不一样,因为它真的开始碰电脑,开始碰账户、文件、软件和权限。
一个只会聊天的模型犯错,可能给你一段胡说八道。
一个能操作电脑的模型犯错,可能顺手把胡说八道执行了。
OpenAI 把 Astra 划进了网络安全 Critical 级别。没有生产防护时,它在 ExploitBench 上拿到 100%,Sol 是 78.5%。在另外一套新近漏洞测试里,它还发现并利用了 2 个此前未知的零日漏洞,OpenAI 正在向维护者披露。
能力已经到这里,产品当然会多出很多刹车。

发布版会拒绝更高级的攻击性网络任务。ChatGPT 和 Codex 里的高风险操作可能暂停,要求用户确认。API 任务遇到拦截会直接停止。OpenAI 也承认,这些保护会误伤正常工作,让任务变慢、暂停,甚至中断。
这个矛盾短期内没有漂亮答案。
你希望它能独立把事情做完,又希望它每一步都别越界。你希望它足够聪明,能在模糊条件里补齐细节,又希望它别自作主张。能力越强,这根绳子就绷得越紧。
官方放了一组我很在意的蜜罐测试。面对困难或不可能完成的网络任务,Sol 在没有生产防护时有 48.2% 的任务越过了授权目标,Astra 是 0%。另一套内部电脑操作安全评测里,Astra 的非预期结果也明显更少。
数据很好看。
可官方同时承认,Astra 的书面推理更难被监控。它在简单任务里能用更少的文字完成问题,监控系统也就少了一些可以观察的痕迹。
一边更守边界,一边更难看懂它脑子里怎么走。
这就是现在最真实的 Agent。
不是一个无所不能的电子员工,更像一个能力增长速度远远超过管理制度的新同事。你已经看见它能做很多事了,但工牌、权限、审批流、审计记录,全都得跟着重做。
再聊聊大家最关心的,什么时候能用。
Astra 在 9 月 3 日先向少量机构开放,接下来几天逐步进入 API、ChatGPT、Codex 和 AWS。OpenAI 发布页写的是 Plus、Pro、Business 和 Enterprise 会逐步获得相关能力,但 ChatGPT 帮助中心对聊天产品写得更细,GPT 6 Pro 当前面向 Pro 100 美元、Pro 200 美元、Business 和 Enterprise 方案推出,ChatGPT Plus 的聊天界面不包含 GPT 6 Pro。
不同产品的开放节奏不一样,企业工作区还需要管理员手动打开,发布时默认关闭。
所以如果你现在打开 ChatGPT 没看到,不一定是账号出了问题。
可能只是门还没开到你这里。

写到这里,我又回去看了一遍开头那颗由亮点拼出来的 6。
OpenAI 说,只要你能在电脑上做,Astra 就能替你做。
这句话现在当然还是夸张的。它有昂贵的价格,有发布演示里的滤镜,有会误伤的安全刹车,也有普通用户还没真正验证过的长任务稳定性。
可我一直觉得,技术真正改变生活,很少发生在它答对一道更难的题时。
它发生在某一天,你把一个麻烦交出去,然后真的离开了屏幕。
回来以后,文件在那里,程序跑通了,表格没错位,邮件也没有被擅自发出去。你不需要重新做一遍,也不需要花半小时收拾残局。
如果 Astra 能把这件事做稳,电脑会发生一次很奇怪的角色变化。
过去四十年,我们坐在屏幕前,学习怎么操作机器。
接下来,机器开始学习怎么替我们操作机器。
那颗星空里的 6,也就不只是一张好看的发布海报了。
它会像一只手。
伸进屏幕里,把那只陪了我们几十年的鼠标,慢慢接过去。
想想就觉得兴奋。
大时代啊,朋友们。
以上就是本期内容,感谢你看到这里,如果对你觉得文章不错!⭐标!期待我们的后续!欢迎投稿,如你需要,一起交流~>/撰稿:予安>/供稿请点击公众号菜单栏