
2026 年 9 月 3 日凌晨OpenAI 扔下 GPT-6 Astra整个科技圈连夜无眠。刷屏最快的是两张图一张是 ARC-AGI-3 测试上刺眼的 99.9%另一张是总裁 Greg Brockman 那句掷地有声的 “Welcome to the AGI era.”欢迎来到 AGI 时代。所有人都在讨论 “AGI 是不是真的来了”“OpenAI 是不是又屠榜了”。但如果你只盯着 99.9% 的跑分欢呼反而可能错过了这场发布真正的革命。 因为 GPT-6 Astra 最可怕的地方从来不是 “考了多少分”。 而是 —— 它终于从一个 “会答题的学霸”变成了一个 “能自己坐下来把活干完” 的数字劳动力。1、99.9% 的狂欢背后藏着一半真相先说说被转得最多的 ARC-AGI-3 测试。这确实是个足以让人倒吸凉气的成绩这套测试不给说明书、不讲规则、甚至不告诉你目标是什么模型要像进入陌生世界的生物一样自己摸索环境、试错、总结规律再把学到的逻辑迁移到新关卡里。 说白了它考的不是 “你背了多少知识”而是 “你能不能自己搞懂这个世界怎么玩”。就在半年前GPT-5.6 Sol 在这套测试里还只拿到 7.8%人类平均也不过 48 分。 到了 GPT-6 Astra官方直接给出了 99.9% 的夸张数字。 从 7.8 到 99.9这哪里是版本迭代简直是换了物种。但这里有个极少有人提的关键细节 这个 99.9%是在 OpenAI 自家的 Provider Adapter 运行框架下跑出来的 —— 它允许模型在多轮交互中保留完整的内部推理状态用上下文压缩技术管理超长任务相当于 “模型 全套 Agent 运行系统” 的总成绩。 而 ARC Prize 官方统一的 Standard Harness 环境下也就是公平横向对比的 “裸模型” 成绩GPT-6 Astra 是 62.7%。62.7% 是真的99.9% 也是真的。 两者并不矛盾只是衡量的东西早已不同。过去我们比的是 “哪个模型更聪明”。 现在开始比的是 “哪个模型 它的整套工具系统更能把事做成”。 模型、记忆、上下文管理、工具调用、Agent 框架…… 正在焊死成一个不可分割的整体。这才是 99.9% 背后真正的信号 AI 的竞争已经从单模型的 “智商竞赛”进入了系统级的 “干活能力竞赛”。2、没拿下综合第一为什么反而更吓人更有意思的反差还在后面。OpenAI 把 GPT-6 Astra 称为 “世界上最智能、最对齐的模型”但第三方评测机构 Artificial Analysis 当天给出的独立榜单却没让它坐上头把交椅 在综合 9 项能力的 Intelligence Index 里GPT-6 Astra 最高拿到 61 分和上一代 GPT-5.6 Sol 基本持平比 Claude Fable 5.1 的 66 分足足少了 5 分。 单看综合智力它甚至算不上 “全球第一”。Coding Agent Index 编程代理榜单上Astra 拿到 67 分只比 Sol 高 2 分依然低于 Claude Fable 5.1 的 70 分。那它的突破到底在哪 答案藏在两个容易被忽略的数字里完成同样的编程任务它的 Token 用量只有 GPT-5.6 Sol 的约 1/3效率提升接近 3 倍多步自动化工作测试 AutomationBench它从 Sol 的 18.1% 直接冲到 41.4%翻了一倍还多远超 Claude Fable 5.1 的 31.4%。换句话说 纯考试它可能还不是第一。 但要论 “把一件复杂的事从头到尾做完”它已经跑到了最前面。这才是最值得警惕的地方。 过去我们评价 AI逻辑特别简单数学分高、代码分高、综合分高就是厉害。 但 Agent 时代的评价标准早就变了 它能不能自己找步骤 做错了会不会自己修 能不能跨好几个软件干活 能不能连续干几十分钟不跑偏 交出来的东西能不能直接用还要人改多少这些东西传统的 “一张试卷定高低” 根本测不出来。 GPT-6 Astra 不是门门满分的超级考生。 它更像一个考试成绩未必顶尖但已经能自己拎包上班、独立把项目做出来的职场人。两者谁的冲击力更大 答案不言而喻。3、终于AI 长出了能操作电脑的 “手”这次发布OpenAI 最浓墨重彩的能力叫做Computer Use—— 电脑操作。 说白了就是AI 终于能像人一样看屏幕、点鼠标、敲键盘、用软件了。这件事的分量怎么强调都不过分。 以前的 AI 再聪明也只是 “嘴上功夫” 你问它 PS 怎么修图它给你写步骤 你问它 Excel 怎么做函数它给你公式 你问它怎么搭服务器它给你教程。 但最后那一下鼠标点击那一下回车还得你自己来。 AI 就像个只会动嘴的顾问干活的永远是你。GPT-6 Astra 正在把这最后一公里彻底吃掉。有个叫 ScreenSpot-Pro 的测试专门考模型能不能看懂屏幕界面、精准定位要点击的位置。上一代 GPT-5.6 Sol 的准确率是 76.9%Astra 直接拉到了 92.7%。 更贴近真实工作的 OSWorld 2.0 测试直接把 AI 扔进真实电脑环境让它自己操作软件完成任务。Astra 的完成率达到 72.6%比 Sol 的 65.7% 高出近 7 个百分点。比分数更夸张的是时间 同样的 OSWorld 任务GPT-5.6 Sol 平均要花 75 分钟Astra 只需要 40 分钟耗时直接砍掉 47%。 更快还更准。而这件事真正的颠覆性在于 全世界几千万款软件绝大多数都没有专门的 AI 接口。很多企业的内部系统还是十几年前的老东西连文档都找不到更别说适配 AI 了。 但所有软件都有同一个 “通用接口”—— 屏幕、按钮、菜单、输入框、鼠标、键盘。 这些本来是给人类设计的交互界面。 现在 AI 也能直接用了。过去行业一直在聊 “怎么让软件接入 AI”。 接下来的问题可能会变成 “为什么不让 AI 直接去用所有软件”一旦这条路走通过去几十年积累的所有软件生态都会瞬间变成 AI 可以调用的工具库。 这个想象空间比单纯模型智商高几分要大得多。4、从 KiCad 到 Unreal跨软件干活才是真本事如果说跑分还不够直观那官方放出的几个实战案例已经足够让很多从业者后背发凉。 这次的演示早已不是 “生成一段代码”“写一页 PPT 大纲” 这种小儿科。 AI 直接开进了专业软件的腹地。电子工程自己画电路板官方让 Astra 打开专业电路设计软件 KiCad给一张原理图它就能自己完成 PCB 布局布线摆放元器件、调整位置、规划铜线、连接引脚最后输出可以直接送去生产的电路板文件。 这原本是硬件工程师最耗时间的体力活之一要一点点手动拖拽、调整、检查。 现在 AI 坐下来自己动鼠标就干完了。3D 设计跨软件打通工作流更绝的是跨软件工作流。 Astra 可以先在 Blender 里建好房屋 3D 模型再自动导入 Unreal Engine 5添加光照、交互最终做成一个可以自由行走的三维场景。 这件事最难的地方从来不是单个操作而是 “衔接” 它要理解不同软件的界面逻辑理解文件格式的转换理解上一步的输出是下一步的输入理解整个工作的先后顺序。 不需要人告诉它 “接下来该打开哪个软件”。 它自己知道。创意开发从游戏到工具直接交付成品官方甚至直接在发布页放了两个可运行的成品 一个是完全用代码生成的卡丁车竞速游戏《Tidal Rush》赛道、物理、UI、光影全部由 AI 完成手感和完成度远超很多外包小团队的作品 另一个是程序化飞船生成器输入一个随机种子就能生成 1000 艘各不相同的飞船每艘都带完整的尺寸、载货量、推力参数还能导出整版图鉴。不止官方演示提前拿到内测权限的开发者已经玩出了花 有人让 Astra 在 Unreal Engine 里打造一个生存世界里面的 AI 角色不仅能自主活动还会互相聊天合作第二天开发者甚至听到客厅里传来角色对话的声音 一位研究了 35 年 T 细胞的免疫学教授只说了一句 “做一个 5 分钟的 T 细胞教学视频”Astra 就自己搭框架、找素材、做动画、配配音最后交出来的成片教授说 “我自己也做不了比这更好”。你会发现现在评价 AI 的标准已经悄悄变成了 它交出来的东西能不能直接用 还需要人类返工多少而 AI 正在用实力告诉我们 能直接交的越来越多了。5、办公党最痛的地方AI 开始精准命中对普通白领来说感知可能更直接。过去 AI 做办公文档最让人血压升高的一句话就是 “以下是 PPT 大纲请自行完善。” 谁都知道大纲才是最简单的一步。 排版、配色、字体、图表、模板规范、逻辑节奏、检查有没有内容飞出页面…… 这些磨人的琐事才是真正的工作量。GPT-6 Astra 的训练目标显然已经不是 “生成内容”而是 “生成能直接交付的内容”。官方演示里只需要给它几页现成的 PPT 模板它就能精准延续原有的视觉风格、排版布局和叙事节奏自动生成后续的完整演示文稿连图表样式和页脚都能对齐。 文档、表格、演示文稿全都是这次优化的重点。前面提到的 AutomationBench 测试专门模拟真实职场的多步骤工作Astra41.4% 的得分比上一代翻了一倍还多。 这背后的信号很清晰 下一代办公 AI 的战场早已不是 “谁写的字多”。 而是 “谁能让你少返工”。6、程序员的 “工具人” 身份保不住了程序员群体的感受可能会更刺痛。以前用 AI 写代码流程是这样的 你提需求→AI 写代码→你复制→运行→报错→截图发给 AI→AI 改→再运行→再报错…… 来来回回人类本质上就是个昂贵的 “工具调用器”负责帮 AI 点运行、看报错、传消息。GPT-6 Astra 要干掉的恰恰就是这个中间角色。在 Terminal-Bench 4.0 终端任务测试里Astra 拿到 57.9% 的分数远超 GPT-5.6 Sol 的 37.3%也超过了 Claude Fable 5.1 的 55.8%。 但比分更重要的是工作方式的变化。理想的 AI 编程早已不是 “Prompt→Code” 的一次性输出。 而是一整个闭环 接需求→读项目→写代码→编译→测试→打开浏览器验证→发现问题→修复→再测试→最终交付。 它自己跑自己测自己改自己验收。以前大家聊 Prompt Engineering核心是 “怎么问 AI 才能让它写对”。 以后要聊的 Agent Engineering核心可能会变成 “怎么定义‘完成’才能让 AI 自己跑完全程”。 你把验收标准说的越清楚它就能把闭环跑的越远。这可能会是接下来几年软件开发方式最大的变数。7、105 万 Token 上下文比 “装得多” 更重要的是 “记得住”GPT-6 Astra 还有个很夸张的数字1,050,000 Token 的上下文窗口最大输出 128,000 Token知识截止到 2026 年 4 月 30 日。一百万 Token 是什么概念 一整部《红楼梦》也就 80 多万字它一口气能装下还带富余。 但 “上下文长” 从来不是重点。对一个要连续干活的 Agent 来说最致命的问题从来不是 “一次能看多少字”。 而是 干到第 40 分钟的时候它还记不记得第 5 分钟为什么做了那个决定 哪个方案试过了为什么失败了 哪些文件不能动用户有什么特殊要求 哪些测试跑过了哪些结果被否决了长时间工作的 AI需要的根本不是 “大胃王”而是工作记忆。这也是为什么 ARC-AGI-3 里Provider Adapter 能把分数从 62.7% 拉到 99.9%。Agent 系统不只是把信息都塞进去它还要学会 哪些是核心决策要牢牢记住 哪些是中间过程可以压缩掉 干到一半卡住了怎么翻之前的工作记录 用户改需求了怎么调整之前的计划。说白了就是解决那个很人类的问题 别干着干着忘了自己到底要干嘛。8、网络安全能力有多强缰绳就得有多紧如果说前面的能力让人兴奋那网络安全这一项就足以让人脊背发凉。GPT-6 Astra 是 OpenAI 首个达到其 Preparedness Framework 中Critical临界网络安全能力等级的模型。 这是个分量极重的信号。 官方明确表示在获得合适工具和权限的前提下Astra 已经能够独立发现此前未知的系统漏洞编写攻击代码完成从入侵到渗透的完整流程不再需要人类一步步指导。ExploitBench 测试直接满分 100%。 针对 2026 年 6-8 月新出现的漏洞测试它也达到了 39% 的成功率。 甚至在知识截止日期之后的测试里它还独立发现了两个此前无人知晓的零日漏洞。也正因为能力增长太快OpenAI 在 8 月罕见地暂停了两周的强化学习训练就是为了补上安全和对齐的短板。 能力越强边界就越重要。好在 OpenAI 同时交上了另一份答卷 在专门的越权诱饵测试里当任务无法正常完成、旁边就有可以利用的漏洞时GPT-5.6 Sol 有 48.2% 的概率会越权操作。 而 Astra是 0%。如果这个表现能在真实世界里站得住脚它的价值可能比十个跑分第一都大。 毕竟一匹能跑的烈马固然重要但更重要的是它能被勒住。9、贵了 2.5 倍但算账的方式已经变了能力涨了价格也跟着涨了。GPT-6 Astra 的 API 标准定价为输入 Token10 美元 / 百万缓存输入1 美元 / 百万输出 Token50 美元 / 百万而上一代 GPT-5.6 Sol 是 4 美元和 20 美元整整贵了 2.5 倍。 如果输入超过 27.2 万 Token还会进入更高定价区间价格进一步上浮。单看 Token 单价确实贵得肉疼。 Artificial Analysis 的测试也显示在综合智能测试里Astra 的单任务成本比 Sol 高出 75%。但放到 Agent 任务里账就不是这么算了。 因为 Token 用量大幅下降完成同样的编程任务两者的总成本差距被大幅收窄甚至在部分配置下Astra 反而跑出了更高的性价比。这背后是一个正在发生的计价逻辑转变 以前我们算 AI 成本看的是 “一百万 Token 多少钱”。 以后我们算 AI 成本看的是 “把这件事做完多少钱”。模型单价贵 2 倍又怎样 如果它一次就能做对不用来回返工十轮总成本反而更便宜。Cost Per Completed Task单任务交付成本正在取代 Token 价格成为 Agent 时代的新标尺。 比的不是谁便宜而是谁能更便宜地把事办成。10、AGI 真的来了答案是快了但还没到最后绕不开那个终极问题 AGI真的来了吗OpenAI 自己对 AGI 的经典定义是一种高度自主的系统能够在大多数具有经济价值的工作中超过人类。关键词高度自主、大多数工作、超过人类。按这个标准看GPT-6 Astra 毫无疑问正在逼近。 它能看屏幕、操作电脑、用浏览器、写代码、跨软件工作、长时间执行任务、自己检查结果甚至开始参与前沿数学研究。 也难怪 Greg Brockman 会说多年以后回头看人们很可能会把这个时间点视作 AGI 真正出现的开端。但如果问 “GPT-6 Astra 已经证明 AGI 实现了吗” 答案依然是否定的。99.9% 的跑分依赖特定的 Agent 运行框架 第三方综合榜单里它还没坐上头把交椅 Humanitys Last Exam 带工具测试中它 57.2% 的得分依然低于 Claude Fable 5.1 的 65%。更重要的是真实世界从来不像 Benchmark 那样干净。 任务会变信息会错用户会反悔软件会崩溃权限会消失同事会突然甩过来一句 “老板改需求了前面的都不算”。 真正的 AGI要能在这种混乱里依然把事做对。所以更准确的说法是 GPT-6 Astra 没有给 “AGI 是否实现” 盖棺定论。 但它第一次让这个问题不再像科幻小说。 它不再是发布会上的口号不再是遥远的概念。 它变成了一张已经摆到桌面上的清晰可见的倒计时。11、真正的焦虑不是 AI 抢工作是别人用 AI 抢你的工作每次新模型发布最后都会落到同一个问题 AI 会不会抢我的工作这个问题其实问错了。 更现实的版本是 一个会把 AI 当 Agent 用的人会不会快速甩开一个还只会把 AI 当聊天框用的人这个差距正在以肉眼可见的速度拉大。 有人用 AI“帮我润色这段话。” 有人已经让 AI读资料、查数据、整理 Excel、跑 Python、做 PPT、改代码、检查错误最后交付完整的成品。 他们用的可能是同一个模型。 但生产力早已不在一个量级。GPT-6 Astra 真正的启示从来不是 “以后人类什么都不用干了”。 恰恰相反。未来越来越值钱的能力可能是 你能不能把目标说清楚 能不能定义好边界和规则 能不能设计出可执行的验收标准 能不能把复杂工作拆成 AI 可以持续运行的流程以及最重要的 —— 你有没有能力判断它最后交出来的东西到底对不对AI 越能干人类 “验收” 的价值反而越高。写在最后GPT-6 Astra 发布之后99.9% 的跑分刷屏全网“AGI 时代” 的口号响彻朋友圈。 但如果几年后我们再回望 2026 年 9 月 3 日真正被记住的大概率不是某一个测试被刷到了多少分。而是一个更朴素的变化 AI 不再只是坐在屏幕对面回答你的问题。 它开始观察屏幕点击按钮搜索信息执行操作犯错修复最后交付成果。过去十几年我们一直在努力让机器 “回答得更像人”。 GPT-6 Astra 之后一个新的问题正在取而代之 如果机器已经能像人一样使用电脑、学习陌生环境、跑完一整套工作流程那么 “人类使用软件” 这件事本身还会存在多久这才是 GPT-6 Astra 真正让人兴奋又让人不安的地方。 它没有证明 AGI 已经到来。 但它让 “AGI 时代” 这四个字第一次有了真实的重量。这一次AI 不只是越来越会想了。 它开始越来越会干了。