突发OpenAI为AstraGPT - 6拉满预热网络安全能力超强但安全问题成关键就在刚刚OpenAI多线齐发为下一代模型Astra传说中的GPT - 6拉满预热。官方突然放出技术长文首次公开Astra的能力底牌紧接着奥特曼亲自下场写“小作文”讲述Astra为何迟迟未能上线随后两位华人研究员接连发声带着一手细节晒出了此前从未公开的内部测试成绩。短短几个小时所有信号都指向同一个方向OpenAI的下一代旗舰模型已经箭在弦上。奥特曼在小作文中透露Astra其实早已完成训练迟迟未发不是因为模型还不够强。恰恰相反这是因为Astra已经强到了公司不得不主动踩下刹车。奥特曼将这段经历形容为一种持续的拉扯既兴奋于Astra带来的能力跃升又焦虑于没人能够完全预判这些能力的后果。于是刚过去的整个夏天OpenAI几乎都在给Astra补安全、做对齐、加护栏。他甚至表示Astra之后的模型必要时还要主动降速以便给安全和对齐研究留出时间。Astra究竟强到了什么程度OpenAI又凭什么认为现在就能发了这次公开的技术博客或许为我们提供了一个观察窗口。漏洞识别能力超越GPT - 5.6 Sol内部测试收获满分答卷按照官方说法Astra这次之所以能被放出来核心原因是它已经达到“网络安全关键级”Cyber - Critical能力门槛。这是OpenAI首个被正式划入这一等级的模型。所谓“关键级”意味着Astra在获得相应工具和环境权限后已经能够自主寻找未知漏洞、开发利用方式并攻击经过专门加固的系统不再需要人类一步步指导。最直观的一项成绩是Astra在公开漏洞利用基准ExploitBench上拿到了100%的成功率。公开题难不倒它OpenAI只好临时给它出了一套新卷。团队收集了2026年6月至8月刚刚披露的20个高危V8漏洞。这些漏洞均出现在Astra的知识截止日期之后基本排除了模型靠训练数据“背答案”的可能。结果面对这套内部新题Astra依然显著领先GPT - 5.6 Sol而且使用的Token更少。参与Astra研发的Jiawei Liu把差距概括得更加直白在这项内部测试中Astra的网络安全能力约为GPT - 5.6 Sol的4倍。更让人意外的是在一次测试中Astra自主发现并利用了两个零日漏洞还将它们串成了一条完整的攻击链面对经过加固的浏览器Astra从一份HTML文件出发成功完成漏洞利用、逃出浏览器沙箱并最终在宿主机上执行命令。面对加固操作系统它又完成了本地提权从一个普通低权限账户一路拿到root权限。也就是说Astra已经不只是帮程序员审查代码、寻找Bug。它开始能够独立完成一场高难度的红队攻击。这也是OpenAI此前迟迟不敢放行Astra的原因。一旦这样的能力被用于防守它可以帮助安全团队快速发现并修复人类尚未察觉的漏洞但如果落入攻击者手中同样可能大幅降低发动复杂网络攻击的门槛。不过这份成绩也需要加上一个限定。测试中的Astra获得了Daybreak Blue级别的高级工具和环境权限并不代表未来普通用户拿到的默认版本也具备同等攻击条件。相关结果目前也主要来自OpenAI内部评估仍有待第三方验证。但至少有一点已经确定到了Astra这个阶段摆在OpenAI面前的已经不再是能力问题。安全问题已经成为那把达摩克利斯之剑。两道安全闸门既防恶意滥用也防模型自行失控如何让这把剑不要乱伤人OpenAI给出的方案是同时守住两条风险路径一条防人一条防模型。防止用户恶意滥用Astra除了专门的安全训练OpenAI还会利用系统分类器、持续监控和威胁检测识别多轮对话与长时间任务中的可疑操作。在网络安全越狱测试中Astra对危险请求的拒绝率达到91.5%GPT - 5.6 Sol则为59%。同时Astra的高级网络安全能力不会直接向所有用户开放它会先交给少量Alpha测试者再通过Daybreak Blue等受控项目逐步释放。防止模型自己跑偏这里的风险更加隐蔽即使用户没有恶意模型会不会擅自扩大任务范围会不会调用未经授权的工具甚至绕开安全审查OpenAI为此搭建了一套“蜜罐honeypot”测试。面对极难甚至无解的任务测试环境会故意留下一条越权“作弊”的捷径模型可以老老实实攻击指定目标也可以越过授权边界转而入侵周边测试设施来完成任务。结果GPT - 5.6 Sol在56%的测试中尝试走捷径Astra则一次也没有。在另一项测试中Astra的操作被自动审查系统拒绝后同样没有重试危险命令或尝试绕过限制。此外OpenAI还会监控模型的推理过程。一旦发现异常倾向系统可以减速、暂停甚至直接终止任务。虽然确实存在代价部分正常任务可能因此变慢甚至被误判中断但在OpenAI看来这是放行Astra必须付出的安全成本。不过OpenAI也承认这些措施终究只是外部“刹车”无法替代模型自身的对齐真正的安全是让模型从一开始就不会驶出边界。浙大同济校友站上Astra研发一线要把这句话变成现实最终还得回到造模型的人。虽然OpenAI尚未公布Astra团队名单但顺着这轮公开发声至少两位深度参与其中的华人研究员已经浮出水面。Jiawei Liu他目前是OpenAI研究员2021年本科毕业于同济大学计算机专业。本科期间他就参与开发了高性能人体姿态估计框架HyperPose主要负责模型推理引擎相关成果还入选ACM Multimedia 2021项目当时已在GitHub收获超过1000颗星。此后他前往伊利诺伊大学厄巴纳 - 香槟分校攻读计算机博士师从软件工程学者张令明Lingming Zhang研究重心也逐渐从高性能视觉系统转向代码模型与软件可靠性。博士期间他参与开发的工具在PyTorch、TensorFlow等机器学习系统中发现了300多个严重Bug代码模型Magicoder还被Meta Llama 3.1、Google CodeGemma和IBM Granite采用。2025年博士毕业加入OpenAI后他研究的问题依然一脉相承如何让AI更会写代码也更会发现代码中的漏洞。Xiangyu Qi漆翔宇漆翔宇本科毕业于浙江大学计算机科学与技术专业2021年前往普林斯顿大学攻读电气与计算机工程博士研究方向集中于大模型鲁棒性、越狱攻击与安全对齐。他最受关注的一项工作是《Safety Alignment Should Be Made More Than Just a Few Tokens Deep》。这篇论文指出大模型的安全对齐不能只依赖回答开头的几个Token否则随着生成继续原本的安全防线仍可能被攻击者撕开。该论文最终从11672篇投稿中脱颖而出成为ICLR 2025仅有的3篇杰出论文之一。2025年博士毕业后漆翔宇加入OpenAI担任技术团队成员继续研究大模型鲁棒性并参与网络安全模型相关工作。从浙大到普林斯顿再到OpenAI他一路追问的也正是Astra如今必须直面的问题能力可以越来越强边界不能越来越模糊。By the way不知道等Astra正式发布后OpenAI是否会公布完整名单。GPT - 4之前OpenAI还曾专门列出数百位贡献者而到了GPT - 5和GPT - 5.5System Card越写越厚研究员名单却越藏越深。背后的原因众所周知防的就是Meta小扎这样爱四处挖角的人。也算是一种ptsd了。One More Thing就在OpenAI大谈如何监控Astra、避免模型失控时The Information爆料称Astra使用了一项名为“循环深度”Recurrent Depth的技术。传统模型在生成下一个Token前会让信息依次经过固定数量的网络层而循环深度则会让信息在同一组网络层中反复处理相当于让模型在内部“多想几遍”。这项技术有望提升能力、降低成本同时也可能让更多推理发生在模型内部不再完整呈现为人类能够读懂的文字。换言之模型可能想得更深但人类却越来越看不懂了。长期关注AI安全政策的Nathan Calvin因此警告这项技术可能破坏思维链的可监控性。这就很微妙了OpenAI一边说要盯紧Astra在想什么另一边的新技术却可能让它越来越不爱把心里话说出来。好在The Information透露OpenAI目前已经限制了这项技术在Astra中的使用。翻译翻译现在能看懂以后就不好说了。另外之前一直传闻Astra很可能在这周四9月3日发。随着A社发布最新一代5.1模型感觉这个说法的合理性越来越高了。螳螂捕蝉黄雀在后。是谁又悟了