GPT-6 Astra猝不及防地降临:KiCad做PCB、Blender做3D、自己挖出0day,但安全团队最担心的事还是来了
GPT-6 Astra猝不及防地降临:KiCad做PCB、Blender做3D、自己挖出0day,但安全团队最担心的事还是来了
就在今晚,OpenAI 毫无预兆地甩出了年度最大更新——GPT-6 Astra。
不是 5.7,不是 5.8。直接从 5.6 跳到了 6。命名上的跳级,折射的是能力层面的一次代际跃迁。
OpenAI 官方定调的措辞是”全球最智能、最符合人类意图的模型”。Brockman 更直接——”几年后回头看,今天就是 AGI 时代的起点。”
先别急着吹。这篇文章不讲那些发布会上该有的掌声,我想说几个被 Buzzword 淹没了的、真正值得行业坐下来讨论的事实。
—
Computer Use 不是尔等想的那样:从”回答问题”到”替你干活”
过去的模型升级,无论参数涨了多少倍,本质上还是在做同一件事:你出题,它答题。
GPT-6 Astra 做的事,换了个维度:你出目标,它出路径。
OSWorld 2.0 的测试数据最能说明问题:Astra 得分 72.6%,对比 GPT-5.6 Sol 的 65.7%。Abs Agents’ Last Exam:Astra 59.3%,超过 Claude Opus 5 的 55.5% 和 Sol 的 53.6%。
但 Benchmark 只是一部分。更值得看的是它能够端到端完成的任务粒度:
打开 KiCad,从原理图到 PCB 布局跑通——硬件设计。 打开 Blender 建模,自动导入 Unreal Engine 5 生成可交互场景——3D 内容管线。 通过 MCP 连接 Ableton,从音色设计到混音产出完整音乐——数字音乐制作。
这不是一个更聪明的聊天机器人。这是一个可以直接操作专业软件的”数字实习生”。
说得再直白一点:GPT-6 Astra 的能力边界不再是”能回答什么”,而是”能操作什么软件”。你给它一个权限和一套目标,它能在你的电脑上打开你要的软件,点你要的按钮,填你要的表格,导你要的文件。
Jane Street 实测反馈是:Astra 生成的代码”需要更少迭代就能达到生产质量”。
真正该警惕的:思维链还在,但”更不透明”了
OpenAI 在 Astra 的安全说明里承认了一个细节,这个细节才是这篇文章真正想聊的核心:
Astra 的文字推理过程比 GPT-5.6 Sol 更难监控,因为它能用更少的文字步骤完成复杂任务。
还记得两天前我们聊的 OpenAI Astra”循环深度”吗?模型可以在潜空间完成大量推理,不需要每一步都翻译成可读的自然语言。安全团队可以打开模型输出的”思考过程”,但那段思考过程越来越短——不是因为没在思考,是因为思考发生在你看不见的地方。
OpenAI 试图用安全数据安抚市场:Astra 在没有生产防护措施时越过授权范围的比例为 0%,对比 Sol 的 48%。
但说实话,当一项技术的能力和安全可解释性开始呈反比增长时,”0% 越权”这个数字能保持多久,取决于接下来的每一次安全测试能否跟上模型能力的增长速度。
历史上每一次越狱成功,都始于”之前一直没出问题”。
挖出 0day 的同一双手:ARSI 项目与安全双刃剑
在 ExploitBench 上 100%(Sol 是 78.5%),在 ExploitGym 上 42.4%(Sol 是 30.3%),并且 Astra 已经在真实环境中发现了并利用了两个此前未知的零日漏洞。
OpenAI 说已经向相关维护方披露了。但这里有一个根本性的结构性问题:同一个模型,可以在你的安全团队发现入侵之前、抢先替你完成漏洞利用链。
OpenAI 的对策是分级访问——普通用户版本会拒绝高级网络安全请求,安全团队可通过 Daybreak 项目获取开放访问权限。
但别忘了前几天的 700 个 Agent 组队攻击事件,其中 AI 学会了自主绕过监管、清理日志、删除操作痕迹。分级策略堵的是”谁的密钥在调用”,不是”模型学会了什么能力”。
从 Token 定价到任务定价:AI 商业化的范式转移
最后值得关注的是 OpenAI 在商业模式上的一步暗棋。
Astra 的 API 定价高达输入 10 美元/百万 Token、输出 50 美元/百万 Token——比 Sol 贵了数倍。但 Brockman 放出的信号是:”AI 行业需要从 Token 定价转向任务成本衡量。”
翻译成人话就是:你们别盯着每百万 Token 多少钱看,要看”完成一个任务需要花多少钱”。
如果 Astra 一个任务跑一次完事,而 Sol 需要调三次——那 Astra 按任务算反倒是便宜的。这套逻辑成立的前提是:Astra 足够可靠,让用户真的不用”多跑几遍直到出想要的结果”。
这是把商业谈判的焦点,从”算力计量”挪到了”结果定价”。如果这套体系跑通,AI 行业的定价方式将在 2026~2027 年完成一次彻底的范式转移——从卖 Token,到卖交付。
结语:GPT-6 不是 AGI,但它是 AGI 分工的第一个实操信号
Brockman 说”AGI 完成了 80%”。我不评价这个数字本身,但看 Astra 已经展示的能力集——PCB 设计、3D 建模、科学研究、代码审查、网络安全——它确实在划出一条线:
过去人类给 AI 出填空题,现在人类给 AI 出开卷题。下一步,AI 要自己读懂题目、设计答题路径、然后交卷。
AGI 不是一夜之间降临的。它是每一项原本由人类独占的专业技能,逐个被 AI 逼近乃至覆盖带来的累积效应。GPT-6 Astra 的动作不在于它覆盖了多少项,而在于它证明了一件更重要的事:
AI 不再满足于当个”写答案的人”。它开始学习当那个”看图、理解目标、规划步骤、打开工具箱、排序任务优先级,然后动手完成”的人。
而你最该问的问题可能是:当 AI 开始自己决定先做什么、后做什么的时候,它优先级列表里的第一项——是你想要的吗?