Astra,OpenAI 的下一个模型:又一个新阶段?
本周,Sam Altman 在华盛顿闭门介绍了一个名为 Astra 的新模型家族。The Information 曝光了这场演示的存在。所有人记住的都是那个房间和那些西装。
我感兴趣的是机器。而最有意思的东西并不在那个房间里。它在十天前发布的一篇数学文章里,几乎没人读到最后。
右下角那只在打盹的机器人,就是已经完成自己那部分的那只。
一句话说清这会带来什么变化
今天,当你向 AI 提出某件事时,你是在和一个独自工作的员工说话。他非常快,知识非常丰富,但最后还是会跟丢思路。你交给他一个任务,他把它完成,然后第二天你得重新向他解释他做了什么,以及你想让他继续做什么。
Astra 基于另一个想法:让多个智能体一起处理同一个问题,持续数小时或数天。这里的智能体,是指被分配了一部分工作的 AI。智能体分配任务,互相审阅,互相纠正,然后在后台继续工作。这有点像我集成到 Claude Code 里的“Loop”系统,但这里会是它的 10 倍威力。
同一摞文件。唯一的区别,是谁来搬它。
所以这不是速度的问题,而是耐力的问题。这个差别看起来微不足道。它却大得惊人。我们不再寻找一个更快的短跑选手,而是在寻找一支能够轮流接力,开发,不断改进的队伍。一种不会再忘记的 AI。
数学和账单给出的证据
8 月 1 日,OpenAI 发布了十个数学和理论计算机科学开放问题的解答,这些问题此前一直没有解决。至少十年来,再也没有人能在这些问题上取得进展,很多问题的时间还要长得多。它们涉及高维几何,编码理论,群论,量子复杂性和格密码学,总之,绝不是什么轻松活。公布的结果包括驳斥 Connes 刚性猜想(噗呲……我的脑子要烧了),以及回答 Paul Erdős 提出的几个问题,而他身后留下了几百个问题。
真正重要的细节不是数字十。而是每个证明都用 Lean 进行了形式化,这是一种能让机器逐行验证证明的语言。所以你不需要只凭 OpenAI 的话来相信它:一台电脑已经重新检查了这份答卷。10 个问题都解决了!
这花了多少钱?
两千美元。数学研讨会光是咖啡就要花得更多。
OpenAI 白纸黑字地写道:找到这十个解答消耗了大约 2 000 美元的 token,按其 API 的公开价格计算。Token 是服务处理并计费的文本单位。在这里,它们被用来解决十个问题,而人类几十年来一直在尝试,却没有成功!呃……我不知道你有没有意识到这一点?我们是不是正在走向解决那些人类从未解决过的科学,数学,量子问题的道路?
好,别急着下结论。OpenAI 的 Noam Brown 是他们的一名研究员,他补充说:“遗憾的是,目前还没有千禧年难题。”那些价值一百万美元的大谜题可能还会继续顽强抵抗。数学家 Thomas Bloom 也把事情说回了正轨:人工智能并不是凭空得出这些结果的。它建立在一百多年的人类理论之上。好吧,但话又说回来!
具体来说,我们能拿它做什么?
这里我得老实说:这个产品还不存在。今天没人能说清楚接下来会发生什么。不过,它瞄准的任务类型相当明确:我开发的时候,会在三个项目上并行打开三个 Claude Code 窗口。然后在它们之间来回切换。我把工作拆开,分配出去,检查一遍,再把各个部分拼回来。效果非常好。只是得有一个项目经理。这个项目经理就是我,而我会累。Astra 承诺做同样的事,不需要那个疲惫的项目经理,而且可以持续不断地做,由它的代理舰队来完成。
对于不写代码的人来说,这对应的是那种会占掉整整一个周末的苦差事:
- 逐行比较十四份保险或补充医疗保险合同,不漏掉小字里的任何免责条款,然后做成一张表。这不难。只是很耗时间。正因为如此,没人会去做,而我们会在十二年里付出过高的费用。
- 安排一趟有十二个互相矛盾的限制条件的旅行:学校的日期、预算、狗,还有不坐飞机的岳母。一个代理会给你提出一个方案。一组代理可以尝试三十个方案,把它们进行比较,然后向你解释为什么另外二十九个行不通。
- 重新整理散落在三块硬盘和两部老手机上的十五年照片。删除重复照片,找回日期,把所有东西分类整理。这是一项你从 2011 年起就一直拖着的蚂蚁活。
真正让人害怕的是:如果政府利用这种智能,在军事攻击中确定消灭敌人的最佳方案呢?我能想象它尽可能完善地思考如何在一个地区干净利落且最高效地杀人,然后把提出的方案票据交给参谋长。别忘了,人工智能没有任何顾忌,它让它做什么它就做什么。
现在还得看看,一个独自工作三天的系统,也可能在没人发现的情况下积累三天的错误。我不知道 OpenAI 会怎么推出这个新产品,但如果我对它说,给我做一款多人电子游戏,而且还要 plusss(请把 s 按重一点)更好,然后它一周后给我弄出一个像《Concord》这样的东西(两亿美元,在PCGamer上评分 45/100,Sony 已经关闭了其工作室),再在账单上于一个数字后面加上几个零,我会非常不爽。
令人深思的细节:他们踩刹车了
8 月 7 日,OpenAI 发布了一些不寻常的内容。该公司表示,根据他们自己的内部评估,无法排除这个模型达到他们称为网络安全“关键”级别的可能性。这个评级还不是最终结论,因为测试仍在继续。在此期间,该公司表示已经放慢了开发速度。翻译成法语:商业广告,“注意,我们必须放慢它的编程速度,因为它会把我们全都消灭。”
桶和铲子都有提供。出口没有。
采取的措施已经说明了很多问题。这个模型在一个隔离的测试环境中工作,无法访问网络或工具。它的权重,也就是决定其行为的内部数据,经过了加密。它的运行是在沙盒中进行的,也就是一个限制它可以修改哪些东西的封闭空间。自动监控程序还会读取它的推理链,也就是它工作时的中间步骤,并且可以在途中将它中断。即使是在训练期间也一样。
就我个人而言,我觉得到了 2026 年,展示一个模型能力的最佳方式,已经变成了列出人们给它装上的那些锁。没人会给一个数羊的东西套上一只用螺栓固定的玻璃箱。
我们不知道的事,而且有很多
这个名字甚至都还没定下来。“Astra”只是暂定名。OpenAI 还没决定它会不会以 GPT-6、GPT-5.7 的名字发布,或者作为一个独立的系列,和 Sol、Terra 以及 Luna 并列。我们不知道日期,不知道价格,也不知道模型的大小。我们也不知道它的上下文窗口有多大,也就是它在执行一项任务时能记住多少信息。我们同样不知道它将来会在 ChatGPT 里变成什么样。甚至没人保证,用来做数学题的那个系统会和有一天发布的产品相像。
所以没错,我们说的是一个几乎一无所知的系统,除了它已经做过什么。已经比这个行业大多数公告强了。
我的看法
两年来,每个新模型都在一个现实生活中没人会做的测试上多拿几分。这有用。进步是真实的,但它是一步一步来的。老实说,我们到时候就知道这个新怪物到底是什么了,看它只是风中放了个屁,还是又要把我们折腾一番。
如今,一个人工智能模型会忘记三小时前做出的决定。要是 Astra 能撞破这堵墙,那会比在基准测试上多拿十分有用得多,也就是一个用来比较模型的测试。
话虽如此,我还是会看它实际能做什么,最重要的是,我希望它不会掏空我们的钱包。




Join the conversation
You need an account to comment on this article. Creating one is free and takes under a minute.
No comments yet.