OpenAI把它的模型放在了一块盘子那么大的芯片上。结果:速度最高快十四倍。
昨天,OpenAI在它的开发者界面中开了一个新档位。它的名字是:Ultrafast。档位,就是一种服务方案:产品相同,背后的机器不同。模型没有变化。还是gpt-5.6-sol,回答相同,智能程度也相同。只有运行它的机器不同。而它的速度最高可以快十四倍。
今日菜品边长21厘米,价格相当于一辆汽车。酒单上也没有标价。
这是这家公司给出的一个例子,因为百分比对谁都说不明白。同一个请求,用同一个模型生成两次财务仪表板。
Standard 12 min 20 s
Ultrafast 1 min 50 s十二分钟,就是出去拿杯咖啡,再回来时已经忘了自己本来要做什么的时间。一分五十秒,就是坐在椅子上的时间。这不是同一回事。
为什么你的 AI 吐字像挤牙膏一样慢
先绕道讲讲机械原理。这里才开始有意思。
模型一次写出一个令牌。令牌,就是一个词的一部分。大约三个令牌对应两个词。为了生成每一个令牌,机器都必须重新读取模型的全部权重,也就是组成这个小玩意的数百GB数字。它先为一个词的一部分这么做,然后为下一个部分重新来一遍。
在显卡上,这些权重放不进芯片。它们被存储在旁边的内存中。所以必须不停地去取它们。结果:你的3万欧元显卡,大部分时间不是在计算,而是在冰箱前来回跑。
左边是现在的厨房。厨师非常优秀。他只是把一辈子都花在了走廊里。
这很反直觉,所以很多人都搞错了这个问题。瓶颈,也就是拖慢整个系统的东西,不是计算能力。而是把数据送到计算单元的管道。你可以把一位米其林三星厨师放进厨房。如果他每拿一个洋葱都得穿过仓库,你还是得等。
一块盘子那么大的芯片
这就是Cerebras这个想法的来源,它制造了这个新档位所使用的硬件。企业没有把硅晶圆切成小芯片,而是把整块晶圆保留下来。所以处理器的边长达到21.5厘米。它覆盖46,225 mm²,包含4,000万亿个晶体管以及900,000个核心。Nvidia的H100芯片是行业标杆,面积为814 mm²。它小了五十七倍。
重点不是为了好玩而制造一块巨大的芯片。这块面积可以把44 GB的超高速内存直接放在芯片上。因此模型的权重就留在操作台上。不用再往冰箱跑。不用再穿走廊。不用再进仓库。
Cerebras宣布其内部吞吐量为每秒21拍字节,而H100内存的速度约为每秒3.35TB。我先老实地加个限定:这两个数字的测量方式并不相同。第一个数字把900,000个核心与其旁边内存之间的交换量加在了一起。第二个数字测量的是外部总线,也就是与内存的连接。所以别记住那个精确的比值。记住数量级就够了。我们已经不在同一个管道工类别里比赛了。
说实话,这件事里最让我觉得好玩的是,这个赌注当时被看成工程师的异想天开。一块餐盘大小的芯片,似乎不可能做到无缺陷生产,不可能冷却,也不可能卖出去。十年后,它让 OpenAI 的模型跑了起来。
不,这不是你看到的那块晶圆
一张照片传得很广,而且可能会把你搞糊涂。它也把我搞糊涂了。照片里,萨姆·奥特曼笑容满面,和一位穿西装的先生一起拿着一块硅晶圆。但这不是我们这里说的那块。
6月24日,萨姆·奥特曼和 Broadcom 掌门人霍克·谭展示 OpenAI 自研的芯片。照片由 OpenAI 和 Broadcom 提供。至于这块晶圆,它会被送进切割机。
这张照片拍摄于6月24日。右边那位先生是 Broadcom 的掌门人霍克·谭。他们手里拿着的东西叫 Jalapeño。这是 OpenAI 设计的第一块芯片,由 Broadcom 制造,然后由 Celestica 装进机架。从第一笔草图到把版图送去刻蚀,中间只用了九个月。对这种大家伙来说,这非常快。
现在,仔细看看这块晶圆。你看到网格和几百个小矩形了吗?每个矩形对应一块芯片。所以,这块晶圆接下来会被切开。过去五十年来,处理器就是这样制造的:先刻蚀芯片,再把它们切开,挑出合格的,最后把失败的扔掉。
这就是它们不一样的原因。Cerebras 也是从一块类似的圆形晶圆开始,却选择不把它切开。起点是同一块硅,终点却做了相反的决定。照片里展示的是一块块独立的芯片。这篇文章说的是一整块拿来使用的晶圆。
同时押下三个赌注
话虽如此,这张照片还透露了 OpenAI 的另一件有意思的事。这个策略像一个稳妥的当家人:把解决方案铺开,不依赖任何一家。
如果你数一数,OpenAI 同时押下了三个硬件赌注。第一个是像所有人一样租用 Nvidia 的显卡。这样成本很高,也让公司受制于单一供应商。第二个是和 Broadcom 一起制造自己的芯片,就是照片里的那块。计划在今年年底前以千兆瓦规模部署,微软可能会拿走其中的40%,而 OpenAI 的一个代码模型已经在上面以测试版运行。第三个赌注是昨天推出的,在那些等待时间变成真正问题的场景里,从 Cerebras 租用纯粹的速度。
至于 Jalapeño 的能效表现,这家公司只说“明显优于现有产品”。没有数字,没有技术报告。你知道我对这类说法的态度:先记下来,然后等证据。
公布的数字,以及我相信的数字
Ultrafast 档位最高可以达到每秒生成750个令牌。作为比较,人类读者大约每分钟读250个词,也就是每秒4个词。这里达到的是每秒560个词。所以,这个模型写东西的速度大约是你阅读速度的一百三十倍。
橙色柱来自销售方。灰色柱是别人测出来的。这一点很重要。
每秒57个令牌这个标准档位的数字不是 OpenAI 给的。它来自Artificial Analysis,这家机构持续测量现有模型的性能。巧的是,750除以57等于13。所以,所说的“最高快14倍”是站得住脚的。
至于其他内容,就得读小字了。Cerebras 还声称,在快速模式下,它比 Fable 5 快11倍,比 Opus 4.8 快5倍。这家公司还说,自己在11小时11分内完成了一项公认很难的测试,而用时基准是78小时27分。这些是它自己的测量结果,在它的条件下用它的硬件完成。我不是说这些数字是假的。我是说,Cerebras 不是独立裁判。
最有意思的数字也是最保守的那个。在一组专业任务中,从工作开始到结束,整体收益降到了5.6倍。这很合理。一个干活的代理不会一辈子都在写东西。它会编译代码,等待网络,然后重新运行测试。模型可以眨眼之间给出回答。如果编译需要两分钟,它还是会需要两分钟。
价格还没公布,这可不是小事
啊,对了,价格。没有。
不是“价格很高”。也不是“下个月公布”。什么都没有。没有任何资费,没有正式全面开放的日期,也没有任何成本提示。这是一个封闭预览版,只对少数客户开放。提到的名字有 Jane Street、Podium、Basis 和 Rogo。其他人可以加入等候名单。而且这一切仍然只限于开发者界面。ChatGPT 里什么都没有。
菜单不标价格,从来不是为了给你一个惊喜。
作为一个量级参考,同一个模型在普通档位的价格是输入每百万个 token 5 美元,输出每百万个 token 30 美元。输入 token 对应的是我们发送给模型的内容。输出 token 对应的是它的回答。至于一整块在 TSMC 刻出来的硅晶圆,那可不是什么打折促销时买到的替换零件。我们会为这种速度多付一倍吗?五倍吗?这项服务会不会只留给那些做毫秒级交易的人?
我不知道,这正是问题所在。买不起的速度,就叫演示。
具体来说,这对你有什么改变
如果你不写代码,也从来没打开过开发者界面,这个问题很合理。事情是这样的。
想象一下厨房里的语音助手。你让它把克数换算成勺数,它要两秒钟才回答。这两秒就足以让所有人都不用它。我们宁愿还是拿出手机。电商网站的客服也是同一个问题,每次回答前都要等二十秒:你直接关掉标签页。假期里实时翻译也是一样。有延迟,它就是个小玩意儿。没有延迟,它才会变成对话。
冷咖啡、蜘蛛网和胡子:2026 年人工智能的真正代价。
现在,我们不加修饰地谈谈时间表。今天,这对你什么都没改变。零。这是一个没有价格的封闭预览版,由四家公司测试,存在于一个你大概永远不会打开的工具里。这项服务明年可能会普及。它也可能继续成为交易大厅的奢侈品,或者在价格和速度之间的比例撑不住时消失。
在我看来,最恰当的比较是从 56k 调制解调器转向 ADSL。当时从纸面上看,我们只是让同一个网络变快了。在实践中,2000 年没有人看在线视频。这不是品味问题。等待让人无法忍受。速度不只是改善了一个已有的用途。它还创造了另一个用途,然后五年后 YouTube 出现了。这里也是同样的赌注。而且它完全可能赌输。
我的看法
我每天都和代码助手一起工作。这些发布消息中没人衡量的一点,是等待对你大脑产生的影响。二十秒在纸面上算不了什么。可二十秒之内,你会去看邮件。然后你就不会回来了。
OpenAI 的一位研究员总结得比我能做到的更好:“它在我还没来得及转去做别的事情之前就完成了”。就是这样。真正的问题不是速度。而是注意力。一个在你还集中注意力时就给出回答的工具,是你会使用的工具。一个等到你喝完咖啡才给出回答的工具,是你会绕开的工具。
好吧,不过我们也别太快下结论。没有价格,没有日期,也没有独立测量,目前我们手里只有一个漂亮的承诺和一块漂亮的晶圆。但如果这种速度变成常态,我们回想起机器还在说完一句话时,我们盯着光标转圈的那个年代时,会笑出来。有点像调制解调器的声音。






Join the conversation
You need an account to comment on this article. Creating one is free and takes under a minute.
No comments yet.