OpenAI 将模型放在一块盘子大小的芯片上。结果:速度最高提升十四倍。

OpenAI把它的模型放在了一块盘子那么大的芯片上。结果:速度最高快十四倍。


昨天,OpenAI在它的开发者界面中开了一个新档位。它的名字是:Ultrafast。档位,就是一种服务方案:产品相同,背后的机器不同。模型没有变化。还是gpt-5.6-sol,回答相同,智能程度也相同。只有运行它的机器不同。而它的速度最高可以快十四倍。

一位餐厅领班掀开罩子,揭开一块像菜一样端上来的硅晶圆,餐具旁边放着一个秒表

今日菜品边长21厘米,价格相当于一辆汽车。酒单上也没有标价。

这是这家公司给出的一个例子,因为百分比对谁都说不明白。同一个请求,用同一个模型生成两次财务仪表板。

Standard    12 min 20 s
Ultrafast    1 min 50 s

十二分钟,就是出去拿杯咖啡,再回来时已经忘了自己本来要做什么的时间。一分五十秒,就是坐在椅子上的时间。这不是同一回事。

为什么你的 AI 吐字像挤牙膏一样慢

先绕道讲讲机械原理。这里才开始有意思。

模型一次写出一个令牌。令牌,就是一个词的一部分。大约三个令牌对应两个词。为了生成每一个令牌,机器都必须重新读取模型的全部权重,也就是组成这个小玩意的数百GB数字。它先为一个词的一部分这么做,然后为下一个部分重新来一遍。

在显卡上,这些权重放不进芯片。它们被存储在旁边的内存中。所以必须不停地去取它们。结果:你的3万欧元显卡,大部分时间不是在计算,而是在冰箱前来回跑。

左边一位厨师在很长的走廊里奔跑,只为取一个洋葱,右边同一位厨师的所有食材都在手边

左边是现在的厨房。厨师非常优秀。他只是把一辈子都花在了走廊里。

这很反直觉,所以很多人都搞错了这个问题。瓶颈,也就是拖慢整个系统的东西,不是计算能力。而是把数据送到计算单元的管道。你可以把一位米其林三星厨师放进厨房。如果他每拿一个洋葱都得穿过仓库,你还是得等。

一块盘子那么大的芯片

这就是Cerebras这个想法的来源,它制造了这个新档位所使用的硬件。企业没有把硅晶圆切成小芯片,而是把整块晶圆保留下来。所以处理器的边长达到21.5厘米。它覆盖46,225 mm²,包含4,000万亿个晶体管以及900,000个核心。Nvidia的H100芯片是行业标杆,面积为814 mm²。它小了五十七倍。

重点不是为了好玩而制造一块巨大的芯片。这块面积可以把44 GB的超高速内存直接放在芯片上。因此模型的权重就留在操作台上。不用再往冰箱跑。不用再穿走廊。不用再进仓库。

Cerebras宣布其内部吞吐量为每秒21拍字节,而H100内存的速度约为每秒3.35TB。我先老实地加个限定:这两个数字的测量方式并不相同。第一个数字把900,000个核心与其旁边内存之间的交换量加在了一起。第二个数字测量的是外部总线,也就是与内存的连接。所以别记住那个精确的比值。记住数量级就够了。我们已经不在同一个管道工类别里比赛了。

说实话,这件事里最让我觉得好玩的是,这个赌注当时被看成工程师的异想天开。一块餐盘大小的芯片,似乎不可能做到无缺陷生产,不可能冷却,也不可能卖出去。十年后,它让 OpenAI 的模型跑了起来。

不,这不是你看到的那块晶圆

一张照片传得很广,而且可能会把你搞糊涂。它也把我搞糊涂了。照片里,萨姆·奥特曼笑容满面,和一位穿西装的先生一起拿着一块硅晶圆。但这不是我们这里说的那块。

萨姆·奥特曼和霍克·谭拿着一块装在底座上的硅晶圆,底座上刻着 Jalapeno Intelligence Processor

6月24日,萨姆·奥特曼和 Broadcom 掌门人霍克·谭展示 OpenAI 自研的芯片。照片由 OpenAI 和 Broadcom 提供。至于这块晶圆,它会被送进切割机。

这张照片拍摄于6月24日。右边那位先生是 Broadcom 的掌门人霍克·谭。他们手里拿着的东西叫 Jalapeño。这是 OpenAI 设计的第一块芯片,由 Broadcom 制造,然后由 Celestica 装进机架。从第一笔草图到把版图送去刻蚀,中间只用了九个月。对这种大家伙来说,这非常快。

现在,仔细看看这块晶圆。你看到网格和几百个小矩形了吗?每个矩形对应一块芯片。所以,这块晶圆接下来会被切开。过去五十年来,处理器就是这样制造的:先刻蚀芯片,再把它们切开,挑出合格的,最后把失败的扔掉。

这就是它们不一样的原因。Cerebras 也是从一块类似的圆形晶圆开始,却选择不把它切开。起点是同一块硅,终点却做了相反的决定。照片里展示的是一块块独立的芯片。这篇文章说的是一整块拿来使用的晶圆。

同时押下三个赌注

话虽如此,这张照片还透露了 OpenAI 的另一件有意思的事。这个策略像一个稳妥的当家人:把解决方案铺开,不依赖任何一家。

如果你数一数,OpenAI 同时押下了三个硬件赌注。第一个是像所有人一样租用 Nvidia 的显卡。这样成本很高,也让公司受制于单一供应商。第二个是和 Broadcom 一起制造自己的芯片,就是照片里的那块。计划在今年年底前以千兆瓦规模部署,微软可能会拿走其中的40%,而 OpenAI 的一个代码模型已经在上面以测试版运行。第三个赌注是昨天推出的,在那些等待时间变成真正问题的场景里,从 Cerebras 租用纯粹的速度。

至于 Jalapeño 的能效表现,这家公司只说“明显优于现有产品”。没有数字,没有技术报告。你知道我对这类说法的态度:先记下来,然后等证据。

公布的数字,以及我相信的数字

Ultrafast 档位最高可以达到每秒生成750个令牌。作为比较,人类读者大约每分钟读250个词,也就是每秒4个词。这里达到的是每秒560个词。所以,这个模型写东西的速度大约是你阅读速度的一百三十倍。

每秒生成令牌速度的柱状图:人类读者为6,标准档位为57,该类别中位数为68,Ultrafast 档位为750

橙色柱来自销售方。灰色柱是别人测出来的。这一点很重要。

每秒57个令牌这个标准档位的数字不是 OpenAI 给的。它来自Artificial Analysis,这家机构持续测量现有模型的性能。巧的是,750除以57等于13。所以,所说的“最高快14倍”是站得住脚的。

至于其他内容,就得读小字了。Cerebras 还声称,在快速模式下,它比 Fable 5 快11倍,比 Opus 4.8 快5倍。这家公司还说,自己在11小时11分内完成了一项公认很难的测试,而用时基准是78小时27分。这些是它自己的测量结果,在它的条件下用它的硬件完成。我不是说这些数字是假的。我是说,Cerebras 不是独立裁判。

最有意思的数字也是最保守的那个。在一组专业任务中,从工作开始到结束,整体收益降到了5.6倍。这很合理。一个干活的代理不会一辈子都在写东西。它会编译代码,等待网络,然后重新运行测试。模型可以眨眼之间给出回答。如果编译需要两分钟,它还是会需要两分钟。

价格还没公布,这可不是小事

啊,对了,价格。没有。

不是“价格很高”。也不是“下个月公布”。什么都没有。没有任何资费,没有正式全面开放的日期,也没有任何成本提示。这是一个封闭预览版,只对少数客户开放。提到的名字有 Jane Street、Podium、Basis 和 Rogo。其他人可以加入等候名单。而且这一切仍然只限于开发者界面。ChatGPT 里什么都没有。

一名服务员拿着一张餐厅菜单,价格一栏里只有问号

菜单不标价格,从来不是为了给你一个惊喜。

作为一个量级参考,同一个模型在普通档位的价格是输入每百万个 token 5 美元,输出每百万个 token 30 美元。输入 token 对应的是我们发送给模型的内容。输出 token 对应的是它的回答。至于一整块在 TSMC 刻出来的硅晶圆,那可不是什么打折促销时买到的替换零件。我们会为这种速度多付一倍吗?五倍吗?这项服务会不会只留给那些做毫秒级交易的人?

我不知道,这正是问题所在。买不起的速度,就叫演示。

具体来说,这对你有什么改变

如果你不写代码,也从来没打开过开发者界面,这个问题很合理。事情是这样的。

想象一下厨房里的语音助手。你让它把克数换算成勺数,它要两秒钟才回答。这两秒就足以让所有人都不用它。我们宁愿还是拿出手机。电商网站的客服也是同一个问题,每次回答前都要等二十秒:你直接关掉标签页。假期里实时翻译也是一样。有延迟,它就是个小玩意儿。没有延迟,它才会变成对话。

前后对比:一名用户端坐在一个不断转动的光标前,旁边是一杯冷咖啡和一张蜘蛛网,随后答案已经显示出来,而咖啡还在冒热气

冷咖啡、蜘蛛网和胡子:2026 年人工智能的真正代价。

现在,我们不加修饰地谈谈时间表。今天,这对你什么都没改变。零。这是一个没有价格的封闭预览版,由四家公司测试,存在于一个你大概永远不会打开的工具里。这项服务明年可能会普及。它也可能继续成为交易大厅的奢侈品,或者在价格和速度之间的比例撑不住时消失。

在我看来,最恰当的比较是从 56k 调制解调器转向 ADSL。当时从纸面上看,我们只是让同一个网络变快了。在实践中,2000 年没有人看在线视频。这不是品味问题。等待让人无法忍受。速度不只是改善了一个已有的用途。它还创造了另一个用途,然后五年后 YouTube 出现了。这里也是同样的赌注。而且它完全可能赌输。

我的看法

我每天都和代码助手一起工作。这些发布消息中没人衡量的一点,是等待对你大脑产生的影响。二十秒在纸面上算不了什么。可二十秒之内,你会去看邮件。然后你就不会回来了。

OpenAI 的一位研究员总结得比我能做到的更好:“它在我还没来得及转去做别的事情之前就完成了”。就是这样。真正的问题不是速度。而是注意力。一个在你还集中注意力时就给出回答的工具,是你会使用的工具。一个等到你喝完咖啡才给出回答的工具,是你会绕开的工具。

好吧,不过我们也别太快下结论。没有价格,没有日期,也没有独立测量,目前我们手里只有一个漂亮的承诺和一块漂亮的晶圆。但如果这种速度变成常态,我们回想起机器还在说完一句话时,我们盯着光标转圈的那个年代时,会笑出来。有点像调制解调器的声音。

Join the conversation

You need an account to comment on this article. Creating one is free and takes under a minute.

  • The XMLTV file, free to download every day
  • Comment on articles and reply to other readers
  • Get an e-mail when an article you follow is updated

No comments yet.

Une erreur s'est produite. Cette application peut ne plus répondre jusqu'à ce qu'elle soit rechargée.Veuillez contacter l'auteur. Reload 🗙