一个便宜89倍的模型,声称几乎达到 Opus 的分数。陷阱不在大家以为的地方。

一个便宜89倍的模型,分数几乎追上了 Opus。陷阱不在我们以为的地方。


7月31日,DeepSeek 发布了 V4-Flash-0731。这个模型每生成一百万个 token 收费 $0.28,而 Claude Opus 5 收费 $25。在它的成绩表里,它在 Terminal-Bench 上还拿到了 82.7 分,对比之下 Opus 4.8 是 85.0 分。

只差两分,价格却低了89倍。要是这个比较成立,所有人都有麻烦了。

我核查了一下。这个数字是真的。这个比较不是真的。原因比模型本身更有意思。

两辆一模一样的赛车,左边被一整队机械师围着,右边只有一个人和一台自行车打气筒

同一台发动机,同一条赛道。祝你比较圈速好运。

先说模型

DeepSeek-V4-Flash-0731 并不是一个新模型。它和几周前发布的试用版本是同一个模型:架构相同,规模相同,拥有2840亿个参数。只有后训练被重新做了一遍。后训练,就是原始学习之后进行的训练阶段。它教会模型使用工具和遵循指令,而不是只会补全文本。

换句话说,他们没有换掉大脑。他们只是教会它工作。

说到价格,输入每一百万个 token 要 $0.14,输出每一百万个 token 要 $0.28。一个 token 是一个词的一小段。一百万个 token 大约相当于750,000个词。如果发送的文本之前已经发送过,价格会降到 $0.0028,也就是正常价格的2%。

比较五个模型每生成一百万个 token 的价格的柱状图,价格从 $0.28 到 $50

DeepSeek 的柱子只有四个像素宽。这不是显示错误,这就是价格。

资料表的其他部分也站得住脚:一百万个 token 的上下文窗口,也就是说模型一次能放在眼前的文本量,大约是1,500页。它每秒还能生成112.8个 token,并在Artificial Analysis的智能指数上拿到52分。这家机构会自己进行测量,而不是照搬官方通告。

到这里一切都好。这是一个不错的模型,价格低廉,而且它的权重可以下载。权重就是包含模型所学内容的文件。

不对劲的那个数字

在 DeepSeek 的表格里,Claude Opus 4.8 在 Terminal-Bench 2.1 上拿到了 85.0 分。

Terminal-Bench 的官方排名上,同一个 Opus 4.8 拿到的是 78.9 分。

差了六分。同一个模型,同一个测试,同一个版本号。没有人撒谎。可是,这两个数字测量的并不是完全相同的东西。

区别来自测试框架。

测试框架是什么

语言模型自己什么也做不了。它读取文本,然后生成文本。就这样。要修复一个项目里的 bug,必须有人把文件提供给它,执行它建议的命令,把错误消息发回给它,然后决定工作什么时候结束,或者模型什么时候开始原地打转。

这个有人其实是一个程序。我们把它叫作测试框架。Claude Code 就是其中一个。Codex 也是。Terminus 2 同样是。这就是官方排名用来在相同条件下测试所有模型的测试框架。

测试框架决定所有不直接属于模型的事情:放弃前要尝试几次,可用的工具,把问题呈现出来的方式,或者对一个要运行三分钟的命令作何反应。换一个测试框架,分数就会变,而模型本身完全不用动。

这不是假设。可以测出来。

图表显示三个模型分别用两种不同的测试框架进行评估,并标出了误差范围

三个模型,每个用两个测试框架,只有一个评审员。在 Gemini 这里,这两个点重合了。这也是一种信息。

Claude Fable 5 使用 Claude Code 得分 83.8,使用 Terminus 2 得分 80.4。相同模型,相同日期,相同评测者,但相差 3.4 分。Opus 4.7 得分 68.9,对比 66.1,也就是相差 2.8 分。Gemini 3.1 Pro 得分 65.8,对比 65.6。这一次,差异完全处在误差范围内。

最后这个案例最有启发性。工具链的影响不是一个可以到处减掉的固定值。它取决于模型。有些模型从自己的工具中获得的收益远高于其他模型。当制造模型的公司同时设计工具链时,这并不怎么令人意外。

DeepSeek 说了什么,以及它没有隐瞒什么

公平一点说:DeepSeek 什么都没有隐瞒。方法白纸黑字地写在那里。

Harnais   : DeepSeek Harness, mode minimal
Palier    : max
Réglages  : top_p = 0.95, temperature = 1.0
Publié    : non, annoncé comme à venir

DeepSeek 甚至明确说明,智能体分数,也就是模型通过工具行动时得到的结果,对工具链极其敏感。因此,在第三方复现之前,必须把它们当作厂商数据来对待。真希望所有人都能把这件事写得这么清楚。

问题在于,这套工具链没有公开。所以没人能够重新进行测量。而 DeepSeek V4-Flash 仍然没有出现在官方排名中,排名里有十七个条目。

现在我们来算一下公告中缺失的部分。DeepSeek 的工具链让 Opus 4.8 得到 85.0 分。官方排名给它的分数是 78.9。对于 Opus 来说,这套工具链产生的分数因此高出大约六分。由于无法访问,我不能证明它对 DeepSeek 也有相同的影响。但我很难相信,一套对竞争对手如此慷慨的工具,突然会对自家模型变得严格。这样一来,公布的 82.7 分在官方排名的尺度上大概只相当于 76 或 77。这是一个不错的分数。它不是 Opus 的分数。

表格中我唯一信任的数字

有一个。这也是最有意思的那个。

在同一张表中,使用相同的工具链,并且是在同一天,V4-Flash 得到 82.7 分。V4-Pro,它的哥哥,得到 72.1 分。所以小模型击败了同一家公司的大模型,足足超过十个百分点。

这个比较是有效的,因为其他一切都相同。规则就是这样:用相同的工具链比较两个模型是有意义的。比较使用两套不同工具链得到的分数则毫无意义。

这个结果讲述的事情,比排名竞赛更有意思。一个明显更小、训练方式不同的模型,在智能体工作上做得比大模型更好。体量不再决定一切。

具体来说,这对你有什么改变

如果你不写程序,你可能会问我为什么要给你讲这些。有三个原因。其中两个会影响你的钱包。

前后对比,左边是厨房餐桌上的一摞订阅账单,右边是同一张桌子上只有一枚硬币

目的不是再付一个订阅费。而是不再需要订阅。

人工智能的价格正在迅速崩塌。高端模型每生成一百万个 token,目前仍然要花 25 到 50 美元。这个模型只要 0.28 美元,而它的结果也并不丢人。到了这个价格,一项功能可能不再以月度订阅的形式出售。它会变成你已经在使用的软件中的一个简单选项。语音消息转录、假期照片整理或自动字幕很快都不会再单独收费,因为它们的成本会变得几乎为零。真正让人松一口气的,不是少付几个订阅费。而是不再需要订阅它们。

排名并不能衡量全部现实。它衡量的是特定条件下的一个结果,而这些条件几乎从来都不是你的条件。当广告宣称某个助手因为多出两分而比另一个更好时,你现在知道了,这两分可能就薄薄的一线之差。这对人工智能适用。对智能手机的速度测试和汽车公布的油耗来说,过去也一样。同一套机制,同一个世纪。

先例是存在的,而且相当令人安心。在 1990 年代,每家电脑制造商都会发布自己的性能测试。它们全都很讨喜,也全都无法比较。这种情况一直持续到独立实验室强行推行自己的测试规范,而厂商自家的数字也不再引起任何人的兴趣。人工智能正好处于这个阶段,只是在时间表上落后了几年。还要多久?两年,五年,或者永远,如果没人资助中立的评测者。

我的看法

我不会去抨击 DeepSeek。这家公司公开了自己的设置和警告,这让它高于行业平均水平。问题不在 DeepSeek,而在这张表的用法上。当一家公司自己填写竞争对手那一栏时,这就不是对比。这是一份宣传册。

真正让我恼火的是这个数字被反复引用。短短几天里,我到处都读到这个模型只比 Opus 低两分。没人去查官方排名。它公开、免费,三十秒就能打开。这个数字自己传开了,因为它很适合当标题。

真正的信息不在于它和 Opus 的这场对决。一个拥有 2840 亿参数的模型,在一行架构都没改的情况下,击败了自家那个大模型。只需要重新训练它。新闻就在这里。它没有登上任何标题。

Join the conversation

You need an account to comment on this article. Creating one is free and takes under a minute.

  • The XMLTV file, free to download every day
  • Comment on articles and reply to other readers
  • Get an e-mail when an article you follow is updated

No comments yet.

Une erreur s'est produite. Cette application peut ne plus répondre jusqu'à ce qu'elle soit rechargée.Veuillez contacter l'auteur. Reload 🗙