进入主要内容

Grok 4.7 只要2美元,MiMo v2.6 可下载:该选哪个 AI 模型?


周一下午,UTC时间15时39分。Hugging Face上出现了一个仓库,里面是一个署名 Xiaomi、采用MIT许可证的3090亿参数模型,这个许可证基本什么都允许,包括拿它赚钱。十八秒后,Pro版本也紧挨着上线了。同一个下午,SpaceXAI发布了Grok 4.7,并宣布输入每百万个token收费2美元,输出收费6美元。

同一天出现两个模型,这没什么特别的,每周都会出来三个。真正有意思的是,这两则公告放在一起说明了什么。一个按分钟租用,另一个可以下载。一个需要一间有空调的机房,另一个装在你的硬盘文件夹里就行。

Grok 4.7:便宜一半,而且它并不是处处都赢

官方页面宣布,这是“代码和知识工作”能力最强的模型,速度是可比竞争对手的两倍,价格便宜一半,和Grok 4.6的价格相同。这是所有实验室在发布日都会写的句子,而它的价值,就和随附的那些表格一样。

说到表格,确实有一个。四项测试,三个模型。我按照原样保留数字重新画了一遍,也保留了各家公布的测试版本:

Grok 4.7、GPT-5.6 Sol max和Fable 5.1 max在四项测试中的对比

Grok只参加了四项测试中的两项。唯一一项对我来说真正重要的测试,修复代码,最后打成平手

解释一下,因为测试名称对任何人来说都没什么意义。CursorBench,就是在别人给你现有项目的情况下,在编辑器里写代码。DeepSWE,就是在一个仓库里修复真正损坏的代码。Terminal-Bench,就是在命令行里靠自己解决问题,没有界面,也没有安全网。Harvey Legal,就是美国法律考试,也就是律师参加的那场考试。

结果是:Grok 4.7在法律上碾压对手,19.6%对另外两个的2.5%和6.7%,这可不是轻轻打了一巴掌。它在纯工程方面也大胜。它在终端测试上则被甩开了,Fable 5.1 max拿到57.9%,而它最高只有38%。在代码修复上,三个模型的差距只有两点半,这也就是说它们打成了平手。

现在说价格,因为这才是今天真正的公告:

三个模型输入和输出每百万个token的价格

橙色那一条,就是你为机器写出来的东西付的钱。在Grok这里,它比Fable短五倍

换算到真实工作里,这会改变一张账单。我一直开着三个代码助手会话,而预算里的“模型”这一项已经变成了我每个月都会看的项目,就像其他人查看电费账单一样。读取每百万个token只要2美元时,和10美元已经不是同一个话题了。如果你想看所有费率的细节,包括订阅费和API费用,我一个半月前已经在这篇每百万个token的对比文章里完整梳理过了,大致的数量级没有变化。

MiMo v2.6:3090亿个参数,15个在工作

小米这边,同一天是另一回事。这个模型叫MiMo v2.6,而且非常庞大:总共3090亿个参数,分布在48层和256个专家中。但在这256个专家里,每次只有8个会醒来处理给定的一个词,这样实际同时运行的参数大约是150亿个。这就是混合专家的原理:一个大脑,但只点亮有用的区域。结果是,一个半挂车那么大的模型,消耗却像一辆小货车。

技术规格表的其余部分,我在随权重发布的配置文件里核实过了:上下文长度是一百万个token,也就是说足以吞下整个大型代码库并继续对话,而且输入接受文本、图像、视频和声音。许可证是MIT,没有研究条款,也没有收入上限,这对于这么大规模的模型来说很少见。权重有172.9 GB,分成65个部分供下载。

八块显卡并排安装在一个打开的机箱里

八张卡,而且这是公布的最低配置。电费不包含在机型价格里

要在家里让它跑起来,你得准备什么

172.9 GB,塞不进你的显卡里。这甚至不是内存问题,而是机器问题:部署文档说,最低要并行使用八张卡,另一种推荐配置则是十六张加两张,部署在多台彼此连接的服务器上。换句话说,你需要一个机架、网络,以及一间能把热量排出去的房间。

这和我之前为另一个今年夏天发布的7500亿参数模型讲过的是同一堵悬崖:从某个规模开始,“自由”就意味着“如果你已经有一座数据中心,那你就可以自由使用”。

只不过,小米考虑到了世界其他地方。除了这个大模型,同一系列还有一个缩小到90亿参数的版本,而这个版本已经被社区转换成可以在普通硬件上运行的形式:给 PC 用的 GGUF 版本,给 Apple Silicon Mac 用的 4 bit MLX 版本。发布当晚就有人开始传播副本。这才是今天真正的礼物,却没有登上任何人的头版。

具体来说,这对你有什么改变?

三件事,按它们到来的顺序说。

今晚,什么也没有。你既没有这些卡,也没有机架,而那个90亿参数的小模型,能做的事情,你现在的助手本来就已经能做,所以它帮不了你多少。不过如果你喜欢自己折腾,你可以把它下载下来,用你自己的数据进行微调,不用向任何人请求许可,也不会比买一块硬盘多花一分钱。一年前,大模型还做不到这一点。

今年,改变的是价格。Grok 4.7 读取一百万个 token 只收2美元,给所有人都施加了压力,而最后从中受益的会是你的订阅费。当一个企业模型的收费比六个月前的同等模型低五倍,效果却更好时,唯一剩下的问题就是谁会第一个跟上。

两三年后,改变的是下面那一层。一个采用 MIT 许可证的3090亿参数模型,意味着任何企业、任何政府机构、任何医院都可以把它安装在自己的地方运行,而不用让自己数据中的任何一行离开这里。两年前,这种能力还只属于全世界五家公司。今天,它是一个夜里就能下载的172 GB文件。这是否意味着一切都会变成免费?不会,因为总得有人来付电费。但这意味着,等到你的雇主想要一套属于自己的 AI 时,答案不再会是“不可能”。

有些事别信

先说小米的数字。那些数字都是他们自行公布的,测试使用的版本和 Grok 表格中的版本并不相同,而且测试的是他们自己训练的模型。把 MiMo 在 Terminal Bench 2.1 上的87.6%和 Fable 5.1 在 Terminal Bench 4.0 上的57.9%拿来比较,会是计算错误,而没人这么做,是因为没人让这两个模型在同一个测试中同时出现过。两者无法放在一起测量,而这正是营销最喜欢的地盘。

再说仓库的成功,这事让人微笑。我写这段话的时候,Hugging Face 页面显示有151个人给这个模型点了爱心,下载量则是零。零。大家都知道 Hugging Face 的统计会延迟,但你得承认,对于一个被宣布为革命的模型来说,这很好地显示了真实情况:人们鼓掌,然后回去继续用自己每月十美元的订阅。

还有 Grok 自己的那张表,它是 SpaceXAI 在自己的网站上发布的。它该赢的地方赢,该输的地方输,这并不意外,但终端测试上二十分的差距,却很少出现在宣传里。这值得记上一笔。

同一天出了两个模型,一个出租,一个赠送。如果由你选择,你会选哪一个?我会留着那个能在我机器上运行的,即使它更笨。我的网络断掉那天,至少它还在。

加入对话

您必须拥有一个账户才能评论这篇文章。注册免费,耗时不到一分钟。

  • 每天免费下载的 XMLTV 文件
  • 评论文章并回复其他读者
  • 通过电子邮件获知您关注的新文章

目前没有评论。

Une erreur s'est produite. Cette application peut ne plus répondre jusqu'à ce qu'elle soit rechargée.Veuillez contacter l'auteur. Reload 🗙