Kimi K3、GPT-5.6、Grok 4.5、Opus 5:2026 年 7 月,AI 彻底失控的一个月
你们 7 月初去度假了?那可不是个好主意。就在你们涂防晒霜的时候,AI 行业决定在三周内推出四个前沿模型。OpenAI、xAI、Moonshot AI 和 Anthropic 上演了一场“来,接着”的狂欢,与其说像科技市场,不如说像一场所有人同时梭哈的扑克游戏。坐稳了,我们将为你们总结这场混战,并附上经过核实的数据和完整对比。

7 月 9 日:OpenAI 推出三种版本的 GPT-5.6
OpenAI 打响头炮,推出GPT-5.6,并像餐车菜单一样分成三个版本:Sol(高端推理、代码和科学能力)、Terra(以半价提供 5.5 的品质)以及 Luna(快速且便宜的大规模版本)。Sol 尤其在智能体能力方面令人印象深刻:Terminal-Bench 2.0 得分91.9%,BenchAlign 综合得分81.96。上下文窗口为 105 万 tokens,输入每百万 tokens 收费 5 美元,输出每百万 tokens 收费 30 美元。严肃、高效,输出价格昂贵。很有 OpenAI 的风格。
7 月 16 日,双重出击:Grok 4.5 与巨兽 Kimi K3
一周后,同一天发布了两个模型(这个行业里不存在巧合)。首先是 xAI 的 Grok 4.5:在大多数基准测试中不如 Sol 强(BenchAlign 76.72,Terminal-Bench 83.3%),但在 SWE-Bench Pro 上领先,而且价格尤其低廉,为2 美元/6 美元,按 token 计算大约比 Sol 便宜 4 倍。这个性价比,确实让人难受。
然后是 Moonshot AI 的 Kimi K3,这就完全是另一个级别了。拥有2.8 万亿个参数,是迄今发布的最大开源权重模型。为了让运行成本不至于高到相当于一个国家的 GDP,它采用了混合专家(Mixture-of-Experts)架构:896 个专家中,每个 token 仅激活 16 个。简单说,就是一个只调动所需神经元的巨大大脑(我们都认识那么一两个反过来的人)。再加上混合注意力机制 KDA(每 1 层完整注意力搭配 3 层线性注意力)、100 万 tokens的上下文、原生文本/图像/视频多模态能力,以及让整个模型得以装入约 1.4 TB 空间的 MXFP4 量化技术。
精彩之处在于:K3 在Frontend Code Arena上夺得全球第一名(1,679 分),领先 Claude Fable 5(1,631 分)。一个即将可以下载的模型,在前端代码方面击败专有模型冠军,这是历史上的第一次。而且完整权重将于 7 月 27 日以修改版 MIT 许可证发布。在为此清空硬盘之前,还是先读读下方“我能在家里运行它吗?”这一节吧:现实会让人瞬间清醒。
7 月 24 日:Anthropic 以 Opus 5 回应
我们以为这个月已经结束了,Anthropic 却拿出了重磅武器:Claude Opus 5,定位为日常使用模型,能力几乎逼近旗舰级 Fable 5……但价格只有一半(每百万 tokens 输入/输出收费 5 美元/25 美元,而 Fable 5 为 10 美元/50 美元)。而且这些数字可不是摆设:
- Frontier-Bench:43.3%,是 Opus 4.8(18.7%)的两倍多,比 Fable 5(33.7%)还高出将近 10 个百分点。没错,超过了自家老大哥。
- ARC-AGI 3(流体智能):30.2%,而 GPT-5.6 Sol 最高只有 7.8%,Opus 4.8 更只有 1.5%。差距非常悬殊。
- CursorBench 3.2:距离 Fable 5 的最高分仅差 0.5%,但每项任务的价格大约低一半。
此外,它还提供 100 万 tokens 的上下文,以及 low/medium/high 三档工作强度设置,可以针对每次请求调节成本与算力之间的平衡。Anthropic 简直是在以中端产品的价格出售“几乎等同旗舰”的模型。科技公司的财务人员大概都喜极而泣了。
完整对比
因为一张表胜过再写三段话:
| Kimi K3 | GPT-5.6 Sol | Grok 4.5 | Claude Opus 5 | |
|---|---|---|---|---|
| 开发商 | Moonshot AI | OpenAI | xAI | Anthropic |
| 发布 | 7月16日 | 7月9日 | 7月16日 | 7月24日 |
| 架构 | MoE 2.8T(16/896 个专家) | 未知 | 未知 | 未知 |
| 上下文 | 1M tokens | 1.05M tokens | 500K tokens | 1M tokens |
| 价格(每 M tokens 输入/输出) | 3 $ / 15 $ | 5 $ / 30 $ | 2 $ / 6 $ | 5 $ / 25 $ |
| 开放权重 | 是,7月27日(修改版 MIT) | 否 | 否 | 否 |
| 优势 | 前端代码排名第 1(Arena 1 679) | 智能体能力(Terminal-Bench 91.9%) | 性价比 | ARC-AGI 3(30.2%),代码 SOTA |

在真实的专业任务中(GDPval-AA v2,涵盖 44 个职业、9 个行业),排名依然是:Claude Fable 5 Max(1 815)领先于 GPT-5.6 Sol Max(1 747.8)和 Kimi K3(1 687)。但在全球排名前三的模型中出现一个开放权重模型——要在一月份预测到这一点,确实需要些勇气。
“那我用自己的 Mac 或 PC,能运行它吗?”
每当有人提到“开放权重”,这就是最常被问到的问题。简短回答:不能。详细回答:还是不能,不过请坐稳,因为这里有很多有趣的事情值得说,尤其是还有一些相当不错的备用方案。
为什么“只有 16 个活跃专家”救不了你的机器
典型的误解是:“这是 Mixture-of-Experts,所以 896 个专家中只有 16 个在工作,因此我的 GPU 放得下。”错了。路由是逐 token决定的,没有人能提前知道下一个 token 会调用哪些专家。结果是:所有权重都必须一直加载在内存中。MoE 节省的是计算,而不是内存。这就像你有一座藏书 896 本的图书馆:你一次只读 16 本,但家里仍然必须放下完整的书架。
而这个书架的代价很高:2,800 亿个参数采用原生 MXFP4(4 bit),仅权重就约占1.4 TB。再加上 KV 缓存(只要涉及长上下文,很快就会达到几十 GB)和运行时。即使采用激进的 2 bit 量化(如果它能推出,并且仍然可用),也还需要约 700 GB。

产品目录中最昂贵的 Mac Studio M4 Ultra 配备512 GB 统一内存,其容量上限也只有 K3 以 4 bit 运行所需内存的大约 2.7 分之一。而在 Apple Silicon 上,统一内存还要与 macOS、KV 缓存和推理引擎共享。你永远无法真正使用账单上显示的那个数字。总之,这不是“需要正确设置”的问题,而是物理规律的问题。
那 Ollama 呢?
还不行,而且这不仅仅是大小的问题。K3 使用KDA,这是它自研的混合注意力机制(每 1 层完整注意力对应 3 层线性注意力)。这个东西必须在每个推理引擎中手动实现:截至目前,Mac 端的 llama.cpp、Ollama(基于 llama.cpp)和 MLX 都不支持 KDA。在这段代码出现之前,无论你的 RAM 有多大,都不会有 GGUF,也不能使用 ollama run kimi-k3。目前能运行 K3 的引擎是vLLM和SGLang,运行在配备高速互联的多 GPU 服务器上——这类机器甚至配有自己的断路器。
这个周末你真正能做什么
| 您的设备 | 可以实现的功能 |
|---|---|
| 便携式电脑 / 标准 PC (8 至 32 GB) | K3 只能通过云端使用:kimi.com、Moonshot API 或 OpenRouter(moonshotai/kimi-k3,兼容 OpenAI API)。本地运行则建议选择 7 至 32 B 的模型:真正的离线乐趣就在这里。 |
| 36 至 128 GB 的 Mac (M4/M5 Pro 或 Max) | 非常适合通过 Ollama、LM Studio 或 MLX 运行量化后的 27 至 70 B 模型。Qwen3.6-27B 在 24 至 32 GB 内存上运行得很轻松,时至今日仍然是我们能够亲手掌握的最佳代码成绩。K3:不行。 |
| 256 至 512 GB 的 Mac Studio | 本地 LLM 的 VIP 俱乐部:Kimi K2.6 以 Q4 量化后,通过 MLX 或 llama.cpp 可达到每秒 20 至 32 个 token(根据量化方式,占用 240 至 600 GB)。依然无法运行 K3,但这是您能够托管的最接近 Moonshot 的模型。 |
| 游戏 PC (RTX 5090,32 GB VRAM) | 在 4 bit 下运行最高约 30 B 的模型非常强悍,速度是 Mac 无法达到的。再往上,卸载到系统 RAM 会把您的聊天机器人变成一位书信往来的笔友。 |
| 您真的非常在意这件事 | 按小时租用 GPU(RunPod、Vast.ai、Lambda):使用 vLLM 或 SGLang 的 8×H200 节点。每小时需要花费几美元,而且在向模型打招呼之前,还要先下载 1.4 TB 的数据。 |
大多数团队在 2026 年推荐的配置是混合式:对于涉及敏感数据或重复性工作量的任务,使用小型本地模型;对于困难任务,则使用 K3 API。这样既能在重要领域保持主权,又不必把办公室变成数据中心,也不用向会计解释为什么买了四台 Mac Studio——“就是想测试点东西”。
为 7 月 27 日权重发布日提供一个实用提醒:请准备好存储空间(1.4 TB,可不是一根 USB 闪存盘)、带宽(下载可能需要数小时,甚至数天),以及一些耐心。需要等待社区(Unsloth 等项目)发布动态量化版本,并等待 KDA 加入 llama.cpp。从历史情况看,这需要几天到几周时间。在此之前,API 已经能够很好地完成工作。
那么,谁赢了?
诺曼底式回答:这取决于您的预算和使用场景。纯推理?是 Opus 5,以及让竞争对手相形见绌的 ARC-AGI 3 得分。工业级智能体?GPT-5.6 Sol。预算紧张?Grok 4.5,以价格取胜。主权和完全控制?Kimi K3,其开放权重将于 7 月 27 日发布。真正的赢家主要还是我们:这场价格战正以肉眼可见的速度降低推理成本,而巨头们争得不可开交之际,中国证明了可以凭借架构效率绕过芯片限制。
五年前,这些模型中的任何一个都足以占据头条半年。而现在,三周内就出现了四个,我们几乎已经觉得这很正常了。7 月 27 日见,届时下载 K3 权重;而下一次“世纪发布”很可能会在 8 月 1 日到来。
来源
- TechCrunch:Anthropic 发布 Opus 5
- Vellum:Claude Opus 5 基准测试详解
- Tom's Hardware:Moonshot 发布 2.8 万亿参数的 Kimi K3
- VentureBeat:中国 Moonshot AI 发布 Kimi K3
- Simon Willison:Kimi K3,以及我们仍能从鹈鹕基准测试中学到什么
- LLM-Stats:GPT-5.6 Sol 对比 Grok 4.5
- MindStudio:2026 年 AI 模型定价
- Modem Guides:可以在本地运行 Kimi K3 吗?2.8T 硬件的现实情况
- Layer3 Labs:如何在本地运行 Kimi K3:硬件与设置指南
- Unsloth:Kimi K2.6:如何在本地运行(动态量化)
- OpenRouter:moonshotai/kimi-k3
Join the conversation
You need an account to comment on this article. Creating one is free and takes under a minute.
No comments yet.