开发者每个月到底该在 AI 上花多少钱?
我测量了自己十四天里的实际用量。然后我套用了市场上的官方费率表,计算出每个方案每百万 token 的价格。这次我先从答案开始。这篇文章的第一版列出了所有数字,却没有清楚地回答这个问题。
所以答案来了。表格放在后面。
你现在就该选什么
| 你的情况 | 你该选什么 | 每月 | 含税欧元 |
|---|---|---|---|
| 你在学习,或者晚上自己捣鼓 | 通过 API 使用 GLM-4.7 Flash,免费,再在自己的机器上用 Ollama | $0 | 如果你已经有显卡,就是 0 欧元 |
| 你靠写代码谋生 | 用 Claude Pro 负责判断,GLM Coding Lite 负责量,再准备一点 DeepSeek API 额度应付超出部分 | $58 | 大约 65 欧元 |
| AI 就是你的工作台,从早到晚都在用 | Claude Max 20x,再加 GLM Coding Pro 作为第二引擎 | $272 | 大约 303 欧元 |
| 你们有五个人 | Copilot Business,每个席位 $19,共享一个 GLM Coding Pro,再准备一些额度用于测试 | $190 | 大约 212 欧元,如果你有公司可以抵扣 |
如果你真的一点都不想费心,买 Claude Pro,$20。你不会吃亏。只是在达到上限的那天,你会多付一点钱。
好了。你可以关掉这个标签页了。后面的内容会解释我是怎么得到这个答案的。尤其会说明,编辑器显示的价格,和你实际要付的钱几乎没有关系。
显示出来的价格在骗人,而且我可以告诉你骗了多少
订阅服务已经不再直接卖 token 了。Claude Pro、ChatGPT Plus 和 GLM Coding Plan 卖的是五小时窗口和每周上限。所以要计算每百万 token 的价格,就得知道自己的实际用量。我去测了测自己的。
我分析了 Claude Code 会话在 ~/.claude/projects 里的日志:724 个文件,时间从 2026 年 7 月 28 日到 8 月 11 日。我的脚本会把 API 在每次响应中声明的 token 加起来,然后套用 Anthropic 的费率表。
| 我测量的内容 | 结果 |
|---|---|
| 周期 | 14天,从28/07到11/08/2026,724个会话文件 |
| 消耗的Tokens | 58.5亿 |
| API本来会向我收取的费用 | $4,867,也就是每月大约$10,400 |
| 每百万的平均成本 | $0.84,而不是$5或$25 |
| 缓存读取 | 占总量的95.81% |
| 缓存写入 | 占总量的3.60% |
| 输出,实际写入的代码 | 占总量的0.55% |
| 之前从未见过的输入 | 占总量的0.04% |
Claude Opus 5的输入价格是每百万Tokens 5美元,输出价格是25美元。可是,我的实际成本降到了0.84美元。为什么?代码代理会把时间花在反复读取同一个仓库上。这些重复读取来自缓存,也就是供应商保存的一份上下文副本,收费低了十倍。它们占了几乎全部的总量。实际生成的代码只占半个百分点。
那些假设输入占70%、输出占30%的对比,会按照Opus 5的价格表算出每百万11美元。我测出来的是0.84美元。他们的结果高了十三倍。
但另一个结果让我抬起了头。我在第一版里没有注意到它。
总量的3.6%,账单的27%。缓存写入就是电影院里的爆米花。
缓存读取占总量的95.81%,但只占账单的57%。缓存写入只占总量的3.6%,但占价格的27%。大约三十分之一的流量,却花掉了四分之一的账单。这就是你的钱花掉的地方。没人谈这个,因为这个成本在任何一个定价页面上都没有清楚地显示出来。
所以接下来我全程采用一个简单的规则:我用四种价格重新计算每一行,输入、缓存读取、缓存写入和输出。没有通用公式。没有缓存的模型会按全价为每次重复读取收费。差别很惊人。
effectif = cache_lecture x 0,9581
+ cache_ecriture x 0,0360
+ sortie x 0,0055
+ entree x 0,0004两个保留意见。我的使用方式很极端:我会并行调度多个子代理,这解释了测量中每天累计二十小时的会话时间。我也没有测试本文的四十种方案。我每天都使用Claude Code,也用Ollama捣鼓过。剩下的内容,我依据官方价格表。
一次性看完这张表
这里是整个市场的一张表,从最便宜到最贵。能力指数是我自己的。我根据8月10日在 BenchLM 上记录的 SWE-bench Verified 和 SWE-bench Pro 结果制作了这个指数,然后在没有公开分数时,补充了我自己的感受。一个星号表示估算值。价格直接来自官方来源。
| 模型 | 指数 | 输入 | 缓存 | 输出 | 实际 | 在哪里获取 |
|---|---|---|---|---|---|---|
| GLM-4.7 Flash | 48* | 免费 | 免费 | 免费 | $0 | API 和本地 |
| DeepSeek V4 Flash | 60* | $0.14 | $0.0028 | $0.28 | $0.009 | API |
| DeepSeek V4 Pro | 74* | $0.435 | $0.0036 | $0.87 | $0.024 | API、开放权重 |
| GPT-5.6 Luna | 58* | $0.20 | $0.02 | $1.20 | $0.033 | API 和订阅 |
| MiniMax M2 | 64* | $0.30 | $0.03 | $1.20 | $0.049 | API |
| Qwen3 Coder Next | 66* | $0.30 | $0.03 | $1.50 | $0.051 | API、开放权重 |
| Qwen3.7 Plus | 68* | $0.40 | $0.04 | $1.60 | $0.065 | API |
| GLM-4.7 | 70* | $0.60 | $0.06 | $2.20 | $0.091 | API、开放权重 |
| Claude Haiku 4.5 | 62* | $1.00 | $0.10 | $5.00 | $0.169 | API 和订阅 |
| GLM-5.2 | 76* | $1.40 | $0.14 | $4.40 | $0.209 | API 和订阅 |
| Kimi K2.7 Code | 72* | $0.95 | $0.19 | $4.00 | $0.239 | API、开放权重 |
| GPT-5.3 Codex | 82* | $1.75 | $0.175 | $14.00 | $0.308 | API 和订阅 |
| GPT-5.6 Terra | 84* | $2.00 | $0.20 | $12.00 | $0.330 | API 和订阅 |
| Gemini 3.1 Pro | 80* | $2.00 | $0.20 | $12.00 | $0.330 | API 和订阅 |
| Claude Sonnet 5 | 86 | $2.00 | $0.20 | $10.00 | $0.337 | API 和订阅 |
| Grok 4.5 | 75* | $2.00 | $0.30 | $6.00 | $0.393 | API 和订阅 |
| GPT-5.4 | 78* | $2.50 | $0.25 | $15.00 | $0.413 | API 和订阅 |
| Kimi K3 | 78* | $3.00 | $0.30 | $15.00 | $0.479 | API、开放权重 |
| GPT-5.6 Sol | 88* | $5.00 | $0.50 | $30.00 | $0.826 | API 和订阅 |
| Claude Opus 5 | 100 | $5.00 | $0.50 | $25.00 | $0.844 | API 和订阅 |
| Claude Fable 5 | 98 | $10.00 | $1.00 | $50.00 | $1.687 | API 和订阅 |
| GPT-5.5 Pro | 85* | $30.00 | 无 | $180.00 | $30.825 | API |
价格以每百万 token 的美元价格标示。数据于 2026 年 8 月 12 日从官方页面采集。“缓存”一栏对应缓存读取的价格。
价格相差九十倍。能力相差两倍。找找哪里不对。
有四个结论一眼就能看出来。最后一个纠正的是一位非常仔细的读者发现的错误:两天后的我自己。
首先,缓存读取价格几乎决定了一切。DeepSeek 对这项读取收费 0.0028 美元,也就是输入价格的 2%。大多数其他供应商收取 10%。对于一个不断循环读取自身上下文的 agent 来说,这个差距比标出来的输入价格重要得多。这样一来,DeepSeek V4 Flash 的价格降到了每百万 token 不到一美分,比 Opus 5 便宜九十三倍。
其次,有两家供应商收取的缓存价格高于平均水平,而这几乎没有引起注意。Kimi K2.7 按输入价格的 0.20 倍收取读取费用。Grok 4.5 按 0.15 倍收取,而其他地方几乎都是 0.10 倍。因此,它们的实际成本分别上涨了 50% 和 25%。
第三,Gemini 还设置了一个我在其他任何地方都没见过的陷阱。除了读取之外,Google 还按每百万 token 每小时 4.50 美元收取缓存存储费用。如果你让缓存开着去吃午饭,它会继续花你的钱,却一个 token 都不会重新读取。噗。现在你知道了。
最后是 GPT-5.5 Pro。这个模型没有任何缓存价格。在第一个版本里,我还是给它套用了缓存折扣。错误蠢得离谱,后果大得离谱。没有缓存时,95.81% 的重复读取都按原价计费:每百万 30.83 美元,也就是 Opus 5 的三十七倍,而不是我写的六倍。它的代码表现更差,价格却贵了三十七倍。对于 agent 来说,这不是贵。这是直接淘汰。
还有两个门槛值得你注意。Gemini 和 Grok 在上下文超过 200,000 个 token 后会将价格翻倍。在 Grok 这里,这次翻倍适用于整个请求,而不只是超过门槛的 token。GPT-5.6 在 272,000 个 token 处设置了同样的陷阱。当上下文越过限制时,账单不会慢慢上涨。它会一下子翻倍。
订阅,以及它们真正隐藏的东西
在这里,我们离开公开的价目表,进入模糊地带。表格展示了两件事:套餐价格,以及厂商实际公布的额度上限。第二栏已经说明了不少东西。
| 套餐 | 每月 | 这个上限真正说明了什么 |
|---|---|---|
| Claude Pro | $20,或按年付费$17 | 5小时窗口,每周上限,没有公布具体数字 |
| Claude Max 5x | $100 | Pro的五倍,仍然没有具体数字 |
| Claude Max 20x | $200 | Pro的二十倍,在我这里测得的结果:每月125亿tokens,也就是每百万tokens $0.016 |
| GLM Coding Lite | $18 | 每周10,000积分,已公布具体数字。根据你的缓存命中率,约为43到87 Mtok |
| GLM Coding Pro | $72 | 每周60,000积分,已公布具体数字 |
| GLM Coding Max | $160 | 每周140,000积分,已公布具体数字 |
| ChatGPT Plus | $20 | Sol上每个5小时窗口15到90条消息,现在还公布了以每百万tokens积分计算的表格 |
| ChatGPT Pro | 5x为$100,20x为$200 | Plus的倍数。不是无限量,文档对此有明确说明 |
| ChatGPT Business | 每个席位$25,按年付费$20 | 推理模型每周3,000次请求 |
| Google AI Pro | €21.99 | Code Assist每天1,500次请求 |
| Google AI Ultra | €99.99 | 每天2,000次请求 |
| SuperGrok | $30 | 以百分比表示的每周配额。没有绝对数字 |
| GitHub Copilot Pro | $10 | $10积分,按API价格消耗 |
| GitHub Copilot Pro+ | $39 | $39积分 |
| GitHub Copilot Business | 每个席位$19 | 每个席位$19积分 |
| Cursor Pro | $20 | 包含$20的用量,按API价格计算 |
| Cursor Ultra | $200 | 包含$400的用量 |
| Zed Pro | $10 | $5积分,之后按API价格上浮10%计算 |
| Le Chat Pro | $14.99 | 每天150条快速回复 |
三点说明:
GitHub Copilot 已于 2026 年 6 月 1 日改为按使用量计费。你支付 10 美元,就能获得 10 美元的额度。1 比 1。这已经不太算是套餐了,而是一个套着编辑器外壳的 API。Cursor 和 Zed 也是一样,它们按编辑器的价格把 tokens 转卖给你,再附带一个每月额度。对于这张表里的一半产品来说,“订阅”这个词已经没什么意义了。
GLM 仍然是唯一一个用可验证单位公布上限的产品。它的系统在 7 月 30 日改过:不再按“提示词”计算,而是按额度计算,Lite 套餐每周有 10,000 个额度。我换算成 tokens 的结果假定缓存率为 90.9%。这个数字来自文档,不是我凭空编的。其他供应商都躲在无法验证的五小时窗口后面。Claude 在这一点上最糟,偏偏我用的就是它。我写出来也觉得烦,但事实就是这样。
我自己的数字还是最有说服力。十四天里,我消耗了相当于 4,867 美元的 API 用量。和同一时期的 Max 20x 价格相比,比例是52 比 1。按这种使用方式,没有任何套餐能做到划算。要么 Anthropic 在大规模补贴使用量,要么上限让几乎所有人都无法达到这个水平。可能两者都是。我不会对此抱怨得太大声。
四层方案,以及它们何时会崩
四层楼。唯一要做的选择,就是看你住在哪一层。
你在学习,$0。 GLM-4.7 Flash 通过 API 完成大部分工作。Ollama 负责自动补全和离线工作。只要任务需要真正的推理能力,这一层就会崩:模型会原地打转,而你得知道如何接管。只有当你已经拥有一块显卡时,这一层才算真的免费。否则,一块二手 4090 要花 1,500 欧元,按三年折旧计算就是每月 42 欧元。免费的东西也有账单。
你靠写代码谋生,$58。20 美元的 Claude Pro 提供判断力。18 美元的 GLM Coding Lite 提供用量。大约 20 美元的 DeepSeek API 用来吸收超出的需求。你先让便宜的模型打好基础,再让最好的模型进行润色。花 20 美元,DeepSeek V4 Flash 按实际价格能提供超过 20 亿个 tokens。没错,20 亿。这一层会在你整天泡在里面时崩掉。Claude Pro 会先于其他东西达到上限。这就是该升级到 Max 的信号。
AI 是你的职业,而且你晚上还在写程序,$272。Claude Max 20x 作为主引擎。GLM Coding Pro 并行运行,作为第二引擎。这大致就是我的方案。计算很简单:如果使用 API,我的用量每月会花掉 10,400 美元。即使除以五,代表更合理的使用量,这个订阅仍然便宜十倍。你为此放弃了什么?272 美元。到了这个层级,你主要是在花钱买一个不用再盯着计数器看的权利。说实话,这个价格值得。
AI 是你的职业,但你晚上和周末不再写程序: 一个优化得当的 200 美元 Claude Code Max x20 订阅(不要放太大的 Claude.md,如果你写的是 .Net 代码,就在 mcp 里使用 Roslyn(这样可以避免到处 'grep'))也可能已经够用了,具体要看你的用量
你们有五个人,$190。Copilot Business 每个席位收费 19 美元,涵盖自动补全以及与代码仓库的集成。一个共享的 72 美元 GLM Coding Pro 用来处理大型任务。大约 20 美元的 OpenRouter 额度可以用来测试其他模型,不必开五个账户。缺点是,没有人能一直使用顶级模型。如果整个团队整天都在使用重量级代理,就得换成 Claude Team 席位。预算届时会直接上一个数量级。
本地部署和聚合器,两个值得了解的绕路方案
本地部署并不免费。这大概是这个话题上最流行的谎言。电费不高:按比利时的电价,以 350 瓦的满载功率计算,每生成一百万个 tokens 大约需要 0.55 欧元。真正的成本是显卡。一块二手 4090 大约要 1,500 欧元,三年折旧下来每月 42 欧元,这还没算你写下第一行代码之前的成本。一块 700 欧元的二手 3090 可以运行同样的模型,速度大约慢 20%,但能把折旧成本减半。
| 本地模型 | 评分 | VRAM | RTX 4090 上的吞吐量 | 我的看法 |
|---|---|---|---|---|
| Qwen3-Coder 30B | 55* | 19 Go | 40 到 60 tok/s | 最好的选择。它的专家架构每次只激活 33 亿个参数,所以尽管体量大,速度依然很快。它的 256K 上下文对于本地模型来说大得离谱。需要一张 24 Go 的显卡 |
| Qwen3.6 27B | 50* | 17 Go | 大约 30 tok/s | 稠密模型,也就是说每个 token 都会用到所有参数。结果差不多,速度却几乎慢了一倍 |
| GLM-4.7 Flash | 48* | 19 Go | 我这里没测 | 198K 上下文,同样的体量。这是一个可信的方案,如果你更愿意把显卡留给别的事情,它也可以通过免费 API 使用 |
| 完整的 Kimi 和 DeepSeek | 70 及以上* | 200 Go 及以上 | 非常慢 | 纸面上很漂亮,在开发者电脑上却根本没法用。需要一台装有多张显卡的工作站,或者一台配备 128 Go 的 Mac,结果还是拖拖拉拉。留给好奇的人折腾 |
能力差距确实存在。一个能装进 19 Go 显存的本地模型,在我的评分中大约能达到 55,而 Opus 5 是 100。这不只是完成度上的简单差异。这是一个补全一行代码的助手和一个能独自重构模块的智能体之间的差距。本地模型主要适合自动补全、机械性任务,以及不能离开任何一台机器的代码。至于其他事情,便宜的 API 比显卡的折旧成本还低。
我们来看看聚合平台。它们是中间商,提供一个账户和一张账单,让你访问几十个模型。
OpenRouter 不从推理中抽成。它的文档写得很清楚。这个服务靠充值收取费用,银行卡支付的手续费是 5.5%。没想到吧,它甚至可能比厂商更便宜,因为它会把请求转给自己网络中最便宜的供应商。Kimi K2.7 在那里要 0.68 美元,而 Moonshot 要 0.95 美元。我当时写过“如果量大,直接找厂商”。所以还是要逐个核实,因为这已经不总是正确了。
Together AI 的价格也低于某些厂商。Hugging Face 宣布不抽成,并且每月为 PRO 账户提供 2 美元额度。Fireworks 按模型大小公布价目表,每百万 token 收费 0.10 到 1.20 美元。在 Cerebras,两个 Code 套餐分别是每天 2400 万 token 收费 50 美元,以及每天 1.2 亿 token 收费 200 美元,目前都显示为“sold out”。卖速度就是会有这种结果。
到秋天会发生什么变化
我们先从一个好消息开始,它会推翻我第一版中的一句话。我曾写道,Claude Sonnet 5 的 introductory price 会在 8 月 31 日到期,之后涨到 3 美元和 15 美元,并且我会在 9 月更新表格。涨价取消了。Anthropic 将 2 美元和 10 美元的价格永久保留。因此不会有任何更新计划。Sonnet 5 仍然是每百万有效单位 0.337 美元,这让它成为表格中能力与价格比最高的模型。
相反,DeepSeek 在其文档中宣布即将大幅涨价。不要根据 0.009 美元的价格来制定你的年度预算。
SuperGrok Heavy 也从 xAI 的官方页面上消失了。现在只剩下 30 美元的 SuperGrok 和 100 美元的 SuperGrok Plus。网上流传的 300 美元金额来自博客,从来没有出现在厂商的页面上。
我的结论
一个模型标出来的价格几乎说明不了你的实际账单。缓存读取价格很重要,因为读取占一个代理消耗量的 96%。缓存写入也很重要,因为它只占大约三十分之一的流量,却会产生四分之一的账单。两个标价相同的模型,最后的比例可能达到一比五。至于没有缓存的模型,不管得分如何,都会直接被淘汰。
表格顶部和底部之间的价格差距大约达到 90 倍,而能力差距只有 2 倍。这并不意味着高端模型没用。如果一个小模型在某项任务上失败了,它价格低也没有意义。结果才是唯一重要的东西。相反,把每项任务都交给最贵的模型,仍然是纯粹的浪费。因此,一个好的技术栈会结合两个模型。
如果你只能记住一个数字,就记住这个:每月 40 到 60 美元,也就是含税大约 45 到 65 欧元,如今一个独立开发者就能获得一年前还要花几千美元才能买到的算力。问题已经不再是“值不值得”。而是“该怎么组合”。答案就在页面顶部。
文章写于 2026 年 8 月 12 日,价格可能会在此期间发生变化。



Join the conversation
You need an account to comment on this article. Creating one is free and takes under a minute.
No comments yet.