谁斩杀了“斩杀线”?

最近几个月,大模型圈很喜欢讲“斩杀线”。
这个词本身没有问题。把能力放在一个轴上,把价格放在另一个轴上,一个模型如果能力差不多、价格却低得多,那些更贵又没更强的模型,自然就该被“斩”掉。于是 DeepSeek 是斩杀线,后来 Qwen 是,再后来 GLM Flash 又来一条。模型更新得快,斩杀线也挺忙。
DeepSeek 当初最有冲击力的地方,本来也不只是“模型很强”,而是“模型很强,而且便宜”。假如一个 frontier 模型能力是 100、价格是 100,另一个模型能力是 80、价格是 10,那后者的性价比就是前者的八倍。“梁圣”虽然是个网络梗,背后其实有很清楚的经济学。
问题是,最近越来越让人怀疑:过去几个月大家拿来计算“性价比”的那个价格,可能根本不是用户真正面对的价格。
先从一个很奇怪的数字说起
《财经》最近做了一件很朴素的事情:不只看各家 API 官网挂出来的 Token 单价,而是真的跑 coding agent,看看一个重度用户实际花的钱,最后能换来多少 Token。
图片
结果里有个数字很扎眼:
GPT-5.6 Sol:12.5 元 / 1 亿 Token。
DeepSeek V4 Pro 涨价前是 17.5 元,V4 Flash 是 6.4 元。8 月 17 日 DeepSeek 新价格生效后,《财经》又在闲时和高峰跑了同样的测试:V4 Pro 变成 50.1 元和 102.2 元,V4 Flash 则是 13.1 元和 25.7 元。
等等,Sol?
这不是 OpenAI 拿来走量的廉价模型,而是目前最强的 coding agent 模型之一。结果在真实产品里,一个订阅用户使用 Sol 的 Token 成本,已经低于涨价后的 V4 Flash,甚至低于涨价前的 V4 Pro。
过去一年大家很习惯说一句话:“GPT 是强,但架不住国产模型便宜。”
至少在 coding agent 这里,这句话已经没有那么理所当然了。
不过如果文章到这里就结束,其实没什么意思。《财经》自己已经把这个问题讲得很清楚:API 标价和用户实际支付的成本,可以完全是两回事。
真正有意思的问题是:
为什么我们一定要用“一亿 Token 多少钱”来衡量性价比?
一亿 Token,并不是一亿 Token
DeepSeek V4 刚出来的时候,笔者第一时间就在 OpenRouter 上充了 20 美元。
那时还主要使用 Claude Code,而 Claude Code 实在太贵。V4 Pro 看起来正好:能力不错,Token 又便宜,这不就是大家一直说的性价比吗?
结果实际跑起来,20 美元似乎没有想象中那么多。尤其是 Pro,跑一阵再看余额,几美元就没了,于是很快切到了 Flash。Flash 确实便宜不少,但那 20 美元最后也没坚持多久,几天还是用完了。
这当然算不上什么严谨的实验。当时也只是觉得,coding agent 本来就费 Token。
后来再看 Artificial Analysis 的测试,事情开始有点意思了。他们测试 DeepSeek V4 时,V4 Pro 跑完整套 Intelligence Index 消耗了大约 1.9 亿 output tokens,V4 Flash 更高,大约 2.4 亿。Artificial Analysis 直接把 V4 的一个特点概括为high token usage。
这本身并不是坏事。一个 reasoning model 完全可以多想一会儿、多消耗一些 Token,换取更好的最终结果。
但它暴露了一个很简单的问题:
Token 单价低,不等于完成任务便宜。
一家出租车公司当然可以宣布自己的每公里价格只有竞争对手的一半;如果它去机场习惯绕三圈,乘客真正关心的,大概还是这一趟多少钱,而不是每公里价格有多感人。
模型也是一样。
如果模型 A 每百万 Token 只要模型 B 的一半,但完成同一个任务需要三倍 Token,那么 A 实际上已经更贵了。再考虑失败以后重试、Agent 走错路、人类回来纠正,以及模型本身的运行速度,Token 单价和真正的“性价比”之间还要隔好几层。
这还只是开始。
Luna 才是更有意思的例子
笔者长期在两个不同的产品环境里使用 GPT-5.6 Luna。
一个是自己的订阅。重度使用 Codex 时,Sol 是真的会撞 usage limit 的;但换成 Luna 以后,基本不知道它的 limit 在什么地方,因为很难用到。
另一个是公司的 VS Code Copilot,情况也类似。Luna 消耗的 credits 少得惊人,即使高强度使用,也很难把额度真正烧掉。
这当然仍然不是严格的成本测量。两个产品的 quota 和 credit 体系也不一样。
但它至少提供了两个相互独立的 sanity check:Luna 的低成本不是 API 价目表里的理论数字,而是会直接反映到用户体验里的。
更有意思的是,它并不是一个“便宜所以凑合用”的模型。
从公开的 coding-agent benchmark 看,Luna 和 DeepSeek V4 Pro 大致已经处于同一个能力区间,在不同测试上互有胜负;相对于 V4 Flash,Luna 的整体 coding-agent 能力还更强一些。
于是可以做一个很粗糙、但很有意思的计算。
OpenAI 公布的 credit 消耗里,Luna 的普通输入和 cached input 大约只有 Sol 的 1/20,输出大约是 1/16.7。而《财经》测试 Sol 时,大约 97% 的 Token 都是 cached token。
如果按照这个 Token 构成和官方 credit ratio,从 Sol 实测的 12.5 元 / 亿 Token 往 Luna 外推,结果大约是:
0.63 元 / 亿 Token。
这个数字很可能不准。
所以干脆不要相信它。
让它错十倍。
0.63 变成 6.3 元。
这时候 Luna 才刚刚追上 DeepSeek V4 Flash 涨价前的 6.4 元;而涨价后的 V4 Flash,闲时是 13.1 元,高峰是 25.7 元。V4 Pro 则是 50.1 元和 102.2 元。
也就是说,即使这个粗糙估算错了整整一个数量级,结论仍然没有翻过来。
而 Luna 的 coding-agent 能力还高于 V4 Flash。
所以真正值得争论的已经不是 Luna 到底值 0.63 元、1 元还是 3 元。一个估算如果需要错十倍甚至更多,原来的结论才能回来,那么小数点后面是多少已经没那么重要了。
梁圣呢?
这时候再回头看“梁圣”这个梗,就有点意思了。
DeepSeek 当初最漂亮的故事,其实不是“我比 GPT 强”,而是“我根本不需要比 GPT 强”。
如果 frontier 模型能力是 100、价格是 100,DeepSeek 能做到 80、价格却只有 10,那么过去那个问题非常有杀伤力:
为了多 20% 的能力,为什么要多花十倍的钱?
这也是“斩杀线”真正有力量的地方。挑战者不需要在绝对能力上登顶,只要在能力—价格平面上站到更漂亮的位置,就足以把一大片模型变得没有购买价值。
但今天如果 Luna 已经接近 V4 Pro 的 coding-agent 能力,而真实使用成本即使估错十倍,仍然可能低于 V4 Flash,那么这个问题就会很自然地反过来:
为了少一点能力,为什么反而要多花这么多钱?
这就有点尴尬了。
当然,这不意味着 DeepSeek 不行,更不意味着国产模型以后没有机会。直接调用 API 和购买 coding agent 订阅本来就是不同的产品;这个行业几个月就能换一次牌桌,下一次模型发布或者价格调整,也完全可能重新改变比较结果。
如果最后只得到一个“OpenAI 赢了,国产模型输了”的结论,那这篇文章也就和那些每个月宣布一次“新斩杀线”的文章差不多了。
真正有意思的是另一件事:
“斩杀线”可能没错,错的是横轴。
Token 不是用户真正购买的商品
过去大家画“斩杀线”,横轴通常是 API list price:每百万输入 Token 多少钱,每百万输出 Token 多少钱,cache 打几折。
在模型主要通过 API 交付的时代,这很合理。Token 是计费单位,Token 单价自然就是价格。
但 coding agent 正在改变这件事。
今天一个用户可能每个月支付一笔固定订阅费,然后让 Agent 长时间在 repository 里工作。大量 context 被 cache,平台再通过 subscription、quota、credits、routing 和 rate limit 控制自己的资源成本。API 官网写着多少钱,和用户真正为了获得模型能力付了多少钱,已经不再是一回事。
《财经》的测试其实已经往前走了一步:不要只看 API 标价,而要看真实用户每一亿 Token 到底花了多少钱。
但还可以再往前一步。
因为Token 本身也不是用户真正想买的东西。
用户并不需要一亿 Token。
用户需要的是把这个 feature 写完,把这个 bug 修掉,把测试跑通,把 repository 理清楚。
Token 更像是模型厂商生产这些结果所消耗的一种中间投入。不同模型可以使用完全不同数量的 Token、计算量和时间去生产同一个结果。
从这个角度看,拿 Token 单价比较 coding agent,有点像拿航空公司的航空煤油采购价来比较哪家机票便宜。它当然和最终成本有关,但消费者真正购买的从来不是煤油。
消费者买的是从阿姆斯特丹飞到北京。
Agent 用户买的,也不是 Token。
买的是工作。
所以真正值得比较的指标,可能应该经历三次变化:
API Token 标价
变成
用户实际 Token 成本
再变成
完成一项可靠工作的实际总成本。
到了最后这一步,Token 消耗只是其中一个变量。模型能力、任务成功率、重试次数、运行速度、人类介入时间,全部应该进入分母。
这才更接近 coding agent 真正的生产率。
谁斩杀了“斩杀线”?
所以,“斩杀线”这个概念其实仍然很好——它使得性价比的意识深入人心。
能力更强、实际成本更低的产品,当然应该斩。
问题只是,过去几个月大家忙着讨论 DeepSeek 越过了谁、Qwen 又越过了谁、GLM Flash 又把线推到了哪里,却很少回头检查一个最基础的东西:
那条线的横轴,我们画对了吗?
如果横轴是 API 官网的 Token 标价,过去那些“斩杀线”可能完全成立。
如果换成真实 Token 成本,图已经会变一次。
如果再换成完成一个真实 Agent 任务的总成本,恐怕还得再变一次。
而这可能也是 coding agent 真正改变模型竞争方式的地方:当用户开始购买“完成的工作”,而不是购买 Token,模型厂商之间的价格竞争,就已经不再只是模型 API 的价格竞争。
到那时候,真正被斩掉的,也许不是某一个模型,而是我们过去用来画“斩杀线”的那把尺子。