
本文来自微信公众号: 动察Beating ,作者:Sleepy
10月8日,Anthropic发布Haiku 5.5。对于不超过10万token的短请求,每百万token输入收0.1美元、输出收0.5美元,只有上一代Haiku 4.5的十分之一。
当天上午,Dragonfly管理合伙人Haseeb Qureshi在X上贴出两张Artificial Analysis的散点图,配了一句:
「If you want the cheapest LLMs,you should now buy American.」
(想要最便宜的大模型,现在该买美国货了。)

散点图的横轴是完成一次基准任务要花的钱,纵轴是得分。连接所有最优解的那条虚线,在微观经济学里叫帕累托前沿,线上每一个点都意味着,在同等成本下你找不到更聪明的模型。
6月那张图上,虚线最便宜的那一端,是小米MiMo、DeepSeek V4 Pro、MiniMax-M3和智谱GLM-5.2,几乎全是中国大模型的名字。
到了10月8日,整条线被Anthropic和OpenAI接管。中国模型只剩下一个MiMo还勉强挂在边缘,智谱GLM-5.3-Flash和DeepSeek V4.1 Flash则被一掌推到了Haiku 5.5的右下方,意味着相比之下它们花得更多,得分更低。
当天港股开盘,大模型概念股应声下挫。上午10点26分,MiniMax跌幅扩大至10%,智谱跌5.6%。午盘恒生科技指数跌1.93%,两家大模型新贵跑输大盘近五倍。
过去两年,中国开源与高性价比模型,给全球大模型市场焊死了一条斩杀线。只要把价格压进泥地,海外走量档的闭源模型就难以为继。硅谷明星公司排着队把底层管道换成中国开源大模型。
如今,牌桌被掀了。
斩杀线,被斩杀了。
斩杀线的形成
2023年3月GPT-4刚上线时,8K上下文版本的官方报价是每百万输入30美元、输出60美元。
智能极度稀缺,供给由极少数硅谷寡头垄断,价格完全是卖方市场。那是一个相信「智力可以单独溢价」的蜜月期。
打破这一神话的,是一家由中国量化对冲基金孵化的技术团队。2024年5月6日,DeepSeek推出V2。2360亿总参数,每个token仅激活210亿;依靠MLA架构与极致的工程剪裁,团队将KV cache砍掉了93.3%,吞吐量拉升至5.76倍。省下来的算力直接折现为商业定价,每百万输入1元人民币,输出2元。

国内大厂几乎是被生拉硬拽拖进价格战的。
5月15日,字节跳动火山引擎发布豆包,主力模型给出0.0008元/千token的企业价,宣称比行业均价便宜99.3%。5月21日,阿里云宣布通义千问系列断崖式降价,Qwen-Long输入端折合每百万token仅收0.5元;数小时后,百度文心两款主力模型直接宣布免费。
到了8月,DeepSeek进一步引入硬盘缓存技术,缓存命中的输入token每百万仅收0.1元。
当时的大洋彼岸,巨头们并未全盘跟进。2024年7月OpenAI发布GPT-4o mini,输入输出降至0.15美元与0.6美元;但四个月后Anthropic推出Claude 3.5 Haiku,标价反而是上一代的四倍。Dario Amodei当时的逻辑是,模型更聪明了,定价必须体现智力进阶。
真正让硅谷感受到彻骨寒意的,是2025年1月。
DeepSeek-R1横空出世,推理表现直逼OpenAI o1,而输出每百万token仅需2.19美元,而那时o1的报价是60美元。
1月27日,英伟达单日市值蒸发近5890亿美元,创下美股历史纪录。Marc Andreessen将其称为AI领域的斯普特尼克时刻,微软CEO Satya Nadella在社交平台上感慨说,杰文斯悖论又灵验了。
斩杀线自此成形。
开放权重让这柄利刃更加锋利。面对闭源模型,客户只能在几份垄断价目表间做算术;而权重一旦开放,开发者既能在自己的集群上私有部署,也可以在任何一家第三方推理云上跑起同样的模型。同一个模型有了多家供应商,客户也多了自行部署的选择,模型提供方维持高溢价的空间随之缩小。
一批美国本土公司率先过了河。
2025年10月,Airbnb首席执行官Brian Chesky公开表示,公司的智能客服Agent极度依赖阿里千问,整个系统调度了13个模型,虽然也接入了OpenAI最新的旗舰,但在生产流水线里极少被调用,因为有更具性价比的替代品。
同月,Cognition推出SWE-1.5,宣称构建在「某个行业领先的开源基座」之上,智谱随后证实,该底座正是GLM-4.6。
紧接着,a16z合伙人Martin Casado对《经济学人》透露,带着开源模型架构来路演的美国AI初创企业中,大约八成用的是中国基座。
今年3月,代码编辑器Cursor发布Composer 2,定价每百万输入0.5美元、输出2.5美元,团队最终承认基座调优自月之暗面的Kimi K2.5。
开发者在用代码与预算投票。Mozilla发布的报告显示,中国开放权重模型在OpenRouter上的token份额,从2024年底的不足2%,升至2026年4月的超过45%。

在走量与结构化调用的生态位上,高傲的闭源模型一度毫无还手之力。
代价
斩杀对手,并不必然意味着自己活得体面。
Mozilla的同一份报告里,还有一组对照数据。2025年5月至9月,开放模型约占OpenRouter平台两成的模型使用量,却只获得约4%的模型层收入。这是一个平台在特定时期的样本,不能代表全球市场,但使用份额与收入份额之间的落差已经十分明显。

创造价值,从来不等于捕获价值。
今年1月,智谱与MiniMax相继敲钟。随后披露的中期业绩,让外界得以看清收入增长背后的成本与亏损。
智谱上半年收入9.54亿元,其中开放平台及API业务收入8.25亿元,占比达到86.5%。这项业务的毛利率已经由负转正,升至24.6%;但公司整体仍录得约20.72亿元净亏损,同比收窄12.1%。卖出更多token开始产生毛利,但是距离覆盖公司的全部开支,还有一段距离。
MiniMax上半年营收约1.17亿美元,同比增长283.1%;净亏损约3.58亿美元,同比收窄11%。剔除股份支付、金融负债公允价值变动及上市费用后,经调整净亏损约2.93亿美元,同比扩大111.2%。
上市之后,低价带来的增长需要接受另一重检验。每一次调用究竟能留下多少毛利,这些毛利又能覆盖多少研发与运营开支。收入增长很快,距离公司整体盈利仍然很远。
今年春末,Agent浪潮将算力消耗推向了临界点。
开源项目OpenClaw席卷全球开发者社区,至3月初在OpenRouter上的累计token消耗突破8.52万亿,雄踞榜首。3月中旬的一周内,中国模型单周跑出了7.36万亿token,环比激增56.9%。
2月12日上线的GLM-5一度登顶调用榜,汹涌的需求在瞬间击穿了基础设施配额。海外与国内开发者开始密集抱怨GLM Coding Plan出现秒级延迟和高频限流,这是中国头部AI团队首次公开告急求算力。
2月23日,智谱单日股价暴跌近23%,一日之内蒸发逾700亿港元市值。
接踵而至的,是一轮防御性涨价。
智谱在GLM-5推出时上调资费,3月的GLM-5-Turbo价格再度上浮20%,整体较上一代规格平均贵了83%。
DeepSeek在4月24日发布的V4-Pro拥有1.6万亿总参数,上线即给予75%峰值折扣。这把火先烧向了同行,MiniMax两个交易日连续下挫约9%和10%。
但到了8月中旬,DeepSeek亦转入分时计费策略,V4-Pro高峰期输出每百万token攀升至3.96美元,缓存命中成本上涨超12倍。
7月,月之暗面发布Kimi K3,API标价推升至每百万输入3美元、输出15美元,比K2.6整整贵出三倍多。
不过,令人意外的是,涨价并未引发剧烈的客户流失。
智谱CEO张鹏公开透露,一季度调价83%后,API调用规模反而激增了400%。至8月底,智谱MaaS平台的年化收入摸高到16亿美元,API业务毛利率奇迹般转正至24.6%。
在算力供不应求的数月窗口期内,中国模型团队第一次触摸到了难能可贵的定价权。
然而,那条曾让海外巨头寝食难安的斩杀线,也在不知不觉间,被它们自己推高了。
闪电战
大洋彼岸在夏天完成了战略调头。
6月底,Anthropic发布Sonnet 5,标出每百万输入2美元、输出10美元的首发促销价,原本明确声明9月将恢复至3美元和15美元。
而到了7月,OpenAI推出GPT-5.6系列,三周后突然发动闪电战,Luna价格降低80%,输入端跌至0.2美元,输出端降至1.2美元。

OpenAI将这次降价归功于纯粹的底层工程重构,重写的GPU kernel将端到端服务成本压低了约20%,重新训练的投机解码草稿模型令生成吞吐提速15%以上。
8月10日,Anthropic撤回涨价通告,宣布Sonnet 5永久锁定低价。
9月22日,Anthropic掏出Opus 5.5,综合使用成本下调40%;同日OpenAI推出GPT-6 Sol与Luna,Luna将入门价锁死在输入0.1美元、输出0.5美元。随后登场的,便是Haiku 5.5。
两年前坚信「智能必须享有单独溢价」的Anthropic,亲手撕掉了自己的标签。
现在大模型发布时的话术也变了。不再是纯粹罗列MMLU的微弱胜出,他们开始反复强调单位美元产出、延迟与每一步推理消耗的工程效率。
并且,在Haiku 5.5亮相同时,Anthropic宣布向订阅用户全面配发API额度,Max级别每月赠送100至200美元,企业Team用户最高可享500美元抵扣。
这招直切腹地。价目表上的折扣只影响单次调用决策,但一旦客户的代码工程与Agent编排完成适配,撬动迁移的壁垒将高如城墙。
美国巨头敢于发起这场价格战,靠的是深不可测的资金池与供应链特权。
Anthropic的年化营运收入,从2025年底的约90亿美元,狂飙至今年7月底的超650亿美元。5月完成的那笔高达650亿美元的融资,直接将其估值推上9650亿美元。
在算力层面,Anthropic于4月宣布扩大与Google、博通的合作,获得多吉瓦级的下一代TPU算力容量,预计从2027年起陆续上线。
与之对照,智谱年内通过配售及可转债艰难筹集700余亿港元,折合美元,不及Anthropic单轮弹药的七分之一。
出得起钱的,依然只有超级巨头。
二级市场的清算向来不留情面。
智谱于1月8日登陆港股,发行价116.2港元。春季的算力荒未能阻挡多头的狂热,6月22日其股价冲至2980港元,市值一度触碰1.33万亿港元天花板。
随后是漫长的下跌。
7月限售股解禁,两轮配售将定增价从1588港元一路砸至714港元。7月16日Kimi K3登场次日,智谱全天下挫28.48%。9月22日Opus 5.5与GPT-6联袂出击,智谱跌幅再度超过10%。
9月25日,智谱盘中探底至610.5港元,总市值缩水至3000亿港元附近,自历史高点回撤近八成。
MiniMax的轨迹同样惨烈。自1330港元峰值下坠,解禁当日重挫17.98%,7月中旬收于216港元。其上半年近六成收入仰赖海外客户,而海外,正是美国巨头降价风暴首当其冲的战场。
估值口径也开始收紧。据媒体转述,杰富瑞在9月的研报中,将智谱云业务对应的2026年预测年化收入估值倍数,从50倍下调至30倍,降幅为40%。
中国模型曾经凭借极致性价比从巨头口中虎口夺食,而如今,这条路在大洋彼岸也走通了。开发者因便宜而来,自然会因更便宜而去。
0.1美元的幽灵
2006年8月25日,Jeff Barr在墨西哥卡波圣卢卡斯一片燥热的海滩边,敲下了介绍Amazon EC2测试版的文章。
在技术说明的末尾,他写下了一个注定载入商业史的数字,开发者租用一台虚拟计算实例,每小时收费0.1美元。
其后的故事众人皆知。AWS在接下来的十余年里主动下调价格逾百次,2014年仅S3存储费率便腰斩51%。
云计算从未靠着将同等算力越卖越贵来成就霸业。规模、底层自研芯片与极致运维压榨出的每一分边际利润,被源源不断地回馈给终端市场,进而吸引更多开发者。持续降价的AWS最终成长为年营收近1300亿美元、营业利润率高达35.4%的现金奶牛。
价格战,是规模垄断者最后的围剿战术。
今天能够把模型价格压到一折、发布即刻铺满全球三大公有云货架的人,不仅在贩卖token,更在消化token。Anthropic一边血洗API价格,一边用庞大的推理算力反哺Claude Code、Cowork与自身的端到端Agent产品。
中国大模型团队依然没有放下武器。9月DeepSeek再度下调Flash系列资费,小米将MiMo-Flash推向1元/百万token的极限,智谱亦将GLM-5.3-Flash定价死磕在微利区间。但牌桌上的筹码规则已经改写。
低价本身,已经不再是一张具备排他性的护城河牌。
在那张由Artificial Analysis实时更新的散点图上,中国公司的名字一家都没有缺席。GLM、DeepSeek、Kimi、千问、MiniMax依然都在。
只是,它们现在已经划不出那条斩杀线了。
如对本稿件有异议或投诉,请联系 tougao@huxiu.com。