
本文来自微信公众号: 硅星GenAI ,作者:周一笑
开源模型最近密集到有点不讲道理。七月底到八月中,Kimi K3、Qwen3.8-Max先后放出权重、DeepSeek V4 Pro正式版也刚刚上线。与此同时,沉寂了一年多的美国开源也回来了,Meta拿出Muse Glimmer,英伟达跟上Nemotron 3.5 Lightning。
如此盛况,那可就必须把五个模型接进同一个测试环境测一测,是骡子是马拉出来遛遛。
这次的测试中,每道题额外设了统一的输出上限(输出长度),思考和作答共用这个额度,超了就算没交卷,同时超过额度的任务会重新放开上限单独完整跑一遍作为对照,所有结果由脚本+真人盲评判分。
先直接上成绩:绿格最多的是K3,十项里六项满分,DeepSeek排第二。需要注意的是表里的0分,部分是因为模型思考太长被截断,没有完整输出,后文有具体解释。

模型测试成绩
接下来我们来看看这几个开源模型的具体表现。
1
逻辑推理:两个小模型交了白卷
第一组题是24点和五位数密码锁。
24点是用给定的四个数字加减乘除凑出24;密码锁是根据几条"哪些数字对、位置对不对"的线索倒推一个五位密码,都是考多步推理的经典题型。题目全部新生成,里面还埋了一组无解的24点,看谁会硬编一个假解出来。
无解陷阱骗到了一家。K3、Qwen、Nemotron都识破了,Muse主测没答到这题,后来放开上限补跑时它上了当,硬编了一个把10用了两次的假解。
真正的意外在密码锁上,K3和Qwen全对,两个美国小模型却交了白卷,回答里一个字都没有。DeepSeek密码锁三次里有两次同样在思考撞上上限后交了白卷。
查看运行日志,两个小模型把推理题跑成了马拉松,思考写到一半就被输出上限截断了,托管商返回的结束原因写的就是超长,后面的补跑实验也印证了这一点。托管平台给这两个模型的单次输出额度本来也紧,一个只放16K token,一个只放24K。

Nemotron被上限截断的原始记录
按规则放开上限补跑。Muse Glimmer密码锁两次全对。Nemotron烧掉六万token,最后信心十足地交出错误答案。DeepSeek放开上限后,密码锁同样全对。
顺着这组题我们加了一个加时赛。
每个模型30美分,题型不变换一套新题,解不出可以重试,直到把预算花完。
Nemotron十轮花了不到10美分,24点全拿下,但密码锁还是十次都没成。
Muse密码锁前三次失败,第四次解出,15美分拿下五题全解。
K3一次认真的思考就要35美分,Qwen也要将近20美分,预算只够试一两轮。单独放开预算后K3把题解了,花费35美分,比预算线多出5美分。
这里表现突出的是DeepSeek。同一套题,它一轮全对,五题全解只花了4美分,比Muse靠重试磨出来的还便宜四倍。
2
代码画图能力:画熊猫、画地铁图、做网页,三道看得见的题
在代码呈现方面,我们先让五个模型用SVG代码画同样的画:一只白头鹰坐在共享单车前座蹬车,一只大熊猫坐后座撑伞。
SVG是用代码描述图形的格式,模型看不到画布,全凭想象在代码里摆坐标。
在这一轮,完成的最好的K3和Qwen都是能看图的多模态模型。K3的两张图都能一眼认出剧情,Qwen一张画得最满、一张没画完。
Nemotron和Muse的作品需要观众自带想象力,有点惨不忍睹。DeepSeek一张能认出剧情(鹰趴在车把上没蹬车),另一张直接没有产出。
第二道是做一个能用的网页。
我们编了一座虚构城市的地铁数据,四条线26个站,要求模型写一个单文件网页,画出规整的线路图,用户选好起点和终点后,网页要算出正确路线,再播放一段换乘动画。判分表有十项,路线算错直接判低分。
K3两次都拿满分,线路、换乘提示、动画一个不缺。Muse画出了图但路线算错,Nemotron的功能缺了一大半,Qwen在上限内没写完,页面打不开。放开上限补跑后,Qwen补交了一版完成度很高的。DeepSeek排第二。

K3寻路动画

五家地铁对比

放开上限后Qwen补交的地铁图
第三道测试把这次横评的真实数据喂给每个模型,让它们给自己的成绩单做可视化网页。
这道题输出量最大,Muse Glimmer两次都在上限内完成,拿下第二。K3一次满分,一次超限被截断。Qwen两次都没写完,放开上限补跑后完成。DeepSeek两次都在上限内完成,拿了这道题的最高分。


成绩单网页对比

DeepSeek生成的单页面

Kimi K3生成单页
3
Agent能力:接上工具修代码、洗账单,看谁能独立干完活
这个环节让模型自己动手,读文件,跑命令,改代码,一直干到收工。
agent的表现和运行环境有关,同一个模型装进不同的工具框架,成绩可能不一样。我们用最简单的循环,是为了让五家在完全相同的规则下比。
第一题是修一个埋了三个bug的小项目,要求把十二个测试全部修绿。中途我们伪造了一次工具超时,五家没有被假故障带偏,全都修到了全绿。最后的差别只在花费上,两个30B模型一次不到1美分,两个万亿参数的贵上几倍,而DeepSeek一次只要0.3美分。
看来只要是算账,就是DeepSeek赢。

修bug任务的轮次时间线
第二题是真实的脏活。
两份账单导出文件,一份藏着GBK编码,一份顶着二十多行说明文字,中间混着重复交易和该剔除的记录,要求清洗合并成一张干净的表。
K3、Qwen和DeepSeek全部满分,Muse十五轮全耗在编码问题上,Nemotron只拿到部分分数。另外我们第一次测试时托管商还不支持Nemotron的原生工具调用,这两道题它走的是纯文本协议。后面DeepInfra把支持补了上来,我们用原生工具重测了一遍,修bug依旧满分,账单题依旧没能通过。
4
写Blender脚本:建一座中式庭院
最后一个测试让模型给Blender写脚本,从零建一座低多边形的中式庭院,院墙、月亮门、松树、石灯笼、拱桥、水面都要有,脚本必须一次跑通并渲染出图。Blender的Python接口在版本之间变动很大,一个接口名写错,整个脚本就跑不起来。
K3两份脚本全部一次跑通,庭院像模像样。Qwen放开上限后也出了图。Muse的脚本一跑就报错。Nemotron先是被上限截断,放开后又把渲染引擎的接口名写错,还是没出图。
DeepSeek一份出图,另一份倒在一个早已废弃的接口参数上。

5
写作:谁更会说人话
很多人抱怨模型写东西一股AI味,我们出了四道改写题。
最简单的一道是把物业的官腔停水通知改成业主群消息,配了一道英文场景做对照。难的两道,一道是给已经吵起来的业主群写涨价说明,一道是把年度工作总结改成群里唠嗑的年终盘点。所有答卷打乱顺序,由真人盲评打分。

盲评工具
简单的题模型之间差距不大,每篇改写的关键信息倒是都没丢事实,分数差距主要在文风上。难的两道没有一个模型摸到4分,八股结构和口号频繁。DeepSeek简单题4分,难题也只有2分。K3是唯一在两道难题里都拿到3分的。不过需要说明的是,这轮测的文本都不长,结果仅供参考。

“说人话”题的高分与低分答卷

五模型核心对比(成绩、速度与价格)
6
开源模型路线更热闹了
五个模型测下来,最明显的感觉是,大模型和小模型的差距还在,但各自的长处也越来越明显。如果只看中国这三个模型,K3在冲能力上限,Qwen走稳和全能,DeepSeek则在拉升性价比。
K3的表现基本和最近几个公开benchmark的结果对得上,已经可以和最前沿闭源大模型放在一起比。这次测试里,它也是五个模型里做得最全面的一个,推理、写代码、Agent、Blender都很能打。缺点也很简单,相对贵,也偏慢。
Qwen的表现也很稳,难题基本都能做,但经常需要想很久。给它足够的时间和额度,很多事情都能做出来,只是花的时间多一些。
DeepSeek则是这次最让人意外的一个。能力不弱,价格还特别低。加时赛里五道题全做对,花费和两个小参数模型属于同一梯队。至少从这次实际花费看,它确实做到了又强又便宜。
如果这个价格还能保持下去,后面模型继续变强,DeepSeek带来的优势就不只是来自能力,而是性价比。它可能会把大家对“一个足够强模型到底该卖多少钱”的预期再往下拉一截。
小模型也没有失去意义。Muse和Nemotron在简单任务上又快又便宜,很多工作不需要上万亿参数的模型。但任务一旦变难,需要长时间推理、写复杂代码或者连续调用工具,大模型的优势还是很明显。
Meta预告旗舰Muse Spark 1.2的权重未来几周放出,阿里已经把Qwen3.8大杯的权重传上了Hugging Face。半个月里同时这么多开源模型出来的景象,一年前很难想象。不管怎么说,有了更多选择,对用模型的人来说总是一件好事。
(本次测试通过OpenRouter接入各家托管商的通道,文中的花费都按托管商标价结算,与官方API的价目表不完全匹配)
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。