2026-08-13 10:03

一夜之间,DeepSeek V4 Pro和Grok 4.6把全球大模型推上了新的高度

author_path 数字生命卡兹克©
头图

本文来自微信公众号:数字生命卡兹克,作者:卡兹克,原文标题:《一夜之间,DeepSeek V4 Pro和Grok 4.6把全球大模型推入了新的斩杀线》,头图来自:AI生成


今天,可以说是神奇的一天。


两个事:一个是DeepSeek V4 Pro正式版发布。



另一个是Grok 4.6正式发布。



这是一夜,2个小时之内发生的事。


而且有趣的是,这两全都是同等参数模型。


一个1.6T,一个1.5T,但是都在今晚,逼近了Claude Fable 5的体验。


然后呢,我在体验完以后,也用脚投票了。


我人生第一次为Grok怒氪了300美元的SuperGrok Heavy会员。



同时,调头给DeepSeek的API充了1000块钱的额度。



雨露均沾了一下。


而且,这两个模型发布以后,我觉得现在这个大模型的市场,会有一层非常鲜明的斩杀线了。


这一轮大模型,可能又会被淘汰掉很多很多玩家。


从曾经的Claude遥遥领先,让人感受到绝望的差距,到现在,各领风骚好几周,也才不过短短3、4个月而已。


所以在今天这个疯狂的时间点,我也更新一下我自己现在的常用AI组合:


首先,我未来的日常主力Vibe Coding产品,会使用Grok Build + Grok 4.6了,理由我后面会说。


第二,ChatGPT和Codex。


它们会继续负责最困难、绝对不能出任何差池的超大型任务,还有日常的所有办公任务、创意、内容生产,以及浏览器操控和电脑操控相关。


第三,DeepSeek V4 Pro正式版。


因为无与伦比的性价比,我会把大量不要求实时反馈的自动化任务、异步任务,还有我开发的产品比如AIHOT里面的一些自动化Agent工作交给它。


这就是我今晚重新分配完以后,暂时形成的模型组合。


鬼知道后面的新模型诞生后,会不会变,但是目前来说,这确实就是我自己用着最舒服的最优解。


之所以这么分配,理由特别简单。


因为我一直觉得,大模型其实存在一个很难同时满足的不可能三角。


性能。


价格。


速度。


这就是过去几乎满足不了的不可能三角。


前面两项大家可能讨论的最多的,但是最后一条常常被人遗忘。


因为速度这事,你真的只有天天用,你才能感受的到,因为不止跟模型有关系,也跟厂商的推理能力、算力储备有关系。


如果你和我一样,每天接近十个小时的时候,几乎都在让各种Agent不停歇的干活,速度有时候就是一个至关重要的因素。


我现在其实已经快接受不了Codex用GPT-5.6 Sol正常模式的速度了。


一个任务十几分钟很常见,半小时起步也不稀奇,有些任务常年能干到一个小时。



我最讨厌的就是十几分钟或者半小时一个反馈,硬生生的把我的时间切成一块一块的碎片,然后这个时间我又百无聊赖,只能在那刷X,导致我最近刷X的时间都暴涨。



所以最近我用Codex,常年被迫开着Fast模式。



然后我的额度那烧的,我是200刀会员,随便跑两天,额度就撑不住了。



这是一个非常非常非常现实的情况。


也是我过去很长时间里,我每天真实面对的模型的不可能三角。


聪明的,比如Claude Fable 5、GPT-5.6 Sol,经常是又贵又慢。


便宜的,速度确实经常也快,但是性能又经常差一截,比如DeepSeek V4 Flash,日常确实够用,但是对于我这种菜逼来说,我还是需要更强的模型能力来拔高我的上限。


速度快性能又好,那基本就是各种Fast模式,你也便宜不了。


这就是大模型的不可能三角,更是整个行业的斩杀线。


但是,就在今天凌晨,DeepSeek V4 Pro和Grok 4.6从两个方向,一起把这个不可能三角,逐渐的撕开了一个口子。


按照目前定价,DeepSeek把Fable级Agent能力压到了百万输出Token 0.87美元,虽然之前发过涨价预告,不知道涨价完以后多少,但是我觉得应该超不过2美元。


而Grok 4.6更是把接近Fable 5的综合能力变成了2美元输入、6美元的输出价格,而且还给了我一个快到有点离谱的真实开发体验。


于是,新的斩杀线形成了,我把那个著名的大模型斩杀线的图补了这次的DeepSeek V4 Pro和Grok 4.6,DeepSeek V4 Pro的分因为还没出,我大概根据跑分,算了一下,估计就是56~58左右。



大模型世界,再无活口,全面覆盖。


先看DeepSeek V4 Pro的跑分。



跑分看着是比较夸张的,这么多跑分,其实你就关注两个就行。


一个是Terminal Bench 2.1,你可以把它简单理解成,让模型自己进入电脑终端,装环境、敲命令、处理报错,最后真的把任务做完。


DeepSeek V4 Pro预览版只有72.1,正式版直接涨到了87.9,而Fable 5是88.0,只差0.1。


第二个,是DeepSWE。



这个是我重点看的一个评测集,它需要更接近真实的软件开发,模型需要自己读懂一个代码项目,再处理里面复杂的工程问题。


DeepSeek从12.8一路冲到了62.7,一次涨了将近50分。


Fable 5是70分,所以DeepSeek依然有差距,可它已经从几乎干不了,还是大幅强化了很多,能干活一点了。


其他什么代码仓库理解、网络安全、自动化和工具调用,趋势也都差不多。


只要给它工具,让它真的开始操作环境,DeepSeek V4 Pro就会迅速逼近Fable 5,个别项目甚至还能超过。


但是它的短板也很清楚。


不使用工具,只考模型自身知识和推理时,它和Fable 5还会差十几分。碰到最困难的软件工程和复杂全栈任务,也依然会落后几分。


所以,我更愿意把它叫作Agent和Coding领域的准Fable级模型。


它在工具环境里的战斗力已经进了第一梯队,但是纯知识、困难软件工程、和超长期稳定性其实在我自己测试下来,也是感觉有点问题的。


特别还有个致命的点,就是还是没有多模态。


但是这个所谓的致命点,在如此离谱的价格和缓存命中率下,也不算啥了。


Fable 5的API价格,是百万输入Token 10美元,百万输出Token 50美元。


DeepSeek V4 Pro当前是百万输入Token 0.43美元,百万输出Token 0.87美元,缓存命中输入只有0.0036美元。


普通输入大约便宜23倍。


输出大约便宜57倍。


缓存命中输入的差距接近276倍,有一说一,DeepSeek的缓存技术实在是过于黑科技了,不仅便宜,命中率还极高。



这个价格,还挑个屁对吧,当然,前提是DeepSeek V4 pro不涨价,如果涨价不多的话,那未来搭配WorkBuddy,我觉得就是新一代的真神组合了。


我把DeepSeek V4 Pro直接接进Claude Code,实际跑了一些开发和Agent任务。


能力确实是不错,尤其是开发和工具调用,我能很明显感觉到它和预览版已经完全是两种状态了,预览版我其实吐槽过很多,现在至少是可以的,不开发大活你基本也分辨不出来啥区别。


这个模型,在经济价值上,直接就是新一代斩杀线了。


但是呢,问题就来了,那个不可能三角的定理还是在,就是DeepSeek V4 Pro实际开发速度,真的挺一般的。


尤其是当我同步在用Grok 4.6,那边都跑三任务了,这边一个还没跑完,这个速度的对比,还是挺强烈的。


不过如果你对任务的实时性和速度没有那么高的要求,或者跟我一样,就是跑异步自动化,那我觉得,这就是一个当今完美的模型。


以前我可能会习惯性把那些自动化任务任务全部挂在Codex上。


但是今天,我基本全切到DeepSeek V4 Pro了。


然后就是我的新宠,Grok 4.6。


讲道理,这是当今唯一一个,我觉得快把不可能三角拉满的,综合性能媲美Claude Fable 5,速度快到飞起,价格比DeepSeek这种价格屠夫要贵,但是相比现在OpenAI和Anthropic的旗舰模型,直接就砍了好几倍。



Grok 4.6的API起步价格,是百万输入Token 2美元、输出Token 6美元。


输入比Fable 5便宜5倍,输出便宜大约8.3倍。


虽然你看价格和性能跟Kimi K3差不多,但是这个价格,你不能这么算,因为,老马家是有订阅的。


我今天开了300刀的SuperGrok Heavy,而且现在还有活动,你订阅SuperGrok Heavy,还可以直接送你Cursor的价值200刀的Ultra会员。



也就是300刀,你能享受两个会员订阅的额度。


Cursor里面可以用一堆的Claude模型啥的,我就不提了,就单说这个SuperGrok Heavy,你们知道它的额度有多离谱吗。


我从2点多订阅完,一直用他们的Grok Build然后Coding到了早上6点。


4个小时,而这个额度,一共只消耗了2%,从1跳到2%,还是5点半左右涨的,也就是前3个半小时,我一直开发,还加上用Heavy开了N个Agent去深度调研,我只用掉了周额度的1%,即使我知道这是第一周包含了双倍用量,但这依然也太离谱了。



你要按这个额度算,绝对是便宜的没边的级别,我甚至还没有算上Cursor的额度。


综合性能也极强,基本跟Kimi K3比,除了前端审美差一些,其他的我感觉是没啥区别的。



而且在真实世界的任务中,比如做财务模型、PPT、法律案件之类的,Grok还能赢一些,但是短板依然还是开发和Agent上,这块确实比Fable 5还要差一些。


所以我说的是准Fable级的模型了。


而它的开发速度,更是舒适的无以复加。


我用Grok 4.6连续开发了大概四个小时,几乎没有碰到超过20分钟的任务。



有些任务甚至3分钟就结束了,而且不减质量。


这绝对是我用Codex时几乎从来没有体验过的速度。


过去一个任务跑十几分钟、半小时甚至一小时,我人都快被磨麻了,绝大多数的时间,都在等,而今天,我用Grok 4.6开发,居然久违的感受到了我跟Agent之间交互的感觉。


相信我,在很多时候,速度也会把模型的智力,真正变成生产力。


这个不可能三角,我觉得在今天,老马是做到了,Grok 4.6做到了。


所以我在开头说,我会从今天开始,把日常的主力开发,全部切换到Grok Build + Grok 4.6上,爽怎就一个字了得。


而且老马又放出了狂话:



Grok 4.7要超越所有模型。


这一次,我信老马。


那回到最开头,为什么我会说,DeepSeek V4 Pro和Grok 4.6,会把一众大模型推入了斩杀线?


因为斩杀线首先斩掉的,是一个模型继续傲慢下去的资格。


过去的大模型市场,大家都可以找到自己的生存空间。


能力最强的,可以贵一点、慢一点。


能力弱一些的,可以靠低价抢用户。


速度足够快的,也可以专门承接简单任务。


因为不可能三角存在,所以每个模型都有短板,用户也只能接受各种各样的妥协。


但今天,这个市场的最低标准变得不一样了。


DeepSeek V4 Pro告诉所有人,准Fable级的Agent能力,百万输出Token可以只要0.87美元(当然我知道后面还会涨,但是估计也就2美元)


Grok 4.6则告诉所有人,一个综合性能接近Fable 5的模型,可以同时拥有极快的开发速度以及一个高强度使用几个小时才掉百分之几的订阅额度。


当这两个东西同时出现以后,夹在中间的模型就会非常难受。


特别是Grok 4.6,基本在游戏里,现在就属于钻石分段守门员。


你要是打不过这两,我用你的意义在哪里?


整条斩杀线,被DeepSeek V4 Pro和Grok 4.6。


向前推了一大截。


这是一个最好的时代。


但,也是一个最坏的时代。


本文来自微信公众号:数字生命卡兹克,作者:卡兹克

本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。
如对本稿件有异议或投诉,请联系 tougao@huxiu.com。