
本文来自微信公众号: AIX财经 ,作者:AIX财经团队,编辑:金玙璠
DeepSeek赢在速度,Kimi胜在完成度。
AIX财经(AIXcaijing)原创
盼望着,盼望着,DeepSeek-V4-Pro正式版终于来了。
这次发布,过程还有点曲折。8月12日晚,DeepSeek官方API定价页悄然发生变化,DeepSeek-V4-Pro对应版本已经更新为DeepSeek-V4-Pro-0813,新模型先在API端静默上线了。
8月13日下午,DeepSeek官网的发布通知以及开放平台公告被撤回,不过模型仍然显示在模型与价格页面中。到了13日晚间,DeepSeek重新发布公告,确认正式版已同步登陆APP、网页端和API。
正式版继续往长任务和Agent方向走。它延续了1M上下文、384K最大输出等规格,同时支持非思考和思考模式,思考模式默认开启。1M上下文可以一次塞进更大的代码库和文档,384K最大输出则给连续编程、复杂Agent任务留下了更大的执行空间。
除此之外,正式版还新增了low、high、max三档思考强度,并原生支持Responses API。对应到官方公布的基准成绩上,它的重点能力也比较明确,主要集中在Coding、Agent、工具调用和复杂任务执行。
DeepSeek这次也涨价了。从8月17日开始,DeepSeek API将采用峰谷定价:每天9:00-12:00、14:00-18:00为高峰时段,其余为空闲时段,空闲价格为高峰的一半。以DeepSeek-V4-Pro为例,空闲时段缓存未命中输入、输出价格将从目前的3元、6元涨至4.5元和13.5元,高峰时段则达到9元和27元。
配置摆在这里,价格也涨了,那实际能力到底如何呢?
要判断DeepSeek-V4-Pro处在什么水平,Kimi K3是一个很合适的参照物。Kimi K3是上个月发布的旗舰模型,在Coding和Agent相关榜单上表现突出,且两款模型瞄准的能力区间高度重合。我们具体来看一下基准成绩的对比。

DeepSeek-V4-Pro正式版VS Kimi K3跑分对比图
从上图可以看出,两款模型没有出现谁把谁完全甩开的情况,而是各自守住了几块优势。Kimi K3更占优的项目,大多集中在长程软件工程和连续任务执行。DeepSeek-V4-Pro正式版则在自动化、安全以及部分高难任务上更占优势。
跑分只能说明一部分问题。真正放进具体任务里,两款模型谁更会干活?我们选了四类任务,用同一套提示词分别交给两款模型,看看谁的表现更好。
不过,需要说明的是,我们是在DeepSeek-V4-Pro正式版尚未上线App和网页端时开始测试的,使用方法是将它接入Codex使用;Kimi K3则直接在Kimi Work中调用。这意味着在编程、网页生成和文件操作等任务里,最终表现除了模型本身,也可能受到工具链和运行环境影响。另外,本次测试均为单次生成结果,模型输出存在一定随机性,结果仅供参考。
接下来,我们一起看看它们的实际表现。
01.内容创作:DeepSeek更会讲故事,Kimi更会做报告
我们先从最容易暴露模型“表达习惯”的内容创作开始。
我们设计了两道题:一道考故事续写,看模型能不能理解人物、延续叙事;另一道考行业报告,看它能不能从大量信息里抓住重点、组织观点。
我们先让两款模型为近期爆火的AI漫剧《被裁掉的女孩》续写第二季,从第一季女主角方桃子结束巴黎时装周、回到上南城的第二天开始,写一个1000字左右的故事。要求延续第一季的现实风格,不走一路开挂的爽文路线,而是继续讨论行业规则、舆论压力和自我价值等更现实的问题。
写故事对大模型来说不算难,难的是不暴露“AI味”。从结果来看,两款模型都没有完全逃过这个问题。还需要说明的是,即便做了简单的介绍,它们对具体的人物依旧不了解,给出的故事人物和原剧设定有出入。
先来看DeepSeek-V4-Pro正式版的成品,有“AI味”但至少故事线是顺的。

DeepSeek-V4-Pro正式版生成的故事
Kimi K3的问题更明显,它没有完全分清“背景资料”和“故事正文”。我们在提示词中简单回顾第一季,只是为了帮助模型理解人物和前情。结果Kimi K3在故事里写了几句类似“第一季里陪她熬过来的助理小满”的句子,正常的续集不会突然站在观众视角提醒这是第一季的人物和情节,很容易出戏,也让整篇故事的衔接不够流畅。

Kimi K3生成的故事
接着,我们把内容创作从文学拉回工作场景,让它们分别写一份2026年AI编程工具行业竞争格局分析报告。
DeepSeek-V4-Pro正式版给出的框架比较清楚。它按照行业演变、全球格局、中国市场等维度展开,也会结合公司案例和数据支撑判断。不过,整体内容偏少,对头部产品竞争关系、市场变化等问题点到了但没有进一步展开。
←左右滑动查看更多→
Slide for more photos
DeepSeek-V4-Pro正式版写的行业报告
Kimi K3则明显更“能搜罗”。它不仅整理了市场规模、采用率、国内外市场份额、产品定价等信息,还通过大量表格把不同公司和产品放在一起比较,呈现上更直观。论证也比较有条理,结尾还附上了信息来源。
←左右滑动查看更多→
Slide for more photos
Kimi K3生成的行业报告
这一轮,它们各赢一题。DeepSeek-V4-Pro正式版更会把故事讲顺,Kimi K3则更会收集和整理信息。
02.编程:DeepSeek修改快,Kimi还原准
接下来,进入两款模型都很受关注的编程场景。
我们先从最常规的前端网页开始,让它们做一个“电影选片器”。网页需要内置至少24部经典电影,支持按类型和评分筛选,再通过“随机选一部”不断抽选。这道题本质上是前端综合题,主要考察模型能不能把数据、筛选逻辑、交互和视觉效果装进一个HTML文件。

Kimi K3生成的电影网页
两款模型交出来的结果相当接近。它们都选择了深色背景,把筛选条件放在页面上方,中央用电影卡片承载抽选结果,类型筛选、评分区间、“换一部”等核心功能也都正常实现。

DeepSeek-V4-Pro正式版生成的电影网页
DeepSeek-V4-Pro正式版的问题出在一个小细节。它在电影卡片中央加入了胶片图标,本意可能是为了增强氛围,但在部分加载情况下,图标会与文字发生重叠,影响观感。
这一题差距不大,于是我们把要求提高了一档,给它们两张艺术博物馆官网的截图,让它们据截图还原网页。这道题要求模型不仅要会写代码,还得先真正“看懂”页面。


艺术博物馆官网的截图
这一轮,差距明显拉开。DeepSeek-V4-Pro正式版的成品“不能说一模一样,只能说毫不相关”,它仅仅抓住了截图的色调,没有真正还原截图表达的内容。原图明明是艺术博物馆官网,它最终做出来的却是品牌官网。


DeepSeek-V4-Pro正式版还原的网页
Kimi K3的还原更准确。官网的整体结构、模块都保留下来,和原截图相当接近。比较明显的差别主要在图片素材,原截图的首页主视觉和部分页面使用了实景照片,Kimi K3没有原始素材,用几何图形进行了替代。


Kimi K3还原的网页
我们再把难度继续拉高,让它们做一款威尼斯运河快艇游戏。玩家要控制快艇,在倒计时结束前沿运河穿过桥洞,最终抵达码头。我们还要求加入晾衣绳、水面倒影等细节。
两款模型都交出了能玩的游戏,但侧重点不太一样。DeepSeek-V4-Pro正式版把要求的运河两侧建筑、桥洞和晾衣绳等大部分元素都还原了,整体完成度不错。不过,它漏掉了一个细节,水面没有呈现建筑的倒影。此外,晾衣绳上的衣服虽然存在,但悬挂状态比较生硬,多少有一点“贴”上去的感觉。
我们随后临时加了一道题,把原本相对规整的桥洞改成交错分布,增加游戏难度。DeepSeek大约5分钟完成修改,调整后的桥洞交错,且船不能直接穿墙而过,游戏逻辑基本成立。

DeepSeek-V4-Pro正式版生成的游戏
Kimi K3这一轮在视觉上更胜一筹。两侧建筑、晾晒的衣物处理得更自然,水面也能够看到房屋倒影,整个运河美感更强。尤其同样是“晾衣绳”,两边都做了,但Kimi K3会进一步处理衣物悬挂状态,更像真实场景。此外,它还加入了快艇行驶、穿过桥洞得分等音效,游戏的沉浸感也更强。
我们同样要求它把桥洞改成交错分布。修改后的游戏能正常运行,碰撞逻辑也没有明显问题,不过这一轮它花了大约10分钟,是DeepSeek-V4-Pro正式版的两倍。

Kimi K3生成的游戏
这一轮,两款模型在纯前端功能实现上的差距并不大,真正拉开差距的是复杂需求下的理解和执行方式。Kimi K3更擅长还原视觉要求,成品细节也更完整;DeepSeek-V4-Pro正式版虽然视觉表现稍逊,但二次修改速度更快,对明确指令的响应也更直接。
03.视觉审美:DeepSeek先卡壳,Kimi一次“出片”
接下来,我们再看看视觉审美。
我们让两款模型用Three.js还原水母湖,画面里要有大量金色水母随着光线迁徙,在碧绿海水中形成近似“金色星河”的效果;同时还要表现水面光束、丛林倒影、鱼群和不同远近层次的水母。这道题也在考验模型能不能理解一段偏文学化的视觉描述,再把“金色星河”“发光云团”这些抽象要求翻译成具体画面。
DeepSeek-V4-Pro正式版先卡了几次。它半小时后交出的首个成品,打开页面一片空白;第一次修改后又出现渲染错误;直到第二次调整,场景才正常显示,但页面上仍留有一行渲染错误提醒。

DeepSeek-V4-Pro正式版生成的水母湖
再具体看成品,它对视觉呈现的理解也偏了。我们想要的是金色水母密集分布,在水中形成像星河一样的发光云团。DeepSeek的成品却在海水里铺了大量金色光点,而真正的水母则被处理成灰色椭圆状物体。结果“星光”有了,“金色水母群”这个主角反而没有体现。
它的整体色调也偏暗,更像置身较深的水底,看不出水面和阳光穿透的层次感。不过,它倒是体现了水下植物丛,背景环境铺得比较全。
Kimi K3则花了大约40分钟,一次交出了可以正常运行的成品。它的理解更准确,画面里能看到密集的金色水母群,不同远近的水母形成明显层次,基本呈现出了要求的“金色星河”。

Kimi K3生成的水母湖
除了水母,画面中能看到鱼群、水面以及从上方洒下来的光束,整体风格也更偏写实,画面也更加精美。不过,我们要求水下能够看到植物,它的成品里基本没有呈现。
这一轮两者的差距依然比较明显。DeepSeek视觉表现稍弱,首轮运行的稳定性也还有提升空间;Kimi的理解和审美完成度更高。
04.物理仿真:Kimi跑通逻辑,DeepSeek卡在穿模
最后,我们把难度拉满,进入一个更容易露馅的场景:物理仿真。
我们让它们用Three.js制作一个“鞭炮箱子”的3D连锁爆炸演示。100个鞭炮落入箱中后,要完成点燃、爆炸、弹射和连锁引燃,同时处理碰撞、碎片和烟雾等效果。
这道题最重要的是物理逻辑和因果链能不能成立,鞭炮掉下来不能穿模、爆炸不能凭空发生,被冲击的鞭炮也要符合运动规律。
Kimi K3大约用了10分钟就交出了结果,整体完成度比较高。鞭炮从上方落入透明箱子后,会留在箱体内部,没有明显穿模。点击“开始燃放”后,一个已经点燃的鞭炮从外部落入箱中,再逐渐引燃周围的鞭炮,整个过程至少在视觉上有清楚的因果关系。燃放的反应也比较写实,能看到明显的烟雾和气团效果。

Kimi K3生成的“鞭炮箱子”
单个引爆模式也和正常燃放做了区分,可以直接选择箱内某个鞭炮点燃,再从这个位置向周围触发连锁反应。这样一来,正常燃放是外部点火,单个引爆是局部触发,两条逻辑都连贯,更像一套完整的仿真演示。
DeepSeek-V4-Pro正式版就要曲折得多,前后花了接近40分钟。首先出现了碰撞问题,鞭炮从上方落入箱子的过程中会直接穿过箱体,说明最基础的碰撞约束没有成立。到了点燃环节,箱内某个鞭炮突然冒出火星,开始连锁爆炸,缺少火源的过渡。它可能想展示爆炸后的气体形成的气团,但最终呈现像短暂白屏。而且整个爆炸过程明显卡顿,多次运行也没有明显改善。

DeepSeek-V4-Pro正式版生成的“鞭炮箱子”
单个引爆模式没有和正常燃放拉开明显差别,依旧是某个位置突然出现火星,随后进入同样的爆炸流程。按钮虽然有了,但对应的交互逻辑并没有真正做出区分。
这一轮,Kimi K3明显更稳,更能把物理规律落实到运行逻辑里;DeepSeek-V4-Pro正式版则在基础碰撞和因果链上掉了链子。
05.结语
几轮测下来,我们发现,DeepSeek-V4-Pro正式版在内容创作上叙事更顺;编程任务里,它的修改速度也更快。但在需要理解视觉信息的任务中,表现有待提升。截图还原、3D视觉和物理仿真任务中,Kimi K3对画面的理解更准确,成品完成度也更高。
所以,DeepSeek-V4-Pro正式版依然能打,只是没有做到全面领先。考虑到它依然保持了较低的价格,性价比仍然突出。在旗舰模型里,“够用且便宜”本身就是竞争力。
一直以来,DeepSeek最鲜明的标签,是用相对低的价格,提供足够强的模型能力。到了DeepSeek-V4-Pro正式版,这套逻辑发生了一些变化,API将采用峰谷定价,虽然给开发者留下了通过错峰调用控制成本的空间,但“绝对低价”已经不再像过去那么突出。
模型表现之外,DeepSeek背后的深度求索自己正在变“重”。
6月,深度求索启动大规模的公开招聘,提出希望各部门规模至少扩大一倍,岗位从算法研发扩展到产品、数据工程、运维等方向。与此同时,DeepSeek官网招聘页面开始频繁出现Agent Harness、Agent Infra以及通用Agent数据产品经理等岗位。
8月13日晚,DeepSeek Harness开发者预览版正式开放测试,并同步以MIT协议开源。这套系统解决的是模型“怎么干活”的问题,模型、工具、存储等能力都可以通过插件自由组合。相比直接做一个面向用户的Agent产品,DeepSeek选择先搭一套开放的Agent运行框架,把能力从模型层进一步延伸到Agent基础设施。
团队和产品都在扩张,背后也需要更多资金支撑。DeepSeek过去长期依靠幻方体系提供资金,并一度拒绝外部融资。今年策略明显改变,6月完成首次外部融资,规模超过500亿元,此后又继续推进新一轮融资。
所以,DeepSeek-V4-Pro正式版之后,还有两个更值得观察的问题。
第一,涨价之后,DeepSeek还能不能守住“高性价比”。模型规模扩大、Agent任务变长,都在增加算力消耗和成本压力。价格不再足够低之后,它需要靠更强的任务完成能力和更高的调用效率,证明自己依然“值”。
第二,DeepSeek能不能真正进入用户工作流。目前的Harness仍主要面向开发者。接下来更关键的是,DeepSeek会不会进一步推出面向普通用户或企业的Agent产品,把这些能力变成真正可用的工作流。只有走到这一步,DeepSeek才能获得更直接的真实任务反馈,也才能把模型能力进一步转化成产品优势。
*题图由AI生成。
如对本稿件有异议或投诉,请联系 tougao@huxiu.com。