2026-08-29 13:12

Hy4,很好,很腾讯

author_path 翔哥趋势研究
头图

本文来自微信公众号:翔哥趋势研究,作者:翔哥,题图来自:AI生成


腾讯 Hy4 preview 发布了,770B参数、1M上下文、真开源、低定价,反响不错,在包括Terminal Bench 2.1、DeepSWE等在内的12项基准测试中,比Hy3,“可以说实现了代际飞跃”。


和我们此前猜想的差不多,因为DeepSeek的开源,大部分开源模型都会收敛到DeepSeek路线,和Hy3比,这次Hy4换了架构,从GQA+192专家+256K切换到了DeepSeek/智谱的技术底盘上重造。


混元非常诚实,在模型卡里写到,“inspired by DeepSeek and GLM”。这个启发有点大,注意力是DeepSeek的DSA,MTP是DeepSeek的;推理框架兼容社区标准;索引缓存是智谱的 IndexCache(本身就是给 DeepSeek DSA 做的加速办法);残差侧采用 iHC,概念上脱胎于DeepSeek提出的mHC,但砍掉了Sinkhorn约束、固定为恒等映射,更轻量。


混元团队很诚实,也很腾讯,用“拿来主义”,搭建了一台完美的“混元机器”:混合别人的架构,混合社区的洞察,元入自家的产品数据,然后针对性特化。


得承认团队的选型品味非常好,混元的模型架构负责人还只是一名在读博士生(By晚点),就能将DeepSeek、智谱谱系等社区技术揉搓到了一起,预训练没崩,后训练也因此还搞得有模有样。


公允地讲,Hy4不是老混元那种污染式打榜,但增益全部尖刺在可RL化的 agentic/工具/工程域,HorizonMath/HLE 这类抗后训练域提升幅度远小于 agentic,整个模型能力结构本身就是按“榜单可见分布”塑造的。


当然了,你也可以说,Hy4 本来就是为腾讯的生态和场景而生。强的地方,比如工具调用、带工具长上下文、工程;弱的地方,数学和纯推理。后训练的资源全部投在了办公场景用得着的地方,可以看作是为 WorkBuddy+CodeBuddy 专门特化的。


腾讯混元团队说,Hy4 preview 定位“为生产力而生”的模型。但LLM生产力最关键的一环,长程推理一致性,恰好是 Hy4 目前最薄弱的环节,README的原文承认两点:复杂任务上推理时间过长、倾向于过度自我验证,也就是轨迹收敛纪律差。就看正式版能否迭代了。


LLM的骨架(注意力、残差、路由、解码)是模型定义权的锚,而混元自建的部分,专家共建数据、后训练、WorkBuddy co-design、基础设施,全在骨架之外。也就是骨架外购,血肉自养,这就是集成商和定义者的分工现场确认。


不过呢,无论是混元还是腾讯也没说过有当定义者的梦想,那这就不是个事,但要说“跻身开源第一梯队”,那就......


是的,DeepSeek是开源了,社区也贡献了开源智力,混元也说受启发了,但拿着人家的东西混合在一起,没有自己的原创性大贡献,那哪天DeepSeek闭源了,一切又得还回去了,攒机的手里只有上一代图纸,还没消化完,搞不好人家又出新图纸了。


当然了,这也不是事,反正小梁一时半会又不打算闭源。按争取来的“从新模型发布起至少一年不看榜单”的规则,时间快过半了,两个月一迭代的发版节奏又压得紧,能消化完别人的就已经很不错了,哪有时间自己推公式,搞原创呢。


可能有大聪明会问,既然骨架大部分来自 DeepSeek,为什么不直接用 V4 Flash 得了,架构还更新,成本还更低。这个问题问得好,下次别问了。


千亿级的资本开支总得给市场交个抵押品,WorkBuddy的数据飞轮需要自家权重做闭环,豪华团队得有事干。另外,V4 的架构、K3 权重也开源,下代 Hy 也就有了可启发的对象,自家的生态场景又多,干嘛不自己干呢?


对吧?


本文来自微信公众号:翔哥趋势研究,作者:翔哥

本内容由作者授权发布,观点仅代表作者本人,不代表虎嗅立场。
如对本稿件有异议或投诉,请联系 tougao@huxiu.com。