
本文来自微信公众号: 董科含 ,作者:N1
过去两年,大模型行业变化很快。模型能力在提升,产品边界在移动,研究热点不断重构,创业公司的PMF也可能只持续几个月。很多人看到的是新模型、新榜单、新融资和新产品。真正身处一线的人,更关心另一组问题:模型下一次升级之后,今天做的事情还剩下什么?数据、环境、训练和产品,哪一个会成为新的瓶颈?年轻人没有大算力、没有大平台,怎样进入前沿?什么样的创业方向会被模型吞掉,什么样的方向会随着模型变强一起增长?
这篇文章整理了多位一线研究者、模型公司核心成员和AI创业者的共同判断。所有具体身份和公司信息都被去掉,只保留对年轻人长期有用的部分。
一、真正有价值的判断,往往只是比行业早半步
前沿判断很少来自预言。更多时候,它来自提前看到一条已经开始形成的趋势,并比行业早几个月解决下一阶段一定会出现的问题。真正厉害的人不会追求每次都提出完全不同的方向。他们会沿着已经被验证的scaling路径,寻找即将成为瓶颈的环节。优势很多时候只是时间差。你不需要比所有人聪明十倍,只需要更早看见问题,更快验证,更早积累解决它的能力。
二、模型结构正在变成基础设施,数据和环境正在成为新的竞争中心
模型结构仍然重要,但它的角色正在变化。过去,架构创新本身可能决定模型能不能进步。现在,架构更像保证模型能够稳定scaling的基础设施。它需要让小规模实验能可靠放大,让训练不在最大规模上反复试错。新增资源正在更多流向数据、Agent Environment、任务系统、Reward、Verifier、真实反馈和后训练。模型有一个很直接的特点:训练什么,就会变好什么。接下来的竞争,越来越取决于团队能否持续构建高质量任务和训练闭环。
三、Environment Scaling可能是下一阶段最确定的主线之一
Agent Scaling Law还没有形成严格公式,但Environment Scaling已经成为模型公司的共同方向。模型需要在Coding、Computer Use、Knowledge Work、多模态和真实软件环境中反复训练,才能提高长程任务能力。真正稀缺的不是再做一个Agent Demo,而是构建高质量任务、状态、反馈、验证器和可复现训练环境。未来很多模型能力的差距,可能来自谁拥有更好的环境,而不只是谁拥有更多参数。
四、Agent最危险的失败,是看起来已经成功
Agent系统最隐蔽的问题不是完全失败,而是满足了指标,却没有完成真实目标。让Agent收集所有发票,评测只检查邮件,它即使漏掉聊天工具和内部系统里的发票,也会被判定成功。模型越强,越会寻找指标漏洞。Reward如果设计错了,Agent会高效优化错误目标。未来Agent领域最重要的能力之一,是定义什么才算真正完成任务。指标是否代表目标,常常比模型本身是否更强更重要。
五、多智能体真正不可替代的地方,是复杂系统模拟
很多所谓多智能体任务,可以被一个更强的单Agent加更多Token和工具替代。把任务拆成几个角色,并不自动产生新能力。多智能体真正有价值的场景,是每个Agent拥有不同身份、局部信息和独立状态的复杂系统,例如社会模拟、市场行为、群体协作和舆情传播。在这些场景里,单Agent很难通过角色切换真实模拟整个系统。多智能体的核心价值可能不在普通办公协作,而在对非完全信息世界的建模。
六、Loss是研究系统里更接近真实进步的信号
很多Benchmark会受到数据配比、测试集设计和评估方式影响。Loss更接近模型是否真正学会了训练数据,也更适合判断一个方法能否进入真实模型迭代。一个架构、数据或优化器改动,如果能让Loss曲线稳定平移,说明它可能在相同算力下获得更好的能力,或者用更少算力达到相同效果。对大模型公司来说,节省10%到15%的Compute已经非常重要,因为这个收益会在每一代模型训练中重复发生。研究者应该优先寻找稳定、可重复的系统收益,而不是只追求一次Benchmark上的漂亮数字。
七、小规模实验有效,不代表能够scale
架构研究里最危险的误判之一,是把小模型上的提升当成大规模成立。复杂gate、分支和trick在小模型上可能表现得格外好,放大后却迅速失效。成熟的研究流程是:先建立真实Baseline,在小规模做大量消融,排除明显错误,再上一个数量级验证。大规模实验应该用来验证高置信度判断,不应该替代思考。简单、稳定、可解释、容易优化的结构,更有机会留下来。
八、技术判断必须同时考虑效果、训练成本和推理成本
一个方法在Loss上有效,仍然可能没有实际价值。如果它需要保存所有中间层输出,训练显存成本过高;如果它让推理延迟大幅增加,也可能无法部署。真正能进入主线的研究,需要同时满足多个约束:效果提升是否稳定,训练成本是否可接受,推理成本是否增加,系统实现是否复杂,收益能否在后续模型中持续复用。今天的大模型研究越来越像Co-design。架构、数据、优化器和Infra必须一起考虑。脱离系统约束讨论方法,很容易得到纸面上成立、现实中不可用的结果。
九、研究的价值,是让整个系统更快迭代
一个研究Idea是否聪明,并不重要。真正重要的是,它能不能缩短训练时间、降低推理成本、加快产品上线,或者让下一轮实验更早开始。模型公司之间的竞争,本质上是一场复利竞争:模型更早训练完成,就能更早上线;更早上线,就能获得更多用户和真实数据;更多数据又能训练出更好的模型;更好的模型继续吸引人才、资本和客户。单次实验节省的几天时间,看起来不多,进入这个循环后会不断放大。速度不是研究之外的工程指标,速度本身就是核心竞争力。
十、真正稀缺的是经历过完整研究过程
很多人会解释一个方法怎么工作,却没有经历过一个想法如何从直觉变成实验,再从小规模放大到真实训练。真正稀缺的经验包括:怎样设置可信Baseline,什么时候相信Loss,什么时候怀疑结果,一个方法在哪个规模下会失效,什么收益值得投入更多算力,什么设计即使效果好也会因为Infra成本被放弃。这些知识很难从论文中完整获得。年轻人做Research的最大价值,未必是发表论文,而是尽早经历一个真实想法从提出、验证、失败、修改到进入主线的完整过程。
十一、看论文时,Experiment比Method更能暴露真实判断
年轻人读论文,常常把注意力集中在方法结构和公式上。真正有经验的人会优先看实验:模型有多大,训练了多少Token,Baseline是否公平,收益能否随Compute放大,Loss曲线是否平移,训练是否稳定,Gradient Norm是否异常,推理和显存成本是多少。Method告诉你作者想讲什么,Experiment告诉你这个方向究竟有多可信。论文中的实验设计,也会暴露一个团队真正重视的指标和研究品味。学会读实验,是从理解知识走向形成判断的重要一步。
十二、应用层创业,最重要的问题是下一代模型会不会把你吃掉
判断一个AI创业方向是否长期成立,可以问一个问题:模型下一次升级之后,我的产品价值会增加,还是会消失?如果产品只是补足模型当前不会做的能力,风险很高。模型升级后,这层价值可能直接归零。更好的方向与模型能力正交:模型变强,你的产品更强;模型成本下降,你的市场扩大;模型能处理更复杂任务,你已经占据用户、工作流、数据和信任。创业者应该站在模型增长的侧面,而不是正面和模型赛跑。
十三、真正有价值的应用,终局通常是端到端交付结果
只帮助专业人士提高效率的工具,会持续受到模型能力挤压。今天帮助律师整理材料,未来模型可能直接交付完整法律方案;今天帮助金融分析,未来模型可能直接承担投资决策;今天帮助药企研究,未来模型可能直接设计候选分子。工具层可以作为起点,但长期价值来自承担结果。做金融,就对收益负责;做法律,就交付完整方案;做科研,就真正推动发现。端到端意味着更难,也意味着更接近不可替代的价值。
十四、AI时代的PMF可能只能持续几个月
传统创业里,找到PMF往往意味着进入相对稳定的增长阶段。AI时代未必如此。模型升级、竞争对手进入、客户内部系统变化,都可能快速摧毁原来的需求。一个产品今天有人付费,几个月后可能被基础模型覆盖。一次增长不能证明长期安全。真正的护城河是持续发现新问题、快速重新定位,并把旧项目积累转化为下一次机会。PMF变得短暂,组织的学习速度就变得更重要。
十五、真正的壁垒是持续产生新能力的系统
AI行业变化太快,一段代码、一个架构技巧、一种Prompt的寿命都可能很短。人才会流动,论文会公开,竞争对手会跟进。长期优势来自团队、数据、算力、环境、客户关系和持续迭代机制。真正拿不走的,是组织不断学习、快速实验、诚实纠错和持续产生新认知的能力。静态秘密的价值正在下降,动态进化能力的价值正在上升。
十六、技术创业者必须逐渐形成自己的Belief
只会复述行业共识,很难产生真正的创业判断。一个人需要逐渐形成对未来技术路线的独立看法:模型性能、长上下文、Test-time Compute、Self-improvement、Agent Data、自动研究,哪个变量更重要?这些判断不需要一开始就正确,但必须能够解释为什么。没有Belief的学习,会变成追逐热点。别人说一个方向重要,就去读;别人说另一个方向更热,就立刻切换。真正有价值的学习,是建立一套可以被现实验证和不断修正的判断系统。
十七、年轻人进入前沿,靠的是学习斜率和Agency
新人刚进入模型团队时,听不懂会议里大部分内容很正常。真正重要的是多久能跟上。成长最快的人通常信息获取能力强,愿意主动讨论,会后立即补课,下一次会议就能参与判断。强者愿不愿意把重要问题交给一个年轻人,也往往取决于他是否主动、投入、反馈快,能不能把讨论转化成结果。提出具体问题,快速完成下一步,带着新结果回来,再继续推进,这种行为会不断增加信任。进入核心靠的不是一次精彩提问,而是持续让事情向前移动。
十八、环境会直接改变一个人的学习斜率
一个人成长最快的阶段,往往发生在进入新的高密度环境之后。每天和更强的人讨论真实Idea,快速试验,公开结果,互相挑战,会让认知更新速度远高于独自学习。环境不是简历背景,它是持续输入和反馈的系统。如果一个环境长期无法提供新的问题、强者和真实责任,就应该主动离开。年轻人的时间价值很高,最重要的选择之一,是把自己放进能让学习斜率持续上升的地方。
十九、未来最核心的竞争单位,是完整学习闭环
今天人们习惯比较模型参数、Benchmark、训练算力和上下文长度。长期来看,真正决定领先程度的,可能是一家公司完成一次学习闭环需要多长时间:发现真实失败,识别失败原因,把失败转化成数据和环境,完成训练与验证,再把新能力部署给用户。模型只是这个闭环里的一个环节。拥有更大模型,却无法持续获得真实任务、准确Reward和高质量反馈,能力会逐渐停滞。模型暂时落后,但闭环更快的团队,可能通过连续迭代完成反超。
这会改变我们对护城河的理解。用户不是单纯的流量来源,而是任务和反馈的来源;产品不是模型的展示窗口,而是持续产生训练信号的传感器;Environment不是一次性Benchmark,而是模型反复练习和进化的场所;Infra的价值也不只在于降低成本,它决定一次认知更新需要多少时间。未来最强的AI公司,可能是把研究、产品、数据、环境和部署压缩成一个高速循环的公司。
判断一个AI项目是否具有长期价值,可以问四个问题:它能否持续获得真实任务?能否准确识别失败?能否把失败转化成训练信号?能否比竞争对手更快把新能力重新交付给用户?如果这四件事无法形成闭环,单次模型领先很难长期保持。
二十、下一代模型的关键能力,可能是把经验真正沉淀为能力
当前大模型的主要能力形成于训练阶段。推理时获得的大量经验,大多停留在上下文中。任务结束后,模型几乎回到原点。人类学习的关键差异在于,一次失败会改变下一次行动。模型如果无法把真实交互中的经验稳定写回自己的策略、记忆或权重,就很难成为长期自主运行的系统。
因此,Self-improvement、Test-time Training、Continuous Learning、长期记忆和自动研究,可能属于同一个更大的问题:怎样让模型把经历转化成可复用能力。真正的突破未必来自一次训练出更大的静态模型,而可能来自建立一种可以长期工作、持续试错、主动验证并安全更新自己的学习系统。
这条路线最难的地方不是让模型发生变化,而是控制变化。系统需要判断哪些经验值得保留,哪些只是偶然噪音;怎样吸收新知识,同时避免破坏原有能力;怎样防止错误反馈、恶意环境和Reward Hacking被写入模型;怎样证明一次局部适应能够迁移到未来任务。谁先解决稳定、可验证、低成本的持续学习,谁可能掌握下一阶段最重要的能力跃迁。
对年轻研究者来说,这个方向的价值在于,它连接了模型、Agent、Environment、Memory、Verifier、RL和安全。它也迫使研究者面对一个比Benchmark更深的问题:怎样让一个智能系统拥有真正连续的成长历史。
给年轻人的十二条行动原则
第一,先进入一个真实问题,不要长期停留在准备状态。
第二,选择模型变强后会一起变强的方向。
第三,优先做端到端交付结果的事情。
第四,不要把热度、融资、论文或GitHub Star当成PMF。
第五,小规模做大量验证,大规模只验证高置信度判断。
第六,关注Environment、Reward、Verifier和持续学习。
第七,看论文时重点看Experiment和系统约束。
第八,先在一个方向做到足够深,再扩大广度。
第九,形成自己的技术Belief,并持续用现实修正。
第十,主动进入高反馈环境。
第十一,公开输出自己的判断,让作品替你建立连接。
第十二,不要试图一次想清十年后的全部路径,先守住一个值得十年投入的问题。
结尾
模型会继续变强,产品会不断重构,今天的壁垒会逐渐变薄,很多看起来确定的答案都会失效。年轻人真正应该押注的,不是某个短期热门方向,而是一组更稳定的能力:发现真实问题,建立正确指标,快速学习,进入高质量反馈,理解系统约束,敢于承担结果,并持续修正自己。
算力决定你能验证多大的问题,平台决定你暂时能看到多远。
而学习速度和判断力,决定你最终能走到哪里。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。