2026-08-02 13:07

从TPU到自我进化的Agent,Jeff Dean如何判断AI的下一步

author_path 机器之心 icon_path
头图

本文来自微信公众号: 机器之心 ,编辑:Panda,作者:关注AI的


2026年的YC Startup School上,Jeff Dean的声音有些沙哑。


访谈刚开始,他便解释自己失声了,今天听起来和平时不太一样。但这并没有影响台下听众的注意力。坐在他面前的YC合伙人Diana Hu,一口气列出了一串足以写进计算机史的名字:MapReduce、BigTable、TensorFlow、TPU、Gemini。



任何一个项目,都足够成为一名工程师职业生涯的代表作。它们却集中出现在Jeff Dean和他身边一批Google工程师的履历里。


Diana没有把访谈做成一次功绩回顾。她更关心另一个问题:当生成式AI已经席卷软件行业,Jeff Dean这种最擅长从底层重构系统的人,今天究竟在看什么?


答案并不是更大的模型。


在这场近一小时的对话里,Jeff Dean反复谈到推理硬件、能量、数据搬运、上下文工程、长时间运行的Agent、自动化实验系统,以及创业公司如何避开通用模型的正面碾压。他讲的看似分散,背后却有一条非常清楚的主线:AI的下一阶段,不只是把模型训练得更聪明,而是把模型放进一个能长期工作、持续试错、自动验证、不断积累能力的系统里。


这也意味着,AI竞争正在从「谁有更大的模型」,转向「谁能更好地组织智能」。


一、AI已经像初级工程师,但这不是最重要的变化


2025年5月,Jeff Dean曾做过一个引发广泛讨论的判断:AI的能力已经接近一名初级工程师。



一年后,Diana问他,这个预测实现得怎么样?


Jeff Dean的回答很直接。他认为,这个判断「相当准确」。模型在Agent化、长流程编码和复杂任务上的进步,甚至比他当时预想得更快。


「模型完成越来越复杂任务的能力,增长得比我预期更快。」他说。


更值得注意的是,这种能力不再局限于写代码。越来越多Agent系统开始进入科学、工程和其他专业领域。它们不只是回答问题,而是拆任务、用工具、运行实验、读取结果,再根据反馈继续行动。


把AI类比成初级工程师,容易让人把注意力放在人力替代上。但Jeff Dean更关心的是另一层变化:当一个「初级工程师」可以复制成几十个、几百个,并行工作几天甚至几周,组织生产的方式会发生什么变化?


在传统团队里,初级工程师需要上手业务,需要理解工具,需要不断得到反馈。Agent也一样。只不过它的培训材料不再只是文档,而是提示词、工具说明、技能文件、测试体系、评估器,以及整个上下文环境。


这使AI工程出现了一个新的分工。


过去,工程师主要负责写代码。未来,更多工程师会负责定义问题,搭建环境,编写规范,设计反馈回路,再调度一群Agent去完成任务。


Jeff Dean对2027年的预测正是如此。他认为,机器学习系统会越来越多地参与改进机器学习系统本身。它们会把目标拆成子问题,自动运行大量实验,比较结果,再把有效方案组合起来,形成更强的新系统。


「只要一个领域存在可测量的目标,就有机会取得很大进展。」


这句话是整场访谈的第一把钥匙。


AI自动化最先攻入的,不一定是知识最多的领域,而是反馈最清晰的领域。代码能不能通过测试,芯片布局能不能降低面积,模型结构能不能提高精度,材料性质是否满足要求,这些问题都有相对明确的评价标准。只要评价器足够可靠,机器就能用极高频率反复试验。


所以,AI时代真正重要的单位,可能不再是一次回答,而是一次完整的闭环:提出方案、执行方案、测量结果、修正方向。


二、改变Google搜索的是一道算术题


Jeff Dean的许多代表性工作,都来自一个非常朴素的起点:先把数量级算清楚。


2001年,Google搜索仍大量依赖硬盘。硬盘容量大,但访问速度慢。Jeff Dean和Sanjay Ghemawat做了一次估算,发现Google当时的整份搜索索引,已经可以放进所有服务器的内存里。


今天听起来,这只是一次存储介质升级。但在当时,它意味着完全不同的系统设计。


如果索引主要待在硬盘上,查询需要等待机械寻道。只要把索引放入内存,访问延迟就能骤降。两人很快写出新版本,并在几天内把它送进生产环境。Google搜索由此明显变快。


这个故事最容易被包装成天才灵光一现。Jeff Dean的讲法却更像一名工程师在陈述常识:系统条件变了,原来不成立的方案突然成立,那就应该重新计算一次。


很多行业创新都发生在这种时刻。


一个旧问题长期存在,人们已经习惯围绕它打补丁。后来,硬件价格、内存容量、网络带宽或模型能力跨过某个临界点,原来的约束消失了。可大多数人仍沿用旧架构,因为旧架构已经变成常识。


Jeff Dean擅长做的,是把常识重新变成假设。


他会问:为什么一定要这样?今天的数量级还是昨天的数量级吗?如果把最贵的一步换掉,整个系统会不会出现完全不同的形态?


这也是他给创业者的建议。不要只看现有方案哪里不够好,而要从第一性原理重新看问题。能不能把性能提高一个数量级?能不能把成本降低两个数量级?能不能不再沿用行业默认的实现路径?


「有时候,你只需要眯起眼睛看一个问题,不要被今天的解法锚定,而是从第一性原理思考应该怎样解决。」


这句话听起来并不神秘。真正困难的是,多数人进入一个行业后,会迅速学会这个行业的所有默认答案。经验帮助人提高效率,也会让人失去重新提问的能力。


三、三分钟语音,为什么催生了一颗TPU


2013年,Google的深度学习语音识别开始显著超过旧系统。错误率下降了一半,相当于过去二十年语音识别进展在几个月里集中发生。


产品团队当然兴奋。Jeff Dean却先算了一笔账。


如果语音识别真的变好,用户就会更愿意使用。假设每名Google用户每天只使用三分钟语音识别,Google需要多少服务器才能支撑?


结果并不乐观。按照当时CPU的效率,Google可能需要把服务器规模扩大一倍。


这就是TPU的起点。


它不是因为研究团队突然想造芯片,也不是为了证明Google有能力做硬件,而是因为一个成功的模型即将制造一个无法承受的服务成本。


这段历史揭示了AI产品中一个经常被忽略的规律:模型效果提升,并不总是降低成本。恰恰相反,效果越好,使用量越大,系统压力越重。


当语音识别不好用时,用户很少调用。系统成本不是问题。当错误率大幅下降,需求突然被释放,原本隐藏在后台的算力约束就会浮出水面。


TPU选择的路径,是为机器学习最核心的计算模式做专用硬件。它不需要运行浏览器,也不需要处理所有通用程序。它主要擅长低精度、稠密线性代数。这类计算恰好位于现代机器学习的中心。


第一代TPU最终带来了数量级上的收益。按照Jeff Dean的说法,它比当时的CPU和GPU节能30到80倍,延迟也低了20到30倍。


这里还有一个容易被忽略的设计尺度。


TPU很专用,但没有专用到只能运行某一种固定模型。团队知道机器学习算法还会快速变化,于是把芯片设计成一种较通用的线性代数系统。它牺牲了运行Chrome或Word的能力,却保留了支持未来算法演进的空间。


这是一种很难把握的平衡。专用得不够,收益不明显。专用得太狠,算法一变,硬件就会过时。


Jeff Dean对今天推理硬件的判断,和当年的TPU有明显呼应。他认为,下一轮重要机会仍然在专用化,但重心会进一步转向低延迟、低能耗推理。


「想象一下,如果延迟能改善50倍,你可以做什么。」


当模型回复需要十几秒时,人们会把它当成一个偶尔咨询的工具。当延迟接近即时,它才可能真正进入交互界面、机器人、实时视频、操作系统和连续决策流程。


等待不是一个小体验问题。等待会改变产品形态。


四、AI的成本中心,不是计算,而是搬运数据


如果要为2026年的AI工程师更新一版「每个工程师都应该知道的延迟数字」,Jeff Dean认为,重点应该从硬盘寻道、缓存未命中和跨洲网络延迟,转向芯片内部的数据流。


工程师需要知道:主存到片上内存的带宽是多少,片上内存到乘法单元的带宽是多少,一次乘法需要多少能量,芯片之间如何互连,500颗芯片扩展到1万颗芯片时,网络效率会怎样下降。


这些数字看起来离产品很远,实际却在决定什么产品能成立。


Jeff Dean给出了一个极具冲击力的比例。完成一次数学乘法,大约只需要一个皮焦耳的能量。把数据从高带宽内存搬到计算单元,能量成本可能高出约1000倍。


换句话说,今天AI系统中的昂贵动作,常常不是「算」,而是「把要算的东西搬过来」。


这也解释了为什么批处理如此重要。


一组模型权重从内存被搬入计算单元后,如果只处理一个token,数据搬运成本就全部压在这一个token上。如果同时处理更大的批次,同一份权重可以服务更多计算,能量和带宽成本便被摊薄。


但批处理和低延迟天然冲突。为了凑够一批请求,系统往往需要等待。吞吐提高了,单个用户的响应却可能变慢。


因此,许多看似属于模型层的问题,其实是硬件和系统问题。训练为何使用大批次,推理为何需要KV Cache,模型为何追求低精度,系统为何需要量化,背后都离不开数据搬运和能量约束。


Jeff Dean近期更关注推理,也正是因为推理对延迟极度敏感。训练任务跑慢一点,往往只是实验结束得晚。推理任务每多等一秒,都会直接影响用户体验和Agent的工作效率。


如果一个Agent要连续调用模型1000次,单次延迟降低50%,整个任务的完成时间就可能出现巨大差异。更不用说未来Agent要运行数天或数周。


因此,AI的「能源问题」并非一个遥远的环保议题。它直接决定模型能否便宜地服务更多人,决定Agent能否持续运行,也决定创业公司的毛利是否健康。


五、模型只是一个零件,上下文才是Agent的工作现场


过去几年,AI行业习惯用参数量、训练数据和基准分数衡量进步。2026年,Jeff Dean更强调模型周围的一切。


一个真正有用的AI系统,除了模型,还需要检索、工具、记忆、历史信息、执行环境和反馈机制。模型知道有哪些工具,知道何时调用工具,知道如何把复杂问题拆成一串动作,也要能比较多种方案,判断哪一种更可能成功。


这就是「上下文工程」开始走到舞台中央的原因。


Jeff Dean说,模型在训练阶段见过的信息,最终被「搅拌」进数千亿乃至数万亿参数里。它们像一锅浓汤,知识存在,但未必清晰。真正放进当前上下文的信息,对模型来说更加直接,也更容易被准确使用。


这给小团队留下了一个重要机会。


训练基础模型需要海量资本、数据和算力。上下文工程却可以从一个API开始。创业者可以围绕具体业务,把领域知识、工具流程、客户数据和评估标准组织起来,让通用模型在一个窄场景里表现得更可靠。


Jeff Dean举了一个自己的例子。


他和Sanjay Ghemawat经常优化Google内部的底层库。这些数据结构可能运行在数百万个进程中,一点点性能差异都会被规模放大。传统做法是工程师先写微基准,测量当前性能,再修改代码,重新运行基准,观察缓存占用和性能变化,然后继续迭代。


两人把这套工作方法写成了一项Agent技能。模型学会了如何运行基准、修改代码、比较结果,再根据测量继续优化。


「我们只是把人会采用的方法,以模型可以使用的形式交给了它。」


这句话几乎可以视为上下文工程的朴素定义。


它不是神秘的提示词技巧,也不是堆更多背景材料。它是在回答三个问题:专家会按什么步骤做事,系统有哪些可靠工具,结果应该怎样被验证。


当这些内容被结构化之后,模型获得的不是更多知识,而是一套可重复执行的方法。


这也是为什么「技能(skill)」会成为Agent生态中的关键资产。一个优秀技能文件,可能封装了团队多年的隐性经验。它告诉模型遇到某类问题时先做什么,哪些错误最常见,哪些工具值得信任,什么结果才算完成。


未来公司的差异化,很可能不只存在于模型权重里,也存在于这些被编码进工作流的经验里。


六、Agent为什么走到第30步就开始失控


几乎所有真正做过Agent的团队,都见过同一种场景。


前几步很顺。模型能读需求,能调工具,能写代码。到了第30步或第50步,它开始忘记目标,误解状态,重复动作,或者沿着一个错误方向越走越远。


Jeff Dean把其中一个原因归结为分布外问题。


模型在训练中见过大量常见任务。只要任务仍位于它熟悉的「明亮道路」上,表现通常不错。一旦连续操作把它带到不熟悉的状态,性能就会突然下降。越偏离舒适区,错误越容易累积。


解决方法之一,是提供技能和提示,把模型尽量约束在它熟悉的路径上。另一个方法,是使用多Agent系统。


多个Agent可以尝试不同方案,再由另一个模型担任评估者,判断哪些方向更有希望。失败的分支被丢弃,成功的分支继续推进。这本质上是在推理阶段进行搜索。


它和人类团队的工作方式并不陌生。面对复杂问题,一个人提出方案,另一个人审查风险,第三个人运行实验。团队不会把全部希望押在第一条思路上,而是通过分工和反馈降低单点失误。


Agent运行时间越长,系统设计越不能依赖一次正确。


真正可靠的长程Agent,需要检查点、状态管理、回滚、分支探索、外部评估、权限控制和异常恢复。它更像一个分布式系统,而不是一个超长聊天窗口。


这正是Jeff Dean的背景开始重新显得关键的地方。


MapReduce解决的核心问题之一,就是如何让大量不可靠机器完成可靠计算。今天的Agent系统面对相似矛盾:单次模型调用并不完美,工具也会失败,但整个任务仍要尽可能稳定地完成。


未来优秀的Agent平台,可能会继承许多分布式系统思想。任务可以拆分,结果可以验证,失败可以重试,状态可以恢复,局部错误不应该摧毁整个流程。


当Jeff Dean说Agent将运行几天甚至几周时,他不是在描述一个更长的聊天。他在描述一种新的计算基础设施。


七、两三个人如何赢过Google:寻找模型成功率只有1%的问题


在Startup School的语境里,最受关注的问题当然是创业机会。


Google可以联合设计芯片、数据中心、模型和产品。Gemini这样的通用模型还在快速扩张能力边界。一个两三人的团队,凭什么赢?


Jeff Dean的回答并不浪漫。


小团队的机会,通常存在于通用模型没有充分关注的具体领域。创业者可以把产品界面、专有数据、工作流和领域技能组合起来,在一个窄场景里提供更高准确率和更好体验。


但他随即给出警告:通用模型正在迅速变强。今天看似独立的产品功能,六个月或十二个月后,可能被基础模型直接覆盖。


因此,创业者需要判断自己的优势是否耐久。


Jeff Dean给出了一条很具体的筛选标准:寻找那些当前通用模型成功率接近0%或1%的任务,而不是已经能做到20%的任务。


「如果模型完全失败,这可能是一个好迹象。如果它已经能做一部分,只是做得不太好,那反而未必是好迹象。」


原因很简单。20%意味着能力已经开始出现。更多数据、更大模型和更长推理,很可能快速把它推向可用。0%或1%则说明任务可能缺少关键数据、特殊工具、领域反馈,或者需要一种通用模型短期难以获得的能力。


这可以称为Jeff Dean的「1%法则」。


它并不是建议创业者专挑最难的问题,而是寻找通用模型存在结构性盲区的问题。


这种盲区大致有三类。


第一类是专有数据。通用模型能组织世界信息,却未必能访问某个用户的全部个人资料、某家公司的内部流程、某种设备产生的实时数据。创业产品一旦获得这些数据,就能形成不同于基础模型的视野。


第二类是专业评价。很多行业不是缺少生成能力,而是缺少可靠判断。医疗、材料、芯片、制造和科学研究,都需要高质量验证器。谁能定义「什么是对的」,谁就能让Agent持续优化。


第三类是窄而深的模型。AlphaFold并不是通用聊天模型,它针对蛋白质结构问题建立了高度专业化能力。材料科学、芯片设计和其他专业领域,也可能出现类似机会。


这套判断对创业者并不轻松。它要求团队既理解模型能力边界,也理解行业深处的问题。只懂AI,容易做出很快被平台吸收的功能。只懂行业,又可能低估模型进步速度。


真正的机会位于两者交界处。


八、当代码不再稀缺,规格、品味和问题选择会更贵


Diana提出一个假设:如果未来每位创始人都能同时管理50个、100个Agent,所有代码都由Agent写,什么能力会变得稀缺?


Jeff Dean的回答是「品味」。


更准确地说,是判断应该让Agent做什么。


他认为,研究工作的大部分价值不在于把实验执行得多漂亮,而在于是否选择了一个值得研究的问题。一个团队可以用最精湛的方法,完成一项无关紧要的研究。也可以抓住一个关键问题,只要解决,就改变整个领域。


Agent让执行成本下降之后,问题选择的重要性会进一步上升。


过去,一个模糊想法会因为开发成本太高而自然消失。未来,只要调动足够多Agent,很多想法都能被迅速做成原型。世界不会因此自动出现更多好产品,只会出现更多产品。


规格也会变得更重要。


Jeff Dean说,和虚拟Agent协作时,目标越清晰,成功率越高。过去,模糊需求交给一名资深工程师,对方可以追问,也能依靠共享背景补全意图。Agent虽然也能提问,却更容易在缺少上下文时自行猜测。


一个典型的高成功率任务,是把软件从一种编程语言迁移到另一种语言。原因不是迁移简单,而是规格极其完整。旧代码定义了行为,测试定义了边界,Agent可以逐项对照,直到新版本表现一致。


「现在Agent可以替你写软件,但说明你究竟想要什么,反而变得更重要了。」


这句话对所谓AI原生组织有直接启示。


未来的管理者不只是分配任务,而要编写更清晰的目标和验收标准。设计文档不再只是团队沟通材料,也会成为机器执行的输入。测试、指标、约束和样例,会从开发流程末端前移到任务定义阶段。


至于「品味」如何训练,Jeff Dean给出的方法很务实。


写下一批你认为未来12个月会变得重要的事情。你不必全部去做。12个月后重新检查,哪些判断成真,哪些被别人做出来,哪些毫无进展。通过不断积累预测样本,人会逐渐校准自己的判断。


品味并不完全是天赋。它也可以通过复盘训练。


九、好的思想实验,先把行业最牢固的前提拿掉


访谈后半段,Jeff Dean分享了一个颇为疯狂的思想实验。


过去60年,芯片行业一直在追求更小、更稳定、错误率更低的晶体管。人们默认,同一设计制造出的芯片应该尽可能完全一致,位翻转越少越好。


可在大型分布式系统中,工程师早已接受单个组件会失效。硬盘会坏,机器会宕机,交换机会出问题。系统可靠性并不来自每个部件绝不出错,而来自复制、校验、冗余和恢复。


于是Jeff Dean问:如果晶体管每天会发生20次错误,而不是几百万年才出一次错,会怎样?


这并不是一项现实产品计划。他只是试图把一个习以为常的前提拿掉。也许极不可靠的晶体管能以完全不同的方式制造,系统则通过多路径和高层冗余保证结果。


多数思想实验最终不会变成产品。很多行业做法持续数十年,确实有充分理由。但Jeff Dean认为,仍应定期重新检查这些理由。


MapReduce就来自类似过程。


早期Google的爬虫和索引系统包含大量手工并行代码、检查点和故障恢复逻辑。真正的业务计算往往很简单,比如读取所有网页,判断页面语言。可大量系统代码把简单意图淹没了。


Jeff Dean和Sanjay Ghemawat从函数式编程中找到灵感。他们把大量任务抽象成Map和Reduce,把并行化、调度、容错和重试下沉到统一框架里。业务开发者只需要表达计算本身。


这项设计并没有让机器变得不出错。它让错误变得可以被系统吸收。


今天的Agent工程也可能处在类似阶段。大量团队仍在为每个任务手工编排提示词、重试逻辑和工具调用。未来,是否会出现一个像MapReduce一样简洁的抽象,让长程Agent的分解、验证、恢复和并行探索成为底层能力?


这也许正是下一批基础设施公司的机会。


十、AI开始构建更好的AI,科学方法被压缩成高速循环


Jeff Dean对未来最兴奋的方向,是把科学方法本身自动化。


传统科研流程是提出假设、设计实验、运行实验、分析结果,再产生下一轮假设。这个循环的速度,长期受制于实验成本和验证延迟。


AI可以改变两部分。


一部分是自动提出和执行更多实验。另一部分是把昂贵验证器变成廉价近似模型。


Jeff Dean举了量子化学的例子。研究人员要判断一种分子构型的性质,可以运行密度泛函理论模拟。一次模拟可能需要一整夜。Google的研究人员用大量模拟输入和输出训练了一个神经网络近似器。它接近原模拟器的准确度,却快了约30万倍。


验证速度变化之后,科学问题的形态也会变化。


过去筛选1000万个候选方案,可能是一个需要数月算力的项目。现在,研究者吃一顿午饭的时间,系统就能完成初筛。实验不再是珍贵的单次下注,而变成高频搜索。


这也是AlphaEvolve、AlphaChip等系统背后的共同逻辑。模型提出方案,工具执行方案,评价器筛选结果,优秀结果进入下一轮。只要闭环足够快,系统就能在巨大的解空间中持续探索。


机器学习本身也会成为这种自动化科学的对象。


今天,大型研究团队通常由人提出新架构或训练方法,先跑小规模实验,再挑选有希望的方案放大。Jeff Dean认为,没有根本障碍阻止模型接管其中越来越多环节。人给出高层方向,系统自动探索结构、数据配方和训练策略,再把成功实验组合成新模型。


未来衡量研究效率的指标,可能不只是每秒浮点运算,而是「每单位算力产生多少有效发现」。


算力当然重要。如何把算力转化为发现,更重要。


十一、被NeurIPS拒绝的蒸馏论文,以及如何看待失败


2014年,Jeff Dean、Geoff Hinton和Oriol Vinyals提交了一篇关于知识蒸馏的论文。今天,知识蒸馏已经是模型压缩和能力迁移中的基础方法。大模型作为教师,把能力传递给更小、更快、更便宜的学生模型。


这篇后来影响深远的论文,当年却被NeurIPS拒绝。


Jeff Dean谈起这段经历时没有愤怒。他说,审稿人可能并不了解大规模AI服务面临的现实问题。对Google来说,把昂贵大模型转化为可服务数亿用户的小模型,显然非常重要。对只关注理论新颖性的审稿人来说,它未必显得足够「基础」。


论文被拒后,团队把它放上arXiv。行业照样读到了它,也照样开始使用。


今天,Gemini的Flash模型能够在较小体量和较低延迟下保持强能力,蒸馏正是其中的重要方法之一。


这个故事并不只是「坚持就会成功」的励志材料。它说明评价体系总有盲区。一个方案的价值,有时只有真正承受过那个系统瓶颈的人才能立刻看见。


对创业者来说,这同样重要。


市场、投资人和同行的否定,可能意味着方向错误,也可能只是对方没有处在同一个问题现场。区别在于,团队是否有足够具体的证据,知道这个问题为什么重要,为什么现在能解决。


Jeff Dean没有鼓励人盲目坚持。他鼓励的是:理解问题,持续验证,然后不要把一次评审当成世界的最终判断。


十二、年轻的Jeff Dean今天会做什么


访谈接近尾声时,Diana提出了一个带有想象力的问题。


如果把1999年加入Google时的年轻Jeff Dean传送到2026年,他会加入一家前沿实验室,还是和两三个朋友创办公司?


Jeff Dean没有给出标准答案。


大组织拥有结构、平台和大量优秀同事。一个人在其中可以接触自己不了解的知识,也能借助成熟产品影响全球用户。小团队则更自由,也承担更大风险。创始人必须真正相信一个问题,愿意用几年时间承受不确定性。


他给出的判断标准,比「加入大厂还是创业」更根本。


「如果我解决了这个问题,并且最好的结果真的发生了,世界会因此明显变好吗?还是大家只会说,嗯,挺酷的,然后就这样?」


如果答案只是「挺酷的」,那可能不值得投入最宝贵的时间。


他也强调同伴的重要性。要找有互补能力的人,也要找低自我、愿意协作、相处愉快的人。真正困难的问题往往需要长期共事。团队成员最好各自拥有别人没有的工具,并在共同工作中继续扩充自己的「工具腰带」。


这番话有一种老派工程师的朴素。


AI行业喜欢谈指数增长、超级智能和巨额融资。Jeff Dean最后仍把选择落回三件小事:做一个真正关心的问题,和喜欢的人一起工作,尽力让世界变得更好。


结语:AI时代最稀缺的,仍然是把问题看清楚


Jeff Dean的职业生涯里,有许多被反复讲述的传奇。


他和Sanjay Ghemawat在几天内重写搜索系统,让索引进入内存。一次关于三分钟语音的估算,推动Google造出TPU。MapReduce把大规模并行和容错藏进统一抽象。知识蒸馏从一篇被拒论文,变成行业基础技术。


这些故事很容易让人把他想象成一个不断获得灵感的天才。


但从这场访谈看,他的方法其实高度一致。


先算清数量级。再找到真正的瓶颈。然后质疑默认假设,建立一个更简单的抽象。最后,用测量和反馈推动系统不断迭代。


今天的AI行业正在经历类似转折。


模型已经足够强,强到可以承担初级工程师级别的任务。接下来,决定实际生产力的,不只是模型智商,而是推理成本、上下文组织、工具质量、验证速度和长程运行可靠性。


Agent会越来越像团队成员。可它们需要清晰规格,需要技能,需要检查点,需要评价者,也需要一个能容纳失败的系统。


创业公司的机会也不会消失,只是会变得更苛刻。最好不要去做通用模型已经能完成20%的事情,而要寻找那些成功率仍接近0%或1%的问题。那里可能藏着专有数据、专业评价器、窄领域模型,或全新的系统抽象。


当代码生成越来越便宜,真正昂贵的会是问题本身。


什么值得做?什么约束已经过时?什么变化刚刚跨过临界点?什么系统如果快50倍,会变成完全不同的产品?


Jeff Dean没有为6000名创业者给出一份机会清单。他给的是一种更耐用的思考方式。


别急着追逐最热的答案。


先把问题算一遍。


参考链接


https://x.com/ycombinator/status/2082938685071491219


https://www.ycrootaccess.com/p/jeff-dean-the-1-rule-for-building

本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。