2026-09-03 20:57

Transformer 架构瓶颈日益凸显,四大技术路线突围,谁会成为下一轮AI 风口?

author_path 世界科学
头图

本文来自微信公众号: 世界科学 ,作者:编译 哔普星人,原文标题:《Transformer 架构瓶颈日益凸显,四大技术路线突围,谁会成为下一轮 AI 风口?》


2017年夏天,谷歌的AI研究人员发布一篇题为《注意力就是一切》(Attention Is All You Need)的论文。文章描述了一种名为变换器或转换器(Transformer)的新型神经网络。


后来事实证明,Transformer网络在处理长序列数据,尤其是文本方面,表现十分出色。


在2026年的今天,Transformer可谓市场上所有主流大语言模型(LLM)的核心引擎。AI初创企业Subquadratic的联合创始人兼首席执行官贾斯汀·丹格尔(Justin Dangel)表示:“整个AI行业都建立在Transformer之上。它们是计算机科学史上最重要的创新之一,已经改变整个世界。”


但与此同时,Transformer技术也显露出疲态。近期大语言模型取得的诸多进展,比如围绕推理模型的开发以及模型一次性处理海量输入的能力,都不是对核心技术的顺势延展,更像是在其某些根本性缺陷上打补丁的权宜之计。


越来越多的科学家和工程师开始思考:技术如何演变?新一代AI是何种形态?我们相信,LLM本身不会消失,但未来它们将以何种方式构建而成呢?一切尚无定论。


一批初创企业争相入局,力求在现有技术前沿上开疆拓土。注定有一部分竞争者会失败,但这些后起之秀的潜力巨大,相比当下行业头部企业,反而更具竞争优势。


迟暮的网络


首先,我们要厘清现存的技术难题。Transformer的核心优势来自所谓“密集注意力”(dense attention)机制,该机制通过一系列数字来编码一段文本的语义。处理过程中,文本里的每一个词(word),或是词的一部分,即词元(token),都会通过乘法运算与其余所有词或词元做比较。


密集注意力机制能以极高精度捕捉文本含义。但随着文本长度增加,处理所需的计算量会急剧攀升。一份长达一万个英文单词的文档,可能要求Transformer完成5000万次乘法运算。这正是大语言模型能耗巨大的主要原因。


算力成本十分高昂。据OpenAI总裁格雷格·布罗克曼(Greg Brockman)透露,OpenAI今年的算力支出将达到500亿美元。国际能源署预测,到2030年,数据中心的总耗电量将翻一番。


更糟糕的是,处理面对诸多新模型所须完成的任务,Transformer网络往往力不从心。受逐词处理文本的工作方式限制,Transformer不擅长同时维护大量信息,换言之,它的上下文窗口无法扩展得太大。


然而,LLM若要开展难度更高的任务,就必须接收更大规模的数据,比如一整套文档库、一整个代码库,或是来自其他大语言模型的输出结果。


推理模型的工作方式是先借助思维链这一草稿本来给自己写笔记,再读取笔记继续推理。这种方式也会增加模型需要维护的数据体量。


随着LLM不断变大变强,Transformer的瓶颈越发凸显。它们曾经的核心优势,如今却成局限性。


下文介绍四种旨在解决Transformer网络局限性的新思路。这些创新有望彻底重塑大语言模型,使其速度更快、效率大幅提升,或许还可越发智能。


路线01


重新设计注意力机制


要让大语言模型跑得更快、成本更低,不妨直击痛点,改变注意力机制,用稀疏注意力(sparse attention)替代密集注意力。


稀疏注意力机制仅对文本块中的部分词对进行运算,而非全部。这可以大幅减少LLM所需的计算量。


多年来,研究人员提出过大量稀疏注意力机制,但它们在捕捉语义方面始终比不上密集注意力机制。当然,今时或已不同往日。


前文提到的初创企业Subquadratic宣称,他们开发的一款稀疏注意力机制,首次在搜索、代码生成等多项任务上展现了对标主流顶尖LLM的性能。此论断可谓重磅,不过业内部分人士仍持怀疑态度。


Subquadratic方面表示,自家模型SubQ会针对输入文本的每一段,实时判断哪些词重要或不重要。据称,有数以万计的用户报名加入等待名单,以求试用SubQ;而该模型向全体公众开放的日子也会很快到来。


另一家初创企业Manifest AI则另辟蹊径,选择不改造注意力机制的工作方式,直接用全新方案取而代之。


这家公司开发出一套名为“幂保留”(power retention)的机制。幂保留机制仅保存与当前任务最为相关的信息,从而确保大模型需要维护的数据量不会爆炸式增长。


传统注意力机制要求LLM记住上下文窗口内的全部内容。以SubQ为代表的稀疏注意力模型虽舍弃了大量单个词,却仍保留其所见内容的概貌。相比之下,幂保留机制会为模型提供一个关于上下文窗口内容,也就是模型当前能看到的所有文本内容的滚动摘要——若有新增信息进入,相关性较低的旧信息即被丢弃。


幂保留的基本原理已存在约十年之久。Manifest AI方面声称:他们完成了技术迭代,首次构建出可比肩基于Transformer的大模型的产品。另外,仅需少量再训练,即可将Transformer模型改造为幂保留模型。


为证明上述改造能力,技术团队将现有开源代码大模型StarCoder调整为搭载幂保留机制的PowerCoder,还发布了Brumby模型,称其性能可匹敌阿里通义千问的某些版本。


Manifest AI的愿景是:当大语言模型需要处理海量数据任务时,幂保留技术能成为首选方案。公司联合创始人兼首席技术官卡莱斯·赫拉达(Carles Gelada)曾表示,他们的技术方案拥有广阔应用场景,小到分析数小时时长的视频,大到打造能连续数周执行任务的AI智能体。


路线02


打造体积更小巧、更灵活的模型


由麻省理工学院孵化的初创企业Liquid AI并未彻底修改或是舍弃Transformer,而是将其自研的液态神经网络(liquid neural networks)与Transformer结合,构建出所谓的“液态基础模型”(liquid foundation models),简称LFM。


Liquid AI的模型体量远小于绝大多数LLM,能耗也更低。公司已为梅赛德斯等车企开发适配车载小型芯片的模型;其最新版本甚至可在售价50美元、低功耗的树莓派开发板上运行。


据称,年收入低于1000万美元的企业可免费使用Liquid AI的产品,而模型下载量已达数千万次,且广受好评。


液态神经网络是卷积神经网络的延伸,其灵感源自蠕虫大脑;卷积神经网络则是Transformer诞生前就已存在的另一类神经网络。液态神经网络之所以脱颖而出,关键在于有一套自适应机制,使模型能根据新信息动态调整自身行为,实现边运行边学习。基于Transformer的模型则无此能力,一旦训练完成,其行为模式就固定不变。


Liquid AI的早期模型虽相对基础,但已能操控无人机、驾驶车辆。如今借助液态基础模型,公司正尝试将技术规模化,以对标主流大语言模型。新模型的性能可匹敌在规模上4倍于自己的竞品,包括阿里通义千问和谷歌开源大模型Gemma的某些版本。


典型的LLM由多个Transformer堆叠搭建而成。Liquid AI最新的LFM属于混合架构,包含20%的Transformer与80%的液态神经网络。


计算出上述配比的并非人类,而是该公司自研的另一套AI系统——专用于辅助模型设计。据称,这套能设计AI的AI会把各种不同神经网络,如液态网络、卷积网络、Transformer等进行大量组合,并筛选组合方案,找到性能与效率的最佳平衡点。


Liquid AI的联合创始人兼首席执行官拉明·哈萨尼(Ramin Hasani)认为神经网络的未来充满无限可能,Transformer只是开端而已。


“人类大脑就个是通用人工智能系统,其功耗却只有20瓦。这是怎么实现的?我们完全能做出更多创新。”


——拉明·哈萨尼


路线03


一次性生成全部文本


几乎所有大语言模型都逐词输出内容。这符合人类说话写作的习惯,但对计算机而言效率极低。若LLM能一次性生成文本——一口气吐出整句乃至整段——速度和成本都将得到优化。


上述思路的践行者之一Inception公司,正利用扩散技术来构建大模型。


扩散技术更为人熟知的角色,是绝大多数图像、视频生成模型的驱动核心。扩散大模型的训练方式则是:先接收一个随机的像素网格(类似老式电视机的雪花噪点),再同时处理全部像素,判断哪些像素需要修改,把雪花噪点变成一幅高清图像。


事实证明,上述流程同样适用文本。Inception团队通过特定训练,使扩散大模型能接收一串随机的词语序列并转化为语义通顺的句子。这种扩散LLM仍使用Transformer来编码语义,但会一次性输出整块文本,以更少代价完成更多任务。


公司联合创始人兼首席执行官斯特凡诺·埃尔蒙(Stefano Ermon)表示,自家的创新依旧属于大型Transformer模型,但它能同时预测多个词元。这就是为什么,对比市场上绝大多数方案,这套模型的文本生成速度快很多,成本效益更高。


其中的难点在于,怎样把原本为图像生成所设计的技术迁移至文本领域。


“处理图像时,把一个蓝色像素改成红色像素,可经过中间过渡颜色逐步调整。但文本不行,‘猫’与‘狗’之间没有中间词汇。”


——斯特凡诺·埃尔蒙


埃尔蒙的另一重身份是斯坦福大学研究员。2024年,他与两名斯坦福同事找到了弥合文本鸿沟的数学方法,并以此为基础训练出一款适配文本的扩散模型,其性能媲美2019年OpenAI发布的GPT‑2,生成速度则快10倍。


基于该项成果,埃尔蒙创办Inception。眼下,他的雄心指向行业头部。Inception称其最新模型Mercury 2性能对标2023年OpenAI发布的部分GPT‑4版本,速度同样快10倍。


“我们非常看好这条路线,它具备规模化扩展的潜力。归根到底,速度与成本是衡量大模型价值的核心标准——你向它投入一块钱后能获得多少智能?”


——斯特凡诺·埃尔蒙


押注扩散技术的企业不只Inception一家。谷歌方面也正积极尝试,并已打造名为Diffusion Gemma的原型LLM。


路线04


干脆跳出文本世界


在围绕Transformer局限性探索创新方案的初创企业里,Pathway公司的理念最具颠覆性。他们想让大语言模型摆脱语言的束缚,并以此为目标开发了Dragon Hatchling大模型。


迄今为止,它最亮眼的成绩来自一项与超过25万多道超高难度数独题对战的基准测试。多家顶尖实验室的主流大模型难以破解哪怕一道谜题,Dragon Hatchling却攻克了97%以上的难关。


Pathway想传递的观点是:主流LLM虽在大量任务上表现出众,但仍对诸多关键类型的问题无能为力,数独只是其中一例。


公司联合创始人兼首席执行官祖赞娜·斯塔米罗夫斯卡(Zuzanna Stamirowska)表示,若要大模型针对现实问题产出真正原创的解决方案,就必须跳出Transformer框架。因为Transformer迫使大模型全部依靠文本完成推理,但语言并非某些推理形式的最优载体。


Pathway的解决方案是修改Transformer的底层数学逻辑,用“状态空间”(state space)这一数学结构替代注意力机制。


状态空间不再逐词编码信息,而是将信息压缩为更抽象的表达。以此为基础,Dragon Hatchling依旧能读写文本,同时也可模拟不依赖词语序列的推理模式。这不仅提升模型效率,理论上还可胜任其他LLM力不能及的任务。


“国际象棋和数学问题,并非以长句形式存在于人类脑中。大脑灵光一闪的顿悟,未必以语言形式出现。我们认为,若推理必须依托语言完成,这本身就是一种局限。主流LLM有能力阅读数独解题教程,再编写求解代码,但这并非我们所求,我们理想中的模型不局限于书本知识。


AI的星辰大海不是解数独题,而是攻克癌症——可这世上还没有一本现成的癌症解法手册。”


——祖赞娜·斯塔米罗夫斯卡


资料来源:


These startups are chasing the next big thing in LLMs

本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。