2026-08-22 12:09

越会用AI 的人,学习能力退化得越快

author_path 极客公园 icon_path
头图

本文来自微信公众号: 极客公园 ,作者:张勇毅,编辑:靖宇,原文标题:《越会用 AI 的人,学习能力退化得越快》


这应该是过去三年被讨论最多的一个迷思之一,从ChatGPT走红那天就有。吵了三年多,两边都拿不出像样的证据:


担心的人只有体感,不担心的人只有立场。


8月18日,《经济学人》给这场争论补上了迄今最硬的一份证据。


报道的主角是2.7万名中国中学生。用上AI之后,他们的作业分数平均涨了18%,写一份作业的时间从64分钟缩到45分钟。到这里全是好消息,直到月考卷子发下来:闭卷考试里,这批学生的成绩比不用AI的同学低了20%。


作业分曾是最可靠的「晴雨表」:作业越好,考试越好。而在用AI的学生中间,作业分越高,基本等于AI用得越深。于是曲线变成了:用得越狠的孩子,考试跌得越惨。


作业分,第一次开始撒谎。


作业分超过100的人之中,不用AI的人分数上涨到了112,用AI之后一路跳水到64。|图片来源:经济学人


《经济学人》的数据底稿,是斯德哥尔摩大学和香港大学三位经济学家6月挂出的论文,标题就叫《生成式AI学习惩罚》。


《生成式AI学习惩罚》|图片来源:SSRN


样本来自中国中部一个县,人口超过一百万。论文特意强调它的普通:像沿海之外的大多数中国县城。26811名初高中生,5所初中、4所高中,装下当地九成中学生,从2022年9月跟到2025年6月,整整30个月。


这个县的作业在线上提交,系统记下每个人的用时;月考、中考、高考的成绩都进数据库——写多快、考多好,第一次成了直接测量的硬数据。谁在用AI,则来自回收率超过96%的全员问卷。


2022年9月,用AI的学生几乎为零。到2025年6月,这个数字是80%。这条曲线有两次明显跳升,分别踩在DeepSeek V2.5和R1的发布点上。工具全是熟面孔:豆包、DeepSeek、文心一言、通义千问。


采纳曲线的两次跳升,都踩在DeepSeek发版上|图片来源:CEPR


结论就是开头那组数字:作业+18%,用时−30%,月考−20%,相当于1.4个标准差。惩罚在各科并不均匀:社科类最重,跌27%;数学22%;英语17%;语文最轻,9%。初中生比高中生惨四成,男生比女生惨。


看来变笨这件事也不优待聪明人:恰恰是原来成绩最好的那批孩子,跌得最狠。


升学考试的账要算得更小心。6月底这项研究在中文互联网刷屏时,传播最广的说法是「中考暴跌24%、高考暴跌18%」。论文里的原意克制得多:这是用满两年以上学生的完整惩罚,全体AI用户的平均效应只有7%左右。


但这份「克制」本身才是更坏的消息:惩罚需要两年才长满。作者们专门点了一句,眼下那些几星期、几个月的短期研究,都在系统性低估AI的学习成本。


01


消失的模范生


这项研究6月刚出现时,英文讨论中其实还有一个安慰性的结论:有两成学生用AI但不外包作业,成绩没受损。所以问题不在AI,在用法。


论文确实说了前半句。它给「外包」下了一个数值上的定义:作业用时少于50分钟算「内包」,少于45分钟才算是真「外包」。


刚开始用AI的学生里,外包的占58%。而那些照常花时间写作业、只拿AI当家教的孩子,考试成绩和不用AI的同学几乎没有差别。


论文甚至发现,在50到65分钟的重叠区间里,两类孩子花同样的时间,考出几乎一样的分数。AI本身不带毒性,毒性全在省下来的那段时间里。


如果论文停在这里,它就是一篇「工具无罪、用法有罪」的标准论文。


但论文其实更深一步地探讨了这个问题:用满5个月之后,外包的比例从58%涨到81%,完全外包从34%涨到50%。那批花65分钟以上认真写作业的「模范用户」,全部是刚上手不到5个月的新手。


以及采纳满6个月之后,没有一个AI学生的作业用时还超过65分钟。


26811人的样本里,「好好用AI」不是一种稳定的用法,是一个维持不到半年的过渡状态。论文作者的解释很短:AI挤掉的,是强度最高的那部分努力。


用满六个月后,65分钟以上的区间空了|图片来源:CEPR


它不是又一篇「AI让成绩变差」的论文,它是在撕掉一个安慰的遮羞布:只要教会孩子正确使用,一切都会好起来。


数据给出的回答是,没有人能一直正确使用:毕竟作业分在涨,家长在群里点赞,老师看到的提交记录越来越整齐。每一个反馈都其实都在潜移默化中,形成一个畸形的激励机制:你做得很好,再快一点也没关系。


02


大人的考场


看到这里,这个研究似乎跟传统我们理解中、大脑已经发育健全的成年人关系不大。但同样的曲线,过去一年多,在成年人身上已经画了四次。


《柳叶刀·胃肠病学和肝病学》去年8月发表了一项波兰研究:四家内镜中心的19名资深医生,人均做过2000例以上肠镜,用了几个月AI辅助检查之后,回到没有AI的状态,腺瘤检出率从28.4%掉到22.4%,相对下降20%。



和中学生的月考,同一个数字。


这是医学界第一次在真实临床里测到「用AI之后,人的手艺生疏了」,主角还是这个星球上最不该被怀疑基本功的一群人。


第二次在写作者身上。麻省理工媒体实验室去年6月的脑电实验里,54名学生戴着电极帽写作文。用ChatGPT那组的神经连接强度垫底,比纯靠自己写的那组最多低了55%;写完不久,83%的人连自己文章里的一句话都复述不出来。


研究团队给这个现象起了个名字:认知负债。


第三次在办公室里。微软研究院和卡内基梅隆大学去年调查了319名知识工作者,结论一句话就能说完:对AI输出越有信心的人,自己动脑核查的投入越少。


第四次在程序员身上。研究机构METR去年的对照实验里,资深程序员用上AI实测变慢了,自己却觉得快了20%。今年2月它想复测,没做成,原因写在报告里:大多数开发者已经拒绝在没有AI的情况下工作。


和那个再也没人肯花65分钟写作业的教室,一模一样。


脱离AI之后,检出率没有回到从前|图片来源:METR


临床、脑电、问卷、对照实验,四次预警说的是同一件事:AI在场,产出变好;AI离场,能力变差。


回到开头那个吵了三年多的问题。这些研究给出的答案,比一句「会变笨」更难受:AI没有降低任何人的智商,它是把「变聪明」的那道工序抽走了。分数照涨,产出照交,只是那份本该在64分钟里长出来的能力,没有长。


认知科学管这个叫「认知卸载」:把本该在自己脑子里跑的过程,交给外部工具。卸载不新鲜,计算器和导航都是。新鲜的是位置:AI接走的不是运算和记路,是打草稿、试错、推演,恰好是心智模型长出来的那道工序。


落到日常工作上,这变化听着甚至像升级:从「写代码」变成「审代码」,从执行者变成把关人。


但把关的前提,是脑子里有一份自己的底稿。没亲手推演过的人,审的其实是个黑箱,AI的逻辑链一旦错在深处,他连该从哪里起疑都不知道。学生的版本更简单:作业是草稿,考试是Debug。草稿外包出去,Debug那天就露馅。


区别只有一个。学生每个月都有一场闭卷考试,把这条曲线摆到台面上。而大多数成年人的工作,没有月考。


论文的最后留了一点余地。把时间拉长看,AI学习惩罚正在收窄:同样用满5个月,2023年初的学生平均损失25%,2025年6月只有16%。


同样用满5个月,惩罚从25%收窄到16%|图片来源:CEPR


师生在适应,工具侧其实也有人想办法,比如逼AI给答案时同步展示推演过程。但按作者们的判断,损失在变小,却没有归零的迹象。


9月1日开学。全国的教室里,这场26811人的实验,会以更大的样本重跑一遍。


以后看到孩子的作业天天100分,也许得先问一句:这100分是孩子挣来的,还是豆包挣来的。


下一次把方案交给老板之前,这个问题,不妨也先问自己一遍。

本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。