2026-09-18 17:56

AI制造的文字垃圾已经把互联网淹没啦

author_path 互联网怪盗团 icon_path
头图

本文来自微信公众号: 互联网怪盗团 ,作者:怪盗团团长裴培


我的一大业余爱好是看体育新闻,尤其是欧洲足球和NBA方面的新闻。如果条件允许,我当然也爱看球赛,可惜这些球赛经常安排在深夜或清早,不可能每场都看;再说,就算看了直播,也总想看看相关的新闻评论的。网易、头条、腾讯的体育板块,我经常都刷一刷,反正它们的信息来源大同小异,都是同一批体育媒体和自媒体,就连分发时间也差不多。


刷的体育资讯越多,我就越感觉不对劲。最近几天,我连续看到好几篇分析英超的文章,信誓旦旦地宣称:曼城主帅是瓜迪奥拉,“瓜迪奥拉的球队今年能否夺回阔别两年的英超冠军,还要看阿森纳和利物浦的脸色”。其实瓜迪奥拉今年不执教任何球队,不会从任何人手里夺回英超冠军。


前一段时间,梅西宣布退出阿根廷国家队,其中一个重要原因是其父亲去世。奇怪的是,我却刷到不止一家自媒体宣称,梅西的父亲“在医院外遭到了抢劫”,导致梅西心灰意冷、不再为国效力。可是一个已经去世了的人怎么可能被抢劫?


穆里尼奥重返皇马之后已经吞下第一次失利,客场0-1负于贝蒂斯;前几天则在最后时刻以3-2险胜埃尔切。奇怪的是我不停地刷到资讯,宣称这两场比赛的比分是1-1和2-2,说的有鼻子有眼的,所以皇马至今还一场没输,积分却少了1分,因为两场平局的价值不如一胜一负,呃……


毫无疑问,上述文字垃圾全是AI制造的,我从行文方式中能看出浓浓的AI味,甚至能想象AI幻觉是如何在其中发挥作用的:


  • 瓜迪奥拉执教曼城长达十年,留下的文字记录太多了,深度渗透进了主流大模型的语料库。接替他的马雷斯卡则远不如他知名,何况上赛季还在切尔西执教。如果不启用搜索功能,AI可能会顽固地认为,曼城主教练过去、现在、未来一直都是瓜迪奥拉。


  • 梅西的父亲被抢劫,此事确实在多年前发生过。而他去世的消息在世界杯期间一度被辟谣(其实已病危),后来才真的去世。AI可能是看到了此前的辟谣信息,结合当年的被抢劫信息,奇怪地产生了“梅西因父亲被抢而退出国家队”的幻觉。


  • 至于皇马这两场球就更简单了:对贝蒂斯,皇马最后时刻曾有点球扳平的机会,但不幸射失;对埃尔切,则是在补时阶段绝杀。AI有可能是根据90分钟正常时间结束时的情况,脑补了全场比赛结束时的比分。


我想强调一下:使用优质前沿大模型(例如Claude Opus),打开搜索功能,输入良好的Prompt,并对结果进行检查,是绝对不会出现上述幻觉的。上述文字垃圾充斥各大信息流平台,纯粹是自媒体(以及个别“专业媒体”)既想省钱、又不懂行、还不想花时间所导致的恶果。因为想省钱,所以不愿为Token付费,或只愿付最低的费用;因为不懂行,所以Prompt估计是乱写的,加剧了而不是减轻了AI幻觉;因为不想花时间,所以没有检查生成结果,直接就发出来了,为人类的知识库带来了永久性的污染。


事实上,我猜很多此类文字垃圾,都是用OpenClaw或WorkBuddy等AI办公工具,全自动、批量制造出来的。作者可能写了一个所谓Skill,从中英文权威媒体不停地抓取“第一手信息”,通过某种方式组织语言(其中产生大量幻觉),根据当天的媒体热搜起个标题并加上标签,然后群发到各个平台。因为这样做的媒体实在太多,你根本拉黑不完,野火烧不尽、春风吹又生,现在我已经习惯通过标题判断是否打开,懒得再去跟它们斗智斗勇了……


历史类资讯则是又一个文字垃圾的重灾区。过去一个月,我至少五次刷到“巴西一黑奴沦为育种机器”的文章,核心内容几乎一样:一位生活在19世纪后期、身高2米多、身强力壮的巴西黑奴,被奴隶主拿来配种,跟不同的女奴生下了几百个孩子,至今巴西某几个村庄大部分人都是他的后裔……这个人真的存在吗?不得而知,重要的是他的故事被多个自媒体反复创作,大家的版本都有一点不同,估计很快会产生更离奇的版本(诸如上千个孩子、半个巴西的人都是他的后裔之类)。


我猜测此类文章的创作路径是:最早可能确有通晓外语的作者,从巴西出版物上看到了这个故事,用中文将其讲述了一遍。因为这个题材很有看点、受人欢迎,其他自媒体遂反复“洗稿”、做出自己的版本。洗稿行为早在AI诞生之前就已存在,但AI把它发展为了一种全自动工业——把原始文章扔进去,再加上一两句指引,就能创造出一篇全新的文章。作者可能还会刻意引导AI产生幻觉,因为这样可以增加“原创性”,不会被平台判断为抄袭。


至于那些“AI味儿浓厚”的历史人物传记、轶事,就不用我点名了。如今各大门户网站的历史频道,可能有三分之一的文章是AI根据历史人物简历“充实”出来的文字垃圾。在这个过程中,AI的主要任务是根据幻觉增加生动有趣的场景和对话,幻觉是一项核心竞争力!坦白说,由人类自己去编,是很难编出这么多细节的,因为人类扯谎总归有那么一点点羞愧心理,而AI的问题是不知道自己在扯谎。


附带说一句,券商和咨询公司的研究报告,是AI创作的又一个重灾区,很多文字都是浓浓的AI味儿。因为这些报告虽然由首席分析师挂名,但众所周知,首席分析师是不写报告的,报告都是实习生写的,而实习生是不会抗拒用AI写报告的诱惑的,尤其是当他们内心对自己的首席很鄙夷、认为自己在被压榨的时候。首席也知道这一点,但睁一只眼闭一只眼,毕竟自己给实习生的钱实在太少,而研究报告从来不是券商的核心竞争力所在。核心竞争力这玩意或许从来没存在过,如果存在,那也只有两个字——牌照。


其实,只要内容本身有干货,我并不在乎文章本身是人写的还是AI写的。我经常在小红书或小绿书上搜旅游攻略,其中不少我一看就知道是AI深度润色的,但是没关系,读者需要的只是信息量,又不是文笔。有些旅游博主确实去过很多地方、见多识广,主要出于分享而非利己的动机,告诉我们出去旅游要注意的事项;他们不擅长文字组织,或者希望AI将其组织为“读者喜欢的形式”,这一点我们是完全理解的。


问题在于,绝大部分AI生成的文字信息既无文笔也无信息量,AI在其中扮演的是“从垃圾到垃圾”(Rubbish in,rubbish out)的角色。我在体育资讯中轻易辨认出了大量文字垃圾,是因为体育资讯非常容易被证伪——曼城主帅是不是瓜迪奥拉、皇马昨天有没有赢球,非常容易搜到并确认,一两个自媒体借着AI说胡话,妨碍不了大局。可是其他领域呢?比如上文提到的那个据说生了几百个孩子的巴西黑奴,我至今都不知道他是否存在,因为自媒体作者没有提供他的外文姓名,我尝试了一下,在外网搜不到任何信息……


如果是更重要的信息,譬如科技、财经或其他专业领域的事实或观点呢?要想骗过所有人是困难的,但要想影响少部分人,或者对大家的心智造成潜移默化的影响,是比较容易的。骗子和说胡话的人一直就存在,但以前效率比较低;现在AI把胡言乱语的门槛降低到了零,只要你肯烧Token,就能每天24小时地向互联网散布文字垃圾;何况这个活儿还烧不了多少Token。


以前我曾有个观点:AI再怎么“胡说八道”,也不如人类的胡说八道更可恶。当时我的意思是,AI幻觉是一种客观存在的技术缺陷,人类说谎则是一种主观驱动的逐利行为,前者的严重性根本不能与后者同日而语。现在我发觉,最可怕的是“人类+AI”的双剑合璧:人类负责提供造假的动机,AI负责提供造假的技术手段,形成所谓“商业闭环”。AI容易出幻觉、一本正经地胡说八道,在这个闭环当中根本不是缺点,反而是核心竞争力……


啊人生啊。


有人会说,何止文字垃圾,AI制造的视频垃圾或许更多。但我想说句公道话:AI制造的“视频垃圾”,迄今为止大部分仍在娱乐领域,就是拿来玩的,大家不会太当一回事。严格地说,虽然视频时代到来这么多年了,对于受过一定教育的受众,文字还是比视频的“权威性”更高一些。观点向、科普向的视频,往往是以文字稿为基础,视频化之后二次传播的。也就是说,必须先有一个“文字垃圾”,才有衍生的“视频垃圾”。


AI视频比文字更烧钱,这也是客观事实。虽然Seedance的价钱已经大幅降低,现在要生成在短视频平台看得过去的视频,每分钟至少也得几百元(以平均10次抽卡计算)。这个钱够生产并分发几十万字的文字垃圾了,性价比根本不是一个档次的……


平台对视频垃圾的管控也明显更严,因为AI视频容易以假乱真。视频博主都知道,对于疑似AI的视频片段,平台是一贯宁可错杀、绝不放过,随手就给你挂个“疑似AI生成”,在观众心中敲响警钟(实际效果存疑)。至于文字,好像压根没人管,我从来没见过一篇文字垃圾被平台挂上“疑似AI撰写”的标签……


再过两三年,或许用不了那么久,AI制造的文字垃圾会在互联网文字内容中占据绝对多数,你随手刷到的信息,几乎可以肯定是AI制造的、真假难辨的、质量严重堪忧的。还可以加上一句:80%是来自某个办公Agent,制造过程只需人类最低程度的干预。数千个、数万个“硅基创作者”,就这样以绝对的数量优势,彻底改造着碳基生命的大脑和心灵。


假如你觉得这一幕不可接受、需要寻找解决方案,那你已经属于人类社会的一小撮有识之士了。大部分人可能根本不觉得这是一个需要解决的问题,乃至乐在其中,希望这无知而快乐的日子永远持续下去。

本内容来源于网络 原文链接,观点仅代表作者本人,不代表虎嗅立场。
如涉及版权问题请联系 hezuo@huxiu.com,我们将及时核实并处理。