观点
当AI开始造谣:虚假信息如何同时瞄准人类与机器?

人工智能使信息获取更加民主化,但AI智能体也可能被人类和机器用来传播虚假或误导性内容。 Image: Getty Images/LaurenceDutton
Tobias Knappe
Senior Project and Research Officer, Polymath Initiative, Geneva Centre for Security Policy (GCSP)- 在人工智能时代,虚假信息行动不仅可以针对人类,也可以针对机器。
- AI智能体与多智能体集群可被用于传播虚假或误导性内容,从而扰乱全球信息生态。
- 防范此类自主影响力行动,需要同时加强人类和机器的认知安全与认知韧性。
技术进步从根本上重塑了全球信息生态。信息世界变得更加数字化,获取信息也更加便捷,但与此同时,整个生态也变得愈发复杂和碎片化。人工智能(AI)正处于这场转型的核心:一方面,它推动了信息获取的普惠化;另一方面,它也为政府和企业进行数据驱动的决策提供了基础支撑。
自2022年以来,生成式AI,尤其是大语言模型(LLM)的兴起,促使大量质量良莠不齐的内容涌入信息生态。据估算,目前新发布的文章中约有50%由AI生成,同时,多达74%的新网页含有合成内容。这种变化模糊了人类创作内容与机器生成内容之间的界限,也对商业智能和数据分析所依赖的输入数据产生了影响。
虚假信息与认知战
虚假信息是指为了操纵或欺骗他人而有意传播的不实内容;错误信息同样可能失实或具有误导性,但传播者通常并非出于故意。
虚假信息和错误信息早在AI出现之前就已存在,但进入数字时代后,二者的复杂性、传播规模和触及范围都进一步扩大。与此同时,推荐算法的广泛应用以及对数据持续进行商业化变现,也让这一问题变得更加严重。
长期以来,影响力行动一直将虚假信息作为工具,其运作方式也随着技术发展不断演变。早期的深度伪造内容往往很容易识别,但近年来出现的深度伪造内容已经足够逼真,能够被用于攫取政治或经济利益。低成本多模态大语言模型的出现进一步降低了恶意行为者的准入门槛,使他们能够大规模发起涵盖文字、音频和视频的虚假信息行动。
企业既可能通过供应链受到这类活动的间接影响,也可能因为有人围绕影响股价的敏感新闻协同散布虚假信息,或利用深度伪造技术冒充企业高管,而直接面临市场操纵的风险。因此,这一问题应当成为每一家企业董事会重点关注的事项。
不同恶意行为者的动机并不相同。有些行为者可能以勒索和诈骗为目的,另一些则可能试图从事颠覆活动,即通过利用政治和社会层面的脆弱之处,削弱现有权威及其影响力。
AI智能体与多智能体集群
AI智能体使当前的威胁格局变得更加复杂。尽管这类技术在可靠性与安全性方面仍存在局限,但能够自主感知周围环境并据此采取行动的AI智能体,正在企业、政府以及军事领域迅速普及。
据估计,2025年企业投入使用的AI智能体已达到2860万个,预计到2030年,这一数量将超过20亿个。
AI智能体的迅速普及,也引发了人们对其遭到滥用的风险的担忧。自主智能体已经能够实现网络行动的部分自动化。这意味着,一些过去只有掌握深厚专业知识才能实施的攻击,如今可以由智能体自主执行,并且能够以机器运行的速度大规模发起。
当具有不同专业能力的AI智能体组成协同网络,或以集群(swarms)的形式共同运行时,各类风险还会进一步叠加。多智能体集群虽然仍处于早期发展阶段,但其更强的自主性、更高的复杂程度以及更大的运行规模和速度,都可能进一步放大虚假信息造成的影响。传统机器人程序的行动通常受到预设规则的约束,而AI智能体则可能支持具有适应能力的端到端影响力行动。一旦目标被设定,这类行动几乎不再需要人工监督便可持续运行。
这种风险并非停留在假设层面。在南加州大学近期一项研究搭建的模拟社交媒体环境中,500个AI智能体在没有人工指挥的情况下自主协同行动,共同为一名政治候选人开展宣传。如果同类行动被用于攻击企业或公众人物,由智能体驱动的影响力活动可能在短短数日内造成严重的声誉损害,而建立信任通常需要花费数年时间。
对人类与机器的双重认知威胁
AI智能体正在推动虚假信息从大规模生成与扩散,进一步迈向自动化和饱和式传播,使人们越来越难以辨别事实与虚假内容。生成式AI让高度个性化的虚假信息成为可能,而AI智能体还可以利用个人数据建立用户画像,进而大规模营造“合成共识”。
正是在这个环节,虚假信息可能进一步演变为认知战。人类认知可能成为现代冲突中的核心攻击目标,而自主运行的影响力行动则会让颠覆活动更容易发动,同时也更难被追踪。
随着社会围绕基本事实形成共识的能力不断减弱,一些人所说的、日益严重的“认识论危机”,为多智能体集群的滋生提供了有利环境。伴随互联网和社交媒体的兴起,科学界、新闻媒体和政府机构等传统信息中介的权威性持续下降。这一变化削弱了整个社会的集体信任,使社会更容易受到虚假信息的影响。AI智能体则可能精准识别并利用这些薄弱环节。
进入AI时代后,认知战还可能将机器认知作为攻击目标。所谓机器认知,是指人工系统中类似于人类感知、推断和推理的一系列过程。
随着合成数据的数量不断增长,数据投毒的风险也在随之上升。大语言模型诱导(LLM grooming)可以通过在开放网络中植入欺骗性内容,使这些内容进入模型的训练数据,进而扭曲模型的输出结果。实施此类攻击并不需要大量投毒样本。一项研究显示,仅凭250份“投毒”文档,就足以在大语言模型中植入隐蔽漏洞。
即使没有人为蓄意操纵,当可靠信息不足时,模型也可能优先呈现或放大虚假信息。多智能体集群可以迅速利用合成内容填补这类数据空白,并在信息形成的早期阶段扭曲公众认知。随着可供训练使用的人类生成数据日渐稀缺,模型开始越来越多地依赖合成数据进行训练,由此可能形成不断自我强化的错误与偏见。这种现象被称为模型崩溃。
已有证据显示,在具有争议的社会议题上,与AI进行互动可能改变人们原有的看法。
因此,AI模型已经成为极具价值的攻击目标。一旦模型遭到破坏,机器认知与人类认知都可能受到污染,从而损害公共部门和私营部门作出决策时不可或缺的可靠信息与不受扭曲的判断。当AI智能体作出决策的规模和速度超出人类监督能力时,这种风险还会进一步加剧。
如何构建认知安全
守护信息生态需要采取多层次的应对方式,并围绕两个彼此关联的目标展开:既要保护人类与机器的认知安全,也要增强二者抵御认知威胁的韧性。
在人类认知层面,增强个人、机构乃至整个社会的韧性,需要综合采取教育、政策和监管措施。系统提升公众的媒体素养和AI素养,并相应调整教育内容和教学方式,有助于培养更强的批判性思维能力,从而维护人类认知安全。
组织需要建立AI审计、红队测试等机制,并制定完善的信息核验规程,确保相关信息在被用于决策之前得到验证。与此同时,组织还应充分认识认知操纵可能带来的风险,包括受到污染的情报、刻意虚构的压力情境,以及利用技术冒充领导层等情况。
从更宏观的角度来看,监管措施不仅要建立明确的问责机制,还应改变那些助长虚假信息传播的系统性激励因素。例如,与真实内容相比,虚假信息往往具有更低的生产成本;与此同时,数字平台又常常将用户参与度置于信息准确性之上。
随着AI系统逐步成为全球认知基础设施的一部分,认知安全的保护范围也必须扩展至机器领域。使用可信且经过严格验证的数据集训练主权模型或组织内部自建模型,可以降低数据投毒与模型崩溃的风险。机制可解释性是指理解模型内部运行机制的能力;这一领域取得的进展,将有助于人们更有效地追踪和审计AI的行为。
跨平台监测在预测虚假叙事将如何传播方面展现出一定潜力,而防御性AI智能体则可以通过识别人类行为中不太可能出现的协同模式来检测虚假信息。这类智能体还能够持续监测品牌声誉,并在诽谤行动形成传播声势之前发出预警。
落实上述所有行动,都需要在思维方式上作出转变,将支撑人类认知和机器认知的基础体系视为关键基础设施。
增强抵御认知威胁的韧性,既是一项技术挑战,也是一项治理挑战。为此,需要提升机构能力,推进跨部门研究,深化国际合作,并促进真正意义上的多利益相关方参与。
本文作者:
Dr. Jean-Marc Rickli,日内瓦安全政策中心全球与新兴风险负责人
Tobias Knappe,日内瓦安全政策中心博学者倡议高级项目与研究员
本文原载于世界经济论坛Agenda博客,转载请注明来源并附上本文链接。
每周 议程
每周为您呈现推动全球议程的紧要问题(英文)







