
这项由复旦大学与美国罗切斯特大学联合开展的研究,发表于2026年6月,论文编号为arXiv:2606.06443,有兴趣深入探究的读者可通过该编号在arXiv平台查阅完整原文。
**一个令人不安的问题**
每个人都有自己的观点,比如你可能支持某款新兴的人工智能产品,也可能持怀疑态度。现在,如果有人告诉你:"我们可以用AI来预测你会怎么说"——你会怎么反应?更进一步,如果这个AI只要稍微改变一下对话的语境,就能让预测出的"你"完全改变立场,你会作何感想?
这正是这项研究想要揭开的谜题。研究团队关注的核心问题是:当大语言模型(就是ChatGPT、Claude这类能和你聊天的AI)被用来模拟真实用户在网络上的立场时,它模拟出来的究竟是真实的人类观点,还是对周围对话环境极度敏感的"变色龙"?
为了回答这个问题,研究团队设计了一套巧妙的实验:他们从Reddit(一个热门的英文社区论坛)收集了真实的对话,让AI扮演目标用户来推断其立场。然后,研究人员悄悄地修改对话中其他人说的话——就像在舞台剧中偷偷换掉别的演员的台词——再看看AI模拟出的"目标用户立场"会不会随之改变。结果令人深思:只要稍微改动对话背景,AI模拟出的立场就会发生显著偏移,有时甚至完全翻转。
一、为什么要"审计"AI的社交模拟能力
要理解这项研究的价值,先得知道AI社交模拟是什么,以及为什么它越来越重要。
近年来,社会科学研究者们发现了一个新工具:大语言模型。这些AI不仅能写文章、回答问题,还能被训练成"扮演"特定人群——比如预测某个Reddit用户在看到一条新闻后会持什么立场,或者模拟不同政治倾向的人对某个政策的反应。相比传统的问卷调查,AI模拟成本低、速度快、可以大规模进行,看起来像是社会科学研究的一大利器。
然而,这里藏着一个根本性的疑问:AI到底在模拟什么?当AI预测说"这个用户持支持态度"时,它是真的捕捉到了这个用户的内在信念,还是只是在对周围对话的措辞、语气、结构做出反应?如果是后者,那AI模拟的可信度就要大打折扣——它不是在描绘真实的人类观点,而是在描绘一幅随环境漂移的镜中幻象。
为了回答这个问题,研究团队引入了一个叫做"反事实语境修改"的框架。这个词听起来复杂,其实逻辑很简单:给同一个舞台同一个主角,悄悄换掉配角的台词,看主角的"表演"会不会随之改变。如果主角代表的是稳定的内在信念,台词改变了它也不该随意变心;如果它只是在随波逐流,那换掉几句台词就能让它"改换门庭"。
研究团队聚焦在Reddit上关于三个AI模型家族的讨论:DeepSeek、Claude和Llama。这三个话题在技术社区里争议不断,有人热捧,有人质疑,立场分明,非常适合研究"立场模拟"的问题。最终,研究人员收集并处理了1821条真实对话实例,这些对话来自97个不同的子版块、416个不同的Reddit帖子,涉及851个独立的"目标用户"和近3000个参与讨论的不同账号,数据规模相当扎实。
二、实验是如何设计的:一场精心编排的"戏中戏"
研究团队把整个实验分成四个环节,像流水线一样环环相扣。
第一个环节是建立基准。对于每条对话,研究人员把目标用户的最后一句话藏起来(用专业术语说叫"遮掩"),然后让AI仅凭之前的对话语境来推断这个用户的立场,分为支持、中立、反对三种。接着,把AI推断的立场与目标用户实际说的话对照,看看AI推断得准不准。结果显示,AI的推断准确率达到约77.6%,主要评估指标F1分数为78.1,在三个话题上表现都比较稳定——这说明AI在没有任何修改的原始语境下,已经能较为合理地模拟用户立场,具备了基本的可信度,也为后续的"修改实验"提供了参照基线。
第二个环节是实施修改。研究团队设计了四种修改策略,用于改写对话中"其他用户"说的最后一句话,同时保持话题、对话连贯性和目标用户本身不变。四种策略分别是:改写(只改措辞不改内容)、解释(对原话进行更详细的说明和澄清)、添加(在原话基础上增加新的论点来支持目标话题)、以及表情包(用一个与对话相关的网络梗图替换文字回复)。前三种都是纯文字手段,最后一种则是多模态的——它不仅有文字,还有图像。
第三个环节是重新模拟。把修改后的对话重新喂给AI,让它再次推断目标用户的立场。这样,同一个对话就有了"修改前"和"修改后"两个AI预测结果,可以直接比较。
第四个环节是评估效果。研究团队用两个指标来衡量每种修改策略的效果:一是"平均方向性立场偏移",也就是AI预测的立场整体向支持还是反对方向移动了多少;二是"立场转换率",具体追踪有多少原本持反对立场的预测变成了中立或支持,或者原本中立的变成了支持(这叫"支持性转换"),以及有多少原本支持的反而变成了反对(这叫"反弹效应")。
三、修改一句话,AI的"立场"就变了:四种策略的实测效果
实验结果表明,仅仅改写措辞而不改变实质内容的"改写"策略基本上没什么用——平均方向性偏移只有-4%,几乎可以忽略不计。这说明AI不是单纯对文字的花哨程度敏感,而是对内容和论点本身更敏感。
"解释"策略稍好一些,平均偏移+17.5%,也就是说让AI模拟出来的立场整体向"更支持"方向移动了约17.5%。这意味着当其他用户对自己的观点做出更详细、更有条理的阐释时,AI模拟的目标用户确实会稍微被"说服"一些。
"添加"策略效果最为显著,平均偏移高达+44.8%。具体来说,它特别擅长把原本"反对"的预测推向"中立",平均有4.7%的反对预测因此转变。这说明,当对话中增加了新的支持性论点,AI在模拟用户立场时会将这些新信息纳入考量,并作出相应调整。
表情包策略的整体平均偏移达到+49.3%,超过了纯文字的"添加"策略。不过,表情包的效果模式有所不同——它不像"添加"那样擅长软化反对立场,而是特别擅长把中立的预测推向积极支持,平均有17.6%的中立预测因此转为支持。换句话说,"添加"是个消除对立情绪的高手,而表情包则是个激发热情的能手。
然而,效果强不代表一切美好。研究人员还观察到,表情包策略的"反弹效应"也更高——有一部分原本支持或中立的预测,在看到表情包之后反而变得更加反对。这说明表情包是一把双刃剑:它的感染力强,但方向未必总是可控的。研究团队因此提醒,评估一种修改策略的好坏,不能只看它能把立场推多远,还要看它的副作用有多大。
四、表情包的"魔力"究竟从何而来:一项拆解实验
表情包为何能如此有效地影响AI的立场模拟?研究团队设计了一组拆解实验,逐层剥开表情包的影响机制,就像把一个洋葱层层剥开,看里面藏着什么。
实验设计了五个变体方案。第一个是完整的表情包方案,即在生成表情包时使用真实的梗图模板,在模拟立场时也展示完整的梗图(包含图像和文字)。第二个是"白背景"方案——同样用梗图模板生成文字内容,但在让AI判断立场时,把梗图背后的图像换成空白白板,只保留文字和版面布局。这样可以测试:在推断阶段,图像本身是否提供了额外信息。第三个方案是用"幽默风格指令"替代梗图模板来生成文字,但立场判断时仍展示完整梗图。第四个方案是用"梗图截图描述"(即对图像的文字描述)替代梗图模板来生成内容,立场判断时展示完整梗图。第五个方案则更进一步,在截图描述基础上额外提供关于该梗图的文化背景和常见用法知识,同样在立场判断时展示完整梗图。
从立场转换率来看,完整表情包方案(五种目标话题平均23.1%)明显优于"白背景"方案(21.6%)。由于两者生成的文字内容完全一致,唯一差别就在于图像是否呈现,这说明图像本身在推断阶段确实为AI提供了额外的信息线索,并非只是装饰。
至于生成阶段,完整表情包方案同样优于另外三种只使用文字替代品的方案。即便研究人员提供了对梗图的详细文字描述、甚至加上了文化背景知识,效果依然不如直接使用梗图模板。这说明梗图所携带的信息——包括图像中的情感表达、视觉框架、隐含态度、文字与图像之间的位置关系,以及这些元素共同营造的文化氛围——并不能被文字描述完整复现。
这并不是说图像天然比文字包含更多信息,而是说:在现有技术条件下,梗图模板所提供的多模态线索,比研究人员尝试的各种文字替代手段都更有效。梗图同时在"生成环节"和"推断环节"发挥作用,而这两个环节的协同,才是表情包策略效果突出的根本原因。
五、"添加"与"表情包":两种截然不同的影响机制
研究团队进一步用一个叫做LIWC的语言分析工具,对比分析了"添加"策略和"表情包"策略生成的文本在情感基调上的差异。LIWC中有一个"语调分数"指标,分值从0到100,数值越高代表文本的情感越积极、乐观、活泼。
原始对话中,用户评论的语调分数分布呈现出明显的"两极化"趋势——大量评论要么情感偏激烈(分数很高),要么情感偏沉郁(分数很低),中间地带相对稀少,就像一个哑铃的形状。
经过"添加"策略修改之后,这种两极化明显被"压平"了:极高和极低的评论都减少了,中间温和的评论比例大幅上升。换句话说,"添加"策略通过引入平衡、理性的论点,把对话的情感基调拉向了中庸——这与它擅长软化反对立场的行为模式完全一致。研究人员进一步分析发现,在"添加"策略下,原本语调低沉(分数不超过50)的评论中有约78-82%在修改后语调升高,而原本语调高昂(分数超过50)的评论中也有约72-82%在修改后语调降低,整体去极化效果非常显著。
表情包策略则恰恰相反:修改后,情感分布变得更加两极分化,中间地带进一步减少,两端的极端情感比例反而上升。表情包的语调变化方向则接近随机——它不像"添加"那样有规律地把情感推向中间,而是把情感推向任意一个极端。这与表情包擅长激发强烈情感、但方向不一定可控的特点高度吻合。
这一发现对于理解AI立场模拟的机制很有意义:不同的修改策略通过截然不同的路径影响AI的判断——"添加"走的是理性说服路线,"表情包"走的是情感激活路线,二者效果相近但机制迥异。
六、结论是否只在特定条件下成立:稳健性验证
一项研究发现如果只在某一个特定模型或特定条件下成立,其价值就要大打折扣。研究团队为此进行了多维度的稳健性验证。
在立场模拟模型方面,研究团队使用了三个不同的AI系统:GPT-5.2、Claude Sonnet-4.6和Qwen3.5-Plus。结果显示,各修改策略的整体排名在三个模型中基本一致——表情包和"添加"始终是最有效的两种策略,"改写"始终效果最弱。不过,不同模型对同一策略的具体响应幅度有所差异,说明修改效果并非完全与模型无关,AI自身的先验偏好和对话理解方式会影响最终结果。
在文本修改模型方面,研究团队使用了Gemini和Claude两种AI来生成修改后的对话,同样观察到相似的趋势,说明修改效果不依赖于特定的生成模型。
在话题层面,研究团队对原始对话进行了主题聚类,将讨论分为"AI模型评测"、"AI辅助软件开发实践"、"AI模型训练成本与效率"、"AI语言模型与意识讨论"等多个子话题。结果显示,"添加"去极化、"表情包"强化极端这一对比规律,在各个子话题中都保持了高度一致性,说明这一发现不是特定话题内容造成的偶然现象。
在提示词和温度参数方面,研究团队测试了不同措辞的任务提示和不同的生成温度(控制AI输出随机性的参数),结果显示各策略下的立场预测高度一致——准确率通常维持在87%至93%之间,说明实验结论对这些技术参数的变化具有较强的鲁棒性。
在表情包模板方面,研究团队收集了5种不同风格的表情包模板(来自ImgFlip平台的热门梗图格式),并分别测试了每种模板的效果。结果显示,不同模板之间的方向性偏移幅度相当接近,说明表情包效果不依赖于某一特定视觉风格。
七、这项研究告诉我们什么:机遇与风险并存
归根结底,这项研究的核心发现可以用一句话概括:AI在模拟社交媒体用户立场时,对对话语境的变化相当敏感——改动其他人说的几句话,就能让AI模拟出来的"用户立场"发生显著偏移,有时甚至完全翻转。
这既是机遇,也是风险。说是机遇,是因为研究团队提出的"反事实语境修改"框架,为评估AI社交模拟系统的可靠性提供了一套可操作的工具。研究者在使用AI进行立场推断或舆情分析之前,可以用类似的测试来检验系统的稳定性,更清楚地了解其局限性所在。
说是风险,则是因为这种语境敏感性意味着:AI模拟出的"用户立场",可能更多地反映了对话语境的框架方式,而非真实用户的内在信念。如果研究者把AI模拟的结果等同于真实的人类舆情,就可能得出扭曲的结论。更值得警惕的是,实验表明通过精心设计的对话修改(无论是文字论点还是表情包),可以系统性地让AI"模拟"出特定方向的立场偏移——这意味着AI社交模拟工具存在被操控的潜在风险,在涉及公共舆论、政治意见、社会态度等敏感领域时尤为值得关注。
研究团队也明确指出了这项研究的局限性:目前只研究了Reddit上关于三个AI模型家族的讨论,话题和平台都比较单一。如果能扩展到更广泛的讨论话题和更多元的社交平台,研究结论将更加全面有力。
这项研究并没有给出"AI社交模拟不可信"的简单结论,而是提供了一个更加细腻的观察视角:AI在这类任务上既有可取之处(基础准确率尚可),也有明显的脆弱性(对语境高度敏感)。如何在使用这类工具的同时保持足够的批判性眼光,是研究者和政策制定者都需要认真对待的问题。感兴趣的读者可以通过arXiv:2606.06443查阅完整原文,进一步了解实验细节与分析方法。
---
Q&A
Q1:大语言模型在模拟社交媒体用户立场时,准确率大概有多高?
A:研究团队在未作任何修改的原始对话语境下测试了AI的立场推断能力,结果显示整体准确率约为77.6%,主要评估指标宏观F1分数为78.1。在DeepSeek、Claude、Llama三个话题上的表现都比较接近,说明AI已具备基本的立场模拟能力,但并不完美。
Q2:表情包为什么能比纯文字更有效地改变AI模拟出的用户立场?
A:研究发现表情包在两个环节同时发挥作用:在生成阶段,梗图模板提供了无法被文字描述完整复现的多模态线索,帮助AI生成更有说服力的内容;在推断阶段,梗图的视觉信息(情感表情、图文关系、文化框架)为AI判断立场提供了额外参考。两个环节协同,使得表情包策略的整体效果超过了纯文字的"添加"策略,平均方向性偏移达到+49.3%。
Q3:"添加"策略和"表情包"策略在改变立场时有什么不同?
A:"添加"策略通过引入平衡、理性的新论点,把对话的情感基调拉向中庸,主要擅长软化反对立场,使其转为中立;"表情包"策略则通过激发强烈情感,主要擅长把中立态度推向积极支持,但情感方向不那么可控,反弹效应(原本支持反而变反对)也更明显。简单说,前者是"理性劝说",后者是"情感激活"。
好文章,需要你的鼓励
芝加哥大学等机构将强化学习引入大型强子对撞机触发系统,用GFPO方法实现阈值自适应调整,显著提升信号效率并保持背景率稳定,首次在真实CMS碰撞数据上完成验证。
英伟达发布Audex多模态大模型,在音频理解与生成达到最优水平的同时,保持文字推理能力几乎零退步,提供完整技术路径。
南加州大学研究揭示语音抑郁检测中"时序聚合"环节的系统性盲点:72个测试组合中三分之一完全失效,骨干网络选择的影响丝毫不亚于聚合架构本身。
斯坦福与根特大学联合提出"变化感知最优采样"方法,无需训练模型,通过匹配历史变化模式筛选AI胸片报告候选,印象部分RadGraph F1提升最高达13.6%。