政治推文中的竞争性叙事:无监督事件链接为话题模型增添了哪些价值

一种新的无监督流程将主题、事件和故事关联起来,以区分德国政客推文中相互竞争的叙事,其效果超越了仅靠主题模型所能揭示的内容。

直接答案

主题模型能告诉你政治推特圈在讨论哪些议题,却无法揭示对立阵营如何将这些议题转化为相互竞争的故事线。一个2025年的框架通过将主题建模、事件检测和事件链接串联成连贯的故事,再按立场相似的用户社群拆分每个故事,来解决这一问题[1]。将该框架应用于2022年1月至2023年6月间189,850条德国政客推文后,它还原出了围绕德国能源危机和移民政策的不同叙事,并依据已知政党归属进行了验证[1]。其贡献不在于更好的主题模型,而在于一种将分散主题组织为在时间和语义上连贯、且其框架可加以比较的故事的方法[1]。此前关于推特事件检测和新闻链接的研究已证明可以检测并概括突增现象和实体[3][6][7],但并未证明可以在无监督条件下分离出相互竞争的政治叙事。

9篇文献引用

本文由 WisPaper 驱动的搜索和论文分析生成。

为何主题模型未能触及竞争性叙事

主题建模长期以来一直是在社交媒体上映射政治话语的默认方法。锚定论文自身对189,850条德国政客推文运行的BERTopic生成了57个主题,涵盖乌克兰战争、新冠疫苗接种、能源价格、移民等,其中43%的文档被留作离群值[1]。这一输出对于方向性把握是有用的,但像“能源、天然气、可再生、电力、价格”这样的主题将数月的辩论捆绑在一起,既未表明哪些事件属于同一组,也未说明不同行为者如何框定它们[1]。同样的局限也出现在相邻研究中:针对TikTok研究话语的文献计量学和LDA方法将主题视为分析的终点,而非叙事重构的原材料[2]。更早的事件检测工作则更进一步,通过检测峰值并将其与新闻报道关联[6],或通过追踪命名实体共现网络来定位新闻流中的重要事件[7],但这些流程是为态势感知和新闻摘要而设计的,而非为了区分对同一事件的意识形态对立叙述。

锚定论文的做法是将主题视为第一轮处理,然后在其上构建叙事结构。事件被定义为在时间上相近、讨论同一议题的文档集合,并通过结合语义与时间相似度的亲和传播进行聚类[1]。仅就能源这一主题而言,这就产生了155个事件[1]。随后,事件通过事件相似度图和社区检测被连接成故事,为该主题生成了12个故事[1]。这正是主题模型无法完成的步骤:它将一个扁平的关键词聚类转化为一系列相互关联的情节,从而可以在不同群体之间进行比较。

按立场而非党派标签区分叙事

该框架在提取过程中刻意忽略党派归属,仅将其用于评估[1]。取而代之的是,每位用户由一个全局嵌入表示,该嵌入由其相对于主题质心的主题级平均立场构建而成,随后使用HDBSCAN将用户聚类为立场社群[1]。这些嵌入的二维投影显示,绿党成员聚集在一侧,德国选择党成员明显分离并处于对立面,而基民盟/基社盟和社民党则分布得更为居中[1]。这一点之所以重要,是因为它意味着该方法原则上可应用于党派标签不可得的场景,而这是大多数社交媒体情境的常态。验证是部分性的:作者聚焦于绿党和德国选择党,是因为这些政党拥有相对极化且客观上对立的立场,并且他们明确指出,鉴于较大的中间派政党内部存在多元观点,他们并不期望各政党能够清晰分离[1]

一旦识别出社区,每条故事的帖子便按社区拆分,而一个社区对一条故事的贡献所形成的结构被视为一种竞争性叙事[1]。在关于天然气储备与价格管控措施的能源故事中,社区1和社区5都反对天然气附加费并支持对家庭的救济,但社区1强调政府干预、可再生能源转型,甚至能源企业国有化,而社区5则强调政府低效、缺乏透明度以及与公民利益的脱节[1]。使用XLM-T进行的情感分析显示,社区5使用了明显更多的负面语言[1]。这正是主题模型会将其扁平化为单一“能源”聚类的那种分歧。

事件关联相较于检测与框架分析的附加价值

此前的推特事件检测研究已确立,事件可以被检测并与新闻建立关联。Sem-TED使用Sentence Transformer嵌入、UMAP和HDBSCAN来检测热门话题,并用单层感知机判断其与新闻报道的相关性,在两个数据集的小样本上报告了相较基于实体的方法平均8%的提升[3]。Thapen等人对生物监测算法进行过滤,以检测推特活动中的局部峰值,并通过识别在事件推文中比基线中出现频率更高的术语,将事件与新闻相关联[6]。Moutidis和Williams构建了带时间戳的实体共现网络,并在KeyGraphs上使用变化点检测和社区检测来刻画新闻流中的事件[7]。这些都是检测与摘要流水线;它们均未在同一事件内区分相互竞争的政治叙事。

锚定论文的事件链接步骤正是实现这种分离的关键。通过将事件归组为故事,再按用户社群拆分故事,它在大规模上产出了更接近比较性框架分析的结果。这与另一支文献相衔接:Kiyak等人对德语X平台上关于叙利亚和乌克兰难民的数据使用了转推网络分析和话语分析,发现了一个极化的群体结构、不断扩大的反难民社群规模、逐渐减少的中立意见领袖,以及2015年至2022年间阵营间距离的持续增大[4]。其方法是基于网络的、人工阐释的;而锚定论文的方法则是基于嵌入的、无监督的。两者在德语政治推特极化这一底层现象上是一致的,但测量方式不同,且二者均未直接验证对方的叙事边界。

移民案例显示同一事件内部的框架差异

移民案例研究从故事层面转向事件层面分析。在庇护与移民主题下的“德国现代移民法与公民平等”故事中,锚定论文展示了每个社群针对单一事件的代表性推文[1]。社群0、3和4对劳工移民与融合总体持正面看法;社群1和2持有限度的正面看法;社群5则完全否定该政策[1]。社群0和2从经济需求和劳动力短缺的角度来框定该议题,而社群1和5则聚焦于安全和防止非法移民[1]。这具体证明了同一事件可以承载不同的框架,而这些框架只有在帖子按立场社群拆分后才能显现。

作者还提出,这种事件层面的社区分布可以揭示不同叙事强调或跳过哪些事件,以及相互竞争的叙事以何种顺序覆盖一个故事中的事件[1]。这是一个关于叙事策略的结构性主张,而非经过验证的发现;论文将其作为一种分析可能性提出,而非经过检验的结果。移民案例也正是证据边界最为清晰之处:它只是一个国家政客推文中某个主题下某个故事中的一个事件。

该框架尚未确立的内容

评估主要是定性性质的。作者指出,现有的叙事提取数据集往往缺乏与竞争性叙事相关的标注,这使得训练和评估能够区分这些叙事的模型变得困难,而且针对叙事质量和框架准确性的稳健指标仍然是一个未解决的挑战[1]。他们依赖示例性案例研究和党派归属验证,而非定量基准[1]。用户社区验证也是部分的:作者刻意聚焦于绿党和AfD,因为这些政党区分度较高,他们承认中间派政党在嵌入空间中分布较为分散[1]。这意味着该方法在极化程度较低或内部异质性较强的群体中区分叙事的能力尚未得到验证。

该数据集包含来自786个德国政客账户的189,850条推文,收集时间为2022年1月至2023年6月,排除了转发、回复和引用推文[1]。因此,结论仅限于德国政客在两个极化议题上的推文,未经进一步验证无法推广至其他语言、平台或选举情境。更广泛的文献也印证了这一审慎态度:跨语言的立场和框架检测仍然比主题检测更为困难,其中框架检测由于概念重叠尤为棘手,且大多数立场和话语语料库仍以英语为中心并偏向全球北方[8]。无监督反事实故事重写的研究同样表明,叙事生成中连贯性与最小编辑之间的权衡并非易事,这提醒我们自动化故事构建仍是一个未解决的问题[5]。最后,关于数字新闻标题的研究表明,互文性和衔接性是使压缩文本与更广泛叙事相连接的关键[9];而锚定论文中的故事由缺乏这些显性衔接手段的推文构建而成,这可能限制了所提取故事的实际连贯程度。

关于这些来源

本研究页面基于9项经过同行评审的研究——发表于2015年至2026年间,其中5项发表于2024年或之后,合计被引用67次——这些研究是从通过质量筛选的9项研究中选出的最相关研究,而这些研究又是从超过5亿篇文献的数据库中检索到的72篇论文中筛选而来。

本文引用的文献

1

社交媒体政治话语中竞争性叙事的自动识别

锚点论文提出了一种无监督多阶段流水线,结合BERTopic主题建模、亲和传播事件检测、事件关联成故事以及用户嵌入社区聚类,以识别189,850条德国政客推文中的竞争性叙事,并在能源危机和移民案例研究中得到验证[1]。

2

三角定位TikTok上的研究话语:整合文献计量学、情感分析与主题建模

Oprea和Bâra运用文献计量学、情感分析和LDA主题建模来研究TikTok研究话语,将主题视为分析的终点,而非叙事重构的输入[2]。

3

Sem-TED:语义推特事件检测与新闻故事适配

Sem-TED使用Sentence Transformer嵌入、UMAP和HDBSCAN检测热门Twitter话题,然后通过单层感知机将其与新闻报道关联,在一个小型双数据集样本上报告称比基于实体的方法平均提升8% [3]。

4

极化与网络化框架:X/Twitter上的叙利亚和乌克兰难民危机

Kiyak等人分析了围绕叙利亚和乌克兰难民危机的德语X转推网络,发现2015年至2022年间存在两极化的群体结构、反难民社群规模上升、中立意见领袖减少以及阵营间距离不断扩大的现象[4]。

5

无监督编辑用于反事实故事

EDUCAT是一种无监督的反事实故事重写方法,采用MCMC采样和受因果模型启发的冲突检测,表明自动化故事构建涉及连贯性与最小编辑之间的非平凡权衡[5]。

6

早起的鸟儿有虫吃:结合推特和新闻数据进行事件检测与态势感知

Thapen等人应用定制的生物监测过滤方法来检测Twitter活动中的局部峰值,并通过识别在事件推文中比基线更频繁出现的术语,将检测到的事件与相关新闻文章联系起来[6]。

7

异构高容量新闻流中用于事件检测的复杂网络

Moutidis和Williams从新闻流中构建带时间戳的命名实体共现网络,并在KeyGraphs上使用变化点检测和社区检测来定位和描述重要事件[7]。

8

全球声音,本地框架:社交媒体与新闻中立场与话语的跨语言语料库分析

GVLF-C语料库提供了来自南亚、撒哈拉以南非洲和拉丁美洲新闻及社交媒体的12种语言、约12万篇文档的立场与框架标注,表明框架检测仍然比立场检测更难,且此类资源大多仍以英语为中心[8]。

9

数字时代的新闻链接:CNN Instagram新闻标题中的语法衔接与互文性

Purba和Pulungan分析了CNN Instagram新闻标题中的语法衔接和互文性,发现指称衔接和连接词占主导地位,且互文性将压缩文本与更广泛的新闻叙事联系起来[9]。