重新思考 WS-VTG:基于博弈论视角的细粒度视频时刻定位

Rethinking Weakly-Supervised Video Temporal Grounding From a Game Perspective

2024-01-01
Xiang Fang, Zeyu Xiong, Wanlong Fang, Xiaoye Qu, Chen Chen, Jianfeng Dong, Keke Tang, Pan Zhou, Yu Cheng, Daizong Liu
总结
问题
方法
结果
要点
摘要

本文提出了一种基于博弈论视角的新型弱监督视频时刻定位(WS-VTG)框架。该方法抛弃了传统的候选框(Moment Proposal)预测范式,通过将视频帧和查询词建模为协作博弈中的参与者,利用交互指数(Banzhaf/Shapley Interaction Index)学习细粒度的跨模态对齐,在 Charades-STA 和 ActivityNet Caption 数据集上均取得了 SOTA 性能。

TL;DR

在弱监督视频时刻定位(WS-VTG)领域,传统的“生成候选框并打分”的方法(Proposal-based)正面临瓶颈。本文提出了一种全新的博弈论视角,将视频帧与查询词视为博弈中的“玩家”。通过计算博弈交互指数,模型能够量化每一帧对最终对齐得分的贡献,并在不使用任何候选框的情况下,实现了更精准、更高效的边界定位。

背景定位:为何 Proposal 限制了想象力?

视频时刻定位任务要求根据一段文字(Query)从长视频中截取对应的片段。在弱监督场景下(只知道视频和文字匹配,不知道具体起止点),现有方法通常采用滑动窗口生成候选框,然后进行对比学习。

这种模式存在两个本质缺陷:

  1. 对齐太“粗”:它只看一整个片段和一整句话是否匹配,忽略了“哪个词对应哪一帧”的底层逻辑。
  2. 效率太“低”:候选框的设计与评估既死板又耗费计算资源,且难以跨数据集迁移。

现有方法与本文方法对比

核心直觉:帧与词的协作博弈

作者提出:如果某一帧和某个词具有强语义相关性,它们就会倾向于“结盟”(Coalition),并在博弈中共同产生更高的收益(即对齐分数)。

1. 自模态增强 (Self-modal Enhancement)

在进行跨模态匹配前,模型先进行“内部会议”。通过 Banzhaf Value 计算每个帧(或词)对整个视频(或句子)语义的边际贡献。这种方法能自动捕捉到时间序列中的上下文权重,增强特征的表达能力。

2. 多级跨模态对齐 (Multi-level Interaction)

这是本文的核心。作者定义了跨模态交互指数 ,用于衡量帧 和词 结盟后带来的“额外收益”。

  • 词级、短语级、句子级:博弈不仅发生在词与帧之间,还扩展到了短语和整句。
  • 软监督机制:由于直接计算博弈指数属于 NP-Hard 问题,作者设计了可学习的 Header 并使用 KL 散度进行软监督,使模型在推理时无需进行耗时的博弈采样。

模型总架构图

实验结果:全方位的领先

实验在 Charades-STA 和 ActivityNet Caption 两个主流数据集上展开。

  • 性能起飞:在关键指标 R@5 (IoU=0.5) 下,相比于之前的 SOTA 方法 CPL,性能提升了约 4.5%。
  • 泛化性极强:在跨数据集测试(A C,C A)中,由于摒弃了数据集敏感的预设候选框,该方法显著优于 LCNet 等传统方法。

实验结果对比

深度洞察:博弈论带来了什么?

  1. 可解释性:博弈价值直观地展示了模型为什么判定某一帧是关键帧——因为它在结盟中贡献了更高的交互分数。
  2. 不确定性建模:弱监督环境下的跨模态对应关系是模糊的。博弈论通过考虑所有可能的联盟(Coalition)组合,优雅地处理了这种不确定性。
  3. 推理效率:虽然训练过程涉及复杂的采样计算,但推理阶段仅利用预测好的 Header 即可,其在推理速度和 GPU 显存占用上甚至优于部分常规方法。

总结与局限

本文通过引入协作博弈论,为弱监督视频理解提供了一个高维度的视角。局限性在于:对于极长视频,玩家集合(Player Set)规模激增,采样效率可能成为训练瓶颈。未来的研究方向可以探索如何更高效地近似这种博弈空间,或将其扩展至包含音频的多模态博弈。

发现相似论文

试试这些示例

  • 查找最近一年内其他尝试在弱监督视频时刻定位(WS-VTG)任务中摆脱 Moment Proposal 范式的最新论文。
  • 协作博弈论中的 Banzhaf 交互指数与 Shapley 交互指数在深度学习语义对齐任务中各有何优劣?哪篇论文对其差异进行了深入理论分析?
  • 有哪些研究将博弈论方法应用到了视频动作检测(Temporal Action Detection)或多模态语义分割任务中?
目录
重新思考 WS-VTG:基于博弈论视角的细粒度视频时刻定位
1. TL;DR
2. 背景定位:为何 Proposal 限制了想象力?
3. 核心直觉:帧与词的协作博弈
3.1. 1. 自模态增强 (Self-modal Enhancement)
3.2. 2. 多级跨模态对齐 (Multi-level Interaction)
4. 实验结果:全方位的领先
5. 深度洞察:博弈论带来了什么?
6. 总结与局限