揭秘 AI Agent 的搜索内幕:1400 万次请求背后的行为逻辑

Agentic Search in the Wild: Intents and Trajectory Dynamics from 14M+ Real Search Requests

2026-01-24
Jingjie Ning, João Coelho, Yibo Kong, Yunfan Long, Bruno Martins, João Magalhães, Jamie Callan, Chenyan Xiong
总结
问题
方法
结果
要点
摘要

本文对 DeepResearchGym 平台上 1444 万条真实搜索请求(397 万个会话)进行了大规模日志分析,揭示了 AI Agent 在执行多步信息寻求任务时的行为模式。研究提出了 CTAR 指标量化证据追溯性,并发现推理型任务倾向于广度探索,而事实获取型任务常陷入高重复率的死循环。

TL;DR

传统的搜索日志分析主要针对人类,而当搜索的主体变成 AI Agent 时,规律发生了巨变。本文通过对 DeepResearchGym 海量日志的深度挖掘,发现 Agent 搜索并非盲目,而是具有极强的“意图驱动”特征。虽然 Agent 动作极快,但也容易陷入“复读机”式的死循环。研究提出的 CTAR 指标首次量化了 Agent “活学活用”检索证据的能力。

背景定位:从“人搜”到“智能体搜”

在 AI 时代,信息检索(IR)正从单次点击演变为多步规划的 Agentic Search。传统的点击(Clicks)和停留时间(Dwell Time)已不再适用,我们需要一种新的范式来衡量 Agent 的搜索效率和证据利用率。

核心发现:Agent 搜索的三大奇观

1. 意图决定策略:事实型 vs 推理型

通过对会话意图的标注,研究者发现:

  • 事实获取(Declarative):Agent 表现得异常保守,后期大量出现重复查询(Repetition),试图通过微调词句来验证某个特定事实。
  • 推理合成(Reasoning):Agent 表现出更强的探索欲,语义漂移(Semantic Drift)更大,能够不断根据新证据挖掘深层信息。

2. “钻牛角尖”的演化偏置(Drill-down Bias)

Agent 在重构查询时,非常喜欢 Specialization(特化)Exploration(局部探索),即在已知领域越挖越深;而极少进行 Generalization(泛化)。这说明当前的 Agent 逻辑往往是“一条路走到黑”,缺乏“退一步海阔天空”的宏观重新规划能力。

模型架构与处理流程

3. CTAR:Agent 到底有没有在看检索结果?

为了回答这个问题,作者提出了 Context-driven Term Adoption Rate (CTAR)

  • 数据说话:超过 54% 的新查询术语可以直接在之前的检索结果中找到原型。
  • 路径差异:当 Agent 进行“特化”操作时,78.35% 的新词来自刚才读到的文档;而当它陷入“重复”循环时,CTAR 骤降,说明它在脱离上下文“盲搜”。

实验深度解析

实验通过对比不同意图下的步骤动态(Figure 4),清晰展示了 Agent 行为的演化:

不同意图下的步骤演化趋势

我们可以看到:

  • Declarative 任务中,Repetition(灰色)的占比随步数显著上升。
  • Reasoning 任务中,Exploration(蓝色)始终占据主导,保持了搜索的生命力。

行业启示:如何设计更好的搜索 Agent?

  1. 重复感知停止(Repetition-aware Stopping):如果监测到系统进入高稳定性、低 CTAR 的循环,应强制触发反思机制或请求人工介入。
  2. 动态检索预算(Intent-adaptive Budgeting):没必要为所有查询设定统一的检索深度(K 值)。程序类查询(Procedural)往往需要更深的 K 值来覆盖长尾步骤。
  3. 显式上下文跟踪:既然新词高度依赖历史证据,系统可以主动提取关键词供 Agent 决策,减少幻觉风险。

局限性与展望

尽管样本量巨大,但由于日志脱敏,研究无法直接获取 Agent 内部的 Prompt 或记忆状态。未来的研究需进一步探索这些行为模式与最终回答准确率(Success Rate)之间的因果关联。

总结

本文不仅是一次大规模的统计实践,更是为 Agentic IR 体系建立了一个坐标系。它告诉我们:Agent 会搜索,但还不够“聪明”,尤其是在打破僵局和战略性撤退方面,仍有巨大的优化空间。

发现相似论文

试试这些示例

  • 查找最近关于在大语言模型搜索智能体(Agentic Search)中通过反馈循环减少查询重复(Query Repetition)的最新算法或论文。
  • 哪篇论文最早探讨了搜索中的“证据追溯性”(Evidence Traceability)概念,本文提出的 CTAR 指标与其有何演进关系?
  • 有哪些研究将类似 DeepResearchGym 的多步检索分析方法应用到了多模态智能体(Multimodal Agents)的视觉搜索任务中?
目录
揭秘 AI Agent 的搜索内幕:1400 万次请求背后的行为逻辑
1. TL;DR
2. 背景定位:从“人搜”到“智能体搜”
3. 核心发现:Agent 搜索的三大奇观
3.1. 1. 意图决定策略:事实型 vs 推理型
3.2. 2. “钻牛角尖”的演化偏置(Drill-down Bias)
3.3. 3. CTAR:Agent 到底有没有在看检索结果?
4. 实验深度解析
5. 行业启示:如何设计更好的搜索 Agent?
6. 局限性与展望
7. 总结