MagicAgent:突破 sub-100B 局限,打造泛化智能体规划的新基座

MAGICAGENT TOWARDS GENERALIZED AGENT PLANNING

2026-02-01
Xuhui Ren, Shaokang Dong, Chen Yang, Qing Gao, Yunbin Zhao, Yongsheng Liu, Xinwei Geng, Xiang Li, Demei Yan, Yanqing Li, Chenhao Huang, Dingwei Zhu, Junjie Ye, Boxuan Yue, Yingnan Fu, Mengzhe Lv, Zezeng Feng, Boshen Zhou, Bocheng Wang, Xuanjing Huang, Yu-Gang Jiang, Tao Gui, Qi Zhang, Yunke Zhang
总结
问题
方法
结果
要点
摘要

本文推出了 MagicAgent 系列智能体规划基座模型(包含 32B 稠密版与 30B MoE 版),通过轻量化合成数据框架和两阶段强化学习,实现了泛化智能体规划。模型在 Worfbench (75.1%)、NaturalPlan (55.9%) 等多个权威榜单上刷新了 sub-100B 模型的 SOTA 纪录,甚至超越了 GPT-5.2 等闭源大模型。

TL;DR

在 LLM 向自主智能体(Autonomous Agents)演进的过程中,“规划(Planning)”是核心天花板。来自荣耀终端与复旦大学的研究团队发布了 MagicAgent。通过一套创新的数据合成逻辑和 χPO 强化学习算法,MagicAgent 在多项规划基准测试中击败了 GPT-5.2 和 DeepSeek-V3,证明了即使是 32B 规模的模型,只要“训得对、数据精”,也能在逻辑复杂度极高的领域实现越级反超。

1. 痛点:为什么“泛化规划”这么难?

目前智能体研究面临两大核心挑战:

  1. 数据极度匮乏:高质量、长程的工具调用轨迹(Trajectories)很难获取,依赖人工标注成本极高。
  2. “跷跷板效应” (Seesaw Effect):智能体任务是高度异构的。例如,任务分解要求模型具备强语义拆解能力,而工具调用要求模型严谨遵循 Schema。直接混合训练会导致性能在不同任务间由于梯度干扰而此消彼长。

MagicAgent 的直觉在于:通过轻量化的“原子计划”组合生成数据,并通过解耦“思考”与“动作”的强化学习来优化决策边界。

2. 核心贡献 1:可扩展的合成数据框架

作者没有采用昂贵的沙盒模拟,而是构建了基于图论的合成框架。

  • 层次化任务分解:通过工具依赖图()和参数共享图()定义“原子计划”,再利用拼接(Concatenate)、掩码(Mask)、转换(Transform)等算子生成复杂的对话轨迹。
  • 长程工具执行:专门设计了需要状态跟踪(State Tracking)的场景,确保模型在多轮对话中不丢掉任务目标。

模型训练框架总览 图 1:MagicAgent 两阶段训练流程:从 SFT 到多目标强化学习

3. 核心贡献 2:χPO 强化学习算法

为了解决在线环境中奖励稀疏(Sparse Reward)的问题,作者提出了 χPO (eXploration-eXploitation Policy Optimization)

  • 探索(Exploration):引入 Token 级熵正则,并区分 Think-level(思考阶段鼓励多样化推理)与 Action-level(动作阶段要求确定性)。实验发现,思考阶段的熵通常比动作阶段高一个数量级。
  • 利用(Exploitation):引入信息瓶颈(Information Bottleneck),强制压缩无关推演,只保留对生成下一步 Action 有效的计算。

4. 实验战绩:sub-100B 的“屠龙”表现

MagicAgent 在 5 大核心数据集上展现了统治力:

任务类型数据集MagicAgent-32BGPT-5.2优势
逻辑编排WorfBench (F1)80.3%60.1%+20.2%
约束调度NaturalPlan55.9%52.5%*+3.4%
工具调用BFCL-v386.9%79.5%+7.4%
交互环境ALFWorld (Succ.)81.4%63.5%+17.9%

性能雷达图对比 图 2:MagicAgent 在各项 Benchmark 上的性能大幅领先同类规模模型

MoE 架构的稳定性

针对 MoE 模型常见的专家负载不均(Load Imbalance)问题,MagicAgent 引入了全局负载均衡(Global-batch LBL)。通过在计算全局 batch 统计量而非 micro-batch 内容来实现负载均衡,这保证了专家在处理高度同质化的智能体指令时,依然能实现良好的专业化分工。

MoE 负载均衡曲线 图 3:联合优化策略下的 MoE 专家分配热力图,显示了明显的任务专业化倾向

5. 结论与洞察

MagicAgent 的成功为我们揭示了一个事实:Agent 的能力不完全取决于参数规模。 通过以下三个维度,MagicAgent 实现了对巨型模型的反超:

  1. 数据原子化:将复杂规划任务拆解为可操作的原子逻辑。
  2. 强化学习的精细化操控:区分“思考熵”与“动作熵”,让推理更发散,让动作更精确。
  3. 计算效率:利用 MoE 架构,在端侧提供了媲美 GPT 系列的规划能力。

未来,MagicAgent 将进一步探索长上下文推理(Long-horizon Reasoning)与个性化信息的结合,有望在手机、PC 等端侧智能体中实现真正的自主决策。

发现相似论文

试试这些示例

  • 查找其他最近试图解决多任务智能体训练中“跷跷板效应”或梯度干扰问题的相关论文。
  • 哪篇论文最早提出了 ReAct (Reasoning and Acting) 框架,MagicAgent 在其基础上做了哪些核心改进?
  • 有哪些研究探讨了将 MagicAgent 这种强化学习规划能力应用到移动端 GUI 自动化或具身智能领域?
目录
MagicAgent:突破 sub-100B 局限,打造泛化智能体规划的新基座
1. TL;DR
2. 1. 痛点:为什么“泛化规划”这么难?
3. 2. 核心贡献 1:可扩展的合成数据框架
4. 3. 核心贡献 2:χPO 强化学习算法
5. 4. 实验战绩:sub-100B 的“屠龙”表现
5.1. MoE 架构的稳定性
6. 5. 结论与洞察