HyperAIHyperAI

Command Palette

Search for a command to run...

DeepSearch-World:面向可验证环境中深度搜索代理的自蒸馏方法

Xinyu Geng Xuanhua He Sixiang Chen Yanjing Xiao Fan Zhang Shijue Huang Haitao Mi Zhenwen Liang Tianqing Fang Yi R. Fung

摘要

训练工具使用型代理从自身经验中持续改进仍具挑战,因为监督微调依赖固定的教师蒸馏轨迹,而稀疏奖励强化学习为长程交互提供的监督信号较弱。我们提出 DeepSearch-Evolve,一个基于 DeepSearch-World 构建的网页代理自蒸馏框架。DeepSearch-World 是一个确定性、可验证的环境,配备可复现的搜索与页面阅读工具,包含 42 万条由实体级随机游走构造的多跳问答任务,并支持对自进化至关重要的代理认知行为,包括进度验证、有依据的反思和失败恢复。DeepSearch-Evolve 迭代执行轨迹生成、过滤、数据混合与微调,以训练更强的代理。在未借助更强模型蒸馏的情况下,DeepSearch-World-9B 取得了与开源代理相比具有竞争力的表现,在 BrowseComp 上达到 31.2%,在 GAIA 上达到 61.5%,在 HotpotQA 上达到 93.4%,表明可验证环境能够支撑长程网页代理的可扩展自进化。我们将发布环境、42 万条训练池、验证集、模型和代码,以促进自改进深度搜索代理的未来研究。

一句话总结

香港科技大学、腾讯和香港科技大学(广州)推出了DeepSearch-Evolve,一个自蒸馏框架,通过在可验证的DeepSearch-World环境中进行迭代的轨迹生成和微调来训练长时程的web agents,该环境包含42万条多跳问答任务,在BrowseComp上达到31.2%,在GAIA上达到61.5%,在HotpotQA上达到93.4%,而不依赖外部教师模型。

核心贡献

  • DeepSearch-World是一个确定性、可验证的离线环境,提供了可复现的搜索和页面阅读工具,基于Wikipedia,并包含42万条多跳问答任务以及实体级别的进度验证,用于训练deep-search agents。
  • 一种脚手架过程监督方法,将教师引导的rollouts(跟踪进度、证据、失败和恢复)转换为标准的ReAct格式训练数据,向学生agent注入规划、记忆、有根据的反思和失败恢复能力。
  • DeepSearch-Evolve自蒸馏框架迭代地生成、过滤和微调经过验证的轨迹,使开源agents能够从自身的工具使用经验中改进,而无需依赖来自更强闭源模型的合成数据。

引言

大型语言模型(LLM)agents现在可以进行规划、搜索、浏览和工具推理,但使它们能够从自身交互中自主改进,仍然是构建可扩展自进化agent的关键挑战。先前的方法要么在静态的正向轨迹上微调(这会迅速饱和),要么应用带有稀疏轨迹级别奖励的强化学习(没有逐步指导),要么尝试密集的on-policy自蒸馏(需要可靠的教师分布,这在开放式的工具使用环境中很难获得)。作者通过引入DeepSearch-World来解决这些限制,这是一个为deep search agents设计的确定性且可验证的环境,提供了可复现的观察和42万条多跳问答任务的实体级进度验证。基于这个环境,他们提出了DeepSearch-Evolve,一个自蒸馏框架,收集经过验证的轨迹,将脚手架过程监督(跟踪进度、证据、失败和恢复)转换为标准的ReAct格式训练数据,并迭代微调agent,使其内化规划、记忆维护和失败恢复能力。这使得开源agents能够从验证过的自生成经验中改进,而无需依赖更强的闭源模型。

数据集

作者构建了一个多跳问答数据集和一个配套的离线Wikipedia语料库,作为确定性DeepSearch-World环境。数据基于Wikipedia超链接图构建,用于agent的自蒸馏训练。

  • 数据集组成

    • 42万条问答实例,通过图上的实体级随机游走生成,每一步游走定义了一个H跳推理链。实体提及被混淆,因此agent必须通过搜索、查询修正和证据发现来恢复目标实体。
    • 一个留出的验证集DeepSearch-Val,包含377个高质量实例。每个实例至少由五位专家中的三位独立验证,并保证可以通过提供的离线语料库和搜索工具回答。
    • 一个离线Wikipedia语料库,约1000万个条目,每个条目包含标题、摘要和完整文章正文。该语料库通过爬取所有出现在问答实例中的目标实体的Wikipedia页面构建。
  • 数据来源与处理

    • Wikipedia超链接图通过实体级随机游走采样,生成目标实体序列。
    • 游走中显式的实体提及被混淆,以创建需要多跳推理的问答对。
    • 利用42万条实例中所有目标实体的并集,爬取相应的Wikipedia页面,形成1000万条目的离线语料库。这确保所有所需证据在环境中可搜索和可验证。
    • 验证实例仅保留那些证据完全被离线语料库覆盖,且可通过环境的搜索和访问工具检索到的实例;然后由专家池进行人工验证。
  • 数据使用方式

    • 42万条问答池(排除377个验证实例)作为训练的任务分布。agent与离线Wikipedia语料库交互来解决这些任务,生成轨迹,随后用于自蒸馏。
    • DeepSearch-Val保留用于验证和行为分析,从不用于轨迹生成或模型训练。

方法

作者提出了DeepSearch-Evolve,一个面向搜索agents的自蒸馏框架。如框架图所示,系统包含三个关键组件:一个名为DeepSearch-World的可验证工具环境,一个用于生成高质量轨迹的脚手架教师agent,以及一个迭代的自进化训练循环。

为了支持可扩展的自蒸馏,作者构建了一个确定性离线Wikipedia环境。他们从Wikipedia超链接图中采样实体级随机游走,通过混淆显式实体提及来创建42万条多跳问答实例。该环境提供两个与标准web agent工作流对齐的离线工具:使用BM25检索返回摘要和URL的搜索工具,以及通过SQLite索引将URL映射到完整文章正文的访问工具。在rollout过程中,环境维护一个实体真值集用于过程级验证。如果工具响应与一个未解决的实体匹配,则标记为成功。失败的调用会触发分阶段的基于规则的反思,引导agent从通用的修正信号转向具体的实体名称,从而创建有根据的搜索-失败-反思-重试轨迹。

脚手架教师agent分三个阶段操作:PLAN、ACT和END。如下方图所示,规划阶段初始化一个结构化的进度状态,包含已完成子目标、待执行动作、失败教训和所提取证据等字段。在动作循环中,教师执行交互步骤,选择工具调用并根据方程 st+1=U(st,at,ot,rt)s_{t+1} = \mathcal{U}(s_t, a_t, o_t, r_t)st+1=U(st,at,ot,rt) 更新其状态,其中 rtr_trt 是环境提供的反思。最后,在结束阶段,教师基于经过验证的工作记忆生成简洁的答案。

下方图展示了这一过程的一个示例。教师分解一个复杂问题,在搜索和访问工具之间交替,并更新其工作记忆。当搜索失败时,例如查询“Baroque crater coordinates”找不到结果,环境提供有根据的反思。教师随后将查询修改为“Rembrandt named place coordinates”并成功恢复,确保最终答案得到验证过的观察支持。

自进化训练循环在轨迹生成和模型更新之间交替进行。当前模型作为教师,在虚拟环境中生成脚手架轨迹。经过验证的成功轨迹会经过拒绝采样和质量过滤,以去除冗余和弱目标对齐。然后这些轨迹被转换为标准的ReAct格式监督信号。脚手架特定的提示被移除,进程状态和反思被改写为思考块。对于每一步 ttt,目标思考块构建如下:

thinkt=PtRtAt\langle \text{think} \rangle_t = P_t \oplus R_t \oplus A_tthinkt=PtRtAt

这里,PtP_tPt 总结进度状态,RtR_tRt 将反思改写为自我修正,AtA_tAt 保留动作理由。

作者采用演进式监督微调(SFT)以保证长时程工具使用中的稳定性。虽然On-Policy自蒸馏(OPSD)在学生轨迹诱导的前缀上匹配学生与软教师分布,但完全on-policy的监督可能不可靠,如果学生的rollouts偏离到低质量状态。相反,作者采样脚手架rollouts,过滤它们,并转换为ReAct痕迹。SFT目标最小化硬目标分布与模型策略之间的KL散度:

LSFT(θ)=Eτ~D~(R)t=1TKL(δytπθ(x,y<t))\mathcal{L}_{\text{SFT}}(\theta) = \mathbb{E}_{\tilde{\tau} \sim \widetilde{\mathcal{D}}(R)} \sum_{t=1}^{T} \text{KL}(\delta_{y_t} \parallel \pi_{\theta}(\cdot \mid x, y_{<t}))LSFT(θ)=Eτ~D(R)t=1TKL(δytπθ(x,y<t))

这种方法使用经过验证的离线前缀提供密集的token级别监督,在分布匹配的完整性和稳定高效的训练之间进行权衡。

实验

评估在七个深度搜索和推理任务上对DeepSearch-World-9B进行基准测试,将其与专有和开源agents进行比较,并在仅使用环境验证的自身backbone rollouts的自进化训练设置下进行。该模型在不依赖更强教师模型的情况下取得了有竞争力的开源性能,并在所有任务上相对Qwen3.5-9B-Instruct表现出一致且显著的提升。分析表明,自进化受益于多样化的数据池,导致明显更长且更多证据支持的工具使用,并且关键依赖于反思改写和拒绝采样来确保轨迹质量。这些发现表明,确定性环境验证和精心策划的自蒸馏可以有效地替代外部监督,用于训练有能力的deep search agents。

DeepSearch-World-9B仅通过自身环境验证的rollouts进行优化,在不依赖更强教师模型或合成流程的情况下,在深度搜索基准上取得了有竞争力的开源性能。它一致且显著地优于其基础模型Qwen3.5-9B-Instruct,在所有任务上的提升反映了可迁移的查询重构、证据锚定和多步综合技能。该agent还维持了更长的工具使用交互,并执行了更多的证据收集动作,表明更强的文档级推理能力。从环境验证的rollouts中进行自蒸馏,使DeepSearch-World-9B超越了使用多agent蒸馏或来自前沿模型的合成SFT轨迹的开源agents。该模型在BrowseComp上相对Qwen3.5-9B-Instruct提升了+23.8,在GAIA上提升了+37.6,在HotpotQA上提升了+48.1,同时将平均工具使用轮次从4.7延长到18.0,证据调用从0.9增加到5.4。

消融实验表明,拒绝采样(RS)是主导因素,大幅提升了SearchQA。轨迹质量过滤(QF)单独使用时提升较小,但与RS结合时,通过丢弃冗余或答案正确但轨迹不一致的痕迹,达到了最高性能。组合方法超越了SDAR和Skill-SD等现有方法,突显了为自进化SFT进行验证轨迹过滤的有效性。拒绝采样提供了主要增益,将SearchQA从46.4提升到54.9,证实了答案正确性验证是自蒸馏的关键保障。质量过滤与拒绝采样结合后达到58.2,优于单独的过滤器和先前方法,因为它去除了冗余、弱对齐或答案正确但轨迹不一致的痕迹。

结合反思改写和状态内部化的完整流程达到了最高的DeepSearch-Val分数31.9,明显优于25.0的SFT基线。反思改写至关重要;没有它,性能急剧下降到16.7,而状态内部化持续带来额外增益。省略这两个组件则得到最低分数14.8,突显了它们组合的重要性。反思改写是主导因素:移除它会导致性能大幅下降,而状态内部化贡献了较小但持续的提升。通过状态内部化注入规划、记忆和进度跟踪,相比省略它提升了超过8个点。完整流程相比普通SFT有显著提升,展示了将这些组件演进式自蒸馏的价值。

DeepSearch-World-9B完全通过环境验证的自蒸馏训练,不依赖外部教师模型,大幅超越了其基础模型和依赖多agent蒸馏或合成数据的开源agents,在查询重构、证据锚定、多步推理以及更长的工具使用交互方面展现了强大的可迁移技能。消融研究揭示,拒绝采样是推动增益的主导因素,而轨迹质量过滤、反思改写和状态内部化各自贡献了持续的额外提升。组合这些组件的完整流程取得了最高的整体性能,证实了带有谨慎轨迹过滤和agent状态建模的自进化对深度搜索任务非常有效。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供