Command Palette
Search for a command to run...
Autodata:一种用于生成高质量合成数据的智能体数据科学家
Autodata:一种用于生成高质量合成数据的智能体数据科学家
摘要
我们推出了 Autodata,这是一种通用方法,使 AI 智能体能够充当数据科学家,从而构建高质量的训练与评估数据。我们展示了如何训练(元优化)此类数据科学家智能体,使其学会生成更强的数据。我们阐述了整体方法论框架以及一种具体的实用实现——“代理式自指令”(Agentic Self-Instruct)。我们在计算机科学研究任务、法律推理任务以及涉及数学对象的推理任务中开展了实验,结果显示,与传统的合成数据集创建方法相比,我们取得了更优的性能。此外,对数据科学家智能体本身进行元优化带来了更为显著的性能提升。代理式数据创建提供了一种将增加的推理计算资源转化为更高质量模型训练数据的路径。总体而言,我们认为这一方向具有改变人工智能数据构建方式的潜力。
一句话总结
Meta AI 研究者提出 Autodata,一种 agentic 数据科学家,通过 Agentic Self-Instruct 对自身的数据生成过程进行元优化,以产生高质量合成训练集与评测集,在计算机科学研究、法律推理和数学推理任务上超越经典方法,同时将增加的推理计算转化为更强的模型训练。
核心贡献
- 论文提出 Autodata,一个通用框架,其中 AI agent 充当数据科学家,自动构建高质量训练与评测数据集。
- 一种元优化过程训练该数据科学家 agent 迭代提升其数据生成能力,具体实现称为 Agentic Self-Instruct。
- 在计算机科学研究、法律推理和数学推理任务上的实验表明,Autodata 优于经典合成数据创建方法,且对 agent 进行元优化可带来进一步性能提升。
引言
AI 前沿的进展越来越依赖高质量合成训练数据和具有挑战性的基准,因为人工编写的数据变得昂贵、稀缺或难度不足。此前的方法如 Self-Instruct 及其接地、推理感知和自我挑战的扩展,将数据生成视为基本固定的提示或过滤流水线,缺乏对数据质量和难度的直接迭代控制。作者提出 Autodata,一个通用框架,其中 AI agent 充当数据科学家,生成样本、评估其学习效用、分析失败并在闭环中修正其数据创建配方;作者进一步表明,对该 agent 本身进行元优化可带来可观的额外性能收益。
数据集
作者使用 Agentic Self‑Instruct 流水线构建 Principia 数据集,生成具有挑战性的问答对。从完整的 agentic 数据中随机抽取 1,000 个经过验证的 QA 对,以刻画问题的推理需求。
-
标注流水线与类别发现
- 采用两阶段基于 LLM 的标注流程(Kimi‑K2.6)。
- 首先,按挑战分数分层抽取 200 条,以每批 20 条展示给模型;模型提出 98 个原始问题类型类别,合并为 11 个不重叠的类型。
- 其次,将全部 1,000 条采样项归类到 11 个类型中的恰好一种。过滤解析失败后,687 条获得有效标注。
-
问题类型分布(Principia 子集)
- 标注样本(称为 Principia 问题)显示,约一半以推理为主,约四分之一为混合型,五分之一以知识为导向。
- 该分布证实 Agentic Self‑Instruct 流水线强调多步推理而非简单回忆,产生的训练数据能区分弱求解器与强求解器。
-
论文中的使用
- 完整的 agentic 数据集(标注样本是其一部分)用于模型训练;此摘录未详述具体训练划分与混合比例。
- 标注作为质量分析,验证生成的问题符合预期的推理密集型特征。除分类标签外,未描述额外的裁剪或元数据构建。
实验
论文评估了一个 Agentic Self-Instruct 循环,该循环通过瞄准弱求解器与强求解器模型之间的性能差距,迭代生成训练问题,应用于计算机科学研究、法律推理和科学推理任务。在计算机科学中,该循环将过于简单的问题转化为更难、更具区分度的问题,从而扩大差距;在法律任务中,它将过难的问题(弱求解器得分接近零)重塑为更可学习的提示,具有更高方差,改善 RL 奖励信号。在 agentic 数据上进行下游 GRPO 训练,始终优于标准 CoT Self-Instruct 数据,一个 4B 模型甚至在法律基准上超越 397B 基线,并且更难的的科学问题可迁移到更简单的分布,同时提升 token 效率。对数据科学家 agent 的提示进行元优化,通过自动修复如通用答案和上下文泄漏等失败模式,进一步提升验证通过率,表明改进生成策略本身即可产生更高质量的合成数据。
作者在科学推理基准上评估不同训练数据源的分布外性能。结果表明,在 Agentic Self-Instruct 数据上训练带来平均性能的最大整体提升,证明更难的问题构建出更稳健的推理能力。然而,组合数据源在某些类别的 pass-at-k 指标上具有优势,表明增加数据多样性有助于模型偶尔解决更广泛的问题。Agentic Self-Instruct 数据在基准类别上取得最高的整体平均分提升。与其他训练设置相比,Agentic 方法在 RealMath 和 SuperGPQA 等特定领域显示出一致增益。组合训练数据在 ARB 和 RealMath 等类别的 pass-at-k 指标上领先,表明更大数据集多样性的好处。
作者使用强化学习,在 agentic self-instruct 方法生成的数据上训练一个小型语言模型,并与标准 chain-of-thought self-instruct 数据进行比较。结果显示,在 agentic 数据上训练始终在更简单和更困难的留出测试集上优于标准基线。这表明 agentic 流水线产生的区分性训练数据转化为更强的推理性能和更好的迁移能力。在 agentic self-instruct 数据上训练,在分布内和分布外测试集上均取得比标准 chain-of-thought 基线更高的分数。与较简单的 chain-of-thought 测试集相比,agentic 方法在更困难的 agentic 测试集上的性能优势显著更大。经 agentic 训练的模型展现出强迁移性,在更简单和更困难的评测基准上均提升性能。
作者通过使用强化学习在不同方法生成的合成数据上训练小型语言模型,评估法律推理能力。结果表明,通过 Agentic Self-Instruct 循环创建的数据使小型模型能够同时超越标准 CoT 基线和未使用强化学习的显著更大的模型。Agentic Self-Instruct 方法为小型模型带来最佳性能,超过标准 CoT Self-Instruct 训练的结果。在 agentic 数据上训练的小型模型,在标准和困难法律推理基准上均超越大得多的基线模型性能。这些性能增益在不同评估评分器和测试集难度上保持一致。
作者应用元优化迭代改进负责生成计算机科学研究问题的数据科学家 agent 的提示。通过分析失败轨迹并自动修改 agent 指令,系统大幅提升验证通过率,该指标衡量生成能有效区分弱求解器与强求解器的问题的能力。元优化过程成功识别并修复系统性失败模式,如通用答案和上下文泄漏。验证通过率从基线配置到最终迭代呈现明显上升趋势,证明自动提示演化的有效性。
作者分析不同训练配置下的截断率,以评估固定 token 预算下的 token 效率。结果显示,基础模型截断率较高,表明响应在完成推理前经常超出预算。训练显著降低这些截断率,Agentic 和 Combined 方法达到最低截断率,表明训练使模型推理更简洁高效。基础模型在两个评测集上截断率最高,而所有训练配置均显著降低截断率。Agentic Self-Instruct 方法相比基础模型大幅降低截断,证明 token 效率提升。Combined 训练配置整体截断率最低,表明最简洁的推理模式。
实验使用强化学习在 agentic self-instruct 流水线的合成数据上训练小型语言模型,在科学推理、法律推理和 token 效率基准上,与标准 chain-of-thought self-instruct 及组合数据源进行比较。Agentic 数据始终带来更强的分布外性能,尤其在更难的问题上,并教会模型更简洁地推理,而混合数据源偶尔会改善 pass-at-k 多样性。一个独立的元优化循环自动优化数据科学家 agent 的提示,系统性地修复失败模式,提高生成区分性研究问题的比率。总体而言,agentic self-instruct 构建出更稳健、可迁移的推理能力,迭代提示演化进一步提升数据质量。