HyperAIHyperAI

Command Palette

Search for a command to run...

衡量人类与LLM研究想法之间的差距

Ziyu Chen Yilun Zhao Arman Cohan

摘要

大语言模型(LLM)越来越多地被用于头脑风暴研究想法,但现有评估大多通过新颖性、可行性或专家偏好来评判单个想法。我们转而提出一个问题:当前LLM生成的想法与人类研究者之间有多大差距?为了刻画这一差距,我们构建了一个基于高质量人类研究论文的大规模构思评估框架。对于每篇论文,我们逆向推导出一组可能启发其核心想法的密切相关的先前工作。然后,提示LLM根据这组论文标题和摘要生成一个新想法。我们引入了一个双轴研究品味分类法,通过机会模式和研究范式来刻画每个想法的特征,并利用它来量化人类与LLM想法之间的差异。在不同LLM生成的想法集合中,我们观察到一个一致的分布差距:LLM的想法不成比例地集中在桥梁式机会和综合方法上,而人类论文的参考分布则更广泛地分布在构建差距和构建贡献的各种方式上。这一结果表明,强大的LLM可以产生一系列合理的想法,但这一范围仍然比人类的研究品味更窄,并且相对于人类发生了系统性偏移。

一句话总结

耶鲁大学和芝加哥大学的研究者引入了一个大规模评估框架,该框架逆向工程出启发一篇论文的前期工作,提示LLM基于这些前期工作生成想法,并使用双轴研究品味分类法量化差异,揭示LLM产生的想法不成比例地集中在桥接式机会和综合方法上,与人类研究品味相比,分布更狭窄且系统性偏移。

核心贡献

  • 一个评估框架从人类研究论文中逆向工程出相关工作上下文,实现了在共享的、基于文献的输入下对人类和LLM生成的想法进行受控比较。
  • 一个双轴分类法根据机会模式和研究范式对每个想法进行刻画,量化人类与LLM构思之间的分布差异。
  • 跨模型家族和科学领域,LLM生成的想法不成比例地集中在桥接式机会和面向综合的方法上。人类想法覆盖了更广泛的机会模式和研究范式,揭示了更狭窄且系统性偏移的研究品味。

引言

大型语言模型现在被广泛用于生成研究想法,然而目前缺乏对它们相较于人类研究者所产生的想法类型的系统性理解。先前的评估单独评判想法的新颖性或可行性,但未能捕捉LLM的输出是否反复倾向于同一狭窄的问题框架和贡献策略。作者通过引入研究品味的分布视角和一个双轴分类法来解决这一差距,该分类法刻画了一个想法如何框定其研究机会以及提出何种类型的智力贡献。通过一个受控的、基于文献的构思任务,他们发现LLM产生的想法高度集中在弥合差距和综合现有工作上,而人类想法则覆盖了更广泛的机会模式和方法范式。

数据集

作者构建了一个用于研究构思的评估语料库,包含两个子集:人类想法和LLM想法。

  • 来源与构成

    • 人类想法提取自机器学习(ICLR、ICML、NeurIPS,2023–2026年)和《自然·通讯》(2023–2025年)已发表的研究论文,涵盖71个科学学科。
    • 对于每篇论文,将原作者的想法作为人类终点。一个LLM辅助的流程提取包含创新点、与前期工作的区别和关键洞察的结构化表示,然后将其改写为提案式的动机和方法。
    • 为了形成输入上下文,从提取的想法和论文的相关工作部分逆向工程出4–8篇高度相关的前期研究。仅保留这些前期工作的标题和摘要作为输入摘要。
    • 经过筛选后,人类想法子集包含11,683个有效示例。
    • LLM想法子集通过使用相同的前期工作输入提示各种LLM(Claude、Gemini、GPT、DeepSeek、Qwen)生成新想法,采用相同的结构化格式(动机和方法)。
  • 在论文中的用途

    • 该语料库用作构思的评估基准。人类撰写的想法作为参考目标,而LLM生成的想法是待评估的输出。
    • 不划分训练集;数据仅用于比较LLM生成的研究想法与人类撰写的想法的质量。
  • 处理细节

    • 提取提示要求提供论文的创新点、与前期工作的区别和关键洞察,然后将结果重新表述为动机和方法提案。
    • 通过逆向工程步骤识别前期研究,该步骤使用提取的想法和论文的相关工作部分;仅保留标题和摘要,丢弃全文。
    • 人类和LLM想法的最终输入仅由这些前期工作摘要组成,确保了一致的评估设置。

实验

该评估框架将人类和LLM的想法锚定在相同的前期文献上,然后用涵盖机会模式和方法范式的研究品味分类法对每个想法进行标注。实验揭示了一致的分布差距:LLM严重偏向桥接与综合类想法,而人类研究者更均匀地分布在解释、测量、风险和制品贡献上。扩展推理放大了这一模板,机制分析显示LLM反复选择高频技术概念并将其包装在安全的整合操作中,而人类想法更常替换、解耦或形式化局部机制。

LLM生成的研究想法在分布上与人类想法相距甚远,明显向桥接与综合模式偏移。模型在两个分类轴上的熵都较低,尤其在机会维度上,即使是最匹配的模型也需要移动超过三分之一的概率质量才能匹配人类分布。这一差距反映了LLM倾向于将贡献框定为连接或统一前期工作,而人类想法更均匀地分布在解释、测量、优化和其他贡献类型上。所有测试的LLM产生的分布都比人类参考更集中,机会模式熵在0.550至0.758之间,而人类为0.926。桥接与综合机会仅占人类想法的12.1%,却占LLM想法的47.1–64.2%,综合/统一方法占比分别为5.1%对22.5–38.7%。在机会轴上最接近的模型Gemini-3.1-Pro的总变差距离为0.348,意味着需要移动超过三分之一的分布质量才能匹配人类输出。更丰富的全文上下文并未缩小差距;对于测试的两个模型,TVD和JSD均增加,而熵下降或持平。诊断得分显示LLM想法往往更模板化且不够具体,Qwen模型显示出最高的表面拼接标志,而Claude-Sonnet-4.6在瓶颈特异性上略高于人类,但在分布上仍相距甚远。

大多数模型生成的提案表现出比人类想法更低的瓶颈特异性和更高的模板化程度,反映出机制不够精确和措辞更通用。Qwen模型退化最明显,表面拼接得分和标记率最高,而Claude-Sonnet-4.6是唯一在瓶颈特异性和模板化程度上略微超过人类基线的模型。人类提案的表面拼接得分为0.00,标记率为0.0%,而Qwen3-8B达到0.58和20.6%,是所有来源中最差的。Claude-Sonnet-4.6的瓶颈特异性(2.60)高于人类基线(2.56),模板化程度(0.37)低于人类(0.48),成为唯一在这些维度上达到或超过人类表现的模型。所有其他模型,包括Gemini-3.1-Pro和GPT-5.4-mini,在瓶颈特异性和模板化程度上均低于人类水平,其中GPT-OSS-20B在非Qwen系统中特异性最低(2.07)。

用模型生成的全文摘要替换论文摘要并未使LLM的想法分布更接近人类;在机会和方法范式轴上,总变差和Jensen-Shannon散度均增加,而归一化熵下降。差距扩大而非缩小,桥接与综合想法过度代表的相同定性模式持续存在。对于Qwen3-8B和DeepSeek-V4-Flash,当从摘要切换到全文上下文时,两个分类轴上的TVD和JSD均上升,表明与人类参考分布的差异更大。归一化熵在全文上下文下降低,表明更丰富的文档信息使模型输出更集中,而非更多样化。

启用思考模式一致地将模型输出推向更集中且更不像人类的分布。当激活推理时,Qwen3-8B和DeepSeek-V4-Flash均表现出更高的桥接和综合模板占比、增加的总变差距离以及更低的熵,表明扩展推理强化了模型偏好的构思模板,而非拓宽其创造范围。添加推理使Qwen3-8B的桥接模板占比增加超过20个百分点,DeepSeek-V4-Flash增加近7个百分点,综合占比同样上升,揭示了对整合原型的更强依赖。思考模式下机会熵大幅下降(例如,Qwen3-8B从0.658降至0.481),与人类分布的总变差距离增加,证实了更尖锐且与人类对齐度更低的想法分布。

该评估框架沿机会和方法范式分类轴比较LLM生成的研究提案与人类想法,使用散度指标以及模板化、特异性和表面拼接的诊断得分。LLM一致地过度代表桥接与综合模式,导致集中分布,与人类多样性显著偏离;提供全文上下文或启用思考模式扩大而非缩小这一差距。尽管Claude-Sonnet-4.6在瓶颈特异性和模板化程度上略微优于人类基线,但所有模型产生的想法都更通用、多样性更低,且在贡献类型上仍远离人类分布。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供