HyperAIHyperAI

Command Palette

Search for a command to run...

基于深度原生结构推理的精确、跨学科且透明的构效关系理解

摘要

构效关系是生物学、化学和材料科学的基础,功能、反应性和物理响应源于空间、化学和周期性组织。从机理上解释这些关系,需要依据立体化学、键合、对称性、能量学和周期序等科学原理与物理约束来解读结构证据。然而,将人工智能应用于这一过程面临表征与推理的双重挑战:模型必须保留领域原生的结构信息,同时展示特定证据如何在这些约束下支持预测。为此,我们提出SciReasoner,一个面向蛋白质、小分子和无机晶体的多模态科学基础模型,用于原生结构推理。SciReasoner将坐标、拓扑和周期性连接离散化为统一的结构感知词汇,将结构标记视为自回归推理轨迹中的可寻址证据单元。我们在削弱捷径相关性、强调基于结构推理的场景中评估SciReasoner。在同源性控制的基因本体预测中,SciReasoner将低同源和孤儿类蛋白的细胞组分注释的F_max从0.42提升至0.55。在化学领域,它将单步逆合成准确率从0.63提高到0.72,同时生成片段级断键和前体验证轨迹。在材料科学中,其表征能分离元素相和化合物相,并区分高、低带隙区域。在86项基准测试中,SciReasoner在67项任务上达到最先进性能。双盲专家评估显示,其推理轨迹在98%的案例中被认为优于或至少可比肩前沿大语言模型。通过将结构转化为可检验的推理基底,SciReasoner在科学约束下连接了精确预测与可解释的科学推断。

一句话总结

上海人工智能实验室、香港中文大学及其合作伙伴推出了 SciReasoner,这是一种多模态科学基础模型,将来自蛋白质、小分子和无机晶体的结构 token 统一到自回归推理中,将基因本体 FmaxF_{\mathrm{max}}Fmax 从 0.42 提升至 0.55,单步逆合成准确率从 0.63 提升至 0.72,并在 86 个基准测试中的 67 个上取得了最先进的性能,在双盲专家评估中,98% 的推理轨迹更受青睐。

核心贡献

  • SciReasoner 是一种多模态基础模型,将三维坐标、分子拓扑和晶体晶格离散化为统一的结构感知词汇表,将结构 token 视为自回归推理轨迹中可寻址的证据单元。
  • 在蛋白质、小分子和无机晶体领域,它提高了基于结构的任务的准确性:将低同源性蛋白质的细胞组分注释 Fmax 从 0.42 提高到 0.55,将单步逆合成准确率从 0.63 提高到 0.72,并区分了元素和化合物相以及带隙区域,在 86 个基准测试中的 67 个上取得了最先进的性能。
  • 生成的推理轨迹是可检查的,并明确将中间论断建立在结构证据之上,在双盲专家评估中,98% 的情况下这些轨迹被认为优于或与前沿大语言模型的轨迹相当。

引言

理解物质的空间、化学和周期性组织如何产生功能、反应性和物理性质,是蛋白质注释、化学合成和材料发现的核心。然而,当前的人工智能系统很少将原生结构表示与明确的、证据关联的推理结合起来:大语言模型将结构压缩为文本,失去了可寻址的物理基础,而特定领域模型输出预测却不暴露中间证据。作者引入了原生结构推理,并在 SciReasoner 中将其实例化,这是一种多模态基础模型,将蛋白质、小分子和无机晶体离散化为统一的结构感知词汇表。这种设计使得结构 token 能够在生成的推理轨迹中作为可检查的证据单元,在生物学、化学和材料科学之间架起准确预测和可解释科学推理的桥梁。

数据集

作者通过组合五个数据组件构建了一个多模态科学预训练语料库,每个组件均来自公开仓库,并经过处理以避免与下游基准测试发生泄漏。该数据集用于单个模型的持续预训练,通过特殊的结构标签交错模态。

  • 蛋白质数据

  • 来源:PDB–UniProt 映射(通过 SIFTS)、UniProtKB/Swiss-Prot 注释、PubMed/PMC 文献以及用于预测结构的 AlphaFoldDB。

  • 处理:每个蛋白质表示为一个包裹在 <protein></protein> 标签中的一级氨基酸序列,以及一个包裹在 <protein_structure></protein_structure> 标签中的并行结构序列。结构序列由残基级别的 Foldseek 3Di token 构建,描述局部 3D 环境。pLDDT < 70 的区域被掩码或替换为特殊 token 以减少噪声。

  • 过滤:所有与下游基准测试保留测试集中任何蛋白质的 MMseq2 序列同一性 >30% 的文本关联蛋白质记录均被排除,以防止标签泄漏。

  • 用途:模型在交错的蛋白质-文本设置中同时学习氨基酸序列和预测的 3D 结构。

  • 小分子数据

  • 来源:来自美国化学奥林匹克竞赛问题、Europe PMC、ChemRxiv、bioRxiv、medRxiv 和 arXiv(化学方向)的文本。来自 MoleculeNet、Therapeutics Data Commons、ChEBI、PubChem BioAssay、Tox21、hERG、CYP、CHEMDNER 和其他 ADMET/毒性语料库的结构化属性数据。来自 ORD、USPTO、Buchwald-Hartwig、Rhea、MOSES、MoNA 和光谱推理数据集的反应和光谱数据。来自 ChEMBL 和 BindingDB 的 3D 构象。

  • 处理:分子属性数据集被转换为语言接口模板,将分子与其属性配对。构象使用 RDKit 生成,并以序列兼容的格式表示,该格式将连接性与内部坐标相结合,包裹在 <molecule_structure></molecule_structure> 标签中。

  • 过滤:标识符被规范化,任何分子-标签或反应产物条目与保留测试集重叠的预训练示例均被移除。

  • 用途:模型看到文本描述、属性标签、反应数据和显式 3D 构象,以在语言建模框架内学习分子几何。

  • 材料数据

  • 来源:Materials Project、JARVIS-DFT、SNUMAT、hMOF、QMOF、OQMD、OMDB、JARVIS-QETB、GNoME 和 Cantor HEA,涵盖无机晶体、半导体、MOF、有机材料和高熵合金。

  • 处理:每种材料存储有化学式、元素组成、CIF 晶体结构和自然语言结构描述。模板将这些表示链接到训练样本中。

  • 过滤:在材料样本级别应用随机 80/10/10 划分。所有验证和测试材料样本,包括它们的所有属性记录,均从预训练语料库中完全移除。

  • 用途:模型学习周期性系统的组成级、几何级和文本级表示。

  • DNA/RNA 数据

  • 来源:RNA 序列来自 RNAcentral;DNA 序列来自 NCBI。

  • 处理:RNA 序列保持 FASTA 格式,包裹在 <rna></rna> 标签中,并附加可用的元数据(例如 RNA 家族)。DNA 序列按每个生物体采样为 1,000 bp 片段,以 FASTA 存储,包裹在 <dna></dna> 标签中,并标注生物体名称和基因组坐标。

  • 过滤:除采样策略外,未描述显式过滤。

  • 用途:这些序列为模型提供基因组和转录组上下文。

  • 通用文本和指令遵循数据

  • 来源:来自经过质量过滤的 Nemotron-CC v2(数万亿 token 的 Common Crawl 衍生品)的通用网络文本。来自 Dolci-Think-SFT-32B 的数学和指令遵循分割的推理指令数据,其中包含显式的 thinking 分隔的思考轨迹。来自 SciIF 训练分割的科学指令数据,该数据在科学上下文中施加可验证的约束。

  • 处理:数据按原样使用,指令-响应对保留其格式化的推理轨迹。

  • 用途:这些语料库通过通用领域语言和结构化的指令遵循监督来补充科学数据。

所有组件被组合用于持续预训练;除材料划分外,确切的混合比例未公开,而过滤规则确保没有基准测试信息泄漏到训练语料库中。

方法

作者介绍了 SciReasoner,这是一种多模态科学基础模型,旨在对蛋白质、小分子和无机晶体进行原生结构推理。与将科学实体视为文本字符串或低维描述符的系统不同,SciReasoner 通过结合离线结构编码、结构感知词汇嵌入和大语言模型骨干的统一架构,将三维结构表示为推理的主要对象。

整体架构由三个组件组成:模态特定的离线结构压缩器、作为离散跨模态投影的结构感知词汇嵌入层,以及统一的自回归语言模型骨干 fϕf_{\phi}fϕ,该骨干从 Qwen3-14B 初始化。该设计避免了子词分词器对物理拓扑的任意分割。相反,每个原始结构输入 S{Sprot,Schem,Scryst}S \in \{ S_{\text{prot}}, S_{\text{chem}}, S_{\text{cryst}} \}S{Sprot,Schem,Scryst} 首先由领域特定的离散编码器处理:蛋白质使用 Foldseek,晶体使用 SLICES,小分子使用 ConfSeq。这些编码器将 3D 坐标、分子拓扑和晶体晶格序列化为整体的结构 token,保留基本的物理语义。生成的结构序列 XvX_vXv 用适当的模态标签标记(例如 <protein_structure><molecule_structure><material_structure>)。

一个关键创新是结构感知词汇嵌入。在推理过程中,模型没有采用图神经网络等重型连续编码器,而是通过可学习的嵌入矩阵 WvRVv×dLLMW_v \in \mathbb{R}^{|V_v| \times d_{\text{LLM}}}WvRVv×dLLM 将离散的结构 token 序列直接投影到 LLM 的隐藏空间中,其中 Vv|V_v|Vv 是结构词汇表的大小,dLLMd_{\text{LLM}}dLLM 是 LLM 的隐藏维度。嵌入查找

Hv=Embedding(Xv,Wv)RLv×dLLM\mathbf{H}_v = \text{Embedding}(X_v, \mathbf{W}_v) \in \mathbb{R}^{L_v \times d_{\text{LLM}}}Hv=Embedding(Xv,Wv)RLv×dLLM

将结构 token 转换为密集的连续表示,与语言模型的语义空间无缝对齐,绕过了连续空间编码器的计算瓶颈。

语言指令 XqX_qXq 由 LLM 的原生嵌入层进行分词和嵌入,产生 Hq\mathbf{H}_qHq。结构和语言嵌入沿序列维度连接,形成统一的提示 Hprompt=[Hv;Hq]\mathbf{H}_{\text{prompt}} = [\mathbf{H}_v; \mathbf{H}_q]Hprompt=[Hv;Hq]。然后 LLM 骨干以自回归方式生成响应序列 XaX_aXa,条件依赖于结构证据和文本指令。

多阶段预训练策略通过单一的自回归下一 token 预测目标进行优化。给定结构输入 Hv\mathbf{H}_vHv 和语言指令 Hq\mathbf{H}_qHq,模型最小化目标响应 token 的负对数似然:

LNTP=t=1TlogPϕ(xa,txa,<t,Hv,Hq).\mathcal{L}_{\text{NTP}} = -\sum_{t=1}^{T} \log P_{\phi}(x_{a,t} \mid x_{a,<t}, \mathbf{H}_v, \mathbf{H}_q).LNTP=t=1TlogPϕ(xa,txa,<t,Hv,Hq).

训练分三个阶段进行,具有不同的参数冻结和学习率调度。在阶段 1(预热)中,仅更新结构感知词汇层、LLM 文本 token 嵌入和预测头;核心 transformer 骨干保持冻结。这将在嵌入空间中锚定新引入的结构 token,而不破坏模型预训练的推理能力。阶段 2(全参数训练)解冻所有参数 ϕ=Θ\phi = \Thetaϕ=Θ,并在多样化的配对结构-文本数据上训练模型。为阶段 2 和阶段 3 初始化一个共享的预热-稳定-衰减(WSD)学习率调度器,学习率 η(t)\eta(t)η(t) 定义为

η(t)={ηmaxtTwif 0t<Twηmaxif Twt<Tw+Tsfdecay(t)if Tw+TstTtotal,\eta(t) = \begin{cases} \eta_{\max} \cdot \frac{t}{T_w} & \text{if } 0 \leq t < T_w \\ \eta_{\max} & \text{if } T_w \leq t < T_w + T_s \\ f_{\text{decay}}(t) & \text{if } T_w + T_s \leq t \leq T_{\text{total}}, \end{cases}η(t)=ηmaxTwtηmaxfdecay(t)if 0t<Twif Twt<Tw+Tsif Tw+TstTtotal,

其中 TwT_wTwTsT_sTsTdT_dTd 分别表示预热、稳定和衰减阶段的持续时间。阶段 2 跨越预热阶段和稳定阶段的初始部分,允许整个网络在高恒定学习率下吸收领域特定知识。阶段 3(退火)继续全参数优化,并继承相同的调度器;最终进入衰减阶段,并增加问答式数据的比例以优化模型行为。

为了将预训练模型转化为遵循指令的推理器,作者设计了一个两阶段后训练流程,结合了监督微调(SFT)和强化学习(RL)。该过程旨在避免异构科学任务之间的破坏性干扰,并用同策略推理轨迹取代外部教师监督。

冷启动 SFT 阶段重新建立双模式响应协议:思考模式,模型在最终答案 yyy 之前生成一个包含在 `` 分隔符中的思维链推理 ccc;非思考模式,思考跨度为空,模型直接产生答案。SFT 目标是仅响应部分的掩码下一 token 预测:

LSFT=t=1TmtlogPϕ(xa,txa,<t,Hv,Hq),\mathcal{L}_{\text{SFT}} = -\sum_{t=1}^{T} m_t \log P_{\phi}(x_{a,t} \mid x_{a,<t}, \mathbf{H}_v, \mathbf{H}_q),LSFT=t=1TmtlogPϕ(xa,txa,<t,Hv,Hq),

其中 mt=1m_t = 1mt=1 仅针对 XaX_aXa 中的 token,对于提示 token 为 000。这确保优化专注于从指令到推理答案的映射。在第一阶段,任务宇宙被划分为 JJJ 组,基础检查点 M0M_0M0 在每个组的教师提供的 CoT 语料库上独立冷启动,产生专门的专家 {Mjcs}\{M_j^{\text{cs}}\}{Mjcs}。然后这些专家通过 RL 进行域内结构证据基础化进一步优化,之后它们生成同策略推理轨迹。教师监督被模型自身的验证轨迹取代,并在合并的语料库上从 M0M_0M0 进行统一冷启动,为最终整合阶段提供良好匹配的初始化。

RL 阶段使用 DAPO 算法,并采用奖励软化方案来处理评估超出精确匹配的任务。训练数据通过经验解决率过滤程序进行策划。对于每个提示,生成八个随机展开,并计算经验解决率 p^(x)\hat{p}(x)p^(x)。仅保留 p^(x)(0.125,0.875)\hat{p}(x) \in (0.125, 0.875)p^(x)(0.125,0.875) 的示例,并通过选择最接近中间成功率 0.5 的实例构建一个 2,000 示例的训练集。这种以难度为中心的采样产生信息丰富的梯度并实现稳定改进。策略使用 PPO 风格的裁剪目标进行优化,该目标使用组内标准化优势和不对称的裁剪上限调度以保持探索。RL 过程首先按任务组应用(域内结构证据基础化)以产生一组专家,然后从统一冷启动检查点开始在合并的全任务池上再次执行(跨域推理整合)。这最后一步将专门的能力整合到一个单一的统一模型中,该模型能够在科学模态之间进行显式的结构推理。

实验

SciReasoner 作为一个统一的多模态模型,证明了在蛋白质、DNA/RNA、小分子和晶体之间整合序列、结构和文本推理能够产生最先进的性能,始终匹配或超越领域专家,同时提供可解释的、基于结构的思维链。该模型的增益在低同源性区域和需要显式 3D 推理的任务中最为显著,消融研究证实结构证据对其原生推理能力至关重要。通过自举的后训练框架,域内基础化和跨域整合提高了准确性和推理质量,人类专家因其忠实性、连贯性和领域合理性而压倒性地偏好 SciReasoner 的输出,而非通用大语言模型。


用 AI 构建 AI

从创意到上线——通过免费 AI 协同编码、开箱即用的环境和最优惠的 GPU 价格,加速您的 AI 开发。

AI 协同编码
开箱即用的 GPU
最优定价

HyperAI Newsletters

订阅我们的最新资讯
我们会在北京时间 每周一的上午九点 向您的邮箱投递本周内的最新更新
邮件发送服务由 MailChimp 提供