Command Palette
Search for a command to run...
从零开始扩展原生多模态预训练
从零开始扩展原生多模态预训练
Haoyuan Wu Aoqi Wu Hai Wang Jiajia Wu Jinxiang Ou Bei Yu
摘要
尽管大语言模型(LLM)展现出卓越的推理能力,但其仅依赖文本的预训练方式限制了对多模态物理世界的感知。原生多模态预训练通过从零开始在多模态输入上训练模型,避免了这一局限,从而实现深层的跨模态融合,并缓解了传统后期融合架构固有的优化不对称性。尽管具有这些优势,该范式的扩展特性仍缺乏系统性的刻画。为填补这一空白,我们在固定计算预算下,研究了训练基于 Transformer 的视觉-语言模型的最优模型规模与 token 数量。我们证明,最小目标损失遵循可预测的计算定律,而计算最优的模型规模与 token 数量则按幂律扩展。值得注意的是,语言目标与多模态目标表现出截然不同的扩展行为。语言分配定律在很大程度上不受数据构成的影响,表明无论多模态数据比例如何,语言学习均保持稳定。相反,多模态分配定律对数据构成高度敏感。具体而言,文本占比较高的混合数据仅在较大模型规模下才变得计算高效,从而将最优资源分配推向更大的模型容量。此外,通过建模数据构成对计算定律和分配指数的影响,我们推导出一条效率前沿,明确规定了模型规模、token 数量与数据混合的精确配置。下游评估进一步揭示,原生多模态预训练能引发正向跨模态迁移,从而增强纯文本空间推理能力,并实现稳健的多模态上下文学习。总之,本实证研究为可预测地扩展多模态基础模型奠定了必要的基础。
一句话总结
香港中文大学和腾讯的研究人员研究了原生多模态预训练的缩放定律,发现语言目标和多模态目标表现出不同的计算最优行为,数据构成对多模态资源分配有强烈影响,并推导出关于模型规模、token 数量和数据混合的效率前沿,同时证明原生预训练通过正向跨模态迁移,改善了纯文本空间推理和多模态上下文学习能力。
核心贡献
- 将联合训练损失解耦为独立的语言目标和多模态目标,揭示了语言缩放几乎不受数据构成影响,而多模态缩放对多模态数据比例高度敏感。
- 推导出一个明确考虑数据混合的计算最优前沿,精确指定了模型规模和 token 数量作为计算预算和数据构成的函数分配。
- 下游实验表明,原生多模态预训练带来了正向跨模态迁移,提升了纯文本空间推理能力,并实现了鲁棒的多模态上下文学习。
引言
尽管大语言模型具有强大的推理能力,但纯文本训练缺乏多模态 grounding。晚期融合方法通过将预训练的语言模型与视觉编码器结合来缓解这一问题,但会引入根本性的表示不对称性,因为视觉和语言是分别学习的。从头开始的原生多模态预训练有望实现更深层次的整合,然而此前缺乏缩放定律来指导如何在固定计算预算下,在不同模态之间分配模型规模和数据。作者填补了这一空白,为原生多模态预训练推导出计算最优的缩放定律,并将语言和多模态目标解耦。他们发现,语言缩放遵循数据构成不变的分配规则,而多模态缩放对数据混合高度敏感,这导致了一个联合帕累托前沿,为任何计算预算规定了最优的模型规模、文本 token 数量和多模态 token 数量。他们还表明,原生预训练可以将空间推理能力迁移到纯文本任务中,并实现多模态上下文学习。
数据集
[[P2B_BLOCK_0]]
作者构建了一个混合文本和多模态数据的训练语料库:
- 文本子集:2500亿个 token,来源于网页、书籍、学术论文及类似领域。
- 多模态子集:750亿个 token,由网络爬取的图像-文本对和交错式图像-文本文档生成。图像使用单个 patch 嵌入层转换为连续的 patch 嵌入,将每张图像转换为一系列类似 token 的嵌入。不使用额外的视觉编码器。
整个数据集(文本 + 多模态 token)用于训练一个仅解码器的专家混合(MoE)Transformer。patch 嵌入与文本 token 一起直接输入模型,将图像视为原生 token 序列。除标准网络规模数据整理外,未提供任何裁剪、过滤或元数据构建的细节。
方法
作者重新审视了原生多模态预训练中计算最优分配的基本问题。给定固定的计算预算 C,目标是在模型规模 N(激活的非嵌入参数数量)和训练 token 总数 D 之间最优分配资源。这种权衡由多模态数据比例 r 参数化。最终的预训练损失 L(N,D) 在约束条件 C=6ND 下被最小化。由于语言目标和多模态目标(Ltext 和 Lmm)使用共享参数同时优化,作者将分配问题解耦。他们将文本和多模态目标的有效计算分别定义为 Ctext=6NDtext 和 Cmm=6NDmm,其中 Dtext=D/(1+r),Dmm=Dr/(1+r)。
为了估计计算最优分配,采用了两种独立的方法。主要估计器是 IsoFLOP 剖面方法。在预定的计算预算 C 下,绘制每个模型损失相对于 logN 的图,生成 IsoFLOP 剖面,该剖面被建模为一条抛物线。这条抛物线的最低点确定了最优模型规模 Nopt(C),由此得出最优 token 数量为 Dopt(C)=C/(6Nopt)。如下图所示:
[[P2B_BLOCK_1]]
语言目标的 IsoFLOP 曲线在不同 r 值下均显示出稳定的抛物线最小值,表明对于任何给定的 FLOP 预算,都存在一个最优模型规模。
第二种方法是训练曲线包络,作为一种独立的交叉验证机制。对于固定的模型规模 N,增加 token 数量 D 会产生一条损失相对于总计算量 C 的轨迹。汇集所有评估模型的轨迹并提取下包络,即可得到在任何给定预算 C 下可实现的最小损失。参见下图:
[[P2B_BLOCK_2]]
此图展示了语言目标的训练曲线包络。通过从这些不同 r 值和模型规模的曲线中提取每个 FLOP 的最小损失包络,作者估计了最优模型规模和训练 token 分配。计算前沿严格遵循幂律 L(C)=E+(Cc/C)β。
关于实验设置,模型在混合了 2500 亿个文本 token 和 750 亿个多模态 token 的数据上进行训练。架构采用基于仅解码器 Transformer 的专家混合(MoE)。不使用传统的视觉编码器,而是用一个单一的 patch 嵌入层直接将图像投影为连续的 patch 嵌入。MoE 模型采用无辅助损失的方法进行训练。
解耦分析揭示了不同的缩放行为。语言目标的计算最优分配高度不受数据构成影响。IsoFLOP 参数拟合和训练曲线包络显示,最小化 Ltext 所需的参数容量严格由孤立的预算 Ctext 决定,表现出对引入多模态 token 的经验鲁棒性。相比之下,多模态目标表现出严格受数据构成影响的缩放行为。随着 r 的增加,最优模型规模的指数显著下降,证实了跨模态对齐固有的数据饥渴特性。处理日益密集的多模态数据,会将最优计算分配大幅转向数据缩放而非参数扩展。
为了解决实际的原生多模态预训练问题,即必须在统一的计算预算 Ctotal 下优化共享参数数量 N,作者建立了一个严格的帕累托前沿。他们采用了一个非对称的建模框架,将数据构成不变的语言目标与数据构成变化的多模态目标配对。这种非对称性反映了模态之间的结构差异。基于文本的语言建模依赖于稳健的统计结构,而视觉 token 则提供外部上下文。因此,缩放统一的多模态基础模型需要有意的架构调整,限制理论上的参数扩展,而倾向于在更大的 token 预算上进行训练,以适应密集多模态输入的数据需求。
实验
评估设置使用 16 个文本基准和 23 个多模态基准,在上下文学习条件下评估基座模型。原生多模态预训练保留了核心语言能力,整体文本性能没有下降,并产生了跨模态迁移,其中来自视觉数据的空间推理能力提升了纯文本的空间任务。多模态上下文学习能力随着模型规模增大和训练数据增多而自然涌现,最强的少样本增益集中在空间推理基准上,而非以识别为中心的任务。