Command Palette
Search for a command to run...
通过音频感知的风格参考实现风格保持的口型同步
通过音频感知的风格参考实现风格保持的口型同步
Weizhi Zhong Jichang Li Yinqi Cai Ming Li Feng Gao Liang Lin Guanbin Li
一键部署高质量口型同步模型 MuseTalk
摘要
近年来,音频驱动的口型同步(Audio-driven lip sync)因在多媒体领域的广泛应用而备受关注。尽管不同个体在朗读相同语句时口型形状各异,这种差异源于个人独特的说话风格,但也为音频驱动的口型同步带来了显著挑战。早期的此类方法往往忽略了个性化说话风格的建模,导致生成的口型同步效果仅符合一般风格,表现次优。近期的口型同步技术试图通过聚合风格参考视频中的信息,以引导任意音频的口型同步,但由于风格聚合的不准确性,它们未能很好地保留说话风格。本文提出了一种创新的音频感知风格参考方案,通过有效利用输入音频与风格参考视频中参考音频之间的关系,解决了旨在保留说话风格的音频驱动口型同步问题。具体而言,我们首先开发了一种先进的基于 Transformer 的模型,该模型擅长预测与输入音频对应的唇部运动,并通过风格参考视频中的交叉注意力(cross-attention)层聚合风格信息对其进行增强。随后,为了更逼真地将唇部运动渲染为说话人脸视频,我们设计了一种条件潜在扩散模型(conditional latent diffusion model),通过调制卷积层(modulated convolutional layers)整合唇部运动,并通过空间交叉注意力层融合参考面部图像。广泛的实验验证了所提方法在实现精准口型同步、保留说话风格以及生成高保真真实说话人脸视频方面的有效性。
一句话总结
针对先前方法在风格聚合方面存在的不准确问题,本文提出了一种音频感知的风格参考方案。该方案融合了基于 Transformer 的口唇运动预测器(通过交叉注意力层增强以实现风格聚合)与条件潜在扩散渲染器(通过调制卷积和空间交叉注意力进行融合)。大量实验验证了该方案在实现精确口唇同步、保留个人说话风格以及生成高保真说话人脸视频方面的有效性。
核心贡献
- 本文提出了一种音频感知的风格参考方案,通过建模输入音频与参考音频之间的关系来保留个人的说话风格。基于 Transformer 的架构利用交叉注意力层聚合个性化风格特征,以预测目标口唇运动。
- 条件潜在扩散模型将预测的口唇运动渲染为逼真的说话人脸视频。该渲染器利用调制卷积层整合运动信号,并通过空间交叉注意力机制融合参考面部图像。
- 大量实验验证了该框架能够实现精确的口唇同步,有效保留个人说话风格,并生成高保真说话人脸视频。实验结果证实了集成风格聚合与渲染流程的有效性。
引言
未提供待分析的源文本。请提供摘要或正文片段,以便生成一份简洁的研究背景概述,以清晰、专业且易读的方式阐述技术背景、现有方法的局限性以及作者的核心贡献。