科技魔方

字节跳动开源全新AI模型LatentSync 精准控制唇形同步

更多场景

2025年01月06日

  字节跳动推出的LatentSync是一项先进的端到端唇同步技术,利用音频条件的潜在扩散模型,实现了视频中人物唇部动作与音频的精确匹配。

  该技术通过引入TREPA技术,增强了时间一致性,同时优化了SyncNet的收敛性,显著提升了唇同步的准确性。

  端到端框架:LatentSync无需中间运动表示,直接从音频生成唇部动作。

  高质量生成:利用Stable Diffusion生成动态逼真的说话视频,提升视觉效果。

  时间一致性:通过TREPA技术增强视频帧之间的时间一致性,确保唇同步的准确性。

+1

来源:科技魔方

延展资讯