本条微博地址宝玉xpGeneFace++: 通用和稳定的实时音频驱动的人脸说话视频。
📚论文:
网页链接🏡主页:🔗genefaceplusplus.github.io🔗
摘要:在数字人类和元宇宙领域,生成能够根据任意语音音频进行对话的人物肖像是一个关键问题。现代的说话面部生成方法需要实现广义音频-唇形同步、良好的视频质量和高系统效率的目标。
最近,神经辐射场(NeRF)已成为该领域流行的渲染技术,因为它可以通过几分钟的训练视频实现高保真度和3D一致的说话面部生成。然而,基于NeRF的方法仍存在几个挑战:
1) 对于唇形同步,很难生成具有高时间一致性和音频-唇准确性的长面部运动序列;
2) 对于视频质量,由于用于训练渲染器的数据有限,它容易受到域外输入条件的影响,偶尔产生糟糕的渲染结果;
3) 对于系统效率,原始NeRF的训练和推理速度缓慢,严重阻碍了其在现实世界应用中的使用。
在本文中,我们提出GeneFace++来应对这些挑战,通过
1) 利用音调轮廓作为辅助特征,并在面部运动预测过程中引入时间损失;
2) 提出一种基于地标的局部线性嵌入方法,对预测的运动序列中的异常值进行调节,以避免稳健性问题;
3) 设计一个计算高效的基于NeRF的运动到视频渲染器,实现快速训练和实时推理。
有了这些设置,GeneFace++成为第一个实现稳定且实时说话面部生成和广义音频-唇形同步的基于NeRF的方法。
大量实验证明,我们的方法在主观和客观评估方面优于现有的最先进基线。视频样本可以在此https网址获取。
宝玉xp的微博视频
搜索微博更多关键词-GitHub