社区所有版块导航
Python
python开源   Django   Python   DjangoApp   pycharm  
DATA
docker   Elasticsearch  
aigc
aigc   chatgpt  
WEB开发
linux   MongoDB   Redis   DATABASE   NGINX   其他Web框架   web工具   zookeeper   tornado   NoSql   Bootstrap   js   peewee   Git   bottle   IE   MQ   Jquery  
机器学习
机器学习算法  
Python88.com
反馈   公告   社区推广  
产品
短视频  
印度
印度  
Py学习  »  Git

GitHub(微博搜索)-20230503-1

GitHub(微博搜索) • 3 年前 • 451 次点击  
本条微博地址宝玉xp
GeneFace++: 通用和稳定的实时音频驱动的人脸说话视频。

📚论文:网页链接
🏡主页:🔗genefaceplusplus.github.io🔗
摘要:在数字人类和元宇宙领域,生成能够根据任意语音音频进行对话的人物肖像是一个关键问题。现代的说话面部生成方法需要实现广义音频-唇形同步、良好的视频质量和高系统效率的目标。

最近,神经辐射场(NeRF)已成为该领域流行的渲染技术,因为它可以通过几分钟的训练视频实现高保真度和3D一致的说话面部生成。然而,基于NeRF的方法仍存在几个挑战:
1) 对于唇形同步,很难生成具有高时间一致性和音频-唇准确性的长面部运动序列;
2) 对于视频质量,由于用于训练渲染器的数据有限,它容易受到域外输入条件的影响,偶尔产生糟糕的渲染结果;
3) 对于系统效率,原始NeRF的训练和推理速度缓慢,严重阻碍了其在现实世界应用中的使用。

在本文中,我们提出GeneFace++来应对这些挑战,通过
1) 利用音调轮廓作为辅助特征,并在面部运动预测过程中引入时间损失;
2) 提出一种基于地标的局部线性嵌入方法,对预测的运动序列中的异常值进行调节,以避免稳健性问题;
3) 设计一个计算高效的基于NeRF的运动到视频渲染器,实现快速训练和实时推理。

有了这些设置,GeneFace++成为第一个实现稳定且实时说话面部生成和广义音频-唇形同步的基于NeRF的方法。

大量实验证明,我们的方法在主观和客观评估方面优于现有的最先进基线。视频样本可以在此https网址获取。 宝玉xp的微博视频
搜索微博更多关键词-GitHub
Python社区是高质量的Python/Django开发社区
本文地址:http://www.python88.com/topic/154379