Learning realistic lip motions for humanoid face robots(为仿人面部机器人学习逼真的嘴唇动作)研究由哥伦比亚大学的 Yuhang Hu 等人完成,旨在解决仿人机器人嘴唇动作僵硬、不自然的问题,通过结合新型机械设计与自监督学习算法,实现了高度逼真的口型同步。
核心问题
仿人机器人虽然外形越来越像人,但在说话时往往显得“像个机器”,主要面临两个根本性障碍:
- 机械结构的局限性: 传统的机器人嘴唇缺乏复现人类细腻嘴部运动所需的机械复杂性,通常只能做简单的开合运动 。
- 同步算法的僵化: 现有的口型同步方法依赖于手动预定义的规则或简单的振幅映射,不仅耗时费力,而且缺乏适应性和真实感,导致机器人说话时显得笨拙且没有生气 。
- 恐怖谷效应: 视觉线索(嘴唇动作)与听觉线索(语音)的不匹配会让观察者感到不安,即所谓的“恐怖谷”效应 。
核心思想
该论文的核心思想是 “从数据中自监督学习,而非手动编程”。
研究团队提出了一种自监督学习流程,让机器人通过“自我探索”(Motor Babbling)理解自己的物理限制,并利用深度学习模型(VAE 和 Transformer)将从人类语音生成的理想视频信号“翻译”为机器人能够执行的物理电机指令 。这种方法弥合了“2D 视频像素”与“受物理限制的机器人实体”之间的鸿沟 。
研究方法
为了实现这一目标,作者在硬件和软件两个层面进行了创新:
订阅专栏 解锁全文

451

被折叠的 条评论
为什么被折叠?



