ShadowDancer:通过从视频及影子学习统一动态表示实现视频世界模型任意动作控制
本文提出ShadowDancer,一种实现视频世界模型任意动作、帧级控制的新方法。其障碍在于表示层面:现有接口要么对动作进行松散编码,将展开方式留给模型即兴发挥;要么通过结构化信号精确编码,但仅适用于某一类动作且难以获取,跨不同动态的精确控制仍不切实际。演示视频是天然解决方案,可逐帧指定任意动态;但视频仅通过一种特定外观呈现动态,即潜在动力学的一个影子。
查看原文解读生成中或暂时不可用,请稍后刷新重试,或直接查看原文。