ECCV 2026|UniMotion:在统一多模态大模型中引入连续运动模态
当听到「把双手举过头顶,然后向前走」,人可以在脑中补出一整段动作;当看到一段无声的人体轨迹,也能判断人物是在行走、转身还是踉跄。连续运动既可以被语言描述,也可以作为生成、预测和编辑的条件。
今天的多模态大模型已经能够理解和生成文本、图像,却很少把「人怎样连续运动」作为独立模态。动作从单帧延伸到数秒后,模型还需处理顺序、速度、方向、重心转移与全身协调。
(相关资料图)
北京大学、东华大学与华南理工大学的研究团队提出 UniMotion,将连续运动纳入统一多模态模型(Unified Multimodal Model,UMM),在同一框架中连接 Motion、Text 与 RGB。论文已被 ECCV 2026 录用。
图 1|UniMotion 在同一框架中覆盖运动理解、生成、预测与编辑等七项任务。
- 论文标题:UniMotion: A Unified Framework for Motion-Text-Vision Understanding and Generation
- 论文链接:https://arxiv.org/abs/2603.22282
- 项目主页:https://wangzy01.github.io/UniMotion
- 代码链接:https://github.com/wangzy01/UniMotion
统一多模态建模中的运动模态缺口
人体运动领域,「单帧」Pose 描述某一帧的人体构型,「多帧」Motion 则记录身体结构怎样随时间演化。逐帧姿态看起来合理,不代表连成序列后依然自然:脚掌落地后继续平移会形成脚滑,关节角度跳变会产生抖动,动作阶段顺序错误则会破坏完整语义。
现有 Motion–Text 方法多将轨迹量化为离散 token,便于接入语言模型,却可能损失细粒度变化和时间连续性;视觉大模型的人体建模又主要围绕静态 Pose 展开。UniMotion 则让连续运动以完整模态进入统一理解与生成过程。
表 1|代表性方法的任务覆盖与运动表示。UniMotion 是表中唯一覆盖七项任务的方法。
连续运动接口与跨模态对齐
UniMotion 建立在 Show-o2 1.5B 上。Text、Motion 和 RGB 进入共享 LLM backbone;文本继续使用离散 token 与自回归生成,Motion 和 RGB 则编码为连续 latent,并由各自的 flow head 完成生成。统一发生在语义与推理主干,模态专属接口仍被保留。
图 2|Motion 与 RGB 通过平行连续通路进入共享骨干,Text 保留自回归接口。
运动 latent 经过语义与生成双路径嵌入器:前者概括动作含义与阶段,后者保留局部关节和时间位置;Hybrid Attention 与按模态路由的 LoRA 负责协调连续信号和文本的不同建模需求。
Cross-Modal Aligned Motion VAE(CMA-VAE)把运动编码为连续 latent。训练时,DPA 将带图像语义的后验对齐到只读取运动的 Motion Encoder;推理时视觉融合编码器被移除,纯运动任务无需额外图片。
图 3|CMA-VAE 通过训练期视觉后验对齐连续运动表示,两条编码通路共用 Motion Decoder。
连续表示建立后,新运动通路仍需预校准。LRA 使用 motion latent 作为稠密条件,让 flow head 从噪声重建目标 latent,共同校准嵌入器、主干适配分支和生成头。Motion-to-Motion 只提供预训练信号,简单但清晰地提升下游任务上的能力。
图 4|LRA 以 Motion-to-Motion 自监督任务预校准运动生成通路。
理解、生成与编辑能力
图 5|文本生成连续动作:左侧为「a person throws something then moves forward」,右侧为「a man jumps and brings both arms above his head as he spread his legs and then moves them back into the original position」。
Text-to-Motion 需要把语言展开为完整时序,Motion-to-Text 则从连续轨迹中概括动作含义和阶段顺序。
图 6|UniMotion 根据连续动作生成英文描述。
Motion Editing 同时接收源运动与文本指令。下图中,源动作「挥手」被改为「喝咖啡」,动作语义发生变化,轨迹仍保持连续。
图 7|源动作在「not waving drink coffee」指令下被编辑为喝咖啡。
Motion Prediction 则根据已观察前缀延续未来轨迹。样例提供 1.05 秒动作,模型继续预测随后 4.35 秒的变化。
图 8|模型根据 1.05 秒动作前缀预测后续 4.35 秒轨迹。
同一接口还支持从图像恢复人体姿态、为图像或视频生成描述,并让参考运动参与人物图像编辑。运动由此可以充当输入、输出和跨模态生成条件。
实验结果
实验覆盖 HumanML3D、MotionFix、Human3.6M、MoVid 等数据集。雷达图显示,UniMotion 是对比方法中唯一覆盖全部任务方向的模型。
图 9|七项任务的跨任务结果概览
论文在 Text-to-Motion、Motion-to-Text、动作预测、动作编辑和视觉人体恢复等任务上分别报告了有竞争力的结果;其中 Text-to-Motion 的分布指标并非全部最优,专用人体恢复模型也仍有更低误差。Text-to-Motion 的完整定量比较见论文表 3。
表 2|HumanML3D 上的 Text-to-Motion 结果。
项目页还给出了同一复杂提示下的定性比较。在「a person stomps up some stairs」案例中,动作需要连续抬腿、转移重心并表现踏步力度;UniMotion 对这些阶段的执行更完整。
图 10|MoMask、MotionGPT 与 UniMotion 在同一英文提示下的生成结果。
UniMotion 展示了统一多模态大模型接入连续、结构化非原生模态的一种方式:共享语义与推理能力,同时保留专属表示和生成接口。这一思路可服务于通用人体行为理解、数字人和内容创作,也为其他连续信号提供设计参照。
作者介绍
王梓懿、王鑫舜,北京大学深圳研究生院在读博士,研究方向为多模态大模型与人类运动;陈爽,东华大学在读本科生,研究方向为世界模型;丛杨,华南理工大学教授,研究领域为机器人自主操作、端侧智能与学习等等;刘梦源,北京大学深圳研究生院博导,研究领域为人类行为理解与机器人技能学习。
最近更新
- ECCV 2026|UniMotion:在统一多模态大模型中引入连续运动模态2026-08-16
- 隔代亲能厉害到什么程度?网友:能打败嫡长子的只有嫡孙子!2026-08-16
- 广西烟火·八桂粉事⑩|梧州河粉:汤鲜味美融三江2026-08-16
- 房产的持有成本如何影响租金?2026-08-16
- 秦L退场秦MAX接棒:比亚迪秦家族的一次自我修正2026-08-16
- 基金应对市场周期的策略有哪些类型?2026-08-16
- 新民体育|达成申花百场里程碑,高天意进球助攻一个都不能少2026-08-16
- 2026暑期档电影票房超95亿 “下半场”势头依旧强劲2026-08-15
- 男篮72-91乌拉圭1喜3忧!赵嘉义连爆,王俊杰+庞峥麟哑火!2026-08-15
- 5000万欧转会巴黎,费兰是巴萨队史转会费收入第5高的球员2026-08-15
- 斯诺克最新战报!周跃龙拒绝连输3局,单杆清台,桑坎姆仅得7分!2026-08-15
- 体彩为球迷准备的苏超“专属羊毛”今日上线2026-08-15
- 心里装着孩子 日子满是温柔2026-08-15
- 苹果AirPods Pro或迎重大升级,未来将推AI摄像头版本2026-08-15
- 瑞丽市常禾珠宝店(个体工商户)成立 注册资本6万人民币2026-08-15
- 佛山市志禾金属有限公司成立 注册资本30万人民币2026-08-15
- 佛山市三水区佳庆纸制品厂(个体工商户)成立 注册资本3万人民币2026-08-15
- 实话难听!曼联名宿称若现在选择俱乐部 会毫不犹豫加盟曼城2026-08-15
- 封闭式基金的赎回规则是怎样的?2026-08-15
- 玻璃基板验证窗口已开启 国产链迎AI封装爆发机遇2026-08-15
- 时报观察 DeepSeek试水峰谷定价 算力精细化运营料成常态2026-08-15
- 光纤、半导体两只大牛股紧急提示风险2026-08-15
- 中国建材(03323.HK)携北新建材等关联方增资中材高新,总金额约9834万元2026-08-15
- “海鲜专列”邀您上车!国铁南宁局加开79列动车组列车,助力北部湾开海节2026-08-15
- 合生创展(00754.HK)前7月总合约销售约37.73亿元2026-08-15
- 开盘:标普500微升,有望收获周线连涨2026-08-14
- 回购计划丨这家公司拟以5亿元-10亿元回购股份2026-08-14
- 天空:热刺早已为斯彭斯离队做好预案,已经开始物色替代人选2026-08-14
- 斯诺克赛程:决出4强,张安达周跃龙生死战,塞尔比阻击准世界第1!2026-08-14
- 太辰光:2026年半年度净利润1.76亿元 同比增长1.71%2026-08-14