新闻动态

在游戏设立责任室中九游体育娱乐网,动画师持续濒临这么的困扰:为了让变装能更当然的"步碾儿""转圈",不得不反复微调骨骼或者逐帧手动摆出几十个姿势。
淌若只需一句辅导,比如"一个东谈主走两步,然后跳起来",就能自动生成畅达传神的 3D 手脚,动画制作的方式将被透澈改写。
为此,北京大学提倡了ReMoMask:一种全新的基于检索增强生成的 Text-to-Motion 框架。它是一个集成三项枢纽翻新的长入框架:(1)基于动量的双向文本 - 手脚模子,通过动量队伍将负样本的法子与批次大小解耦,显耀提高了跨模态检索精度;(2)语义时空崇敬力机制,在部件级交融经由中强制实施生物力学拘谨,排斥异步伪影;(3)RAG- 无分类器疏导纠合轻捷的无条目生成以增强泛化才略。
基于 MoMask 的 RVQ-VAE,ReMoMask 在最少要领内高效生成期间连贯的手脚。
在法子基准测试上的多量实验标明,ReMoMask 达到了来源进的性能,与之前的 SOTA 方法 RAG-T2M 比较,在 HumanML3D 和 KIT-ML 上折柳罢了了 3.88% 和 10.97% 的 FID 分数升迁。
ReMoMask 举座架构
东谈主体剖析生成因其鄙俚适用于游戏、电影制作、造谣履行和机器东谈主等领域而备受宝贵。比年来,关联盘问勇猛于合成万般且传神的剖析,以裁减手动动画本钱并升迁本色创作遵守。传统方法包括两个处所,t2m 模子和 RAG-t2m 模子。
固然传统的 t2m 模子不祥生成较为精准的手脚,而 RAG-t2m 模子则进一步升迁了生成的手脚的万般性,但这两类方法仍然濒临两个中枢挑战(如图 1):
问题一:负样本太少。因为手脚检索器是用小批量数据试验的,模子见到的"造作样本"太有限,学到的清晰就不够矜重。
问题二:信息交融太粗拙。将手脚序列闹翻化为 1Dtoken,并将文本条目和检索学问胜利拼接到 1Dtoken 上,模子没法深度剖析翰墨 - 时空 - 检索学问之间的预见。

△图 1 现存 t2m 方法对比
团队基于以上问题,盘问新的 RAG-t2m 试验范式,既能救济更大边界的负样本,又能罢了更强的信息交融机制。
中枢方法
为了同期保证手脚的期间动态和空间结构质地,团队领先通过2D RVQ-VAE 编码器将整段手脚量化为二维时空 token map。
生成经由中,从全掩码的二维 token map运行,ReMoMask 使用细粒度双向动量文本 - 手脚检索器(Part-Level BMM Retriever)索取关联的文本与手脚特征。
该检索器通过双向动量建模 ( BMM ) 试验,从而构建了一个大边界的负样本池,升迁了检索遵守。
这些检索到的特征被输入到掩码 Transformer中,并通过语义时空崇敬力 ( SSTA ) 交融,罢了强语义对皆,为中枢手脚结构的重建提供率领。
临了,残差 Transformer敌手脚细节进行精修,生成的隐空间手脚向量再通过2D RVQ-VAE 解码器还原为最终的手脚序列。

△图 2 ReMoMask 框架图
双向动量建模 ( BMM )
BMM 遴荐两套动量编码器,折柳孤寒两个负样本队伍,用于存放文本和手脚的负样本。
在试验的每一步,现时小批量样本通过动量编码器编码得到的负样本会被加入队伍,同期最早的样本则从队伍中移除。这么的设想将负样本池的边界与小批量大小解耦,允许对比学习应用更大边界的负样本集。
此外,这两套动量编码器通过对对应的在线编码器进行指数移动平均更新,从而保证负样本在期间上的一致性和剖析性。

△图 3 BMM 清晰图与伪算法
语义时空崇敬力 ( SSTA )
语义时空崇敬力(SSTA)机制区别于以往仅生成一维 token map、冷漠枢纽间空间关系的 VQ 量化方法。SSTA 通过二维 RVQ-VAE 将剖析序列编码为二维 token map,同期捕捉期间动态特征并团员空间信息。
在后续的生成阶段,该二维 token map 会被展平,并通过再行界说 Transformer 层中的 Q、K、V 矩阵,与文本镶嵌、检索到的文本特征以及检索到的剖析特征进行交融。
与简便的条目拼接方式比较,这一高效的信息交融机制不祥在文本疏导、检索学问、剖析的期间动态及空间结构之间罢了更全面的对皆,从而同期升迁生成的精准性与泛化才略。

△图 4 SSTA 清晰图性能与遵守
性能上风
盘问团队在生成和检索两大方朝上对方法进行了考证,并在主流基准数据集 HumanML3D 和 KIT-ML 上开展了全面评测。
在手脚生成任务中,ReMoMask 框架在 R-Precision 和 FID 等中枢诡计上均获取了优异进展:在 HumanML3D 上生成手脚的 MM DIST 为 2.865,进取现时先进的传统 T2M 方法;在 KIT-ML 上生成手脚的 FID 达到 0.138,优于现存的 SOTA RAG-T2M 方法。

△表 1 手脚生成实验 - 实验轨则
在两个检索任务中,R1、R2、R3 诡计都获取了 SOTA 水平,阐发 ReMoMask 的跨模态检索才略进展出色。

△表 2 手脚 - 文本跨模态检索实验 - 实验轨则
遵守展示
图 5 是 ReMoMask 生成的一些手脚示例,不错不雅察到 ReMoMask 生成的手脚序列连贯且妥当辅导要求。

△图 5 ReMoMask 生成的手脚的可视化遵守
盘问团队还将其 ReMoMask 的可视化遵守与其他主流模子进行比较,并以问卷款式齐集了测试参与者的主见。图 6 和图 7 轨则显现较多的测试者以为 ReMoMask 所生成的手脚序列质地较高且妥当文本边幅。

△图 6 ReMoMask 与主流模子的可视化遵守对比

△图 7 用户盘问轨则,左图为手脚 - 质地用户盘问,右图为文本 - 手脚关联性用户盘问
论文一语气:https://arxiv.org/abs/2508.02605
GitHub:https://github.com/AIGeeksGroup/ReMoMask
款式主页:https://aigeeksgroup.github.io/ReMoMask
一键三连「点赞」「转发」「留神心」
宽待在驳斥区留住你的念念法!
— 完 —
� � 点亮星标 � �
科技前沿进展逐日见九游体育娱乐网

