Xspark AI联合多校发布视触世界模型DexTouch-WM
原标题:懂接触、会预判,视触世界模型来了
AI 摘要
Xspark AI(无界智航)联合香港科技大学(广州)、北京大学、香港大学、清华大学发布视触世界模型DexTouch-WM,面向灵巧手部交互,可同步预测未来视频画面与双手全覆盖精细触觉信息。该模型采用冻结预训练视频编解码网络、解剖感知触觉分词器与双模态联合注意力机制,并采集约100小时人类双手交互数据(50项任务)。评测显示,叠加100小时人类数据后触觉PSNR由24.813升至29.179,Contact-F1由0.551升至0.706,且可作虚拟策略评估器与合成交互数据生成器。
正文节选
机器人前瞻(公众号:robot_pro) 作者 | 周加琦 编辑 | 漠影 机器人前瞻9月20日报道,近日,Xspark AI(无界智航)联合香港科技大学(广州)、北京大学、香港大学、清华大学共同发布视触世界模型DexTouch-WM。 DexTouch-WM是一种以动作序列作为输入约束的视触世界模型,面向灵巧手部交互,可同步预测未来视频画面以及双手全覆盖的精细触觉信息。 此外,该模型还采集了100h的人类双手交互数据集,包含50项日常双手操作的任务。 在评测中,该团队固定5h真机数据,人类双手交互数据从0分别增加至10h、50h、100h进行测试。结果显示,触觉接触相关指标提升尤为显著,Contact-F1最高达到0.706。 一、视触融合,补上灵巧操作中的关键信息 手部灵巧操作包含大量物理接触细节,单凭视觉信息无法完整捕捉这类信息。有些动作看着几乎一模一样,但手部和物体间的接触压力、物体滑动或轻微卡滞的情况不同。当手掌遮住物体时,视觉上的信息缺失会更加严重。 现阶段视触融合类的世界模型,弥补了纯视觉模型无法建模接触力学、无法真实还原操作效果的缺陷。但现有方法同样存在局限,要么依赖高