返回全部动态

DreamTraj:通过读取未渲染的视频扩散潜变量生成 6-DoF 物体轨迹

原标题:DreamTraj: Generating 6-DoF Object Trajectories by Reading Unrendered Video Diffusion Latents

Hugging Face Daily Papers一手来源研究质量 83

AI 摘要

DreamTraj 提出一种新方法,从单张 RGB 图像和语言指令直接预测物体的 6-DoF 轨迹,通过读取冻结的图像到视频扩散模型在早期去噪步骤中的内部表示,而非生成视频后再提取运动。该方法还引入了 MOVE 数据集,包含 5,038 个带细粒度语言注释的以物体为中心的自我中心轨迹。DreamTraj 在平移和旋转预测上均达到最先进水平,且比生成后提取的流程快 4.6 倍。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

DreamTraj: Generating 6-DoF Object Trajectories by Reading Unrendered Video Diffusion Latents Abstract Accurate prediction of object trajectories during manipulation is essential for closing the perception-action loop. Progress is limited on two fronts: available datasets lack fine-grained language-to-motion annotations, and existing predictors either rely on privileged inputs such as video, depth, or CAD models, or recover motion from fully generated videos through costly, error-prone perceptio


发布时间:
抓取时间:2026-08-04 17:28
来源机构:Hugging Face
阅读原文huggingface.co