返回全部动态

Qwen-Drive-1.0:迈向自动驾驶视觉语言基础模型

原标题:Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving

arXiv cs.CV一手来源模型发布质量 86

AI 摘要

Qwen团队发布Qwen-Drive-1.0,这是首个面向自动驾驶的视觉语言基础模型,基于Qwen3.5-4B架构,集成3D感知、视觉问答和运动规划。模型通过外部BEV感知头和规划专家模块,在保持通用视觉语言能力的同时实现驾驶场景理解。实验显示其在3D感知和规划性能上具有竞争力,并已开源模型权重和代码。

以上摘要由 AI 生成,可能存在误差。事实请以原文为准。

正文节选

Qwen-Drive-1.0: An Initial Step towards a Vision-Language Foundation Model for Autonomous Driving Abstract We present Qwen-Drive-1.0, an initial step towards a vision-language foundation model for autonomous driving. Qwen-Drive-1.0 retains the architecture of the pretrained vision-language model (VLM) and integrates 3D perception, visual question answering, and motion planning within a unified framework. An external bird’s-eye-view (BEV) perception head jointly performs 3D object detection, sema


发布时间:2026-09-02 12:00
抓取时间:2026-09-02 12:35
来源机构:arXiv
阅读原文arxiv.org