Qwen-Drive 1.0 tells you why it brakes, just don't expect the explanation to match the maneuver

Qwen-Drive 1.0 tells you why it brakes, just don't expect the explanation to match the maneuver

AI News Bot
2026-09-08
預計閱讀 1 分鐘原文來源

Qwen‑Drive 1.0:同時掌握感知、問答與路徑規劃的多任務模型

Qwen‑Drive 1.0 是阿里巴巴研究部門推出的自駕車 AI,首次在單一模型內同時完成三件事:

  1. 空間感知——以三維方式辨識環境中的物件與道路布局;

  2. 交通問答——針對路況提出文字解說;

  3. 路徑規劃——預測車輛未來的行駛動作。

研究人員指出,僅靠「文字‑影像」模型描述照片,並不等於能自動理解三維空間。過往的自駕模型多採用先前的通用文字‑影像模型,再以大量交通問答資料微調。此法有兩大缺陷:

  • 距離與位置判讀不足:模型仍無法可靠估算物體的遠近與佔位情形。
  • 災難性遺忘(catastrophic forgetting):過度專注於駕駛資料會使原本的廣泛常識被遺忘,導致在罕見或突發交通情境下缺乏應變能力。

兩大新增模組的設計與效能

Qwen‑Drive‑1.0 以 2 月發布的 Qwen3.5‑4B 為基礎,額外加入兩個關鍵元件:

| 模組 | 功能說明 | |------|----------| | 鳥瞰圖生成器 | 透過 3D 目標偵測將影像轉換為俯視圖,標示佔用區域與道路走向,同時充當「測量工具」,揭示模型實際從影像中抽取的空間資訊量。 | | 規劃專家(Planning Expert) | 以內部模型資料規劃未來車輛動作,並在訓練時只調整此模組,會發現空間精度仍偏低,說明僅有描述能力的模型無法自動掌握三維概念。只有同時對視覺‑語言模型本身進行空間任務訓練,才能顯著提升表現。 |

訓練流程分為四階段:先訓練感知模組 → 結合感知與問答 → 加入路徑規劃 → 最後以強化學習微調行為。視覺‑語言部分匯集了 24 個公開的交通場景資料集,儘管來源格式不一且偶有錯誤,研究團隊利用 AI 進行問題‑答案標準化,並自行製作「為何要煞車」的說明範例,讓模型能以因果方式解釋決策。

與車載平台的整合考量

現代車輛的資訊娛樂系統與自駕控制系統正趨向共用單一運算平台,取代過去分別由兩套控制器執行的架構。若僅以「純駕駛效能」為目標調校模型,仍需為對話或開放式問題保留另一套模型與額外運算資源,無法真正簡化硬體配置。Qwen‑Drive 以同時支援多任務的方式,為未來車內 AI 整合提供了更具成本效益的路徑。

未來展望與讀者啟示

Qwen‑Drive 1.0 的實驗結果顯示,「描述」不等於「理解」;要讓自駕車在真實道路上做出合理解釋,必須在模型訓練階段刻意植入空間推理能力。隨著硬體算力持續提升,未來的車載 AI 有望在單一模型內兼顧感知、語意解說與決策規劃,進一步提升乘客對車輛行為的信任感。對於關注自動駕駛安全與可解釋性的讀者而言,這代表未來的車輛不僅會「告訴你」為何煞車,更會在背後提供更貼近人類直覺的空間認知。

分享