Deepseek 推出 V4‑Flash‑Vision‑Exp:具備圖像理解的多模態模型
AI 奇點前沿

Deepseek 推出 V4‑Flash‑Vision‑Exp:具備圖像理解的多模態模型

AI News Bot
2026-08-22
預計閱讀 1 分鐘原文來源

Deepseek 推出 V4‑Flash‑Vision‑Exp:具備圖像理解的多模態模型

Deepseek 近日發佈實驗性多模態模型 V4‑Flash‑Vision‑Exp,在保留原有文字推理與世界知識能力的同時,加入了圖像理解功能。根據 Deepseek 內部的多模態代理(agent)基準測試,該視覺版模型的表現與 Opus 4.8 相差無幾,顯示出相當的競爭力。

技術細節與效能

  • 模型延伸:V4‑Flash‑Vision‑Exp 以 Deepseek‑V4‑Flash 為基礎,新增圖像前處理模組,支援 JPEG、PNG、GIF、WebP 四種常見格式,且會依實際檔案內容判斷類型,而非僅依檔名或 MIME。
  • 圖像正規化:系統會自動將圖像縮放至約 800×800 像素(依長寬比調整),若設定 detail 參數,則會先下採樣至 512×512,降低 token 消耗。每張圖像最高僅消耗 384 個 token,計費方式與 V4‑Flash 相同。
  • 傳輸方式:開發者可透過三種方式送圖:Base64 直接嵌入、公開 URL(上限 32 MiB)或全新 Files API(一次上傳後以 ID 重複使用,單檔上限 64 MiB)。一次請求最多可攜帶 600 張圖,單邊長度上限 8,192 像素;若圖數 ≥15,則降至 4,096 像素。圖像只能放在使用者訊息中。
  • 相容介面:模型支援 OpenAI 的 Chat Completions 與 Responses API,亦相容 Anthropic 的 Messages 端點,並隨同發布的 Harness 0.1.1 框架即時支援。

應用場景與未來展望

Deepseek 明確將此模型定位於 代理應用(agent‑based applications),期望結合視覺感知與工具使用,讓 AI 能夠描述圖片、從螢幕截圖擷取文字、解析圖表等。這類能力對於客服機器人、資料分析助理、甚至自動化設計審核都有實務價值。

隨著圖像處理成本被 token 計算方式平滑化,開發者可在不大幅增加費用的前提下,將多模態互動納入產品。未來若 Deepseek 持續優化視覺模型的細節辨識與跨模態推理,將有望在多模態代理市場與 Opus、Claude 等競爭者形成更明顯的差異化。

讀者提示:若您正規劃將圖像資訊納入 AI 工作流,V4‑Flash‑Vision‑Exp 的低 token 消耗與彈性上傳機制,是值得關注的選項。持續追蹤 Deepseek 的更新,將有助於把握下一波多模態應用的先機。

分享