DeepSeek 視覺模型直球對決 Claude Opus 4.8!中國新創的超車野望能走多遠?

事件總覽:從純文本殺手級應用,到現在把觸角伸進視覺理解戰場——DeepSeek 在 2026 年 8 月 21 日丟出實驗性多模態模型 V4-Flash-Vision-Exp,直接拿 Anthropic 的高階模型 Opus 4.8 當作對照組,這場較量才剛開始。

事件總覽:從純文本殺手級應用,到現在把觸角伸進視覺理解戰場——DeepSeek 在 2026 年 8 月 21 日丟出實驗性多模態模型 V4-Flash-Vision-Exp,直接拿 Anthropic 的高階模型 Opus 4.8 當作對照組,這場較量才剛開始。

先說重點:DeepSeek 這次不是推全新旗艦,而是在既有 V4-Flash 架構上疊加視覺理解能力。換句話說,他們把本來就很能打的純文本模型,裝上了一雙眼睛。

根據 DeepSeek 官方在 X 平台的發布,這款實驗性模型「V4-Flash-Vision-Exp」已經在 DeepSeek API 平台上線。官方宣稱它在純文本能力——包含 Agent 任務、推理、世界知識——與 V4-Flash 正式版持平,而在需要視覺理解的 Agent Benchmark 上,比起純文本版本有「大幅躍升」。多模態 Agent 能力則已接近 Anthropic 的 Claude Opus 4.8。

接近,不是超越。這個用詞本身就有意思了。

Anthropic 的 Claude Opus 4.8 是目前市場上公認最強的多模態模型之一,尤其在視覺推理與工具協作場景上,少有對手能與之匹敵。DeepSeek 敢拿它來當標竿,本身就是一種態度:我們來了,而且我們不是來當陪榜的。

在此之前,DeepSeek 其實已經發布過 DeepSeek-VL 系列等多模態模型,但那些更像是「試水溫」的產品。這次直接把多模態能力嫁接到最頂級的 V4 系列上,商業意圖非常明確——他們要讓開發者可以在同一個模型系列裡,同時處理純文本與視覺理解任務,不用為了看圖而切換到次級模型

這招其實很聰明。模型系列單一化,對開發者來說就是降低切換成本,對 API 的黏著度自然會提高。

從技術規格來看,DeepSeek 這波 API 支援做得相當到位。多模態 API 支援 Chat Completions、Messages、Responses 三種格式調用,可以輕鬆接入各種 Agent 工具。圖片傳入方式也給了三種:base64 內聯、外部 URL、Files API。換句話說,開發者幾乎不用改太多既有架構,就能讓原本的純文本 Agent 開始「看見」東西。

話說回來,實驗性模型畢竟還是實驗性。DeepSeek 自己在發布時特別強調了「Experimental」這個標籤,這不是謙虛,而是必要的免責。模型的穩定性、響應速度、邊界案例的處理能力,通常都需要好幾個月的實戰驗證才能成熟。現在說「接近 Opus 4.8」,更像是給市場一個預告——真正的重磅版本可能還在後面。

📅 2026年08月:DeepSeek 發布 V4-Flash-Vision-Exp

DeepSeek 在 8 月 21 日透過官方 X 帳號宣布,實驗性多模態模型 V4-Flash-Vision-Exp 正式上線 API 平台。這款模型基於旗艦純文本模型 V4-Flash 開發,新增圖像與螢幕截圖理解能力。官方強調,其在多模態 Agent 評測上已接近 Anthropic Claude Opus 4.8 的水準。這直接導致了市場對中國 AI 模型與美國頂級模型之間技術差距的重新評估——過去大家認為視覺理解是中國模型的短板,現在這個差距正在快速收窄。

📅 2026年07月:V4-Flash 純文本版本發布

DeepSeek 正式推出 V4-Flash,作為其新一代旗艦純文本模型,主打 Agent 任務、推理能力與世界知識的綜合表現。該模型發布後在開發者社群中獲得相當不錯的迴響,尤其在中文語境下的 Agent 任務表現被認為是頂尖水準。不過當時市場上也有一股聲音:純文本模型再強,沒有視覺能力,在真實世界應用場景中就是缺一條腿。

📅 2025年-2026年上半年:DeepSeek-VL 系列試水溫

DeepSeek 陸續推出 DeepSeek-VL 系列多模態模型,但這些產品主要定位於特定場景應用,並未整合進主力模型系列。這段期間,市場上對 DeepSeek 的多模態策略始終存在疑問——他們到底有沒有決心做大視覺模型?還是只是「有做就好」?這次 V4-Flash-Vision-Exp 的出現,某種程度上回答了這些質疑。

📅 2024年-2025年:中國 AI 模型軍備競賽白熱化

中國 AI 新創公司在純文本大語言模型上陸續追上 GPT-4 水準,但在多模態領域始終落後於 OpenAI 和 Anthropic。DeepSeek 在此期間主要以「高性價比」著稱,其 API 定價策略被許多開發者視為「窮人版的 Claude」。然而性價比終究不是護城河,技術實力才是。這次往視覺理解推進,正是他們試圖翻轉這個標籤的關鍵一步。

做個簡單的整理,讓大家看清楚這段時間發生了什麼事:

編輯觀點:從產業面來看,DeepSeek 這步棋與其說是技術突破,不如說是「生態卡位」。Anthropic 的 Opus 4.8 確實強大,但它的 API 價格也同樣「強大」。DeepSeek 過去靠高性價比打出一片天,這次如果能把接近 Opus 4.8 的多模態能力,配上更有競爭力的價格,對那些預算有限但又需要視覺理解能力的開發者來說,會是非常有吸引力的替代方案。問題只在於「接近」這兩個字,在實際應用場景裡到底是 90 分還是 70 分。如果是後者,那這波操作就只是宣示意味大於實質;如果是前者,那 Anthropic 真的該緊張了。接下來三個月,開發者社群的實測反饋,會是這款模型真正的生死門。

對一般人來說,這些模型之間的戰爭可能看起來很遙遠。但其實它跟你有關——當你用的 AI 助理可以「看懂」你貼的截圖、分析你上傳的圖表、甚至幫你解讀產品照片裡的細節時,你的工作效率會產生質變。這不是未來的事,而是現在正在發生的事。

如果往後推演,DeepSeek 這步棋真正的戰略意義可能在於:他們正在把多模態能力從「奢侈品」變成「標配」。過去你要用頂級的視覺理解模型,只能找 OpenAI 或 Anthropic,價格高、限制多。現在 DeepSeek 跳進來,等於告訴市場——這東西不該那麼貴,也不該那麼難用。

最後一個有趣的觀察點:DeepSeek 選在 8 月下旬發布,距離年度開發者大會通常的舉辦時間不遠。這會不會只是前菜?真正的主菜還在後面?我的猜測是,這個實驗版本是用來收集真實場景數據的,等到反饋足夠、模型穩定之後,他們很可能會在短期內推出正式版 V4-Flash-Vision。到那個時候,才是真正硬碰硬的開始。

所以,開發者們,該去 DeepSeek API 平台玩玩了。實驗性模型雖然不穩定,但這也正是你最該測試的時候——等它變穩定了,價格可能就不是現在這個價格了。

本文改寫整理自公開新聞來源,原始報導由科技新報發布。

常見問題 FAQ

DeepSeek V4-Flash-Vision-Exp 跟 V4-Flash 有什麼不同?

V4-Flash-Vision-Exp 是 V4-Flash 的實驗性多模態版本,多了圖像和螢幕截圖的理解能力,純文本能力則維持一致。

這個模型真的比得上 Anthropic Claude Opus 4.8 嗎?

官方說法是「接近」,在多模態 Agent 評測上已接近 Opus 4.8 的水準,但實際表現仍需開發者實測驗證。

開發者要怎麼使用這個模型?

可以透過 DeepSeek API 平台調用,支援 Chat Completions、Messages、Responses 三種格式,圖片可透過 base64、外部 URL 或 Files API 傳入。

這個模型是免費的嗎?

目前是透過 DeepSeek API 提供,計費方式請參考 DeepSeek 官方 API 定價頁面,實驗性模型的價格通常會低於正式版。

※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。