AI 看圖說故事竟會憑空捏造?視覺幻覺正考驗自動駕駛與醫療診斷的信任極限

大型語言模型(LLMs)的進化速度驚人。從 ChatGPT 到 Claude,它們不再只是會聊天的文字接龍機器,現在還學會了「看圖說故事」。然而,當這些 AI 開始分析醫學影像或判斷自動駕駛車前的路況時,一個名為「視覺幻覺(Visual Hallucinations)」的系統性缺陷,正讓學界繃緊神經。

大型語言模型(LLMs)的進化速度驚人。從 ChatGPT 到 Claude,它們不再只是會聊天的文字接龍機器,現在還學會了「看圖說故事」。然而,當這些 AI 開始分析醫學影像或判斷自動駕駛車前的路況時,一個名為「視覺幻覺(Visual Hallucinations)」的系統性缺陷,正讓學界繃緊神經。根據《Communications of the ACM》近期報導,這些模型在處理圖像時,常會生成看似頭頭是道、實則荒謬或錯誤的輸出——問題在於,在多數關鍵應用場景裡,人類根本不會發現它在唬弄。

不只是文字胡謅:當 AI 的眼睛開始背叛現實

過去我們熟悉的幻覺,多半是 AI 在對話中引用了不存在的文獻或錯誤的歷史日期;但視覺幻覺的層次更複雜。諾丁漢大學(University of Nottingham)電腦視覺副教授 Michael Pound 點出核心矛盾:這些模型是「統計學上的合理性」的產物,而非「真理」的信徒。它們沒有內建的現實校準機制,只是根據機率分布去猜測「接下來該生成什麼像素或文字」。

柏克萊人工智慧研究實驗室(BAIR)的博士後研究員 David Chan 則提出一個尖銳的觀察:人類固然會看錯,但大眾對 AI 的期望值是「它必須比人類更可靠」。偏偏在現實場景中,當背景資訊與圖像內容出現細微矛盾時,AI 的幻覺頻率就會直線上升——這種不穩定性,對自駕車的障礙物判斷或監控系統的異常行為偵測來說,都是致命傷。

編輯觀點:說實話,我覺得台灣業界對這件事的警覺還不太夠。大家忙著導入生成式 AI 提升效率,卻很少追問:「萬一它看錯圖怎麼辦?」尤其在醫療輔助診斷與工廠自動化品管這兩個領域,視覺幻覺的代價可能是一場訴訟或一條產線的報廢。與其盲目追求模型的多模態炫技,不如先扎實建立「信心分數」的檢核機制。至少,別讓 AI 在你不會複查的地方犯錯——這才是現階段負責任的做法。

醫療與盲人輔具的高風險:使用者無法複查的信任危機

Michael Pound 在訪談中提到一個令人背脊發涼的案例:在醫學影像分析中,如果訓練資料摻入了其他病患的干擾數據,AI 可能完全忽略影像中實際存在的病變跡象。這不是模型不夠聰明,而是它根本沒在「看」——它只是在比對統計模式。

這種風險在盲人輔助科技上更顯得無情。當視障者仰賴 AI 描述周遭環境時,他們無法像明眼人一樣「自己看一眼確認」。如果 AI 描述前方是平坦路面但其實有階梯,這不是便利性的問題,而是安全問題。這類「使用者無法自行驗證」的情境,正是視覺幻覺殺傷力最大的修羅場。研究人員坦言,現有的後驗證(post-hoc verification)方法不僅效率低落,還得動用另一個 AI 來檢查前一個 AI 的錯誤——這種疊床架屋的設計,怎麼看都不是長久之計。

REVERSE 框架登場:從「拒絕錯誤」進化到「即時修正」

為了解決驗證速度過慢的痛點,學界近期提出全新的 REVERSE 框架。它的核心邏輯不是等 AI 講完再來抓錯,而是在生成過程中同步檢查。具體做法是:訓練模型將描述圖像的每個詞語分類為「自信」或「不自信」,並即時給予信心評分,一旦分數過低就立刻修正。

David Chan 將這套機制形容為一種「推論技巧」,讓已部署的系統能根據預期錯誤率動態調整回應。雖然這仍屬於「頭痛醫頭」的治標策略,但至少比過去那種只能拒絕回應、無法修正錯誤的笨方法聰明多了。不過,要真正從源頭防堵幻覺,研究人員的最終目標仍是發展視覺推理(visual reasoning)——讓模型真正理解圖像的幾何結構與外觀邏輯,而不是只做表面的文字與像素配對。

展望與影響:信任是 AI 應用最後一哩路

從產業發展的角度來看,視覺幻覺不是一個可以靠「蒐集更多數據」就能解決的工程問題,它本質上是當前生成式 AI 架構的天生缺陷。只要模型還是基於機率的預測引擎,它就永遠有機率猜錯。對於台灣正積極布局的自駕車供應鏈、智慧醫療新創,以及仰賴影像辨識的電子製造業來說,現在就該把「容錯設計」納入產品規格,而不是假設 AI 永遠正確。

話說回來,這也不是要大家因噎廢食。REVERSE 框架這類嘗試至少證明學界正在務實地解決問題。但一個更根本的哲學問題是:我們願意把多少生命財產安全,交給一個「沒有真理觀」的統計模型?這個答案,恐怕會決定 AI 在關鍵領域的滲透速度。

行動呼籲:如果你是產品經理或技術決策者,請在下次評估 AI 解決方案時,把「視覺幻覺發生率」寫進驗收標準裡。如果你只是一般使用者,下次看到 AI 生成的影像分析結果,不妨多問一句:「這真的假的?」——養成對 AI 輸出保持適度懷疑的習慣,可能是數位時代最划算的生存技能。

本文改寫整理自公開新聞來源,原始報導由Yahoo奇摩新聞發布。

常見問題 FAQ

視覺幻覺和一般的 AI 幻覺有什麼不同?

一般幻覺指文字回應中的事實錯誤,視覺幻覺則是模型在分析圖像時生成與實際畫面不符的描述,例如忽略病徵或誤判障礙物,影響層面更涉及安全關鍵應用。

REVERSE 框架能完全解決視覺幻覺問題嗎?

不能完全解決,它屬於即時驗證的改善機制,能在生成過程中同步檢查並修正低信心的詞彙,但學界認為最終仍需從源頭發展視覺推理技術來根治。

哪些應用場景最容易受到視覺幻覺影響?

自動駕駛、醫學影像診斷、盲人輔具、安全監控等使用者無法輕易複查或後果嚴重的領域風險最高,模型誤判可能直接影響人身安全。

目前業界有標準方法來檢測視覺幻覺嗎?

尚未有統一標準,主要依賴後驗證或信心評分機制,但效率低落。REVERSE 框架是近期較受矚目的創新,不過離商業化落地仍有距離。

※ 此篇文章由 AI 改寫或生成,內容僅供參考,可能存在錯誤或不準確之處。