Google TurboQuant 技術登場:KV 快取壓縮 6 倍、效能提升 8 倍,大摩稱為「另一個 DeepSeek 時刻」

Google 研究院於近期在官方部落格正式揭露名為「TurboQuant」的新型壓縮演算法,宣稱可在不犧牲模型準確度的前提下,將大型語言模型的 KV 快取記憶體占用量降低至少 6 倍,並在 H100 GPU 上實現最高 8 倍的效能提升。

Google 研究院於近期在官方部落格正式揭露名為「TurboQuant」的新型壓縮演算法,宣稱可在不犧牲模型準確度的前提下,將大型語言模型的 KV 快取記憶體占用量降低至少 6 倍,並在 H100 GPU 上實現最高 8 倍的效能提升。這項技術預計於 ICLR 2026 正式發表,由 Google 研究院研究科學家 Amir Zandieh 與副總裁暨 Google 研究員 Vahab Mirrokni 共同撰文說明。摩根士丹利(大摩)在評估後直言,此技術堪稱「另一個 DeepSeek 時刻」,可能從根本上改變 AI 部署的成本曲線。

傳統向量量化技術的瓶頸:壓縮反而增加負擔

在理解 TurboQuant 的突破性之前,有必要先釐清現有技術的侷限。Google 研究員在部落格中指出,AI 模型在處理資訊時仰賴「高維向量」作為基本單位,這類向量能捕捉影像特徵、詞語語意等複雜資訊,但同時也消耗龐大的記憶體資源,進而在 KV 快取環節形成效能瓶頸。

傳統的「向量量化」(Vector Quantization)技術雖能縮減高維向量的體積,但每個壓縮後的小區塊仍須存取額外的量化參數,導致每個數值反而增加 1 至 2 個位元(bit)的記憶體負擔。換言之,原本為了節省空間而設計的壓縮機制,在實際執行時往往抵銷了自身的效益——這是業界長期以來難以突破的矛盾。

TurboQuant 如何運作:兩階段壓縮流程

TurboQuant 的核心設計分為兩個步驟,分別對應其兩項子技術:PolarQuant 與 QJL(Quantized Johnson-Lindenstrauss)。

步驟一:高品質壓縮(PolarQuant)

PolarQuant 技術的關鍵在於改變向量的表示方式。傳統方法以 X、Y、Z 等直角座標描述向量,而 PolarQuant 則將向量轉換為「極座標」形式,以半徑(代表資料強度)與角度(代表資料方向)取代原有的座標系統。Google 以一個直觀的比喻說明:過去的描述是「向東走 3 個街區、向北走 4 個街區」,在新技術下則改為「以 37 度角走總共 5 個街區」。

這種轉換的實際效益在於,當資料被映射到固定且可預測的圓形網格後,邊界條件已知,不再像傳統方形網格那樣需要不斷調整邊界,因此可消除傳統量化方法必然承擔的記憶體額外負擔,同時省去昂貴的資料標準化(normalization)運算步驟。

步驟二:消除隱藏誤差(QJL 演算法)

第一階段壓縮後仍會殘留微小誤差,TurboQuant 在此引入 QJL 演算法作為「誤差修正器」。QJL 源自數學領域的 Johnson-Lindenstrauss Transform,能在壓縮高維資料的同時,保留資料點之間的距離與相對關係。具體而言,此演算法僅使用 1 個位元,即可將每個向量數值簡化為符號位元(+1 或 -1),建立一種高速的資料速記形式,且無需任何額外記憶體負擔。

為維持模型的注意力分數(attention score)準確性,QJL 還採用一種特殊估算器,在高精度查詢與低精度資料之間取得平衡,確保模型仍能正確判斷哪些輸入資訊重要、哪些可以忽略。

實驗數據:多項基準測試中的表現

Google 使用開源大型語言模型 Gemma 與 Mistral,在 LongBench、Needle In A Haystack、ZeroSCROLLS、RULER 及 L-Eval 等多個標準長上下文基準測試上,對 TurboQuant、PolarQuant 及基準方法 KIVI 進行評估。

結果顯示,TurboQuant 在「點積失真」(dot product distortion)與「召回率」(recall)兩項關鍵指標上均達到最佳表現,同時將 KV 快取記憶體占用量降低至少 6 倍以上。在「大海撈針」(Needle In A Haystack)長上下文任務中,TurboQuant 在所有基準測試均達到完美的下游任務表現,PolarQuant 亦幾乎未出現精度損失。

Google 進一步指出,TurboQuant 無需對模型進行訓練或微調,即可將 KV 鍵值快取量化至僅 3 個位元,且執行速度較原始 LLM 更快。在 H100 GPU 加速器上,4 位元 TurboQuant 相較於 32 位元未量化鍵值,效能提升最高可達 8 倍。與目前最先進的 PQ、RabbiQ 方法相比,TurboQuant 在高維向量搜尋任務中同樣維持更優異的召回率。

摩根士丹利的評估:效率提升還是成本結構重塑?

摩根士丹利在分析報告中對 TurboQuant 的短期與長期影響提出不同層次的解讀。

就短期而言,大摩指出,TurboQuant 主要針對推論階段的 KV 快取進行壓縮,對模型權重(GPU/TPU 上的高頻寬記憶體使用量)與訓練工作負載並無直接影響。然而,它能讓相同硬體支援 4 至 8 倍更長的上下文視窗,或在不耗盡記憶體的情況下處理更大的批次大小(batch size)。因此,大摩強調,這並非整體記憶體或硬體需求降低 6 倍,而是「每顆 GPU 吞吐量的效率提升」。

就長期而言,大摩援引「傑文斯悖論」(Jevons Paradox)概念說明,效率提升往往反而推動總需求增加。從這個角度來看,TurboQuant 與其說是漸進式的技術優化,不如說是「改變 AI 部署的成本曲線」,大摩因此以「另一個 DeepSeek 時刻」來定位這項技術的潛在影響力。

後續觀察

目前 Google 與 NVIDIA 均已各自提出針對 KV 快取的壓縮技術,前者為 TurboQuant,後者為 KVTC,兩者的技術路徑與應用場景存在差異,業界正密切觀察這兩條技術路線的後續發展。Google 表示,TurboQuant 除了改善大型語言模型的 KV 快取瓶頸,預期還將有更多應用場景,尤其在大規模向量索引的建立與查詢方面,有望使 Google 的語意搜尋服務變得更快速且更具效率。TurboQuant 正式論文將於 ICLR 2026 發表,PolarQuant 則預計在 AISTATS 2026 亮相,屆時外界將可對其技術細節進行更深入的學術審視與驗證。

常見問題

TurboQuant 是什麼技術?

TurboQuant 是 Google 研究院開發的新型壓縮演算法,專為大型語言模型的 KV 快取與向量搜尋設計。它透過 PolarQuant(高品質壓縮)與 QJL(誤差修正)兩階段流程,在不損失模型準確度的前提下,將 KV 快取記憶體占用量降低至少 6 倍,並在 H100 GPU 上實現最高 8 倍效能提升。此技術預計於 ICLR 2026 正式發表。

TurboQuant 為何被稱為「另一個 DeepSeek 時刻」?

摩根士丹利在分析報告中以「另一個 DeepSeek 時刻」形容 TurboQuant,認為此技術不只是漸進式優化,而是可能從根本上「改變 AI 部署的成本曲線」。大摩指出,若模型能在顯著降低記憶體需求的情況下維持效能,每次查詢的服務成本可大幅下降,進而提升 AI 部署的獲利能力,並透過「傑文斯悖論」效應推動整體 AI 需求持續增長。

TurboQuant 會降低 GPU 硬體需求嗎?

根據摩根士丹利的分析,TurboQuant 並非使整體記憶體或硬體需求降低 6 倍,而是提升每顆 GPU 的吞吐效率。具體而言,它可讓相同硬體支援 4 至 8 倍更長的上下文視窗,或在不耗盡記憶體的情況下處理更大的批次大小,屬於效率提升而非硬體需求的直接削減。