Google Research 近期發表名為 TurboQuant 的一系列壓縮演算法,旨在突破大型語言模型(LLM)在推理過程中的記憶體瓶頸。這項技術能將 AI 模型的「KV cache」(鍵值快取)記憶體佔用空間縮小超過 6 倍,並使注意力運算速度提升最高達 8 倍,同時在基準測試中實現零精準度損失,預期將大幅改變 AI 推理的成本結構與應用範疇。
Google TurboQuant 革新AI推理效能
大型語言模型在處理對話時,需要記憶住使用者先前的所有輸入,這項機制即為 KV cache。然而,隨著對話長度增加,KV cache 會迅速佔用大量 GPU 記憶體,成為 AI 推理效能的一大限制。根據 Google Research 指出,TurboQuant 的核心在於優化這個記憶體密集型的環節,透過獨特的壓縮演算法,顯著提升 AI 運算效率而不犧牲結果品質。這項突破性技術的相關研究,包括將在 ICLR 2026 發表的核心 TurboQuant、於 AISTATS 2026 亮相的 PolarQuant,以及已在 AAAI 發表的 QJL 元件,顯示了 Google 在 AI 基礎建設上的持續投入。
此技術的實測數據令人矚目。Google 在 Llama-3.1-8B-Instruct、Gemma、Mistral 等開源模型上進行了多項基準測試,包括 LongBench、Needle In A Haystack 和 ZeroSCROLLS。結果顯示,TurboQuant 不僅將 KV cache 記憶體縮小 6 倍以上,更在 NVIDIA H100 GPU 上,使 4 位元 TurboQuant 的注意力運算比傳統 32 位元快了 8 倍。最關鍵的是,在所有測試任務中,精準度均達到零損失,這意味著壓縮並未影響模型理解與生成內容的準確性,顛覆了過往壓縮技術常需在效率與精準間取捨的困境。
核心技術解析:PolarQuant 與 QJL
TurboQuant 的運作機制可分為兩個主要步驟:高效壓縮與誤差修正。首先,由 PolarQuant 負責進行「換一種方式記錄」的壓縮。傳統 KV cache 中的向量常以直角座標儲存,需要較多位元來維持精確度。PolarQuant 則先對向量進行隨機旋轉,再轉換為極座標表示。這種轉換使得角度分布更為集中且可預測,可以直接映射到固定的圓形網格上進行壓縮,無需傳統方法中的額外正規化步驟或依賴資料建立編碼簿,大幅提升了壓縮效率。
其次,由 QJL(Quantized Johnson-Lindenstrauss)元件負責「用 1 個位元修正誤差」。任何壓縮技術都可能產生微小誤差,PolarQuant 壓縮後亦然。QJL 採用巧妙的方式,僅利用 1 個位元(正或負,+1 或 -1)來記錄這些殘差,幾乎不佔用額外空間,卻能有效將壓縮帶來的誤差消除至可忽略的程度。這兩項技術的結合,使得 TurboQuant 能夠將 KV cache 從 32 位元壓縮至僅剩 3 位元,並在不需重新訓練模型的情況下直接應用,大幅降低了實施門檻。
廣泛影響:從成本降低到邊緣裝置
TurboQuant 的問世,預計將對 AI 產業帶來深遠影響,涵蓋多個面向:
- 對話長度顯著提升:目前許多 AI 產品的對話長度受限於 KV cache 的記憶體容量。記憶體縮小 6 倍,意味著在相同硬體條件下,模型能支援更長的對話與更大的上下文視窗,提升使用者體驗。
- AI 推理成本大幅下降:GPU 記憶體是 AI 公司營運的主要成本之一。透過 TurboQuant,相同的 GPU 可同時服務更多使用者,因為每個使用者的 KV cache 佔用空間更小,從而有效降低單位服務成本。
- 邊緣裝置 AI 應用更可行:手機、筆記型電腦等邊緣裝置在運行大型 AI 模型時,記憶體不足是主要瓶頸。KV cache 縮小 6 倍,將使得過去因記憶體限制而無法在小型裝置上運行的模型,變得更具可行性。
- 搜尋引擎效能優化:Google 在論文中特別指出,TurboQuant 對搜尋和 AI 應用具有「深遠影響」。KV cache 壓縮不僅限於聊天機器人,任何需要處理長序列的 AI 任務,包括搜尋引擎的排名演算法和摘要生成,都將從中受益,加速資訊處理與回覆速度。
後續觀察與產業展望
Google TurboQuant 技術在基準測試中實現的零精準度損失,是其最大的亮點之一。這項成果若能在更大規模的實際部署中得到驗證,將對整個 AI 推理產業鏈產生革命性的影響。它不僅能有效解決 AI 運算資源的瓶頸,讓 AI 服務更具成本效益,也為 AI 技術從大型資料中心走向個人裝置,實現更廣泛的普及與應用,奠定了重要的基礎。