安謀(Arm)全球儲存業務負責人John Xavier Lionel於2026年6月23日在GMIF 2026全球記憶體產業創新高峰會上提出震撼觀點:隨著生成式AI從雲端向終端設備大規模部署,記憶體已不再是配角,而是直接決定AI系統能力上限的關鍵變數。
Lionel指出,AI推理的解碼(Decode)階段需要持續且高頻率地存取KV Cache,這意味著記憶體的容量、頻寬以及資料傳輸效率,將直接決定系統的響應速度與吞吐量。
更令人驚訝的是,Token已成為衡量AI營運成本的重要指標。假設有100萬台設備,每天進行20次AI互動,每次互動產生500個Token,那麼單日產生的Token總量便高達100億。每一次互動背後,都涉及運算、記憶體、網路與能耗等多重成本;只要儲存效率提升一點,整體開銷就能大幅下降。
面對龐大的邊緣AI需求,Lionel提出了清晰的工作負載分層架構:喚醒詞檢測、異常檢測等輕量級任務,適合在低功耗終端直接執行;AI助手、多模態交互等複雜任務,則由手機、PC、XR裝置與機器人等高效能邊緣設備承擔;產業專用模型與智慧端服務應實現可靠的邊緣本地化;而超大規模模型的訓練與推理仍保留在雲端。這種「端—邊—雲」協同模式,本質上是將儲存壓力合理分散,避免資料在單一節點堵塞。
Lionel的演講為記憶體產業指明了新方向:未來的AI競爭不僅是算力之爭,更是儲存架構之爭。誰能有效解決邊緣側的KV Cache存取效率問題,並降低每個Token的運營成本,誰就能在AI終端浪潮中搶得先機。
FACT BOX · 重點整理
- 來源:PR Times
- 分類:活動
- 原文日期:2026年GMIF高峰会(6月23日)
- 產品、服務:KV Cache最適化技術