跳到正文
原文
Google Research·· 2026-03-25精选AI 评分62

Google 发布 TurboQuant:面向 KV cache 的极端压缩算法

TurboQuant: Redefining AI efficiency with extreme compression

AI 导读

Google Research 提出 TurboQuant 压缩算法,可在零精度损失下把 KV cache 量化到 3 bit,无需训练或微调。它由 PolarQuant 与 QJL 两步组成:前者对随机旋转后的向量做高质量量化,后者用 1 bit 残差消除偏差。

推荐理由

Google 提出免训练、免微调的 KV cache 压缩方法,并给出 Gemini 等长上下文场景的量化与加速数据。

来源:Google Research · research.google