Google Research·· 2026-03-25精选AI 评分62
Google 发布 TurboQuant:面向 KV cache 的极端压缩算法
TurboQuant: Redefining AI efficiency with extreme compression
AI 导读
Google Research 提出 TurboQuant 压缩算法,可在零精度损失下把 KV cache 量化到 3 bit,无需训练或微调。它由 PolarQuant 与 QJL 两步组成:前者对随机旋转后的向量做高质量量化,后者用 1 bit 残差消除偏差。
推荐理由
Google 提出免训练、免微调的 KV cache 压缩方法,并给出 Gemini 等长上下文场景的量化与加速数据。
来源:Google Research · research.google