跳到正文
Google Research·· 2026-03-25精选AI 评分62

Google 发布 TurboQuant 向量压缩算法,KV cache 压至 3 bit 无精度损失

TurboQuant: Redefining AI efficiency with extreme compression

AI 导读

Google 发布 TurboQuant 压缩算法,用于解决向量量化中的内存开销问题,并同时提出 QJL 和 PolarQuant 两种配套方法,三篇工作将分别亮相 ICLR 2026 和 AISTATS 2026。

推荐理由

Google 提出的向量量化方法把 KV cache 压到 3 bit 且不损失精度,读者可据此判断长上下文推理的内存成本走向。

来源:Google Research · research.google