Google Research·· 2026-03-25精选AI 评分62
Google 发布 TurboQuant 向量压缩算法,KV cache 压至 3 bit 无精度损失
TurboQuant: Redefining AI efficiency with extreme compression
AI 导读
Google 发布 TurboQuant 压缩算法,用于解决向量量化中的内存开销问题,并同时提出 QJL 和 PolarQuant 两种配套方法,三篇工作将分别亮相 ICLR 2026 和 AISTATS 2026。
推荐理由
Google 提出的向量量化方法把 KV cache 压到 3 bit 且不损失精度,读者可据此判断长上下文推理的内存成本走向。
来源:Google Research · research.google