跳到正文
原文
Google Research·· 2026-03-25精选AI 评分62

Google 发布 TurboQuant 压缩算法,KV cache 可压至 3 bit 且无精度损失

TurboQuant: Redefining AI efficiency with extreme compression

AI 导读

Google 发布 TurboQuant 压缩算法,用于解决向量量化中的内存开销问题,并同时提出 QJL 与 PolarQuant 两种配套方法,三篇工作将分别发表于 ICLR 2026 和 AISTATS 2026。

推荐理由

Google 提出的向量量化方法在 KV cache 压缩与向量搜索上的实测数据,可供关注推理成本与长上下文部署的读者参考。

来源:Google Research · research.google