Google Research·· 2026-03-25精选AI 评分62
Google 发布 TurboQuant 压缩算法,KV cache 可压至 3 bit 且无精度损失
TurboQuant: Redefining AI efficiency with extreme compression
AI 导读
Google 发布 TurboQuant 压缩算法,用于解决向量量化中的内存开销问题,并同时提出 QJL 与 PolarQuant 两种配套方法,三篇工作将分别发表于 ICLR 2026 和 AISTATS 2026。
推荐理由
Google 提出的向量量化方法在 KV cache 压缩与向量搜索上的实测数据,可供关注推理成本与长上下文部署的读者参考。
来源:Google Research · research.google