人工智能 谷歌 TurboQuant 发布:称可将大模型内存占用降至 1/6,且不牺牲输出质量 谷歌研究团队披露 TurboQuant 压缩算法,称可将大语言模型键值缓存内存占用降低 6 倍,并在部分测试中带来最高 8 倍速度提升,且未见输出质量下降。