人工智能 OpenAI被曝推进推理优化:从KV Cache入手,目标是把成本继续压低 OpenAI据称正在推进新的推理系统优化,重点可能落在KV Cache复用与压缩上。在高亏损和算力账单压力下,降低推理成本已成为其商业化关键。
人工智能 谷歌 TurboQuant 发布:称可将大模型内存占用降至 1/6,且不牺牲输出质量 谷歌研究团队披露 TurboQuant 压缩算法,称可将大语言模型键值缓存内存占用降低 6 倍,并在部分测试中带来最高 8 倍速度提升,且未见输出质量下降。
人工智能 谷歌发布 TurboQuant:AI 推理内存压缩最高可达 6 倍,网友调侃像《硅谷》“Pied Piper” 谷歌研究团队公布 AI 内存压缩算法 TurboQuant,称可在不明显影响性能的前提下,将推理阶段工作内存压缩至少 6 倍。不过该技术目前仍属实验室成果,尚未大规模落地。