英伟达让AI学会“借鉴”:KV缓存跨模型共享,推理速度飙升25倍
背景:大模型推理的“缓存瓶颈”
大语言模型(LLM)在推理时,自注意力机制需要反复计算每个token的键(Key)和值(Value),并将它们存储在KV缓存中。随着序列长度增长,KV缓存不仅占用大量显存,还导致后续token生成时的重复计算——这是当前推理延迟的主要来源之一。传统方案中,每个模型维护独立的KV缓存,即便多个模型处理相同上下文,也无法复用,造成算力浪费。
创新:跨模型缓存共享机制
英伟达最新研究提出了一种**跨模型KV缓存共享框架**,核心思路是让不同架构的模型“学会借鉴”彼此已计算的键值对。具体而言,团队设计了一个轻量级的**统一缓存适配层**,通过可学习的投影矩阵将各模型的注意力头映射到共享的潜空间。当模型A完成对某段上下文的推理后,其KV缓存经适配器转换为统一格式,后续模型B可直接读取并跳过重复计算,无需重新编码全文。
实验采用多个参数量级在7B-13B的模型(如Llama 2、Mistral、Falcon)进行混合推理,在保持输出质量(困惑度下降<0.1%)的前提下,**整体推理吞吐量提升达25倍**。尤其在多模型集成、级联问答等场景中,缓存命中率超过80%,显著降低了首token生成延迟。
意义与未来展望
这一突破本质上将推理从“计算密集型”转向“缓存复用密集型”,对边缘部署和云端推理服务意义重大:一方面,无需为每个模型独立配置高带宽显存;另一方面,通过共享缓存,不同模型可像“知识库”一样协作,为构建更高效的AI系统(如多智能体、模型路由)提供了基础设施。不过,跨模型适配的泛化性、缓存一致性与安全性仍是后续需攻克的难点。