过去两年,大模型推理优化聚焦于 KV Cache,模型在读取上下文后留下的中间计算结果,内容越长,显存和带宽消耗越大。DeepSeek-V2 通过 MLA 技术将 KV Cache 减少 93.3%,Kimi Linear 则最多减少 75%。各方努力降低长上下文的成本。 但现有方案存在限制:缓存通常只能在同一模型内部复用,切换模型时需重新计算前面几万甚至几十万 Token,频繁模型路由导致重复计算难以避免。 英伟达最新论文提出解决方案,发现同一家族、KV 结构匹配的不同大小模型之间,缓存存在明显线性关系。通过 500 段、每段 1024 Token 的文本校准,可以将一个模型的 KV Cache 转移至另一个模型使用。 Qwen3-14B 切换到 32B 时,32K 上下文重新计算约需 7 秒,而转换缓存仅需约 0.28 秒,速度快约 25 倍。这意味着小模型可以先处理长上下文生成 KV Cache,待需要更强能力时再将缓存转给大模型进行生成。 这种跨模型 KV Cache 的成熟应用将使模型路由节省更多算力,简单任务可由小模型完成,复杂问题再调用大模型,避免每次都从头读取上下文。
本内容仅供参考,不构成任何金融、投资、法律或税务建议。文中提及的任何活动、奖励、线上活动或相关信息,不应被视为对购买、出售或交易任何加密资产的推荐、招揽或邀请。加密资产具有高波动性,存在价值损失风险。WEEX服务、产品及相关活动的可用性可能因地区而异。用户在参与前有责任确保符合当地适用法律法规。

















