2026年9月24日,小米 MiMo 团队公布了 MiMo-V3 的核心架构 HySparse2。作为此前 HySparse 的升级版,它专门为长程多轮 Agent 设计:更少的 Prefill 计算、更小的 KV Cache,同时长上下文检索更精准。简单说,就是让 Agent 在又长又多轮的任务里跑得更快、占得更少、找得更准。
两级 KV 共享是核心改动
HySparse2 把模型分成前后两半:前半是 Self-Decoder,采用全注意力与滑动窗口注意力混合结构;后半是 Cross-Decoder,采用全注意力与稀疏注意力混合结构。KV 共享分两个层次:KV Bridging 让后半部分每一层全注意力,直接从前半部分对应层的隐藏状态生成自己的 KV 缓存,不必等输入逐层走完;KV Reuse 则让每个混合块里的稀疏层,直接复用同块全注意力层的 KV 缓存和重要位置选择结果,不用再单独训练一个选择器。
从"选一块"到"选一个 token"
第一代 HySparse 用块级稀疏选择,选中一个重要 token 时常常连带周围一整块内容一起算。HySparse2 改成 token 级选择:强制保留最近的 128 个 token,再从窗口外挑 1024 个全局 token,局部和全局信息在一次稀疏计算里同时读取,原来独立的滑动窗口分支也被省掉了,投影参数和缓存开销一起下降。
数字:Prefill 只跑一半,缓存压到 2.7GB
因为后半部分所需的 KV 缓存都能从前半部分提前构建好,49 层的模型做 Prefill 时只需要执行前 25 层。在 80B-A3B 的 MoE 模型上,HySparse2 的 Prefill 计算量只有 Hybrid SWA 的 1/5、第一代 HySparse 的 1/3;百万 token 下,KV Cache 从 12GB 降到 2.7GB。长上下文评测里,MRCR-v2 和 RULER-v2 相对 HySparse 平均提升 11.30 和 19.81 个百分点,通用能力大体相当。
谁该关注,下一步看什么
做 Agent 应用、被长上下文推理成本卡住的团队,可以直接跟进 MiMo-V3 的后续进展。配合此前 MiMo-UltraSpeed 在 Decode 端的低比特量化、推测解码等优化,MiMo 正在把输入处理和输出生成两端的效率一起往上推。