AI导航

小米 MiMo 团队公布 HySparse2:MiMo-V3 架构让 Agent 长上下文更快更省

AI资讯
2 min read
1 次阅读

2026年9月24日,小米 MiMo 团队公布了 MiMo-V3 的核心架构 HySparse2。作为此前 HySparse 的升级版,它专门为长程多轮 Agent 设计:更少的 Prefill 计算、更小的 KV Cache,同时长上下文检索更精准。简单说,就是让 Agent 在又长又多轮的任务里跑得更快、占得更少、找得更准。

两级 KV 共享是核心改动

HySparse2 把模型分成前后两半:前半是 Self-Decoder,采用全注意力与滑动窗口注意力混合结构;后半是 Cross-Decoder,采用全注意力与稀疏注意力混合结构。KV 共享分两个层次:KV Bridging 让后半部分每一层全注意力,直接从前半部分对应层的隐藏状态生成自己的 KV 缓存,不必等输入逐层走完;KV Reuse 则让每个混合块里的稀疏层,直接复用同块全注意力层的 KV 缓存和重要位置选择结果,不用再单独训练一个选择器。

从"选一块"到"选一个 token"

第一代 HySparse 用块级稀疏选择,选中一个重要 token 时常常连带周围一整块内容一起算。HySparse2 改成 token 级选择:强制保留最近的 128 个 token,再从窗口外挑 1024 个全局 token,局部和全局信息在一次稀疏计算里同时读取,原来独立的滑动窗口分支也被省掉了,投影参数和缓存开销一起下降。

数字:Prefill 只跑一半,缓存压到 2.7GB

因为后半部分所需的 KV 缓存都能从前半部分提前构建好,49 层的模型做 Prefill 时只需要执行前 25 层。在 80B-A3B 的 MoE 模型上,HySparse2 的 Prefill 计算量只有 Hybrid SWA 的 1/5、第一代 HySparse 的 1/3;百万 token 下,KV Cache 从 12GB 降到 2.7GB。长上下文评测里,MRCR-v2 和 RULER-v2 相对 HySparse 平均提升 11.30 和 19.81 个百分点,通用能力大体相当。

谁该关注,下一步看什么

做 Agent 应用、被长上下文推理成本卡住的团队,可以直接跟进 MiMo-V3 的后续进展。配合此前 MiMo-UltraSpeed 在 Decode 端的低比特量化、推测解码等优化,MiMo 正在把输入处理和输出生成两端的效率一起往上推。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。