2026 年 9 月 30 日,蚂蚁集团旗下 InclusionAI(蚂蚁百灵)发布了新一代语言模型 Ling-3.1-flash:总参数 5600 亿、每个 token 激活约 250 亿,设计上下文窗口达到 100 万 token。发布同步开启两周免费试用(试用期上限 25.6 万 token),试用结束后计划开放全部窗口并开源模型。据 TechNode 9 月 30 日转引 IT 之家的报道,该模型定位于智能体任务、搜索、办公软件和专业应用。
参数:5600 亿总量,每次只激活 250 亿
Ling-3.1-flash 延续了 flash 系列的混合专家(MoE)路线:总参数做到 5600 亿,但每次推理只激活约 250 亿,激活率不到 5%。上一代 Ling-3.0-flash 是 124B 总参数、5.1B 激活的配置,新一代在总量上直接放大了约 4.5 倍,激活量同步放大到 25B。思路很明确:用更大的参数储备换能力,用低激活率控住推理成本。
上下文是这次升级的另一个重点:设计目标 100 万 token,试用期先开放 25.6 万。百万级上下文配 250 亿激活量,摆明了是为长任务准备的——读几十份文档、跑多轮工具调用的 Agent 流程,正好吃这一套配置。
定位:从"会回答"到"能干活"
官方给 Ling-3.1-flash 定的四个方向是智能体任务、搜索、办公软件和专业应用。这和蚂蚁百灵近期的动作一脉相承:此前发布的金融增强模型 Ling-3.0-flash-Fin,就是瞄准投研工作流、让 AI 从"回答一个问题"走向"完成一项工作"。Ling-3.1 作为通用底座放大参数和上下文,等于给这类长链路任务补上了更强的地基。
对国内开发者来说,另一个看点是生态位:DeepSeek、Qwen、Kimi 之后,国产开源第一梯队又添一个 5600 亿级别的选手。百灵此前已经开源过 Ling 系列的 tiny 和 flash 基础模型,这次"先试用、再开源"的节奏,延续了它开放权重的路线(开源动态可看本站开源大模型专题)。
试用与开源:先免费两周,再开权重
两周免费试用是这次发布最实在的部分:开发者不用付费就能上手验证,试用期 25.6 万 token 的上限对大多数长文档、Agent 试点场景够用。试用结束后,官方计划开放完整的 100 万 token 窗口并开源模型。
这个时间表对选型的人有个直接建议:现在就可以拿真实业务流量去试,重点测两件事——长上下文下的有效记忆长度(别只看标称窗口),以及 Agent 多步任务的稳定性和工具调用准确率。等开源落地,再评估私有化部署的成本。
接下来值得关注的是开源的具体许可协议和权重发布时间——这两点决定了 Ling-3.1-flash 能不能真正进入国产开源第一梯队的实战序列。