Agent Lightning v1.0 在 2026 年 10 月 7 日由微软亚洲研究院发布并开源。这套强化学习训练框架提出一种新的训练范式:部署时真正使用的智能体框架(harness)直接参与训练,不再要求开发者把智能体在训练框架里重写一遍。整个框架约 3,500 行代码,配套的编程智能体训练流水线把一个 9B 模型的公开基准成绩提高了 14.6 个百分点。
老办法为什么贵
用强化学习训练智能体时,传统框架通常接管模型与环境之间的交互循环,开发者要把智能体的循环在训练框架内重新实现。可现实中的编程智能体各有各的上下文管理、工具协议和执行逻辑,例如 mini-SWE-agent、OpenHands、Claude Code、Codex 都有自己的做法。重写的成本高不说,重写出来的智能体行为还可能和真正部署的那个并不一致,训练效果打折。
它的做法是在模型前面加一层代理
Agent Lightning 在智能体与模型之间放一个兼容 OpenAI 接口的 LLM 代理。智能体只要把原来调用模型的地址指向这个代理,框架就能记录每次调用的提示、回复和对数概率,现有框架代码基本不用改。系统由三部分组成:API 网关负责代理请求并保存训练数据,Rollout 控制器负责启动智能体执行,定制训练器基于 verl 框架组装样本并更新模型。它还提出 Collocated Async RL,让采样和模型更新共用同一组 GPU,研究团队报告其端到端速度约为同步训练的 2 倍,占用 GPU 又少于常规异步方案。
智能体直接跑在 Kubernetes 上
收集训练样本要同时运行大量智能体。一些同类框架把智能体托管在商业沙箱服务上,规模一大成本涨得快。Agent Lightning v1.0 让智能体以标准 Kubernetes 任务的方式运行,自建集群、云上 Kubernetes 或本地基础设施都能用,不依赖付费沙箱,整条流水线开源且可复现。
效果用编程智能体做了完整验证
研究团队用 SWE-smith 数据、mini-SWE-agent 和 Qwen3.5-9B 搭了一条端到端流水线,包含数据清洗、环境构建和防奖励投机措施。只用约 6,000 条训练样本,模型在 SWE-bench Verified 上的 Pass@1 从 41.8% 提升到 56.4%。这是研究团队在公开基准上的结果,适合当作方法有效性的证据,自己的智能体能涨多少仍要实测。
落地前要掂量的地方
研究团队自己列出了真实框架训练的四个难点:重新分词导致样本难以合并、优势估计要按整条轨迹而不是按样本计算、损失归一化不能被样本数量带偏、训练后端要把不确定的工作量映射到固定 GPU 资源上。如果你的智能体只是简单的单循环结构,传统框架可能已经够用,Agent Lightning 的价值主要体现在框架复杂、重写成本高的真实系统上。代码已在 GitHub 以开源形式提供,文档和技术报告一并公开。