AI导航

Agent Lightning v1.0 开源:不改智能体代码也能做强化学习训练

AI资讯
3 min read
0 次阅读

Agent Lightning v1.0 在 2026 年 10 月 7 日由微软亚洲研究院发布并开源。这套强化学习训练框架提出一种新的训练范式:部署时真正使用的智能体框架(harness)直接参与训练,不再要求开发者把智能体在训练框架里重写一遍。整个框架约 3,500 行代码,配套的编程智能体训练流水线把一个 9B 模型的公开基准成绩提高了 14.6 个百分点。

老办法为什么贵

用强化学习训练智能体时,传统框架通常接管模型与环境之间的交互循环,开发者要把智能体的循环在训练框架内重新实现。可现实中的编程智能体各有各的上下文管理、工具协议和执行逻辑,例如 mini-SWE-agent、OpenHands、Claude Code、Codex 都有自己的做法。重写的成本高不说,重写出来的智能体行为还可能和真正部署的那个并不一致,训练效果打折。

它的做法是在模型前面加一层代理

Agent Lightning 在智能体与模型之间放一个兼容 OpenAI 接口的 LLM 代理。智能体只要把原来调用模型的地址指向这个代理,框架就能记录每次调用的提示、回复和对数概率,现有框架代码基本不用改。系统由三部分组成:API 网关负责代理请求并保存训练数据,Rollout 控制器负责启动智能体执行,定制训练器基于 verl 框架组装样本并更新模型。它还提出 Collocated Async RL,让采样和模型更新共用同一组 GPU,研究团队报告其端到端速度约为同步训练的 2 倍,占用 GPU 又少于常规异步方案。

智能体直接跑在 Kubernetes 上

收集训练样本要同时运行大量智能体。一些同类框架把智能体托管在商业沙箱服务上,规模一大成本涨得快。Agent Lightning v1.0 让智能体以标准 Kubernetes 任务的方式运行,自建集群、云上 Kubernetes 或本地基础设施都能用,不依赖付费沙箱,整条流水线开源且可复现。

效果用编程智能体做了完整验证

研究团队用 SWE-smith 数据、mini-SWE-agent 和 Qwen3.5-9B 搭了一条端到端流水线,包含数据清洗、环境构建和防奖励投机措施。只用约 6,000 条训练样本,模型在 SWE-bench Verified 上的 Pass@1 从 41.8% 提升到 56.4%。这是研究团队在公开基准上的结果,适合当作方法有效性的证据,自己的智能体能涨多少仍要实测。

落地前要掂量的地方

研究团队自己列出了真实框架训练的四个难点:重新分词导致样本难以合并、优势估计要按整条轨迹而不是按样本计算、损失归一化不能被样本数量带偏、训练后端要把不确定的工作量映射到固定 GPU 资源上。如果你的智能体只是简单的单循环结构,传统框架可能已经够用,Agent Lightning 的价值主要体现在框架复杂、重写成本高的真实系统上。代码已在 GitHub 以开源形式提供,文档和技术报告一并公开。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。