2026 年 9 月 28 日,GitHub 安全实验室在官方博客宣布开源 Security Lab Taskflow Agent——一套帮安全研究员自动化代码审计的 AI 工作流工具。团队用它审计 Android 应用,已报告 24 个漏洞,其中包括可被恶意应用利用的位置追踪和账号接管问题。
这是一套什么工具
Security Lab Taskflow Agent 不是单个模型,而是一组可复用的审计 taskflow(任务流):安全研究员把自己验证有效的提示词和工作流打包、分享,其他人可以直接拿来跑。项目已在 GitHub 开源,仓库名为 seclab-taskflows。
用法不复杂:在 Codespace 里打开仓库,运行一条审计脚本指向目标代码库,中等规模的仓库一两个小时能跑完,结果汇总在一张 SQLite 表里,标出疑似有漏洞的行。需要注意的是,它要求使用者持有 GitHub Copilot 许可,且会消耗大量高级模型请求和 token。
针对 Android 应用,团队还专门加了移动端入口点识别和常见漏洞类别清单——移动漏洞在大模型的训练数据里相对少见,不给提示词"划重点",模型容易漏掉。
两个真实挖出的漏洞
第一个在 OsmAnd(一款千万级下载量的导航应用)里:它的 MapActivity 是导出的 Activity,任何应用都能向它发送带任意参数的 Intent。攻击者可以静默改写应用设置,把地图瓦片地址换成自己的服务器——用户每加载一块地图,精确坐标就回传一次,全程毫无察觉。同样手法还能拿到用户的每条路线起点和终点。
第二个在维基百科 Android 应用:deeplink 的域名解析有个逻辑 bug,能把用户引向攻击者控制的页面;再叠加 cookie 校验的另一个小问题,攻击者可以拿到用户的长期登录凭证,实现账号接管。两个都是逻辑漏洞,而非常见漏洞类别的简单复现——这正是团队想证明的:大模型能找到有真实危害的逻辑问题。
AI 审代码的短板也很明显
团队没有回避局限:大模型经常报出低危害、甚至几乎无法利用的"漏洞",严重程度也经常估错;像"内部存储覆盖外部数据"这类缓解因素它看不出来,会产生误报。想让它少报错,就得让它实际去构造利用证明,这又烧掉更多时间和 token。目前的结论是:AI 适合做初筛和规模化审计,但每条发现仍需要懂移动安全的人复核。
对普通开发者来说,最直接的价值是这套工具链已经开源,可以直接拿来扫自己的仓库;对行业来说,AI 参与漏洞挖掘正在从演示变成日常工具,安全审计的"人效"会被重写。