AstaBrief 8B 在 2026 年 10 月 2 日由 Ai2(艾伦人工智能研究所)正式开源。这款模型只做一件事:把研究人员提出的问题和检索到的文献片段,整理成一篇带引用的科学报告。它已经上线 Ai2 的科研智能体平台 Asta,成为报告生成功能的 Fast mode,与原先由 Claude 驱动的 Thinking mode 并列;模型权重和训练数据同日开放下载,机构可以把它部署在自己的服务器上,不必把未发表的研究问题发给闭源模型接口。
一次写完整篇报告,平均用时从 178.5 秒降到 51.1 秒
提速的关键不是换了更快的硬件,而是改了写法。旧流水线要先做片段摘要、聚类,再逐节生成报告;AstaBrief 接受过专门训练,拿到问题和文献片段后一次写出全文,省掉中间环节。Ai2 给出的全流程数据是:Fast mode 平均每篇报告 51.1 秒,Thinking mode 为 178.5 秒,约快 3.5 倍。对科研人员的实际意义是工作节奏变了:可以先花一分钟拿到结构完整的初稿,再决定哪些部分值得用慢速模式深挖,而不是每次提问都等上三分钟。
训练数据来自真实科研问题,最有效的过滤信号是引用密度
AstaBrief 以通义千问 Qwen3-8B 为基座,后训练数据全部来自真实使用:Ai2 从 Asta 的用户日志里筛出 9 万条科研问题,经 ScholarQA 流水线生成目标报告——参与生成的包括 Claude 3.5 Sonnet、Claude 3.7 Sonnet、o3、o4-mini 和 GPT-4.1——质量过滤后留下 4.7 万条做监督微调;偏好优化阶段另备约 6000 对报告,由 GPT-4.1 和 DeepSeek-R1 双评委意见一致才保留,两个评委与人类偏好的对齐率达到 95%。实验中最值得记的一条经验是:他们试了四种统计过滤器,增益最大的不是复杂组合,而是引用密度——一篇合成报告是否持续为自己的论述附上引用。这个信号简单,却直接对应科学写作最怕的毛病:话说得漂亮,引文对不上。
评测成绩要打折看,Ai2 自己先把话说在前面
这篇发布博客罕见地主动标注了评测边界:大部分训练和评测完成于 2025 年,对照的闭源模型是当时的前沿水平,团队没有拿今天的前沿模型重跑,所以成绩只能证明这套数据与系统设计在当时有效,不能推出现在的排名。细节也对得上这份克制:在 14 个问题的人类评测中,Ai2 自家的 DR Tulu 在总体偏好上胜出,AstaBrief 只在引用准确性上得到 3 位评测研究者中 2 位的偏好。早期使用数据倒是实在:374 名试用过 Fast mode 的用户里,29.1% 使用了两天以上,人均生成 3.67 个报告线程,23% 的人试过之后再没切回 Thinking mode;好评率 84.2%,与 Thinking mode 的 85.2% 接近。
适合谁:问题敏感、又离不开文献综述的团队
最适合的是高校实验室、药企和研究院所这类场景:研究问题本身可能涉及未公开的方向,不能发给外部闭源接口,而开源权重可以放在自家防火墙内运行。Ai2 还在 GitHub 上放了示例工作流,可以从团队自己的 PDF 文献出发组织报告。不适合的情形也明确:需要最强推理能力的深度研究,Thinking 这类闭源流水线仍然更稳;8B 的体量决定了它的上限,引用密度过滤解决的是溯源纪律,不是知识储备。把它当成综述初稿的加速器,而不是研究员的替代品,预期就不会错位。