AI导航

AstaBrief 8B 开源发布:Ai2 科学报告模型生成提速约 3.5 倍

AI资讯
3 min read
2 次阅读

AstaBrief 8B 在 2026 年 10 月 2 日由 Ai2(艾伦人工智能研究所)正式开源。这款模型只做一件事:把研究人员提出的问题和检索到的文献片段,整理成一篇带引用的科学报告。它已经上线 Ai2 的科研智能体平台 Asta,成为报告生成功能的 Fast mode,与原先由 Claude 驱动的 Thinking mode 并列;模型权重和训练数据同日开放下载,机构可以把它部署在自己的服务器上,不必把未发表的研究问题发给闭源模型接口。

一次写完整篇报告,平均用时从 178.5 秒降到 51.1 秒

提速的关键不是换了更快的硬件,而是改了写法。旧流水线要先做片段摘要、聚类,再逐节生成报告;AstaBrief 接受过专门训练,拿到问题和文献片段后一次写出全文,省掉中间环节。Ai2 给出的全流程数据是:Fast mode 平均每篇报告 51.1 秒,Thinking mode 为 178.5 秒,约快 3.5 倍。对科研人员的实际意义是工作节奏变了:可以先花一分钟拿到结构完整的初稿,再决定哪些部分值得用慢速模式深挖,而不是每次提问都等上三分钟。

训练数据来自真实科研问题,最有效的过滤信号是引用密度

AstaBrief 以通义千问 Qwen3-8B 为基座,后训练数据全部来自真实使用:Ai2 从 Asta 的用户日志里筛出 9 万条科研问题,经 ScholarQA 流水线生成目标报告——参与生成的包括 Claude 3.5 Sonnet、Claude 3.7 Sonnet、o3、o4-mini 和 GPT-4.1——质量过滤后留下 4.7 万条做监督微调;偏好优化阶段另备约 6000 对报告,由 GPT-4.1 和 DeepSeek-R1 双评委意见一致才保留,两个评委与人类偏好的对齐率达到 95%。实验中最值得记的一条经验是:他们试了四种统计过滤器,增益最大的不是复杂组合,而是引用密度——一篇合成报告是否持续为自己的论述附上引用。这个信号简单,却直接对应科学写作最怕的毛病:话说得漂亮,引文对不上。

评测成绩要打折看,Ai2 自己先把话说在前面

这篇发布博客罕见地主动标注了评测边界:大部分训练和评测完成于 2025 年,对照的闭源模型是当时的前沿水平,团队没有拿今天的前沿模型重跑,所以成绩只能证明这套数据与系统设计在当时有效,不能推出现在的排名。细节也对得上这份克制:在 14 个问题的人类评测中,Ai2 自家的 DR Tulu 在总体偏好上胜出,AstaBrief 只在引用准确性上得到 3 位评测研究者中 2 位的偏好。早期使用数据倒是实在:374 名试用过 Fast mode 的用户里,29.1% 使用了两天以上,人均生成 3.67 个报告线程,23% 的人试过之后再没切回 Thinking mode;好评率 84.2%,与 Thinking mode 的 85.2% 接近。

适合谁:问题敏感、又离不开文献综述的团队

最适合的是高校实验室、药企和研究院所这类场景:研究问题本身可能涉及未公开的方向,不能发给外部闭源接口,而开源权重可以放在自家防火墙内运行。Ai2 还在 GitHub 上放了示例工作流,可以从团队自己的 PDF 文献出发组织报告。不适合的情形也明确:需要最强推理能力的深度研究,Thinking 这类闭源流水线仍然更稳;8B 的体量决定了它的上限,引用密度过滤解决的是溯源纪律,不是知识储备。把它当成综述初稿的加速器,而不是研究员的替代品,预期就不会错位。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。