AI导航

Kolibri 开源权重发布:78B 参数每 token 只激活 3.46B,上下文达 100 万

AI资讯
2 min read
0 次阅读

Kolibri 在 2026 年 10 月 3 日正式开放权重。德国 AI 公司 Aleph Alpha 在德国统一日当天通过官方博客发布这款德英双语模型:总参数 78B,采用混合专家架构,每个 token 只激活约 3.46B 参数,上下文最长支持 100 万 token。完整权重已上传 Hugging Face,按 Apache 2.0 许可证开放,企业和开发者可以下载到自己的基础设施上运行、微调并商用。

参数不算大,关键是每个 token 只激活一小部分

混合专家架构的账要这样算:78B 参数全部要装进显存,但生成每个 token 时只调用约 3.46B,推理成本接近一个小模型,知识容量却按大模型算。官方模型卡给出的 FP8 权重约占 78GB 显存,最低配置是 2 张 A100 80GB,或 1 张 H200、B200 级别显卡;BF16 版权重约 156GB,门槛更高。模型卡同时提醒,虽然标称上下文 100 万 token,实际部署建议控制在 26 万 token 以内以保效率。训练侧,它在 20 万亿 token 上完成预训练,其中德语原生语料占 21.3%,机器翻译语料只占约 6%——官方强调它要做「天生双语」,而不是给英文模型补德语。推理强度提供无、低、中、高四档可调。

它瞄准的不是聊天,是受监管行业

Aleph Alpha 给 Kolibri 的定位词是「主权」:模型由德国团队开发,在德国和芬兰的基础设施上训练,全程处于欧洲与德国法律之下,设计时就对着欧盟《人工智能法案》、通用 AI 行为准则和 GDPR 做。目标客户是公共管理、工业、航空航天、汽车和半导体这类数据不能出门、流程要可审计的行业,官方自建了五个行业的内部代理评测,称成绩相对三个月前的验证版都有明显提升。它还专门训练了「有据才答」的能力:上下文里找不到依据时,模型应明确说不知道,而不是编一个答案——对政务和工业文档问答,这比多答对两道数学题更要紧。

成绩是官方自报,门槛也写在明处

按 Aleph Alpha 公布的自测成绩,Kolibri 在 AIME 2025 数学竞赛题上得 96.9 分,GPQA Diamond 得 84.3 分,LiveCodeBench v6 得 85.9 分,官方称其整体表现能对上激活参数四倍于它的模型。这些数字出自厂商自己的评测,独立复测出来之前,只能当选型参考,不能当结论。更实际的判断是硬件:78GB 只是权重本身,个人电脑和消费级显卡跑不动这款模型,它的「本地部署」指的是企业机房和政务内网,不是个人玩具。对德语业务、受监管数据或想摆脱 API 依赖的欧洲机构,这是一个新选项;对中文场景团队,它的德英双语定位并不对口,值得看的是「小激活、大容量、权重全开」这条路线会不会被更多厂商跟进。

推荐工具

NVIDIA Chat with RTX AI聊天 Chat with RTX 是 NVIDIA 面向 RTX 电脑的本地 AI 聊天工具,可围绕本地文档和视频资料做问答,适合重视隐私、离线检索并具备硬件条件的用户更适合资料不便上传云 HuggingChat AI聊天 HuggingChat 是 Hugging Face 的开源模型聊天应用,支持 Omni 自动选模型,也可手动选社区开放模型对话。它适合体验开源模型、技术探索和问答,结果可能不稳定,重要内容需复核。 纳米AI搜索 AI搜索 纳米AI 是 360 旗下 AI 搜索和智能体入口,支持文字、语音、拍照提问、多模型协作与内容创作,适合中文用户做日常搜索、学习问答、移动查询、热点追踪、生活决策、知识整理和轻量创作。 Qwen Chat(通义千问) AI聊天 Qwen Chat 是Qwen 大模型聊天助手,支持Qwen 模型聊天、写作和编程问答,适合中文用户和开发者完成 AI 对话、资料问答和任务协作,适合上线前核对权限、成本和资料质量。 DuckDuckGo AI Chat AI聊天 DuckDuckGo AI Chat 适合重视隐私的普通用户使用,围绕隐私 AI 聊天、免账户使用和多模型问答提供对话式 AI 支持和任务协作能力,适合上线前核对权限、成本和资料质量。 Goody-2 AI聊天 Goody-2 是以极端安全和伦理对齐为特色的 AI 聊天助手,常用于观察模型拒答边界、内容安全策略、保守输出体验和 AI 风险讨论,更适合作为安全边界样本使用前应理解它偏实验性质,不适合。