news 2026/10/5 1:51:59

Aleph Alpha 开源 78B 参数 MoE 模型 Kolibri

作者头像

张小明

前端开发工程师

1.2k 24
文章封面图
Aleph Alpha 开源 78B 参数 MoE 模型 Kolibri

德国 AI 实验室 Aleph Alpha 在 10 月 3 日发布了开源权重模型 Kolibri,总参数量 78B,采用 Apache 2.0 许可证。这是一个混合专家架构(MoE)模型,每次推理仅激活 3.46B 参数,在英文数学和代码测试中达到 90 分以上,同时对德语提供了较强支持。

架构与训练

Kolibri 采用 50 层结构,全部使用 MoE,共 384 个专家。预训练使用 768 块 B200 GPU,历时 21 天完成,于 9 月 11 日结束。模型处理了超过 200T token 的原始数据,知识截止日期为 6 月 18 日。

训练数据中英语占比约 62%,代码占比 14%,德语 token 约 4.3T,占总训练数据约 21.3%。预训练期间遇到 38 次非计划中断。

预训练后,模型经过 3.44T token 的中训阶段和 200B token 的长上下文适配。Kolibri 支持最长 1M token 的上下文,通过混合注意力机制实现:10 层处理完整上下文,其余 40 层使用 512 token 的滑动窗口。

测试表现

官方给出的测试成绩:

  • AIME 2025 英文 96.9,德文 87.5
  • AIME 2026 英文 96.0,德文 90.0
  • HumanEval+ 92.7

这些分数显示 Kolibri 在数学推理和代码生成任务上有较好表现。德语测试分数略低于英语,但仍在 87.5 到 90.0 之间。

Kolibri Origin

Aleph Alpha 同时发布了 Kolibri Origin,这是一个更小的前序版本,总参数 30.6B,激活参数 3.27B,于 6 月 11 日完成预训练。Origin 使用 7.5T 训练 token,支持 65k token 上下文窗口。

适用场景

Kolibri 通过 MoE 架构降低了推理成本,激活参数仅占总参数的约 4.4%。对于需要处理德语内容或超长文档的应用,Kolibri 提供了开源选择。Apache 2.0 许可证允许商业使用和修改。

模型知识截止于 6 月 18 日,不包含之后的信息。对于需要最新知识的场景需要配合外部检索或更新机制使用。

版权声明: 本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若内容造成侵权/违法违规/事实不符,请联系邮箱:809451989@qq.com进行投诉反馈,一经查实,立即删除!
网站建设 2026/10/5 1:44:48

终极游戏存档守护指南:用Ludusavi轻松实现跨平台备份

终极游戏存档守护指南:用Ludusavi轻松实现跨平台备份 【免费下载链接】ludusavi Backup tool for PC game saves 项目地址: https://gitcode.com/GitHub_Trending/lu/ludusavi 游戏存档是每位玩家最珍贵的数字资产,但系统崩溃、硬件故障或意外删除…

作者头像 李华