跳到正文
热点事件持续更新

Aleph Alpha 发布德国主权 AI 模型 Kolibri

1 篇报道1 个报道来源2 小时前更新

先了解这件事

AI 综述

2026 年 10 月 3 日,Aleph Alpha 发布开源大语言模型 Kolibri。该模型采用混合专家(MoE)架构,总参数量 781 亿,每 token 激活约 34.6 亿参数。它原生支持 262,144 个 token 上下文,并测试至 1,048,576 个,专为德语和英语场景设计,以 Apache 2.0 协议在 Hugging Face 开放。技术细节显示,Kolibri 通过 UniBPE 分词器处理德语法律文本。

AI 根据报道生成 · 1 小时前更新

报道时间线

沿着报道,了解事件的不同侧面。

10月3日
  1. Hacker News · AI精选
    Aleph Alpha 发布主权 AI 模型 Kolibri:780 亿参数 MoE 架构在德语场景的实测表现

    Aleph Alpha 于 2026 年 10 月 3 日发布开源权重大语言模型 Kolibri,该模型采用混合专家(MoE)架构,总参数量 781 亿但每 token 仅激活约 34.6 亿参数,原生支持 262,144 个 token 上下文并测试至 1,048,576 个,专为德语和英语设计,以 Apache 2.0 协议在 Hugging Face 开放。 技术细节显示,Kolibri 通过 UniBPE 分词器在德语法律文本上比 GPT-5 节省 15% token 数,利用滑动窗口注意力实现百万级上下文处理,并在 RULER 基准 1M 长度下得分 63.2;其核心创新在于 Merlin-Arthur 协议训练出的“拒答”能力,在 Omniscience 测试中 44% 的不确定问题选择承认不知而非幻觉,显著高于 Qwen3.5 的 11.1%。然而,实测评估指出其在闭卷知识问答(51.0 分)、多轮工具调用(39.8 分)及代码生成(Terminal-Bench 27.7 分)方面弱于 Qwen3.5 35B-A3B 等竞品,且需至少 78 GB 显存(如双 A100/H100 或单 H200/B200),依赖特定 vLLM 插件运行。 事实层面,该模型由德国团队在德国和芬兰基础设施上从零训练,符合欧盟 AI 法案要求,但训练数据包含经 Google Gemma 4 和 Mistral-NeMo 重写的英文语料及 Qwen3-32B 标注数据。推断其目标场景为对数据主权、合规性及德语深度推理有强需求的公共部门、医疗或制造业,不适合通用编码代理或低显存环境;猜测其长期价值取决于能否在垂直领域通过 RAG 结合其长上下文与拒答机制形成差异化壁垒,而非追求通用全能性。

本事件热度走势

还没有足够的连续观测数据,暂不绘制趋势。