跳到主要內容

Kolibri 模型發布:德語主權 AI、百萬上下文與官方跑分可信嗎?(2026)

最後更新: ·
Kolibri 模型發布:主權模型誰來驗?

2026 年 10 月 3 日,Aleph Alpha 在官方部落格發布了〈Kolibri Has Landed: A Sovereign Open-Weight Model〉,介紹新推出的 Kolibri 模型。文章把德英雙語、可自行部署與「主權」連成一個故事;讀完真正要分開看的,是權重是否可用、工作負載是否合適,以及跑分能否預測你的結果。

Aleph Alpha Kolibri 模型官方發布文章的標題、日期與綠色封面截圖
畫面/Aleph Alpha;瀏覽器框架/AlphaLab。點圖閱讀原文。

這篇先還原官方的三個主張:以較少活躍參數做德英語任務、以德語原生資料改善語境、讓機構掌握部署方式;再用模型卡和技術報告檢查數字與邊界,最後回答什麼樣的驗收才有意義。

Kolibri 發布了什麼:權重、語言與部署選擇

On the Day of German Reunification, we are releasing our new model: Kolibri.

中文:在德國統一日,Aleph Alpha 發布 Kolibri。這是發布時點,也表明公司希望把模型放進歐洲自主技術的敘事。

Aleph Alpha 原文

官方模型卡列出:Kolibri 模型是德英雙語 MoE,總參數 78.1B、每個 token 約 3.46B 活躍參數,權重以 Apache 2.0 授權提供。原文另主張,它可處理推理、工具呼叫、文件檢索與長文本,並讓機構在自己的基礎設施上部署。這是「可以取得並控制部署」的具體一面;個別機構能否滿足其內部資料、治理與稽核要求,仍取決於實際系統設計。

MoE 的好處容易被一個數字說得太輕巧:每次只啟動 3.46B,降低的是部分運算量;推論時仍須存放整組權重,還要為上下文和並行請求留下記憶體。模型卡估算 FP8 權重約 78 GB,列出的最低硬體為兩張 A100 80GB、兩張 H100 SXM5,或一張 H200/B200/B300。它有本地部署的路徑,但規劃容量時不能把它當成「3B 小模型」。

德語不是翻譯附加功能

原文稱,德語占預訓練 token 的 21.3%,約為 20T 預訓練 token 中的 4.3T;團隊以德語網頁、德語文件的改寫與少量翻譯組成語料,並打造德英雙語 tokenizer。這些是 Aleph Alpha 技術報告與原文揭露的訓練配方,屬公司自述,外部讀者無法只憑比例推論所有德語工作都會更準。

Kolibri 官方圖表比較德語複合字與英文詞彙在不同 tokenizer 下的切分方式
圖/Aleph Alpha 官方發布文。圖中德語複合字被 Kolibri 切成較完整的詞素;這說明 token 效率的設計方向,不能單獨證明回答品質。

圖中「Bundessozialgerichtes」在 Kolibri 被切為 Bundes/sozial/gericht/es;其他 tokenizer 的切分更零碎。相同文字用較少 token,可能減少成本並保留更多上下文空間;但回答德國行政或法律問題,還需要正確的知識、檢索證據和拒答判斷。tokenizer 的詞形優勢只是其中一環。

100 萬 token 是已測延伸,不是建議日常用量

官方文案寫「最多 1M token」,但模型卡把長度分得更清楚:最後長上下文訓練到 262,144 token;1,048,576 token 是延伸後、由官方驗證的長度。模型卡建議複雜任務與重視速度或吞吐量的部署維持在 262,144 token 以內。

同一張模型卡的 RULER 表格還呈現代價:Kolibri Base 在 256k、512k、1M 長度的平均分別為 69.8、65.5、63.2。這是 Aleph Alpha 自行執行的特定測試,不是所有長文件任務的成功率;卻足以提醒:窗口能打開,不代表把整庫文件塞進去就能同樣可靠地找到關鍵句。

官方跑分與內部圖表,應該怎麼讀?

Public benchmarks fail to capture specialized sector needs

中文:公開基準不足以涵蓋產業場景,所以公司另外建立內部代理題集。這個理由合理,也讓外部驗證變得更重要。

Aleph Alpha 原文
Aleph Alpha 內部客戶代理題集圖,五條產業曲線隨後訓練上升
圖/Aleph Alpha 官方發布文。五條曲線是公司內部 customer-proxy 評測,不是企業上線後的獨立成效。

在這張圖裡,官方的汽車供應商代理題集由 0.72 到 0.99,半導體由 0.35 到 0.80,德國公部門由 0.54 到 0.75。這些數字說明公司在自己的訓練與評測循環中看到了進步;題集、資料分布與真實客戶任務的距離,決定了進步能轉移多少。公司同時是模型開發者、題集設計者與成績發布者,因此這是值得檢驗的線索,而非採購結論。

公開基準也有類似界線。原文的比較表把 AIME 2026 英文列為 96.0、BFCL v3 多輪工具呼叫列為 39.8,並在同一套公司 harness 中列出 GLM-4.7 Flash 的 BFCL v3 為 58.2。它讓 Kolibri 模型的強弱分布更立體:數學表現亮眼,多輪工具協調卻值得另行驗收。各分數屬 Aleph Alpha 報告所述設定,不能把不同題目拼成一個「全面領先」的宣稱。

「主權」在這裡能證明什麼?

可下載權重,把部署權交到使用者手裡

Apache 2.0 權重與可自行部署,讓機構有機會決定模型在哪裡執行、文件怎麼流動、版本何時更新。這是可檢驗的控制權。若系統仍把檢索、日誌或工具呼叫送到外部服務,單靠模型權重的來源也無法回答整套系統的資料流問題。

同一套廠商評測,不等於你的任務通過

原文認為通用排行榜不夠貼近公部門、製造與航太,這點說得通;但當專用題集完全由供應商掌握,讀者更需要知道未見過的真實案例表現。尤其「知道何時說不知道」不能只看平均分:一份缺少答案的文件、一次錯誤引用,可能比十題算術高分更影響決策。

百萬窗口與 3.46B 活躍參數,是設計空間,不是免驗承諾

長窗口、稀疏啟動與德語 tokenizer 都是在不同瓶頸間取捨。長度影響延遲和錯漏;活躍參數影響運算,總權重影響記憶體;壓縮率影響 token 數,卻不直接等於理解力。Kolibri 的價值要在這些取捨剛好對準工作負載時才成立。

如果你要評估 Kolibri,先問三個問題

第一,任務是什麼?把德英混合文件、找不到答案的問題、多輪工具任務各取一批,先定義可接受的答案與拒答方式。第二,代價是什麼?同時記錄品質、延遲、GPU 記憶體、並行量與每份文件的成本;分別測 32k、256k 和需要時的更長上下文。第三,控制落在哪裡?把模型、檢索、工具、日誌與更新流程畫成資料流,逐一確認管理邊界。

Kolibri 模型最值得關注的,不是單一 100 萬 token 或單張勝負表,而是它讓德英雙語機構多了一個可下載、可自架的候選方案。把官方數據當成提出測試假設的起點,再用自己的封存題、失敗案例和容量需求決定它是否合適,才能把「主權」從口號變成可操作的選擇。

接著閱讀

左右滑動查看更多推薦

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。已訂閱?管理主題偏好(會寄登入連結到你的信箱)