跳到主要內容

K2 Horizon 評測:AA 外部榜單的榜首/榜末與 5.06B 參數衝突(2026)

最後更新: ·
K2 Horizon 每個尺寸都頂尖嗎 AlphaLab AI 敘事封面

2026 年 9 月 3 日,Institute of Foundation Models(IFM)在官網發布 K2 Horizon 新聞稿,宣稱六種尺寸都能在各自級距交出頂尖表現。這次 K2 Horizon 評測最值得看的,卻不是又一個「小模型打大模型」標題:截至 2026 年 9 月 15 日,Artificial Analysis(AA)把 3.7B 列為 tiny 開放權重類別第 1/49,0.9B 卻列為第 49/49;再往權重檔案多查一步,還會發現 3.7B 的「總參數」口徑與榜單自身定義互相衝突。

IFM K2 Horizon 新聞稿首頁,顯示完整標題、副標與 2026 年 9 月 3 日發布日期,外層為可辨識來源網址的瀏覽器框
IFM 在 2026 年 9 月 3 日發布 K2 Horizon,新聞稿以「全尺寸級距頂尖」與「完整開放」作為主軸。圖/Institute of Foundation Models

所以,本文會把三件常被混在一起的事拆開:IFM 原本承諾了什麼、AA 實際量到什麼,以及這些數字能不能證明一款模型真的更適合部署。結論先說:3.7B 的外部成績有資訊價值,0.9B 的落差則刺穿了「單項基準領先會自然延伸成廣泛能力」的直覺;但榜首名次、效率與產品價值,都還不能只靠這一張榜單定案。

IFM 原本押注的,不只是一個小模型

K2 Horizon 不是單一 checkpoint,而是一組從 0.9B、3.7B、7B、32B、36B-A4B 到 375B-A23B 的模型車隊。IFM 的核心敘事是:同一個家族可以從穿戴裝置一路延伸到資料中心,並把模型權重、程式碼、訓練資料與方法公開。這讓「每個尺寸都夠強」成為整個發布能否成立的支柱,而不是一句可有可無的宣傳文案。

“Across reasoning, mathematics, coding and agentic tasks, K2 Horizon delivers top-tier performance in every size class.”

中文:在推理、數學、程式與代理任務上,K2 Horizon 在每一個尺寸級距都提供頂尖表現。

Institute of Foundation Models

白話翻譯:IFM 認為 K2 Horizon 在推理、數學、程式與代理任務上,每個尺寸級距都有頂尖表現。官方呈現了一批選定單項任務的比較;例如 0.9B、3.7B 與 7B 在若干數學、程式、函式呼叫及工具任務上勝過選定的同尺寸參考模型。不過,官方 3.7B 模型卡也提醒,基準協議可能不同。這些圖最適合讀成「廠商主張的任務亮點」,不是跨任務、跨環境的最終裁決。

IFM 的小模型比較圖,六個面板呈現 0.9B、3.7B、7B 在軟體工程、終端、工具使用、函式呼叫、程式與數學基準的自報成績
IFM 選取的基準顯示 0.9B、3.7B 與 7B 在若干數學、程式與工具任務上的亮點;比較協議與參考模型並不完全一致。圖/Institute of Foundation Models

外部評測把同一家族拉到兩端

截至 2026 年 9 月 15 日,AA 的 K2 Horizon 3.7B 頁面顯示 Intelligence Index 16,位居 tiny 開放權重類別第 1/49;0.9B 頁面則是 3 分、第 49/49。兩個 K2 分數都標為已完成的獨立評測,不是估算值。

AA 頁面指標K2 Horizon 3.7BK2 Horizon 0.9B
Intelligence Index163
Tiny 開放權重類別位置第 1/49第 49/49
整套評測輸出量176,817,175 tokens(頁面約 180M)59,591,388 tokens(頁面約 60M)
加權後每題輸出約 72,081 tokens約 32,259 tokens
標示 context window524,288131,072
資料為 2026 年 9 月 15 日頁面快照;排名與類別內容會隨新增評測而變動。來源:Artificial Analysis。
Artificial Analysis 的 K2 Horizon 3.7B 摘要卡,列出 Intelligence 16、速度與成本缺值、每題約 72k tokens
AA 對 K2 Horizon 3.7B 的摘要:Intelligence 16、每題約 72k tokens;速度與成本欄位沒有可用數據。圖/Artificial Analysis
Artificial Analysis 的 K2 Horizon 0.9B 摘要卡,列出 Intelligence 3、速度與成本缺值、每題約 32k tokens
同一套評測下,0.9B 的 Intelligence 只有 3、每題約 32k tokens;這與官方選定基準上的亮點形成明顯反差。圖/Artificial Analysis

為什麼同一家族會差這麼遠?因為兩邊其實回答不同問題。IFM 的圖表呈現選定的單項任務;AA 的 v4.3 Intelligence Index 方法把十項評測合成一個分數,權重分成代理任務 30%、程式 20%、一般能力 30%、科學推理 20%。這個版本不直接包含 IFM 圖表列出的 AIME、LiveCodeBench 與 GPQA,因此 0.9B 的低綜合分不能否定那些窄任務成績,只能反駁它已展現廣泛通用優勢。這套 Index 較能檢查廣度,卻仍以英文、文字任務為主,也不是手機或穿戴裝置的延遲、記憶體與耗電測試。

第一個煞車:3.7B 真的屬於 ≤4B 嗎?

這是本次 K2 Horizon 評測最容易被忽略、也最需要修正的地方。AA 把開放權重模型的 tiny 類別定義為總參數不超過 4B,頁面同時把 K2 Horizon 3.7B 的「Total parameters」寫成 3.7B;但 Hugging Face 官方模型 API對權重檔統計出的 BF16 參數總數是 5,058,255,360。

官方 technical appendix直接列出:核心 stored/active parameters 約 3.78B,若把 embeddings 算進去則都是 5.06B。差異也能從 官方 config驗算:詞彙表 250,624、hidden size 2,560,而且輸入 embedding 與輸出 head 沒有綁定。兩個矩陣各約 6.416 億參數;從 50.58 億扣掉兩者,剩下約 37.75 億,幾乎就是產品名裡的「3.7B」。換句話說,3.7B 是核心參數口徑,不是所有已儲存、推論時啟用的參數總數。

這不會讓 16 分憑空消失;那仍是 AA 對該 checkpoint 跑出的結果。真正受影響的是比較組:AA 自己把總參數定義為所有可訓練 weights 與 biases,並說 dense 模型的 active parameters 等於 total parameters。依這套定義,這款 dense 模型應如何留在 ≤4B 類別,需要 AA 公開解釋或修正。因此,「頁面顯示第 1/49」可以如實報導,「已證明是 4B 以下最強」則說得太早。

第二個煞車:49 不等於 49 個都完成獨立實測

我們檢查 AA 頁面在同一時間點嵌入的 49 個模型/設定條目,其中 44 個標為估算,只有 5 個已完成當前版本的獨立評測。兩個 K2 都屬於實測,這是加分;但「第 1/49」與「第 49/49」仍是把實測值和大量估算值一起排序的結果,不等於 49 個互異 checkpoint 在完全相同條件下都跑完一輪。

更公平的讀法是:0.9B 在 AA v4.3 的英文文字任務綜合分落在當時類別末位,這項反證不能被官方幾張選定單項亮點圖帶過;3.7B 則交出一個值得重視的高分,但它的類別冠軍仍受參數口徑與待實測對手影響。當更多估算值被真正評測取代,兩端名次都可能變動。

180M tokens 是輸出量訊號,不是能力或效率證明

3.7B 跑完整套評測輸出約 1.768 億 tokens,AA 頁面四捨五入為 180M;頁面顯示的同類中位數約 74M,前者約為 2.4 倍。這說明模型在該設定下輸出量很高,卻不能單靠 token 數推出「思考更深」或「效率更差」。IFM 的模型卡要求以 high reasoning effort、temperature 1.0、top_p 0.95 評測,並建議至少保留 32,768 個輸出 tokens;AA 的方法則允許依模型方建議設定不同的最大輸出,token 計數也可能來自供應商回報或 tokenizer 換算。這更接近「高推理預算下的能力測試」,不是固定成本效率賽。

還有一個資料缺口:當時 49 個模型/設定條目中,只有 5 個具有當前完整 Index 的非空 token 總量,因此 74M 並不是 49 個完整量測條目的中位數。AA 對兩個 K2 也沒有可用的速度與成本數據;摘要卡上的缺值不能被翻譯成「免費推論」。真正部署前,必須在同一硬體、同一量化、同一輸出上限下重測品質、延遲、記憶體、tokens 與成本。

「完整開放」也要按交付進度讀

IFM 的方向比只放權重更積極:官方 Hugging Face collection已有六個核心模型、量化或轉檔版本與多個資料集可以下載,這是實質進展。但截至 2026 年 9 月 15 日,0.9B 與 3.7B 的官方模型卡仍把技術報告與訓練程式碼列為進行中,預計月底交付。新聞稿所說的「完整」比較像發布承諾,而不是當天已全部到齊的工件清單。

這個差別很實際。權重與模型定義程式碼可供試跑;完整訓練程式碼、可複核的評測配方、資料配方、checkpoint 與技術報告若陸續補齊,則能提高第三方重現結果、定位異常與稽核資料污染的能力。對一個以「完全開放」為賣點的家族,交付進度本身就是產品的一部分。

AlphaLab 判讀:把結果、名次與產品價值分開

這份 K2 Horizon 評測最重要的結論,是參數量只代表模型容量的代理變數,綜合分數也只是任務品質的代理變數;使用者真正買單的是一條 Pareto frontier:在可接受品質下,延遲、記憶體、輸出量、成本與可控性是否同時划算。這也是為什麼一個 16 分、180M tokens 的模型,不能只靠「小」與「第一」兩個字就證明適合端側部署。

  1. 先承認有效訊號:3.7B 的 AA 分數是有價值的外部正面證據;0.9B 的低分則顯示官方單項優勢沒有自然轉化成 AA v4.3 英文文字任務上的廣泛能力。
  2. 再限制名次解讀:3.7B 的總參數口徑與 tiny 門檻衝突,而且多數同類條目仍是估算;冠軍是「目前頁面所示」,不是已封印的事實。
  3. 最後回到自己的任務:用 20~50 題真實工作樣本建立 Shadow Eval,在固定硬體與設定下,同時記錄成功率、端到端延遲、RAM/VRAM、輸出 tokens 與失敗型態。

接下來有兩個可被推翻的觀察點。第一,若 AA 按自己的 total-parameter 定義重分類,3.7B 應轉入 4B~40B 的 small 組,或公開一套能解釋例外的口徑;第二,若 IFM 在月底補齊報告與程式碼,第三方將更容易稽核與重現 IFM 自報的方法。至於 AA 的外部結果,後續評測還需要標明模型 revision,並用公開、一致的 harness 加入多語、端側延遲與記憶體測試。這兩件事比收藏一張榜首截圖更能驗證 K2 Horizon 的長期價值。

真正值得追蹤的不是 K2 Horizon 能不能守住一個序位,而是它能否在透明、可重現的同條件測試中,把「小模型」轉化為可量測的部署優勢。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。