跳到主要內容

Naive-N0.5-Flash:309B 開放權重與百萬上下文,哪些證據站得住?(2026)

最後更新: ·
Naive-N0.5-Flash 百萬上下文開放權重模型的 AlphaLab AI 敘事主圖

2026 年 9 月 27 日,NaiveAI 團隊在官網發布了〈Naive-N0.5-Flash: Building Frontier AI with AI〉,介紹新模型 Naive-N0.5-Flash。它把 309B 總參數、15.5B 單次啟動參數、百萬 token 上下文與 AI 參與研發,放進同一個故事。最值得追問的是:這些數字各自證明了什麼,又有哪些仍是團隊自己的測量?

Naive-N0.5-Flash 原始研究文章首頁截圖
點圖閱讀 NaiveAI 原文。圖/NaiveAI 官網截圖

這篇原文同時是模型發布、推論系統案例,以及 AI 參與模型研發的宣言。先看可直接查到的權重與架構,再看速度、跑分和「AI 造 AI」案例的證據邊界,最後才決定它適合什麼工作。

Naive-N0.5-Flash 已發布什麼?

在 Hugging Face 模型頁,可以看到 Naive-N0.5-Flash 的模型檔案、模型卡、設定檔與 MIT 授權檔。設定檔把最大位置數設為 1,048,576;模型卡列出 48 層、309B 總參數及 15.5B 啟動參數。它由 小米 MiMo-V2.5-Base 延伸而來,這個來源模型也標示 MIT 授權。這些公開檔案足以確認「有可取得的開放權重」與「百萬 token 的模型設定」;長距離找資訊的準確率仍要靠任務測試。

MoE 的 15.5B 是每次推論參與計算的參數量,309B 則是整套權重的規模。前者有助理解單步計算,後者仍影響下載、儲存與載入;不能把「啟動 15.5B」直接讀成「像 15.5B 模型一樣容易本機部署」。

百萬上下文:省下注意力計算,仍要處理整段歷史

原文說明,NaiveAI 把原本 MiMo-V2.5-Base 少數全域注意力層,換成滑動窗口注意力(SWA)與 DeepSeek Sparse Attention(DSA)的組合。模型卡列出 39 層 SWA、9 層 DSA:SWA 看附近 128 個 token,DSA 的主幹注意力挑出 2,048 個位置。這種選擇能減少主幹逐點計算,但索引器仍需檢視長歷史。

Although the indexer still scans the full history and the full KV cache is retained,

中文:雖然索引器仍要掃描完整歷史,完整的 KV 快取也仍須保留,

NaiveAI Team,〈Naive-N0.5-Flash: Building Frontier AI with AI〉

這句原文是理解「稀疏」的關鍵:它針對注意力運算與讀取做取捨,沒有讓長上下文的儲存需求消失。對長代理任務來說,真正要測的是早期指令能否被找回、跨多處線索能否正確合併,以及上下文變長時延遲如何上升。單看 1M 的設定值回答不了這三題。

Naive-N0.5-Flash 混合 SWA 與 DSA 注意力架構圖
原文架構圖:左側為五層 SWA 配一層 DSA 的主要配置;右側顯示 DSA 索引與選取位置。圖/NaiveAI

速度與跑分:原文提供的是有條件的內部結果

NaiveAI 的程式任務圖表列出多個 benchmark,並交代了 Claude Code 2.1.207、1M 上下文、temperature 1.0、top-p 0.95 與基本檔案/Bash 工具等設定。這使讀者知道數字從哪種測法而來;圖中的 Naive-N0.5-Flash 成績仍由發布團隊產生,其他模型的比較值又來自不同來源。把多個 harness、版本與日期的結果放在同一張圖,適合做線索,還不能當成相同條件下的勝負。

Naive-N0.5-Flash 官方程式能力 benchmark 圖表
原文的程式任務比較圖。各列與對手分數來源需逐項對照,圖中 Naive-N0.5-Flash 的數值為團隊自測。圖/NaiveAI

最醒目的速度數字是 NaiveRT 的 2,122 tokens/s。原文限定它是 8 張 GPU 上、41 個 HTML/SVG 生成請求之中「表現最好的一秒」的單串流解碼峰值,關閉 thinking 並排除 prefill。它不是一般使用者的持續輸出速度,也不是單張消費級顯卡的效能。團隊另稱同一系統的一輪投機解碼由 SGLang 的 12.3 ms 降至 3.4 ms;這個對照同樣需要公開腳本與環境才能獨立檢查。

NaiveRT 2122 tokens 每秒峰值與投機解碼延遲圖
原文速度圖:2,122 tokens/s 是 8 張 GPU 的最佳一秒解碼峰值,不含 prefill。圖/NaiveAI

原文一面稱 NaiveRT 開源,一面寫明相關程式與基準腳本會在 10 月 12 日前提供。本文於 2026 年 9 月 28 日檢查其 NaiveRT GitHub 連結 時,該位址回傳 404。這不影響目前可下載的模型權重,卻表示上述速度結果在這個時間點還缺少作者承諾的公開重現材料。

AI 參與研發:案例有啟發,因果仍需拆開

NaiveAI 描述研究員設定方向、限制與驗收標準,模型寫程式、跑實驗、分析結果。NaiveRT 案例列出六天內 151 次優化嘗試,其中 63 次採納、71 次失敗或回退、17 次為備選探索。這個紀錄比一句「AI 自己發明模型」具體得多,也說明人類仍主導目標與關鍵取捨。

A faster microbenchmark is not a faster model

中文:微型基準測試更快,不代表整個模型更快。

NaiveAI Team,〈Naive-N0.5-Flash: Building Frontier AI with AI〉

原文舉的例子是:某個短上下文捷徑在 200 token 時省下約 3 微秒,到 2,200 token 反而慢約 3 微秒,因此未採納。這是一個有用的工程判準:應驗收真實端到端路徑,而非把單個 kernel 的改良直接換算成使用者節省的時間。若要判斷六天是否更快,還需要相同人力、算力與既有程式碼條件下的對照實驗。

另一個 AutoWM 案例稱,模型在研究員規定的目標與算力下,經 400 小時、15 輪主要實驗,在 WorldArena-1 Track 1 協定取得 77.43,超過團隊引用的先前公開 73.64。這是 NaiveAI 對自己流程與結果的陳述;WorldArena 的公開評測方法可以查看,但不能僅由圖表推知這個成果已由榜單方獨立登錄、也不能推知模型在其他研發領域會同樣成功。

NaiveAI AutoWM 世界模型研發進程圖
原文 AutoWM 實驗進程圖;77.43 為 NaiveAI 報告的 WorldArena-1 Track 1 結果。圖/NaiveAI

我的判讀:先把可下載、可測量、可泛化分開

我同意什麼

這次發布最紮實的一步,是把模型權重、授權檔、設定檔與結構細節公開。以 SWA 處理近處、以 DSA 挑遠處資訊,是針對百萬 token 推論成本的清楚工程選擇;團隊也坦白指出索引仍掃全史、KV 快取仍保留。這讓外部開發者有機會測它,而不是只看一份產品簡報。

我存疑什麼

「能接 1M」與「在 1M 找得到、答得對、花得值得」是三個不同問題。速度圖的峰值、程式 benchmark 的比較、AutoWM 的研究成績都由同一發布方提供;它們能形成待驗證假說,還不足以推出「開放模型已全面追上閉源模型」或「AI 已可自主打造下一代 AI」。當訓練資料、算力、測試環境與人類決策同時改變,單一案例也無法把功勞精確分配給模型本身。

如果你要試,先做三個對照

第一,用同一套長任務材料,分別測短、中、接近上限的上下文,記錄關鍵事實找回率與錯引位置;第二,固定硬體與解碼設定,分開測 prefill、持續輸出與總完成時間;第三,把 Naive-N0.5-Flash 與 MiMo-V2.5-Base 放在相同工作流中比較,才能看出這次架構與後續訓練究竟帶來多少實際差異。現在最合理的結論是:這是一個值得檢驗的開放權重模型,並非已經被外部驗證的百萬 token 工作流答案。

接著閱讀

左右滑動查看更多推薦

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。