2026 年 9 月 27 日,NaiveAI 團隊在官網發布了〈Naive-N0.5-Flash: Building Frontier AI with AI〉,介紹新模型 Naive-N0.5-Flash。它把 309B 總參數、15.5B 單次啟動參數、百萬 token 上下文與 AI 參與研發,放進同一個故事。最值得追問的是:這些數字各自證明了什麼,又有哪些仍是團隊自己的測量?

這篇原文同時是模型發布、推論系統案例,以及 AI 參與模型研發的宣言。先看可直接查到的權重與架構,再看速度、跑分和「AI 造 AI」案例的證據邊界,最後才決定它適合什麼工作。
Naive-N0.5-Flash 已發布什麼?
在 Hugging Face 模型頁,可以看到 Naive-N0.5-Flash 的模型檔案、模型卡、設定檔與 MIT 授權檔。設定檔把最大位置數設為 1,048,576;模型卡列出 48 層、309B 總參數及 15.5B 啟動參數。它由 小米 MiMo-V2.5-Base 延伸而來,這個來源模型也標示 MIT 授權。這些公開檔案足以確認「有可取得的開放權重」與「百萬 token 的模型設定」;長距離找資訊的準確率仍要靠任務測試。
MoE 的 15.5B 是每次推論參與計算的參數量,309B 則是整套權重的規模。前者有助理解單步計算,後者仍影響下載、儲存與載入;不能把「啟動 15.5B」直接讀成「像 15.5B 模型一樣容易本機部署」。
百萬上下文:省下注意力計算,仍要處理整段歷史
原文說明,NaiveAI 把原本 MiMo-V2.5-Base 少數全域注意力層,換成滑動窗口注意力(SWA)與 DeepSeek Sparse Attention(DSA)的組合。模型卡列出 39 層 SWA、9 層 DSA:SWA 看附近 128 個 token,DSA 的主幹注意力挑出 2,048 個位置。這種選擇能減少主幹逐點計算,但索引器仍需檢視長歷史。
Although the indexer still scans the full history and the full KV cache is retained,
中文:雖然索引器仍要掃描完整歷史,完整的 KV 快取也仍須保留,
NaiveAI Team,〈Naive-N0.5-Flash: Building Frontier AI with AI〉
這句原文是理解「稀疏」的關鍵:它針對注意力運算與讀取做取捨,沒有讓長上下文的儲存需求消失。對長代理任務來說,真正要測的是早期指令能否被找回、跨多處線索能否正確合併,以及上下文變長時延遲如何上升。單看 1M 的設定值回答不了這三題。

速度與跑分:原文提供的是有條件的內部結果
NaiveAI 的程式任務圖表列出多個 benchmark,並交代了 Claude Code 2.1.207、1M 上下文、temperature 1.0、top-p 0.95 與基本檔案/Bash 工具等設定。這使讀者知道數字從哪種測法而來;圖中的 Naive-N0.5-Flash 成績仍由發布團隊產生,其他模型的比較值又來自不同來源。把多個 harness、版本與日期的結果放在同一張圖,適合做線索,還不能當成相同條件下的勝負。

最醒目的速度數字是 NaiveRT 的 2,122 tokens/s。原文限定它是 8 張 GPU 上、41 個 HTML/SVG 生成請求之中「表現最好的一秒」的單串流解碼峰值,關閉 thinking 並排除 prefill。它不是一般使用者的持續輸出速度,也不是單張消費級顯卡的效能。團隊另稱同一系統的一輪投機解碼由 SGLang 的 12.3 ms 降至 3.4 ms;這個對照同樣需要公開腳本與環境才能獨立檢查。

原文一面稱 NaiveRT 開源,一面寫明相關程式與基準腳本會在 10 月 12 日前提供。本文於 2026 年 9 月 28 日檢查其 NaiveRT GitHub 連結 時,該位址回傳 404。這不影響目前可下載的模型權重,卻表示上述速度結果在這個時間點還缺少作者承諾的公開重現材料。
AI 參與研發:案例有啟發,因果仍需拆開
NaiveAI 描述研究員設定方向、限制與驗收標準,模型寫程式、跑實驗、分析結果。NaiveRT 案例列出六天內 151 次優化嘗試,其中 63 次採納、71 次失敗或回退、17 次為備選探索。這個紀錄比一句「AI 自己發明模型」具體得多,也說明人類仍主導目標與關鍵取捨。
A faster microbenchmark is not a faster model
中文:微型基準測試更快,不代表整個模型更快。
NaiveAI Team,〈Naive-N0.5-Flash: Building Frontier AI with AI〉
原文舉的例子是:某個短上下文捷徑在 200 token 時省下約 3 微秒,到 2,200 token 反而慢約 3 微秒,因此未採納。這是一個有用的工程判準:應驗收真實端到端路徑,而非把單個 kernel 的改良直接換算成使用者節省的時間。若要判斷六天是否更快,還需要相同人力、算力與既有程式碼條件下的對照實驗。
另一個 AutoWM 案例稱,模型在研究員規定的目標與算力下,經 400 小時、15 輪主要實驗,在 WorldArena-1 Track 1 協定取得 77.43,超過團隊引用的先前公開 73.64。這是 NaiveAI 對自己流程與結果的陳述;WorldArena 的公開評測方法可以查看,但不能僅由圖表推知這個成果已由榜單方獨立登錄、也不能推知模型在其他研發領域會同樣成功。

我的判讀:先把可下載、可測量、可泛化分開
我同意什麼
這次發布最紮實的一步,是把模型權重、授權檔、設定檔與結構細節公開。以 SWA 處理近處、以 DSA 挑遠處資訊,是針對百萬 token 推論成本的清楚工程選擇;團隊也坦白指出索引仍掃全史、KV 快取仍保留。這讓外部開發者有機會測它,而不是只看一份產品簡報。
我存疑什麼
「能接 1M」與「在 1M 找得到、答得對、花得值得」是三個不同問題。速度圖的峰值、程式 benchmark 的比較、AutoWM 的研究成績都由同一發布方提供;它們能形成待驗證假說,還不足以推出「開放模型已全面追上閉源模型」或「AI 已可自主打造下一代 AI」。當訓練資料、算力、測試環境與人類決策同時改變,單一案例也無法把功勞精確分配給模型本身。
如果你要試,先做三個對照
第一,用同一套長任務材料,分別測短、中、接近上限的上下文,記錄關鍵事實找回率與錯引位置;第二,固定硬體與解碼設定,分開測 prefill、持續輸出與總完成時間;第三,把 Naive-N0.5-Flash 與 MiMo-V2.5-Base 放在相同工作流中比較,才能看出這次架構與後續訓練究竟帶來多少實際差異。現在最合理的結論是:這是一個值得檢驗的開放權重模型,並非已經被外部驗證的百萬 token 工作流答案。
接著閱讀
左右滑動查看更多推薦






