2026 年 8 月 11 日,NVIDIA 在官方技術部落格發布了〈NVIDIA Nemotron 3.5 Lightning Delivers Fast, Accurate Specialized Task Execution for Long-Running Agents〉。Nemotron 3.5 Lightning 是一款 30B 級 MoE、每個 token 的前向運算約啟用 3B 參數的開放權重模型,主打低延遲工具執行、最長 1M context 與長時間 Agent 的高頻工作。真正值得注意的不是它又多拿了幾分,而是 NVIDIA 正把 AI Agent 的成本問題改寫成一個「誰該負責哪一步」的系統設計問題。

以下先還原 NVIDIA 想解決的 Agent 問題,再把架構、速度、品質與開放程度逐項對照官方模型卡和獨立測量,最後給出哪些工作適合交給 Lightning、哪些步驟仍應升級到更強模型的判斷。
Nemotron 3.5 Lightning 真正發布的是「分工」
一般人談 Agent,容易把注意力放在最聰明的模型:先規劃、再呼叫工具、讀取結果、修正錯誤,最後交付答案。但長時間 Agent 的帳單並不是只由最難的那一步決定。它可能要輪詢幾百次狀態、重排資料、檢查格式、執行命令、解析回傳,再把異常交回上層。若每一步都呼叫昂貴的前沿模型,系統很快就會被延遲與成本拖垮。
“Plans route up to the frontier, execution routes down to Lightning.”
中文:規劃交給前沿模型,執行則往下路由給 Lightning。
NVIDIA 官方發布文
因此,NVIDIA 的核心主張不是「Lightning 取代所有大模型」,而是把前沿模型留給拆題、策略與例外處理,再把大量可驗證、重複、時間敏感的步驟交給 Lightning。這與 Prime Agent 的持續改進 Harness 所揭示的方向一致:Agent 的品質不是單一模型屬性,而是模型、路由、工具、驗證器與記憶共同形成的結果。
NVIDIA 同時把 NeMo Switchyard 放進這張藍圖,讓路由器依任務、成本與延遲選擇模型。要分清楚的是:Switchyard 是獨立的路由層,Lightning 是其中一個執行候選;模型本身並不會憑空變成能長期規劃、保存狀態與自我修復的 Agent runtime。「長時間 Agent 模型」在這裡是工作分工定位,不是已證明的自主運作時長。
Nemotron 3.5 Lightning 的 30B 級 MoE,為何每個 token 約啟用 3B?
MoE(Mixture of Experts,混合專家)可以把模型想成一間擁有許多專科小組的公司。總公司保存全部能力,但每個 token 只派少數專家上工。NVIDIA 的公開 NVFP4 設定檔 顯示,模型共有 52 層,其中 23 層為 Mamba-2、23 層為 MoE、6 層為注意力層;MoE 區塊包含 128 個路由專家與 1 個共享專家,每個 token 選用 6 個路由專家。NVIDIA 使用 30B/3B 級標示;Artificial Analysis 則列出 31.6B/3.6B。公開資料沒有完整交代兩者精確計數差異,因此兩組數字都不應被誤讀為獨立審計結果。
Mamba-2 擅長以近似線性的成本處理長序列,注意力層負責需要精確關聯的位置,MoE 則用稀疏啟用換取較低的單步計算量。模型另有一層 multi-token prediction,讓一次前向運算可預測後續多個 token,為推測解碼創造加速空間。NVIDIA 也同時提供 BF16 與 NVFP4 權重;官方量化文件 把模型大小約從 66GB 壓到 22GB。不過「檔案變小」與「你的服務一定快四倍」是兩回事,後者仍取決於 GPU、推論引擎、批次、提示長度與併發。
官方 BF16 模型卡 表示預訓練使用超過 20T tokens,之後再以監督式微調與多環境 GRPO 強化學習補上終端機、工具與程式任務;BF16 主要服務客製化與後訓練,NVFP4 則是部署 checkpoint。這使「可專門化的執行模型」比「縮小版通用前沿模型」更接近它的真實定位。
近 670 tokens/s 很快,但不是部署保證
發布後最吸睛的數字,是 Artificial Analysis 在一個預發布、私有的 DeepInfra 端點上,以最終 NVFP4 權重測得接近 670 tokens/s 的中位輸出解碼速度。這是有價值的第三方測量,因為它顯示 Lightning 在特定服務堆疊上可以站到小型開放權重模型的速度前緣;但測試沒有公開卡型、卡數、批次與 serving runtime,因此它不是本機速度承諾,也不能與 1M context 綁成「百萬 token 下仍有 670 tokens/s」的敘述。

更重要的是,tokens/s 只計算模型開始輸出後的速度。使用者真正感受到的還包括首 token 延遲、提示處理、工具等待、重試、驗證與排隊。若模型答得快卻需要多次修正,整體任務反而更慢。這也解釋了為什麼 Cloudflare Kitesurf 的 Agent-first 瀏覽器實驗 與 HyperProbe 的 Runtime Evidence 都把觀測與回饋迴路放在模型之外:端到端成功率才是產品指標。
品質帳本:Intelligence Index 24 代表什麼?
Artificial Analysis v4.1.1 的 Intelligence Index 給 Lightning 24 分,較 Nemotron 3 Nano 的 15 分進步 9 分,也與 gpt-oss-120b 的 24 分相當。然而同一篇分析中的 Qwen3.6 35B A3B(reasoning)為 32 分,Muse Glimmer(high)為 35 分;Gemini 3.5 Flash-Lite 在相近每任務時間取得 37 分,GPT-5.6 Luna(max)在該分析發布時則是 52 分、每任務不到兩分鐘。結論很清楚:Lightning 把速度與可部署性推到前面,但沒有進入品質前沿。
Agent 類任務也不能只看相對進步。Lightning 在 Terminal-Bench v2.1 約 24%,雖然是 Nano 約 7% 的三倍多,絕對成功率仍意味著多數終端任務沒有完成;GDPval-AA v2 的 Elo 約 824,也低於該評測的人類專家 1000 錨點。NVIDIA 自行執行的 BF16 比較表同樣很誠實:Qwen3.6 35B A3B 在 SWE-bench Verified 為 70.12、Lightning 為 51.56;Terminal-Bench 為 44.38 對 24.58;Lightning 明顯領先的項目則是 IFBench,71.88 對 63.71。這些分數來自 NVIDIA 的統一 harness,適合看相對輪廓,不能當成所有部署環境的保證。

上圖還有一個容易被忽略的口徑問題:NVIDIA 發布文的 PinchBench 圖約為 86%,卻沒有交代該圖使用的精度與完整 serving stack;模型卡另列 BF16 85.37、NVFP4 83.43。另一方面,Artificial Analysis 的近 670 tokens/s 圖才明確綁定最終 NVFP4 權重與私有預發布 DeepInfra 端點。因此,不能把 86% 與 670 tokens/s 當成同一次測試。官方 重現指南 也提醒,服務配置對分數的影響可能與評測配置一樣大。
1M context 與「完全開放」的兩道但書
1M 是支援上限,不是每種精度與端點的共同預設
NVFP4 公開設定把最大位置長度設為 1,048,576,其模型卡稱 H100 與 GB200 的 serving 範例預設可開完整 1M,但也提醒記憶體不足或高併發時可能必須下調。BF16 則不同:設定檔預設為 262,144,模型卡寫明單張 H100 採 256K;其明確的完整 1M vLLM 範例使用 8 張 H100 或 1 張 GB200。因此,準確說法是「最高支援 1M,但可用配置取決於 checkpoint、精度、硬體、快取與併發」,不是所有變體都共享同一項單卡預設。NVIDIA 在 Base-BF16 模型卡公布的 RULER 1M 為 69.62;這不是最終 NVFP4 instruct checkpoint 的 Agent 工作負載結果,也沒有獨立證據證明它在完整百萬 token 中能維持可靠工具決策。
開放程度很高,但不是完整可重現
Lightning 的 BF16、NVFP4 權重、訓練與評測配方,以及大量資料集都已公開;客製化的 OpenMDW 1.1 也允許商業使用,但要求保留來源與授權聲明,包含智慧財產訴訟終止等條款,且不替使用者清理模型材料中的第三方權利。這比只開放 API 更透明,也比只丟權重更接近一套工程配方。
然而,官方模型卡同時列出需申請的資料、第三方私有資料與 NVIDIA 內部資料;官方 Nemotron repository 更明示,模型卡分數使用了額外專有資料。因此,最精確的評價是「開放權重、相當多的資料資產與參考配方」,不是「任何人只靠已釋出的資料就能重建同一 checkpoint」。這個差異對研究重現、商業法務與資料治理都很重要。
Reddit 的 r/LocalLLaMA 發布串 在發布後累積數百票與大量留言,說明開放權重社群確實關注這種「較小啟用參數規模+長 context+高速度」組合;但票數會浮動,也只代表注意力,不是品質證據。真正的採用訊號要看公開端點價格、本機實測、工作負載成功率與後續微調生態。
AlphaLab 判斷:價值在路由經濟,不在取代前沿模型
我們同意 NVIDIA 對問題的定義:Agent 的瓶頸正在從「單次回答夠不夠聰明」移向「整條任務鏈能否以合理成本完成」。能力更強的模型若每一步都昂貴又慢,可能輸給一套把能力較弱但成本較低的模型放在正確位置、並以測試與升級機制保護的系統。Lightning 的價值,就在它讓這個執行層多了一個更有競爭力的速度/成本選項。
但我們不接受三種延伸推論:第一,近 670 tokens/s 不等於所有硬體上的端到端速度;第二,1M 容量不等於百萬 token 中的穩定推理品質;第三,開放大量資產不等於完整資料可重現。NVIDIA 同時是 GPU、推論軟體與 Agent 路由產品的供應商,當然有動機把效率問題描述成一整套 NVIDIA stack 的優勢。這不會讓測量失效,卻要求讀者把模型能力、端點工程與平台銷售主張分開。
更深一層看,長時間 Agent 的可靠性來自可驗證性。格式轉換能用 schema 驗證,程式修改能跑測試,搜尋能檢查引用,資料庫寫入能做權限與回滾;尤其當結果無法被低成本驗證時,模型品質差距會迅速放大。這也是 AgentOPSD 的步驟信用分配 值得延伸閱讀的原因:系統必須知道哪一步造成失敗,才能把工作交給更強模型,而不是盲目重跑。
該怎麼用:先建升級閘門,再選便宜模型
| 工作類型 | 建議模型層級 | 必要保護 |
|---|---|---|
| 目標拆解、跨域規劃、不可逆決策 | 前沿模型 | 人工批准、權限隔離、完整紀錄 |
| 低風險、可驗證的高頻工具呼叫、資料整理、狀態輪詢、格式化 | Lightning 類執行模型 | schema、單元測試、超時、重試上限 |
| 結果驗證與例外處理 | 規則/專用模型;失敗時升級 | 置信閾值、交叉檢查、可回滾 |
實作時,不要先問「Lightning 能不能取代目前模型」,而要從過去日誌抽出 30–50 個真實任務,標記每一步是否可自動驗證,再比較任務成功率、重試次數、首 token 延遲、P95 完成時間、總輸出 token、GPU 時數與升級率。若便宜模型在可驗證步驟成功,遇到模糊或高風險案例又能自動升級,它才真正降低了每個成功任務的成本。若只是把昂貴模型換掉,卻增加重跑與人工救火,tokens/s 再漂亮也沒有意義。
對想在本機跑大模型的讀者,Swiftlet 80B 的 Apple Silicon 實測解讀 提供了另一個重要對照:參數能放進記憶體,只回答了「跑不跑得動」,沒有回答「品質、吞吐與工作流是否值得」。Nemotron 3.5 Lightning 也應用同一把尺。
接著閱讀
左右滑動查看更多推薦
一句話結論:Nemotron 3.5 Lightning 是值得測的 Agent 執行層工作馬,不是新的品質王者;先用你自己的可驗證任務做路由實驗,再決定它能替前沿模型接下多少苦工。






