跳到主要內容

NVIDIA Nemotron 3.5 Lightning:Agent 苦工模型的速度與代價(2026)

最後更新: ·
Nemotron 3.5 Lightning Agent 執行模型封面

2026 年 8 月 11 日,NVIDIA 在官方技術部落格發布了〈NVIDIA Nemotron 3.5 Lightning Delivers Fast, Accurate Specialized Task Execution for Long-Running Agents〉。Nemotron 3.5 Lightning 是一款 30B 級 MoE、每個 token 的前向運算約啟用 3B 參數的開放權重模型,主打低延遲工具執行、最長 1M context 與長時間 Agent 的高頻工作。真正值得注意的不是它又多拿了幾分,而是 NVIDIA 正把 AI Agent 的成本問題改寫成一個「誰該負責哪一步」的系統設計問題。

Nemotron 3.5 Lightning NVIDIA 官方發布文章截圖
NVIDIA 於 2026 年 8 月 11 日發布 Nemotron 3.5 Lightning;點圖可開啟官方原文。圖/NVIDIA

以下先還原 NVIDIA 想解決的 Agent 問題,再把架構、速度、品質與開放程度逐項對照官方模型卡和獨立測量,最後給出哪些工作適合交給 Lightning、哪些步驟仍應升級到更強模型的判斷。

Nemotron 3.5 Lightning 真正發布的是「分工」

一般人談 Agent,容易把注意力放在最聰明的模型:先規劃、再呼叫工具、讀取結果、修正錯誤,最後交付答案。但長時間 Agent 的帳單並不是只由最難的那一步決定。它可能要輪詢幾百次狀態、重排資料、檢查格式、執行命令、解析回傳,再把異常交回上層。若每一步都呼叫昂貴的前沿模型,系統很快就會被延遲與成本拖垮。

“Plans route up to the frontier, execution routes down to Lightning.”

中文:規劃交給前沿模型,執行則往下路由給 Lightning。

NVIDIA 官方發布文

因此,NVIDIA 的核心主張不是「Lightning 取代所有大模型」,而是把前沿模型留給拆題、策略與例外處理,再把大量可驗證、重複、時間敏感的步驟交給 Lightning。這與 Prime Agent 的持續改進 Harness 所揭示的方向一致:Agent 的品質不是單一模型屬性,而是模型、路由、工具、驗證器與記憶共同形成的結果。

NVIDIA 同時把 NeMo Switchyard 放進這張藍圖,讓路由器依任務、成本與延遲選擇模型。要分清楚的是:Switchyard 是獨立的路由層,Lightning 是其中一個執行候選;模型本身並不會憑空變成能長期規劃、保存狀態與自我修復的 Agent runtime。「長時間 Agent 模型」在這裡是工作分工定位,不是已證明的自主運作時長。

Nemotron 3.5 Lightning 的 30B 級 MoE,為何每個 token 約啟用 3B?

MoE(Mixture of Experts,混合專家)可以把模型想成一間擁有許多專科小組的公司。總公司保存全部能力,但每個 token 只派少數專家上工。NVIDIA 的公開 NVFP4 設定檔 顯示,模型共有 52 層,其中 23 層為 Mamba-2、23 層為 MoE、6 層為注意力層;MoE 區塊包含 128 個路由專家與 1 個共享專家,每個 token 選用 6 個路由專家。NVIDIA 使用 30B/3B 級標示;Artificial Analysis 則列出 31.6B/3.6B。公開資料沒有完整交代兩者精確計數差異,因此兩組數字都不應被誤讀為獨立審計結果。

Mamba-2 擅長以近似線性的成本處理長序列,注意力層負責需要精確關聯的位置,MoE 則用稀疏啟用換取較低的單步計算量。模型另有一層 multi-token prediction,讓一次前向運算可預測後續多個 token,為推測解碼創造加速空間。NVIDIA 也同時提供 BF16 與 NVFP4 權重;官方量化文件 把模型大小約從 66GB 壓到 22GB。不過「檔案變小」與「你的服務一定快四倍」是兩回事,後者仍取決於 GPU、推論引擎、批次、提示長度與併發。

官方 BF16 模型卡 表示預訓練使用超過 20T tokens,之後再以監督式微調與多環境 GRPO 強化學習補上終端機、工具與程式任務;BF16 主要服務客製化與後訓練,NVFP4 則是部署 checkpoint。這使「可專門化的執行模型」比「縮小版通用前沿模型」更接近它的真實定位。

近 670 tokens/s 很快,但不是部署保證

發布後最吸睛的數字,是 Artificial Analysis 在一個預發布、私有的 DeepInfra 端點上,以最終 NVFP4 權重測得接近 670 tokens/s 的中位輸出解碼速度。這是有價值的第三方測量,因為它顯示 Lightning 在特定服務堆疊上可以站到小型開放權重模型的速度前緣;但測試沒有公開卡型、卡數、批次與 serving runtime,因此它不是本機速度承諾,也不能與 1M context 綁成「百萬 token 下仍有 670 tokens/s」的敘述。

Nemotron 3.5 Lightning Intelligence Index 與輸出速度比較圖
Artificial Analysis 測得 Lightning 的 Intelligence Index 為 24,預發布私有 DeepInfra NVFP4 端點的中位輸出速度接近 670 tokens/s。這是特定端點的測量,不含硬體與批次細節。圖/NVIDIA 官方發布文;資料與測量/Artificial Analysis

更重要的是,tokens/s 只計算模型開始輸出後的速度。使用者真正感受到的還包括首 token 延遲、提示處理、工具等待、重試、驗證與排隊。若模型答得快卻需要多次修正,整體任務反而更慢。這也解釋了為什麼 Cloudflare Kitesurf 的 Agent-first 瀏覽器實驗HyperProbe 的 Runtime Evidence 都把觀測與回饋迴路放在模型之外:端到端成功率才是產品指標。

品質帳本:Intelligence Index 24 代表什麼?

Artificial Analysis v4.1.1 的 Intelligence Index 給 Lightning 24 分,較 Nemotron 3 Nano 的 15 分進步 9 分,也與 gpt-oss-120b 的 24 分相當。然而同一篇分析中的 Qwen3.6 35B A3B(reasoning)為 32 分,Muse Glimmer(high)為 35 分;Gemini 3.5 Flash-Lite 在相近每任務時間取得 37 分,GPT-5.6 Luna(max)在該分析發布時則是 52 分、每任務不到兩分鐘。結論很清楚:Lightning 把速度與可部署性推到前面,但沒有進入品質前沿。

Agent 類任務也不能只看相對進步。Lightning 在 Terminal-Bench v2.1 約 24%,雖然是 Nano 約 7% 的三倍多,絕對成功率仍意味著多數終端任務沒有完成;GDPval-AA v2 的 Elo 約 824,也低於該評測的人類專家 1000 錨點。NVIDIA 自行執行的 BF16 比較表同樣很誠實:Qwen3.6 35B A3B 在 SWE-bench Verified 為 70.12、Lightning 為 51.56;Terminal-Bench 為 44.38 對 24.58;Lightning 明顯領先的項目則是 IFBench,71.88 對 63.71。這些分數來自 NVIDIA 的統一 harness,適合看相對輪廓,不能當成所有部署環境的保證。

Nemotron 3.5 Lightning PinchBench 準確率與 GPU 時數比較圖
NVIDIA 自家 PinchBench 圖把 Lightning 放在約 85% 準確率、每 1 萬任務約 17 H100 GPU-hours 的位置。Qwen3.6 35B A3B 準確率較高但耗時也較多;圖中數字應視為供應商測量。圖/NVIDIA

上圖還有一個容易被忽略的口徑問題:NVIDIA 發布文的 PinchBench 圖約為 86%,卻沒有交代該圖使用的精度與完整 serving stack;模型卡另列 BF16 85.37、NVFP4 83.43。另一方面,Artificial Analysis 的近 670 tokens/s 圖才明確綁定最終 NVFP4 權重與私有預發布 DeepInfra 端點。因此,不能把 86% 與 670 tokens/s 當成同一次測試。官方 重現指南 也提醒,服務配置對分數的影響可能與評測配置一樣大。

1M context 與「完全開放」的兩道但書

1M 是支援上限,不是每種精度與端點的共同預設

NVFP4 公開設定把最大位置長度設為 1,048,576,其模型卡稱 H100 與 GB200 的 serving 範例預設可開完整 1M,但也提醒記憶體不足或高併發時可能必須下調。BF16 則不同:設定檔預設為 262,144,模型卡寫明單張 H100 採 256K;其明確的完整 1M vLLM 範例使用 8 張 H100 或 1 張 GB200。因此,準確說法是「最高支援 1M,但可用配置取決於 checkpoint、精度、硬體、快取與併發」,不是所有變體都共享同一項單卡預設。NVIDIA 在 Base-BF16 模型卡公布的 RULER 1M 為 69.62;這不是最終 NVFP4 instruct checkpoint 的 Agent 工作負載結果,也沒有獨立證據證明它在完整百萬 token 中能維持可靠工具決策。

開放程度很高,但不是完整可重現

Lightning 的 BF16、NVFP4 權重、訓練與評測配方,以及大量資料集都已公開;客製化的 OpenMDW 1.1 也允許商業使用,但要求保留來源與授權聲明,包含智慧財產訴訟終止等條款,且不替使用者清理模型材料中的第三方權利。這比只開放 API 更透明,也比只丟權重更接近一套工程配方。

然而,官方模型卡同時列出需申請的資料、第三方私有資料與 NVIDIA 內部資料;官方 Nemotron repository 更明示,模型卡分數使用了額外專有資料。因此,最精確的評價是「開放權重、相當多的資料資產與參考配方」,不是「任何人只靠已釋出的資料就能重建同一 checkpoint」。這個差異對研究重現、商業法務與資料治理都很重要。

Reddit 的 r/LocalLLaMA 發布串 在發布後累積數百票與大量留言,說明開放權重社群確實關注這種「較小啟用參數規模+長 context+高速度」組合;但票數會浮動,也只代表注意力,不是品質證據。真正的採用訊號要看公開端點價格、本機實測、工作負載成功率與後續微調生態。

AlphaLab 判斷:價值在路由經濟,不在取代前沿模型

我們同意 NVIDIA 對問題的定義:Agent 的瓶頸正在從「單次回答夠不夠聰明」移向「整條任務鏈能否以合理成本完成」。能力更強的模型若每一步都昂貴又慢,可能輸給一套把能力較弱但成本較低的模型放在正確位置、並以測試與升級機制保護的系統。Lightning 的價值,就在它讓這個執行層多了一個更有競爭力的速度/成本選項。

但我們不接受三種延伸推論:第一,近 670 tokens/s 不等於所有硬體上的端到端速度;第二,1M 容量不等於百萬 token 中的穩定推理品質;第三,開放大量資產不等於完整資料可重現。NVIDIA 同時是 GPU、推論軟體與 Agent 路由產品的供應商,當然有動機把效率問題描述成一整套 NVIDIA stack 的優勢。這不會讓測量失效,卻要求讀者把模型能力、端點工程與平台銷售主張分開。

更深一層看,長時間 Agent 的可靠性來自可驗證性。格式轉換能用 schema 驗證,程式修改能跑測試,搜尋能檢查引用,資料庫寫入能做權限與回滾;尤其當結果無法被低成本驗證時,模型品質差距會迅速放大。這也是 AgentOPSD 的步驟信用分配 值得延伸閱讀的原因:系統必須知道哪一步造成失敗,才能把工作交給更強模型,而不是盲目重跑。

該怎麼用:先建升級閘門,再選便宜模型

工作類型建議模型層級必要保護
目標拆解、跨域規劃、不可逆決策前沿模型人工批准、權限隔離、完整紀錄
低風險、可驗證的高頻工具呼叫、資料整理、狀態輪詢、格式化Lightning 類執行模型schema、單元測試、超時、重試上限
結果驗證與例外處理規則/專用模型;失敗時升級置信閾值、交叉檢查、可回滾

實作時,不要先問「Lightning 能不能取代目前模型」,而要從過去日誌抽出 30–50 個真實任務,標記每一步是否可自動驗證,再比較任務成功率、重試次數、首 token 延遲、P95 完成時間、總輸出 token、GPU 時數與升級率。若便宜模型在可驗證步驟成功,遇到模糊或高風險案例又能自動升級,它才真正降低了每個成功任務的成本。若只是把昂貴模型換掉,卻增加重跑與人工救火,tokens/s 再漂亮也沒有意義。

對想在本機跑大模型的讀者,Swiftlet 80B 的 Apple Silicon 實測解讀 提供了另一個重要對照:參數能放進記憶體,只回答了「跑不跑得動」,沒有回答「品質、吞吐與工作流是否值得」。Nemotron 3.5 Lightning 也應用同一把尺。

接著閱讀

左右滑動查看更多推薦

一句話結論:Nemotron 3.5 Lightning 是值得測的 Agent 執行層工作馬,不是新的品質王者;先用你自己的可驗證任務做路由實驗,再決定它能替前沿模型接下多少苦工。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週一封,第一時間收到新文章與投資觀察。

我們不會 spam,隨時可退訂。