跳到主要內容

Qwen3.8-27B 深度解讀:52 分背後,本機模型真的跨級了嗎?(2026)

最後更新: ·
Qwen3.8-27B 開放權重官方太空視覺,搭配 1.63 億 TOKEN、93% 推理的評測重點

2026 年 8 月 14 日,Qwen 團隊透過 X 宣布開放 Qwen3.8-27B 權重,並同步更新 Hugging Face 上的〈Qwen3.8-27B〉模型卡。這是一個 Apache 2.0、約 278 億參數的 dense 視覺語言模型;截至 8 月 18 日,Artificial Analysis 頁面顯示 52 分,使它在 4B–40B 總參數的 open-weight 分組暫居第一。

Qwen3.8-27B Hugging Face 官方模型卡,顯示 Apache 2.0 授權與模型資訊
Qwen3.8-27B 官方 Hugging Face 模型卡。HF safetensors metadata 計為 27,781,427,952 個參數,頁面介面四捨五入顯示為 28B;本文沿用模型名稱的 27B。(圖片:Qwen/Hugging Face)

這個結果確實讓本機模型的上限往前推,但真正值得回答的不是「它是不是最強開源模型」,而是:52 分證明了什麼,又有哪些成本被單一總分藏起來?以下先還原官方模型的本質,再拆解獨立評測的範圍與 token 預算,最後給出適合誰部署、應該怎麼驗收的判斷。

Qwen3.8-27B 是什麼:27B 不等於輕量

Qwen 把它稱為「A native multimodal dense model」。中文意思是:它原生理解文字、圖片與影片,輸出文字;而 dense 指語言模型沒有 MoE 專家路由,每個文字 token 都通過同一組 dense 語言層,不是只啟用少數專家。27,781,427,952 的總參數仍包含視覺編碼器等文字輸入未必啟用的組件,因此總參數不是逐 token 算力的精確代理,也不代表一般筆電可無痛載入。

“Context Length: 262,144 natively and extensible up to 1,000,000 tokens.”

中文:原生上下文長度是 262,144 tokens,最多可延伸到 1,000,000 tokens。

Qwen3.8-27B 官方模型卡

這句話有一個重要分界:262,144 才是原生長度,100 萬是透過 YaRN 靜態縮放延伸。模型卡也提醒,長上下文縮放可能影響較短文本的表現,因此「支援 1M」不等於所有工作都該開到 1M。架構本身採 Gated DeltaNet 與完整注意力層的混合設計,並提供 low、medium、xhigh 等推理強度;預設會思考,但不同強度的效果不能從一個榜單分數直接外推。

Apache 2.0 則讓下載、修改與商業使用權比許多自訂模型授權清楚。不過,這裡準確的說法是「開放權重」:授權與權重公開,不等於訓練資料、完整訓練配方及重現流程全部開放。

官方成績很亮眼,但先把它放回「廠商自測」

Qwen 公布的表格顯示,Qwen3.8-27B 在多個 coding、agent 與一般推理項目超越前代 Qwen3.6-27B,部分項目也接近更大的付費模型。這能說明團隊的設計目標與改進方向,卻不是獨立複驗:表格含自建評測、特定 harness、不同 timeout 與取樣條件,不能把粗體最高分直接當成普遍勝負。

Qwen 官方公布的 Qwen3.8-27B 文字與程式評測比較表
Qwen 官方自測表格:它提供改版方向的線索,但不是獨立驗證。不同項目採用的 harness、評分器與時間限制並不完全相同。(圖片:Qwen)

因此,這次真正新增的資訊不是廠商又貼出一張榜單,而是 Artificial Analysis(AA)完成了一次獨立測量,並在 8 月 17 日的 changelog 收錄。截至 2026 年 8 月 18 日,Qwen3.8-27B 的 Intelligence Index v4.1.1 後端未四捨五入值為 52.0247,頁面顯示 52,而且不是估算值。52 是多項任務加權後的綜合 Index,不是 52% 正確率;AA 的一般性誤差說明也不是 Qwen3.8-27B 專屬信賴區間。

52 分的正確讀法:小型 open-weight 組第一,不是全球第一

AA 卡片顯示的「#1 / 135」,範圍是它定義的 Small open-weight 組,也就是總參數 4B–40B。這 135 個條目同時包含推理與非推理模型,亦含已淘汰版本與大量估算成績。Qwen3.8-27B 在這個明確分組中領先很有意義,但它不是所有 open-weight 模型的第一名,更不能改寫成「全球最強開源模型」。

Artificial Analysis 的 Qwen3.8-27B 評測頁,顯示 52 分、分組第一與 1.6 億輸出 tokens
AA 頁面同時顯示 52 分、#1/135 與 160M 輸出。圖中的速度為 N/A;價格欄位的 $0.00 是缺少供應商價格時的頁面渲染結果,不代表 AA 測得免費推論。(截圖:Artificial Analysis,2026-08-18)

這套 v4.1.1 方法只測英文、文字任務,權重約為 agents 34%、coding 24%、科學推理 24%、一般能力 18%。它沒有測中文,也沒有測圖片或影片理解;因此 52 是「在這組英文文字任務與指定執行設定下」的綜合表現,不是對整個視覺語言模型的完整評分。

分項也不是全面碾壓:AA 測得 Terminal-Bench 2.1 為 79.78%、GPQA Diamond 為 90.51%,但 CritPt 只有 5.43%、Omniscience 正確率為 15.58%。總分把強弱項壓成一個數字;若你的工作落在弱項,平均 52 不會自動救你。

真正的警訊是 1.63 億 tokens:其中 93% 花在推理

“When evaluating the Intelligence Index, it generated 160M tokens, which is very verbose in comparison to the median of 43M.”

中文:跑完整套 Intelligence Index 時,它產生約 1.6 億 tokens;相較同組中位數 4,300 萬,非常冗長。

Artificial Analysis

頁面底層資料給得更精確:總輸出 163,261,746 tokens,其中 151,795,140 是 reasoning tokens,只有 11,466,606 是最終回答。換算後,92.98%,約 93% 的輸出都在推理階段;在 AA 有 token 紀錄的同組模型中,總量約是中位數的 3.8 倍。這個比較只涵蓋 135 個條目中的 25 個,而且各模型沿用供應商回報的 tokenizer,不是統一 tokenizer 下的文字量或 FLOPs 比較。封面上的「1.63 億 TOKEN/93% 推理」則直接由 Qwen 這次的兩組總量計算而來。

這不表示長思考一定在浪費。複雜 coding 或 agent 任務需要探索、修正與工具互動,額外推理可能正是分數上升的原因。但 AA 的總分不會直接因 token 多而扣分,推理模型也可使用模型方揭露的最大輸出額度。因此,52 衡量的是該測試預算下的任務能力,不是 token 效率、回應速度或每瓦效能。

同樣 27B 的 Qwen3.6-27B 在 AA 測得 37.70 分、加權每題輸出 29,347 tokens;Qwen3.8-27B 為 52.02 分與 47,166 tokens,後者的 AA 加權每題輸出 tokens 多約 61%。這支持「每份儲存權重能做到更多事」與部署密度的進步,卻還不足以證明固定推理運算量下的參數效率跳升。這不是固定 token 預算與相同推理強度的控制實驗,Qwen 專屬的最大輸出設定也未揭露,因此不能把提升全算在模型本體上。

另一個容易踩雷的地方是:截至 2026 年 8 月 18 日,AA 頁面沒有速度資料、可用供應商或有效價格欄位。頁面自動生成的文字把空價格渲染成 $0,不能引用成「免費」或「成本為零」。AA 尚未提供這個模型的獨立 tok/s 與 cost-per-task,因此僅靠目前 AA 資料,還不能判斷它在實際服務中是否比付費 API 划算。

「可以本機部署」和「可在 24GB 顯卡完整跑」是兩回事

Hugging Face 上 18 個官方 BF16 權重分片合計約 55.6 GB,這還只是權重檔案,不含推論框架、暫存張量與會隨上下文長度增長的 KV cache。Qwen 另有官方 blockwise FP8 checkpoint,權重檔約 30.9 GB;截至 2026 年 8 月 18 日,Qwen 官方模型卡與 GitHub 部署文件沒有提供單一「最低 VRAM」保證。

官方 FP8 checkpoint 仍超過 24 GB,因此單張 24GB 消費級顯卡通常需要至少一種折衷,例如較低位元的社群量化,或 CPU/系統記憶體 offload;可用的 context 與 KV cache 還須按格式與框架實測。能載入不等於能在 262K 原生上下文下保持可用速度。先用〈本機 LLM VRAM 估算指南〉算權重與 cache,再用〈GGUF 量化選擇實測〉評估品質懸崖,會比照著模型名稱猜硬體可靠。

AlphaLab 判斷:這是部署甜蜜點,不是效率結案報告

我們同意的部分是:在約 278 億、Apache 2.0、可自行控制資料路徑的權重規模內,52 分顯示的是 AA 分數/總儲存參數這個狹義維度的進步。對有多卡伺服器、充足統一記憶體,或願意用 FP8/量化交換品質的團隊,它可能成為文件理解、程式代理與內網研究工作的實用甜蜜點。

我們保留的部分是:本文引用的獨立證據主要是 AA 這套偏 agent、coding 與科學推理的英文文字綜合測試,而且該次評測使用了極高的推理 token 預算。它的多模態、中文、長上下文可靠度與端到端成本,仍需要另一組工作負載證明。這就是為什麼「分組冠軍」值得下載測試,卻不值得直接替換生產模型。

社群熱度也應放在正確位置:截至 8 月 18 日,相關 LocalLLaMA 討論已累積近千分的 Reddit 動態分數與數百則留言,興奮與「過度思考、延遲、benchmaxxing」疑慮並存。這證明大家正在關注,不證明任何性能主張;性能仍以可重跑的測試為準。

下載前先做三件事

  1. 先選可承受的格式與 context。把 BF16、FP8 或社群量化的權重、KV cache 與 offload 一起估,不要把 262K 當成免費容量。
  2. 用自己的十個任務重跑。各挑常見、最難與最昂貴失敗的案例,固定提示、工具與驗收規則,同時記錄成功率、輸出 tokens、牆鐘時間與峰值記憶體。
  3. 比較完成一件工作的總成本。把硬體折舊、電力、維運、延遲與人工重試加回來,再和付費 API 比較;最便宜的每百萬 token,不一定帶來最低的 time-to-correct。

如果 Qwen3.8-27B 能在你限定的推理預算內仍然通過驗收,它才是你的本機模型突破;如果必須靠大幅高於 AA 同組有資料中位數的輸出才能追上大模型,那就是另一種以算力換能力的工程選擇,而不是免費午餐。

接著閱讀

左右滑動查看更多推薦

最實用的下一步不是轉貼第一名截圖,而是先替 Qwen3.8-27B 設一個你能接受的 token 與時間上限,再看它是否仍能贏下自己的十個真實任務。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多兩封,收到週報精選與關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。