跳到主要內容

Unsloth Dynamic 3.0:1-bit Qwen3.8-27B 真能在 8GB 跑嗎?(2026)

最後更新: ·
Unsloth Dynamic 3.0 1-bit Qwen3.8-27B 量化分析封面,左側提問真的能用嗎,右側為官方 top-1 曲線

2026 年 8 月 20 日凌晨(台北時間;UTC 為 8 月 19 日),Unsloth 的 Daniel Han 在 Reddit 發布〈Introducing Qwen3.8-27B Dynamic v3 Unsloth GGUFs〉,把 Unsloth Dynamic 3.0 的焦點壓在三句話:同體積的量化檔更接近 BF16、1-bit 仍保留大部分 token 忠實度、27B 模型可以挑戰 8 GB 級裝置。

Unsloth Dynamic 3.0 技術頁面截圖,顯示 Qwen3.8-27B 量化版的 top-1 忠實度圖表
Unsloth Dynamic 3.0 技術頁面與官方 top-1 圖表;點圖可開啟原文。截圖/Unsloth

這個發布確實把 27B 視覺語言模型的權重檔壓到 6.19 GB,但最吸睛的「77% accuracy」與「Run on 8GB RAM」也最容易被讀錯。以下先還原官方到底測了什麼,再用公開 artifact、Qwen 架構與量化研究逐一對帳,最後回答:1-bit 是可用的新下限,還是只代表檔案塞得進去?

先說結論

  • 進步訊號存在,但證據仍是廠商自測。Unsloth 的圖表顯示,Dynamic 3.0 在多個低位元、相近檔案大小的比較點,更貼近 Qwen3.8-27B 的 BF16 輸出;它沒有直接證明真實任務成功率提高逾 10%。
  • 72%/77% 是 token 一致度,不是「保留幾成智力」。現行文件把 6.19 GB 的 UD-IQ1_S寫成約 72%;首發貼文的 77% 沒有指明是哪一個 1-bit 檔,兩者不能合併成同一規格。
  • 6.19 GB 權重檔不等於 8 GB 整機舒適運行。KV cache、執行緩衝、作業系統、視覺 projector 與可選 MTP 都要另外占空間;8 GB 比較像受限配置下的啟動目標。
  • 真正的驗收點是你的任務。本機 Agent、程式碼、長文與視覺理解都要用固定題目、可執行 grader 與峰值記憶體紀錄測試,不能只看一張 token 忠實度曲線。

Unsloth Dynamic 3.0 這次發布了什麼?

Qwen3.8-27B 本身不是 8 月 20 日才出現的新模型;這次的新事件,是 Unsloth 在既有 Qwen3.8-27B-GGUF repository 裡換上 Dynamic 3.0 量化檔。現行 commit 27af057e… 的主要低位元檔案如下:

量化檔檔案大小官方目前怎麼描述
UD-IQ1_S6.19 GB約 72% top-1 token 忠實度;小型檔不內含 MTP
UD-IQ1_M6.73 GB另一個 1-bit 家族選項
UD-IQ2_XXS7.27 GB2-bit 家族的小檔
UD-Q2_K_XL9.83 GB官方稱在其 top-1 圖表比下一個同級比較點高約 8%
UD-Q4_K_M16.46 GB較高精度、也需要更多記憶體餘裕
檔案大小來自 2026 年 8 月 20 日的 Hugging Face model API;GB 為十進位。實際常駐記憶體不等於檔案大小。

Dynamic 的意思也不是把每一個參數平均切成一樣的位元數。以 IQ1_S 為例,GGUF 家族名稱代表主要量化格式;Unsloth 會依層與張量的重要性保留不同精度。因此「1-bit」適合當產品標籤,不應照字面推算成 27B × 1 bit 的 3.4 GB 檔案。

Unsloth Dynamic 3.0 原文最強的承諾

“We also release 1-bit quants that retain 77% accuracy. Run on 8GB RAM.”

中文:我們也發布保留 77%「準確度」的 1-bit 量化檔,可在 8 GB RAM 上運行。

Daniel Han,Reddit 首發貼文

這裡的 accuracy 不是 MATH、SWE-bench、Terminal-Bench 或工具呼叫的答對率。依 Unsloth 技術文件的定義,它主要在看量化版下一個最可能 token 是否與 BF16 版一致。BF16 選錯、量化版跟著選錯,也會被算作一致;反過來,量化版換了措辭但仍答對,也可能被算作不一致。

“However top-1% is an argmax on 1 prediction, so it’s not really effective on gauging actual inference.”

中文:不過,top-1 只是一次預測的 argmax,因此並不適合單獨衡量實際推論表現。

Unsloth Dynamic 3.0 技術文件

這段自我限制很重要。Unsloth 沒有只停在一個 token,還補了 Divergence-300 @32 與 KL divergence;但三個指標回答的是三個不同問題,不能全部翻成「模型答對率」。

Top-1:下一步有沒有選同一個 token?

它最直觀,也最容易被誇大。數值越高,表示量化後的第一選擇越常與 BF16 相同;它適合做快速 fidelity 檢查,不代表知識、推理或 Agent 能力保留同樣比例。

Divergence-300 @32:短序列有沒有開始走岔?

Unsloth 從 Terminal-Bench 2.1、DeepSWE、Harbor、MathArena 2025–26,以及非拉丁文字與長文件題型組成 300 個未放入 calibration set 的 prompt,讓 BF16 與各量化版以 greedy decoding 生成 32 個 token。這比只看第一個 token 更接近「軌跡是否快速分岔」,但 32 token 仍遠短於完整程式、長推理或多輪 Agent,而且公開頁面沒有提供 prompt ID、逐題輸出與可執行 grader。

Unsloth 自行測試的 Divergence-300 @32 圖表,比較不同量化檔大小的 32-token 軌跡一致度
官方圖表顯示 Dynamic 3.0 在多個低位元檔案大小上有較高的 32-token 軌跡一致度;這是 Unsloth 自行設計與執行的評測,不是任務答對率。圖/Unsloth

KL divergence:整個機率分布偏了多少?

KL divergence 不只看冠軍 token,而是比較整個 next-token 機率分布。越接近 0,表示量化版越像 BF16。這能抓到「第一名沒變,但其他候選 token 已經大幅移位」的情況;代價是它仍只證明分布相似,無法替代工具呼叫、視覺理解、長上下文召回或程式執行測試。

Unsloth 自行測試的 mean KL divergence 圖表,數值越低代表量化版 token 分布越接近 BF16
Mean KL divergence 越低越好。圖表在多個小型量化點支持 Dynamic 3.0 更貼近 BF16,但比較對象只標成 At、By、Ba,沒有公開綁定 exact repository 與 revision。圖/Unsloth

「高 10%」目前能支持到哪裡?

最公平的說法是:在 Unsloth 自己的 token 忠實度測試裡,Dynamic 3.0 在部分低位元、相近檔案大小的操作點,對 BF16 的貼近程度比圖中的比較者高出低雙位數。這不等於所有檔案都高 10%,也不等於真實任務準確率高 10%。曲線到較大檔案時會收斂,官方也明說部分較大量化檔仍沿用 Dynamic 2,因為新版改善不大。

可重現性還有三個缺口。第一,圖中比較者只有 AtByBa 縮寫,沒有逐一列出 immutable artifact revision。第二,Divergence-300 的公式、原始 prompt 與輸出沒有公開。第三,技術頁面寫著 imatrix calibration file「可供社群使用」,但截至 2026 年 8 月 20 日查核的 目前 repository tree 未列出檔名含 imatrix 的項目。這只能確認該快照裡找不到,不能延伸成它從未在其他位置發布。

外部研究也提醒我們不要把低位元 fidelity 當作終局。COLM 2025 論文〈Quantization Hurts Reasoning?〉搭配公開程式與設定,在其他 Qwen/Llama 推理模型上發現:4-bit weight-only 在其測試範圍通常接近原版,3-bit 以下對難題的損失更不均勻。它沒有測 Dynamic 3.0,因此不能拿來否定這次 release;它證明的是,極低位元的宣稱仍需要 untouched task benchmark 才能站穩。

77% 變 72%:不是小數點,而是規格沒有綁定 artifact

首發 Reddit 貼文說「1-bit 保留 77% accuracy」,現行技術頁則明確寫 UD-IQ1_S 為 6.2 GB、約 72% top-1。兩句話不一定互相矛盾:1-bit 家族同時有 IQ1_SIQ1_M,圖上的點也不同;問題是首發句子沒有把 77% 綁到檔名、雜湊、測試 corpus 與公式。

所以目前能安全引用的是:最小的 UD-IQ1_S 檔案為 6,192,222,208 bytes(6.19 GB),Unsloth 現行文件稱其約有 72% 的 BF16 top-1 token 忠實度。77% 應保留為首發貼文原話,而不是改寫成同一檔案的最新規格。

6.19 GB 為什麼不等於 8 GB 實際好用?

模型執行時至少有四個桶:權重、KV cache/recurrent state、compute buffer,以及 runtime 與作業系統。Qwen 的官方 config列出 64 層,其中 16 層是 full attention、4 個 KV heads、head dimension 256。若 KV cache 使用 f16,只算 full-attention 的 K/V,就約是每 token 64 KiB:

16 layers × 2 (K + V) × 4 KV heads × 256 dims × 2 bytes
= 65,536 bytes / token

這代表 8K context 約 512 MiB、32K 約 2 GiB,而原生 262K context 光這部分就約 16 GiB;還沒算 48 個 Gated DeltaNet 層的 recurrent state、compute buffer 與 6.19 GB 權重。Runtime 可以縮短 context、量化 KV、mmap 或部分 offload,所以小 context 的文字模式可能在某些 8 GB 配置啟動;但「權重放得下」與「長上下文 Agent 能順跑」是兩件事。

視覺與 MTP 也會改變預算。目前 repository 裡的 F16 vision projector 約 0.93 GB,獨立 Q4 MTP 約 1.37 GB;小型 Dynamic 檔為省空間沒有內嵌 MTP。若把 6.19 GB 權重、projector、cache、buffer 與 OS 全部加回去,8 GB 幾乎沒有餘裕。因此原貼文的 8 GB 更適合解讀為「受限、文字優先、短 context 的相容性目標」,不是完整多模態功能與原生 context 的硬體承諾。

AlphaLab 的判讀:這是有價值的壓縮進步,不是任務成績單

我同意:同體積 fidelity 的改善值得重視

如果硬體預算固定,量化的目標本來就不是追求抽象的「位元越低越好」,而是把有限空間分給最重要的張量。Dynamic 3.0 強化 calibration data 與 layer selection,三種內部指標又大致朝同一方向移動,這是合理且有用的工程訊號。它足以讓 Dynamic 3.0 進入候選名單。

我存疑:最吸睛的兩句話超過了公開證據

「77% accuracy」會讓人直覺以為 100 題還能答對 77 題;實際上它是跟 BF16 選同一個 token 的比例。「8 GB」會讓人以為一台 8 GB 電腦能跑完整 Agent;實際上官方沒有公布綁定當前 artifact 的硬體、context、cache dtype、峰值 RSS/VRAM、swap 與 tokens/s 紀錄。宣傳句不是憑空捏造,但省略了決定可用性的條件。

1-bit 的真正價值,是把「能不能試」的門檻往下移

對只有小記憶體設備的人,6.19 GB 檔案可能把 27B 模型從「完全載不進」推到「可以做短 context 文字 smoke test」。這已經有價值;但若要拿來寫程式、操作工具或處理長文件,通過載入只算第零關。模型是否重複、格式是否穩、工具參數是否正確、任務是否完成,都要另外量。

下一版最需要的不是更多曲線,而是一份可重跑的 release bundle

若 Unsloth 補上每個比較檔的 SHA、imatrix 下載與 checksum、完整 benchmark script、300 個 prompt/原始輸出、硬體記憶體 trace,再加至少一組可執行的 coding/Agent task score,「高 10%」就能從廠商圖表變成社群可重現的結論。尤其首發當天 repository 多次更新,沒有 artifact binding,再認真的第三方測試也可能測到舊檔。

你現在要下載,先用這三道閘門

  1. 先算完整記憶體,不只看 GGUF 大小。把 context、KV dtype、batch、projector、MTP 與 OS 餘裕全部列出;8 GB 級裝置先用文字、短 context、單一 session 做 smoke test。
  2. 先用最高可承受精度建立 baseline。若硬體允許,先讓較高位元版本跑同一組固定任務,再逐級降到 Q3、Q2、IQ1;比較任務成功率、格式錯誤與總延遲,不只比較 tokens/s。
  3. Agent 要驗收完整迴圈。至少測第一輪 tool call、參數 schema、tool result 回填、第二輪回答與最終任務成功。可直接沿用 AlphaLab 的Qwen3.8-27B 本機 Agent 六關協定,並把模型檔 SHA 一起保存。

如果你只是想理解不同 GGUF 標籤與 KV cache,先讀GGUF 量化選擇指南;若你還在判斷 Qwen3.8-27B 本身值不值得裝,則先看Qwen3.8-27B 模型深度解讀。把「模型能力」「量化損失」「Runtime 相容性」分開測,才不會把一張漂亮曲線當成整台機器的答案。

接著閱讀

左右滑動查看更多推薦

最務實的下一步,是固定一組你真的在乎的 10 個任務,先跑高位元 baseline,再只改量化檔逐級往下測;當成功率、格式穩定度或延遲越過你的底線,就在前一級停下來。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多兩封,收到週報精選與關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。