跳到主要內容

【2026 最新】本機 LLM 繁中創作盲測:Gemma 4 vs Muse Glimmer vs Qwen3.8 怎麼公平選?

最後更新: ·
本機 LLM 繁中創作盲測:Gemma 4、Muse Glimmer、Qwen3.8 公平比較教學

如果你要找的是自然的繁中對話、小說或文案,Coding 排行榜第一名不一定是你的第一名。真正可用的本機 LLM 繁中創作盲測,不是把三個答案排在一起憑感覺挑,而是先鎖定同一批題目、執行條件與評分規則,再把模型名稱藏起來。本篇會用 Gemma 4、Muse Glimmer、Qwen3.8 示範一套可重跑的 12 題工作表;你最後選出的不是「總冠軍」,而是最適合聊天、小說、商業文案或私密寫作的模型。

本文不會假裝 AlphaLab 已在同一台機器跑完三款 27~31B 模型,也不會公布沒有原始輸出的名次。你會得到的是完整實驗設計:怎麼選精確 checkpoint、如何處理量化與 chat template 差異、如何匿名配對、怎麼把自然度、指令遵循、重複率與跨段一致性分開計分。若你還不熟悉 Temperature、Top-p 與 Top-k,可先讀LLM 採樣參數 A/B Test 教學;判讀公開榜單時則搭配AI 模型排行榜完整指南

先說結論:不要找一個冠軍,要找四個用途的暫時領先者

這套方法的錨點只有一句:可信的創作選模=同題 × 同條件 × 匿名複評 × 分用途決策。少了任何一項,結果都可能只是 prompt、量化檔、左右位置或某顆 seed 的偶然。尤其創作沒有單一標準答案;硬限制可以機械檢查,聲音與情節張力仍要交給熟悉繁中的人類評審。

先把名稱說精確。截至 2026 年 9 月 8 日,本篇的三個候選是 google/gemma-4-31B-itmeta-models/Muse-Glimmer-30B,以及 Qwen/Qwen3.8-27B。三者約為 27~31B 級,權重皆採 Apache 2.0;Gemma 4 31B 與 Qwen3.8-27B 的原生 context 為 262,144 tokens,Muse Glimmer model card 標示 131,072+。這些是型號與上限,不是繁中創作品質結論。

Gemma 4、Muse Glimmer 與 Qwen3.8 繁中創作盲測的型號、Context、授權與量化比較圖
比較前先鎖定精確 checkpoint。Context 與授權來自 2026 年 9 月 8 日的官方 model cards;量化來源必須另記,不能只寫「4-bit」。

本機條件並不完全對稱:Google 與 Meta 已提供第一方 GGUF;本文在 2026 年 9 月 8 日查到的 Qwen3.8-27B 官方集合頁面則列出 BF16、FP8 與 Transformers、SGLang、vLLM serving 路徑。若你的本機方案使用社群 GGUF,就要記下轉檔者、repository、revision、檔名與 SHA-256,並把結果稱為「這個 artifact 的體驗」,不能偷換成純模型能力。想先估算權重、KV cache 與 context 的記憶體占用,可參考本機模型推論與硬體取捨案例

本機 LLM 繁中創作盲測:12 題怎麼設計?

每條用途放三題,避免一個漂亮樣本決定整場。題目要同時包含自由生成、受限改寫與跨段一致性;每題另存 prompt_id、system/user 完整文字、臺灣繁中偏好、目標長度、禁止項目與題目專屬檢查點。版本一旦開始跑就凍結,改一個字也升版,不把新舊結果混算。

  1. 聊天 01|先問再答:給一個資訊不足的旅行需求,要求模型先提出三個必要問題,不可直接排行程。
  2. 聊天 02|同理但不搶戲:回覆一段挫折訊息,保留對方語氣,不說教、不虛構個人經歷。
  3. 聊天 03|五輪記憶:在五輪對話中維持稱呼、預算、忌口與兩項禁忌,最後整理成可執行方案。
  4. 小說 04|夜市場景:以 800~1,000 字寫兩人重逢,衝突只能透過動作與潛台詞浮現,不直接解釋心情。
  5. 小說 05|受限續寫:承接既有片段,保持人稱、時態與三個世界設定,不新增超能力解法。
  6. 劇本 06|可辨聲音:兩名角色各有不同節奏與詞彙,寫一場不超過三頁、結尾改變權力關係的對話。
  7. 文案 07|落地頁首屏:把同一組產品事實寫成標題、副標與 CTA,禁用「最好、唯一、保證」。
  8. 文案 08|事實保真改寫:將生硬公告改成 180~220 字貼文,數字、日期與資格一項也不能變。
  9. 文案 09|三種聲調:同一訊息產出專業、俐落、溫暖三版;三版不能只是替換形容詞。
  10. 私密 10|保留本人聲音:潤飾日記但不得新增事件、診斷情緒或把口語洗成公關稿。
  11. 私密 11|界線訊息:把零散筆記整理成拒絕邀請的短訊,清楚、尊重,也不留下模糊承諾。
  12. 私密 12|跨段回收:提供分散在前、中、後段的九個人物事實,要求結尾回收伏筆且不產生矛盾。
本機 LLM 繁中創作盲測 12 題工作表,分為聊天、小說劇本、商業文案與私密寫作四類
12 題不是 12 個隨機 prompt,而是四條用途各三種壓力:先釐清、受限生成、跨段記憶。

每題再加 3~5 個專屬條件。例如第 08 題直接列出「日期、價格、資格、CTA」四個核對格;第 12 題則把九個設定分散在 context 前、中、後段。這比一份萬用的「文筆 1~10 分」更能指出模型到底在哪裡失手。中文創作評測 Writing Preference Bench也採用人類標註的成對偏好,並刻意控制長度與客觀訊號;它可當方法參考,但其中文/華語子集不是臺灣繁中自然度的證據,你的題庫仍需自己的母語評審。

本機 LLM 繁中創作盲測:固定條件、匿名與評分

步驟一:先凍結 artifact,而不只凍結模型名稱

為每個候選建立一張 run card:原始模型 ID 與 revision、量化檔 SHA-256、runtime 版本、CPU/GPU、offload、threads、chat template、context、最大輸出、stop、採樣器順序與參數。三款模型應使用各自官方 chat template,因為硬套同一 wrapper 可能破壞指令格式;但展開後的 prompt 也要保存,否則你不知道差異來自模型還是模板。

第一輪可把共同控制值設為:context 8,192、最大輸出 1,200 tokens、temperature 0.8、top-p 0.95、top-k 40,seed 使用 20260908、20260909、20260910。這組值只是可重跑的起點,不是三款模型的官方最佳配方;相同 seed 也不保證跨 tokenizer、硬體與 backend 產生相同亂數路徑。若兩個模型接近,再另開「原廠建議參數」賽道,不能把兩條賽道混成一個總分。

同為 Q4 也不代表量化損失相同。若所有候選無法在同一記憶體預算下使用可比 artifact,就改成兩層報告:第一層回答「這台電腦實際可用哪個套件」;第二層只在可比精度與後端成立時討論模型差異。一次只載入一個模型,串行生成,保存原始 request、response、token 數、停止原因與輸出 hash。

步驟二:輸出先封存,再揭盲配對

生成完成後才用隨機代碼取代模型名,例如 T07-S2-X4;映射表交給不參與評分的人保存。每個 prompt 把模型輸出兩兩配對,左右順序對每位評審重新隨機;另抽 20% 題目交換 A/B 再評一次,用來抓位置偏誤。不要修標點、刪贅字或補斷句,因為那些正是要評的輸出。

Chatbot Arena的核心也是匿名、隨機、pairwise 人類偏好。對小型個人盲測,不必急著做 Elo:每題先選 A/B/平手/兩者皆差,再記四個 1~5 分。至少兩位熟悉臺灣繁中的評審先獨立作答,意見不同才討論;若只有一人,就隔天重評交換版,不把一致性說成多人共識。

繁中創作盲測從凍結題庫、串行生成、匿名配對到分用途決策的六步流程圖
公平不是把所有參數寫成同一個數字,而是把不可消除的差異完整留下,讓讀者知道結果能外推到哪裡。

步驟三:硬條件先驗收,再評四個維度

  • 聲音自然度:像母語者在此情境會說的繁中嗎?口氣是否穩定,而非堆砌成語或網路腔?
  • 指令遵循:長度、格式、禁用詞、先提問再回答等硬條件是否逐項通過?硬條件失敗先記 0/1,不讓漂亮文句沖掉。
  • 重複與模板感:是否反覆總結、同義改寫、三段式口號或相同句首?字元 3~5-gram 重複率可做診斷,但刻意排比不能自動判成壞。
  • 情節與事實一致性:人物、時間、場景、產品事實是否自相矛盾?每個矛盾要附兩段原文與位置,不只寫「感覺不連貫」。

LLM judge 最多只能當第二意見。2026 年的 LitBench顯示,其測試中最強的現成 zero-shot judge,與由 Reddit 投票推導的偏好標籤一致率約 73%,而且篇幅等表面訊號會造成偏誤。創作主評仍以人類選擇為準;機械指標用來定位重複、漏條件與矛盾,不拿來宣布「文學品質 86 分」。

四條模型選擇路徑:分數怎麼變成決策?

先分用途計算,不做跨用途平均。三題中至少兩題在多個 seed 維持優勢,只能稱為「此 12 題工作表的暫時領先者」,不具統計代表性;若差距只來自單題或單顆 seed,就標成未分勝負。最後再把品質與你的硬體現實一起看:

  • 聊天:優先看會不會在資訊不足時先問問題、五輪後仍守住限制,以及口吻是否像同一個人。贏在長篇華麗、卻常替使用者做錯假設的模型,不是聊天首選。
  • 小說/劇本:先排除人稱、世界觀與角色聲音漂移,再看潛台詞與節奏。若模型只有在高 temperature 才活潑,另記它的重複率與失控率。
  • 商業文案:硬條件與事實保真權重最高;一個日期或資格寫錯,就不能靠漂亮 slogan 補分。建立品牌語氣時,可搭配AI 寫作風格系統固定範例與禁用語。
  • 私密寫作:優先選能保留本人聲音、少做無根據推論的模型;資料若必須留在裝置內,也要確認你使用的 UI、記錄與同步設定,而不能只因權重本機載入就推定整條流程離線。

遇到平手,先加題與 seed,不要調 rubric 追著想要的答案跑。若某款模型更慢但明顯更穩,記錄「每個合格輸出所需時間」,它往往比每秒 tokens 更接近真實成本。Muse Glimmer 官方 model card把它定位為可接受圖像與文字輸入、輸出文字的 Agentic 模型;想進一步理解其功能與本機包裝,可讀Muse Glimmer 30B 完整解析,但那些能力不應替它在純文字創作題加分。

最常讓盲測失真的七個坑

  1. 只寫家族名:Gemma 4 與 Qwen3.8 都有多個 checkpoint;名稱不精確就無法重跑。
  2. 把相同 seed 當完全公平:tokenizer 與硬體不同,seed 只能幫助重跑各自軌跡,仍不保證每次得到逐位元相同的結果,也不能創造相同隨機事件。
  3. 把 Q4 當同等品質:量化演算法、校準資料與 imatrix 都會改變結果,必須綁定檔案 hash。
  4. 不同 chat template 卻不留展開內容:模板是測試系統的一部分,不是看不見的雜訊。
  5. 評審看得到模型名:品牌預期會偷渡進分數;匿名後才評,揭盲後不回頭改票。
  6. 用字數或重複率代替好看:機械指標只能找異常;有意排比、角色口頭禪與留白要由人判讀。
  7. 把一條總分當萬用答案:寫小說的優勢不會自動移植到事實敏感文案,四條路徑必須分開。

常見問題 FAQ

只有一台 16GB 電腦,也能跑這個盲測嗎?

可以做縮小版,但不應硬比三個大模型。先找都能穩定載入的較小 checkpoint 或減少候選;如果只有其中一款能在合理 context 下工作,答案已經是硬體可用性,而不是純模型排名。

Temperature、Top-p 一定要完全相同嗎?

控制賽道要相同,原廠最佳賽道可以不同。兩者分開報告,才能同時回答「共同設定下誰穩」與「各自調好後誰適合我」。

同一個 seed 能保證輸出一樣嗎?

不能。runtime、硬體、GPU offload、浮點運算、tokenizer 或版本改變,都可能讓輸出分岔;seed 要和整張 run card 一起看。

可以讓 GPT 或另一個 LLM 當評審嗎?

可以做輔助,不可取代繁中人類主評。至少交換 A/B 次序、隱藏模型名,並把 LLM 與人類分數分欄保存。

三個模型需要使用完全相同的 system prompt 嗎?

語意要求相同,但要透過各自官方 chat template。保存原始訊息與展開後 prompt;若某模板自動加入特殊指令,將它列為系統差異。

繁體字比例可以直接代表臺灣中文自然度嗎?

不可以。字形轉換抓不到語序、用詞、稱謂與語氣;自動檢查只能找明顯簡體字,最終仍由母語者判斷。

每個模型只跑一次夠嗎?

不夠。起步至少三顆預先公布的 seed;若結果接近,增加題數與重複次數,比微調權重或換評分規則更有價值。

最後可以公布一個總冠軍嗎?

只有四條用途都穩定領先才值得這樣說。更誠實也更實用的輸出,是聊天、小說、文案、私密寫作各自的勝者,加上適用硬體與精確 artifact。

給新手的五個執行重點

  • 先選精確 checkpoint 與量化檔,再談模型家族。
  • 12 題與三顆 seed 開始後全部凍結,所有原始輸出保留 hash。
  • 匿名、隨機左右、抽題交換順序,評完才揭盲。
  • 硬限制先驗收,四項品質分開評;不讓華麗文字掩蓋事實錯誤。
  • 按聊天、小說、文案、私密寫作分開選,不用一個平均分替你做決定。

如果你想把這套工作表擴成日常內容流程,可以把題庫、run card 與評分 JSON 納入版本控制,再到 AlphaLab 的線上課程學習如何把 AI 評測變成可維護的工作系統。

接著閱讀

左右滑動查看更多推薦

選本機創作模型時,最昂貴的錯誤不是少拿一分,而是把一次好看的回答誤認成穩定能力。現在就先建立 prompt-set-v1.jsonl、凍結三顆 seed,找一位不知道模型名稱的繁中讀者評第一輪。只要始終守住「同題、同條件、匿名複評、分用途決策」,你得到的就不是另一張容易過期的榜單,而是一套能隨新模型持續重跑的選擇方法。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。