跳到主要內容

【2026 最新】MicroLLM Lab 教學:七個瀏覽器小模型怎麼試?(任務驗收+隱私檢查)

最後更新: ·
MicroLLM Lab 教學首圖

你打開 MicroLLM Lab,看見七個能在瀏覽器執行的小模型,第一個念頭可能是:「既然不用把每句話送到雲端,它能不能幫我整理工作?」接著試問一份早餐食譜,得到的卻可能是重複或離題的文字。Hacker News 原討論就有使用者記下這類失敗案例;那是個別人的輸出,不能當作所有裝置與模型的共同成績。

這篇 MicroLLM Lab 教學寫給第一次接觸本機模型、也不想寫程式的讀者。你會學會載入一個模型、看懂執行路徑與下載狀態,再用三種短任務建立自己的驗收表。本文依 2026 年 9 月 30 日線上網站與同版原始碼核對功能;下面的題目是操作範本,不宣稱 AlphaLab 已替七個模型跑出繁中成績。

先說結論:小模型要靠「窄任務+逐題驗收」

一句話記住:瀏覽器小模型的可用性=你指定的窄任務 × 你能檢查的輸出。它像一位跑得很快、但知識與判斷都需要現場考核的實習生:讓它從兩個標籤中選一個,比請它自由寫一份可靠的食譜更容易驗收。這是測試順序,不是任何一款模型已達到工作品質的保證。

MicroLLM Lab 是什麼?先認識七個模型與三條執行路徑

MicroLLM Lab 官方實驗室把模型檔下載到瀏覽器,並提供 Chat、Benchmarks、Compare 和 Custom eval。線上 模型目錄在本文核對時列出 PetitGPT、SmolLM2 135M Instruct、L20-Edu 135M、SmolLM2 360M Instruct、MiniMind2 104M、MiniMind2 Small 26M 與 GPT-2 124M,共七個。專案 README 另外列到 SmolLM 第一代;選模型時請以當下網站卡片和線上目錄為準。

「模型參數」可以想成模型記住規律所用的旋鈕數;「Q4」是把權重壓成較小的格式。檔案變小,首次下載、瀏覽器儲存和顯示卡記憶體仍要付成本。這七個線上模型的檔案大小由約 16 MB 到 226 MB 不等,來自目錄的 q4Bytes 欄位,並非我們量到的執行記憶體。

WebGPU是讓網頁呼叫裝置 GPU 運算的介面,MDN 的 WebGPU 文件說明它如何透過 adapter 使用 GPU;此站也提供 WASM 與一般 JavaScript/CPU 後備路徑。你看到「模型在本機跑」,仍要再看右側 Runtime 的 Backend 與 Adapter,才知道此刻走哪條路。站方原始碼在 GPU 不可用時會選擇後備路徑,因此不要把別人的 tok/s 當成你的速度。

MicroLLM Lab 教學:第一次上手的 5 個步驟

① 開網站,先確認模型卡片與 Runtime

開啟官方頁面,略過上方技術說明,找到 Models 卡片與 Chat 分頁。先記下瀏覽器、作業系統,以及右側 Runtime 的 Backend。如果顯示 none,代表模型尚未載入;不要把空白速度欄解讀成模型失效。

② 從一個模型開始,觀察下載與快取

先按一張模型卡上的 Load,等進度完成,再看頁面上的 Loaded on this device。網站程式把下載的權重放進該網站的 IndexedDB;MDN 的說明指出這類資料依網站 origin 分隔,像瀏覽器替這個網站準備的置物櫃,不等於「永遠離線可用」。清除網站資料或換裝置後,請重新檢查快取狀態。初次體驗可先看較小的 MiniMind2 Small,但「下載快」與「答得好」是兩件事。

③ 在 Chat 送出短題,逐題留下原文

選好已載入模型,從短句開始。每換模型,都貼同一題原文,記下完整回答、是否重複、是否遵守格式和耗時。生成上限 max new 也要固定;若某次只因輸出被截短而判錯,先把這個原因獨立標記。GPT-2 在目錄中屬於 completion 模型,主要接續文字;不要把它與指令模型放在同一種「聊天服從度」題目中直接排名。

④ 先跑內建題,再回到自己的工作題

在 Benchmarks 按 Run suite on active model,看每題通過與執行時間。此版本的內建程式列出 21 題,包含字串、數字、重複檢查及 256-token 持續生成;通過條件由各題的 JavaScript 檢查函式決定,包括字詞命中、重複比例和停止原因。它回答「有沒有命中這組檢查」,不直接回答你的繁中分類、抽取或寫作品質能不能用。同一份原始碼的舊 README 仍記著 14/20 題的舊測量,版本不同,別拿兩個分母直接比較。

⑤ 到 Compare 比執行條件,再決定要不要繼續

Compare 會呈現本瀏覽器最近一次的各模型 suite 結果。先核對同一台裝置、同一瀏覽器、同一執行路徑、同一題組,才比較速度;品質仍看你在下一節留下的原文與人工判定。若只是想感受瀏覽器本機推論,跑一個模型已足夠;若要挑選工作流程,至少換兩個候選模型重複同一組題。

三種任務怎麼驗收:短分類、欄位抽取、開放問答

用一份假資料就能走完範例。先建四欄紀錄:模型/題目原文/完整輸出/人工判定;再加 Backend、耗時與失敗原因。以下是你可以逐個貼到 Chat 的題目,是待測題,不是七模型的既有結果。

  • 短分類:把這句話分成「售後」或「購買」,只輸出一個標籤:我想查昨天訂單的退款進度。 標準答案是「售後」。若回答多出解釋、換了標籤、或前後重跑不一致,分別記錄。這比問「它聰明嗎」可操作得多。
  • 欄位抽取:從這句話取出日期與金額,只輸出「日期|金額」:我在 10 月 3 日支付 420 元。 檢查兩個欄位是否都來自原句,以及是否平白添了貨幣、年份或別的資訊。要上線處理資料,還應補上空欄、錯字與多筆資料題。
  • 開放問答:請給我一份五分鐘內完成的早餐,列食材、份量、步驟與所需時間。 這題沒有一個關鍵字就能判對;請人工看是否可做、份量是否合理、有無重複。HN 有使用者在 2026 年 9 月 29 日記下食譜失敗個案,恰好說明不能用「跑得快」代替「內容能用」。
MicroLLM Lab 教學三種題目驗收:短分類、欄位抽取、開放問答
先選短任務,再依輸出原文驗收;圖為 AlphaLab 自製評估流程。

判斷時分開記兩層:格式是否合格與內容是否合格。分類可能挑對字但加了一大段說明,欄位抽取可能格式漂亮卻捏造一個年份。你的驗收門檻應由用途決定;若會自動送出退款、醫療或財務決定,就不能只靠這類小題通過率決定是否啟用。

「本機、私密」怎麼查?看請求,也看 Custom eval

網站把「100% private」寫在頁面上;這是產品主張,應以你使用的那次工作階段核對。模型初次載入會向網站請求權重、目錄與程式檔,所以有網路流量不等於聊天文字被送出。在瀏覽器開發者工具切到 Network,先清空列表,送出一條不含個資的測試 prompt,再觀察新增請求的目的地與內容。若你看不懂某個請求,先不要把敏感文字貼進去。

還有一個容易忽略的邊界:原始碼的 Custom eval 編譯函式使用 eval() 執行輸入的 JavaScript;文字框甚至提醒程式會在網站 origin 執行。若貼進別人提供的程式,該程式可能讀到此 origin 可讀的資料並發送網路請求。新手先用上面的 Chat 題目與內建 Benchmarks;要寫自訂評估,只用自己讀懂的程式,並在 Network 中看它的行為。

網站還有以 ?auto= 啟動的測試路徑;目前程式碼會在這些自動測試分支把結果 POST 到同站 /result。一般手動 Chat 流程與這些測試分支不同。這也是為什麼「看當次 URL、看當次 Network」比從宣傳句推導所有情況可靠。

常見卡點:模型載不進來、速度很慢、答案像亂碼

  • 卡在下載:看模型卡的進度與 Loaded on this device,再看 Network 是否有模型檔請求失敗。不要直接按 Load all models;七個線上權重合計約 635 MB(十進位檔案位元組),另有瀏覽器儲存與載入成本。
  • 速度偏慢:看 Backend 是否顯示 WebGPU、WASM 或 CPU/JS,以及 Adapter。同一題換路徑再比較,記錄硬體與瀏覽器。這比拿官方 Mac 測值猜自己的裝置快慢更有用。
  • 回答重複或離題:先確認是否選了 GPT-2 這種接續文字模型,再縮短題目、固定生成上限、重試同一題。若結果仍無法通過你的驗收,就記為不適用於該任務;不要因為輸出流暢就把錯誤放進工作流程。
  • 關閉網頁後又要下載:回到模型卡看快取狀態。本站儲存位置是瀏覽器的 IndexedDB,清除該網站資料會影響本機權重副本。

MicroLLM Lab 常見問題

七個模型都要下載嗎?

不用。模型卡各自提供 Load;先選一個,等題目與紀錄方式固定後,再載入第二個比較。

MicroLLM Lab 是聊天機器人嗎?

它有聊天介面,更像一個模型實驗室。官方同時提供客觀題組、比較圖與自訂評估。要把它用在工作上,先定義你的任務與過關規則。

內建分數高,就代表繁中工作可用了嗎?

不代表。目前內建題組主要用英文短題與程式化條件;繁中分類與欄位抽取要另做同題驗收。

模型檔放在哪裡?

放在此網站的瀏覽器 IndexedDB 儲存空間。可以用卡片上的 Unload 或清除網站資料管理副本;兩種操作前都先確認自己是否要保留下載成果。

WebGPU 沒有啟用,還能試嗎?

可能可以。目前程式有 WASM 與 CPU/JS 後備路徑;實際能否載入與速度以你右側 Runtime 和錯誤日誌為準。

為什麼 GPT-2 不照我的指令回答?

先看模型類型。目錄把它標成接續文字的 completion 模型。可用「這篇故事的下一句是」之類接龍題觀察它,而非要求它像指令模型一樣遵守表單。

我可以直接貼網路上的 Custom eval 程式嗎?

先別貼。這個欄位執行 JavaScript。先把每一段程式及其網路請求看懂,再決定是否在自己的瀏覽器執行。

速度指標 tok/s 應該怎麼看?

把它當生成速度,不是正確率。只在相同裝置、模型、題目、生成上限與執行路徑下比較;有用與否仍看原文輸出是否通過你的任務檢查。

給新手的三個重點

  • 先載入一個模型,確認 Backend 與快取狀態,再出題。
  • 用同題測短分類、欄位抽取與開放問答,保存完整輸出;內建分數只看作一種不同的量尺。
  • 先拿假資料檢查 Network;Custom eval 會執行 JavaScript,程式內容要自己看懂。

接著閱讀

左右滑動查看更多推薦

下一步:用三題做出自己的可用性結論

現在打開 MicroLLM Lab,先載入一個模型,複製上面的三題,並把題目、完整輸出、Backend、人工判定記成四行。做到這一步,你就能回答「它在我的裝置上,對我的任務能不能用」,而不必替所有小模型下一個空泛結論。想把這套驗收方式擴充為自己的 AI 工作流程,也可以從 Agent Harness 基礎與 AlphaLab 課程繼續學。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。