你想把 Claude Code、Codex 或 Hermes 搬到本機跑,第一個難題通常不是安裝,而是選擇:16GB 記憶體該下載哪個模型?Q4、Q5 差在哪?標示 64K context 就真的撐得住嗎?Magnitude 本機 Agent 想把這些判斷濃縮成硬體掃描、推薦、下載與接線流程;截至 2026 年 9 月 5 日,最新 npm 穩定版是 0.0.11,而且仍是快速變動的 0.0.x 專案。
這篇專為第一次碰本機模型的讀者寫:你會學會安裝、保存推薦、接上 Agent、驗證離線邊界,最後用公平的同機 A/B 判斷推薦是否適合你。先把答案說在前面:Magnitude 能替你縮短候選清單,但現有公開證據不足以證明它比懂行的手動設定更準。
先說結論:Magnitude 推薦是起點,不是成績單
請記住這條式子:最佳本機模型=跑得動 × 等得起 × 做得對。Magnitude 的硬體規劃器先過濾「跑得動」,再估算「等得起」,並用模型能力與量化保真分數排序;但你的 repo、工具呼叫與驗收規則,才決定它能否「做得對」。後者不能只看推薦卡片。
它也不是會讀懂任務、每次自動路由最佳模型的裁判。依官方排序設計,使用者仍要選 Fast 到 Smart 的偏好,再從可放進記憶體的候選中挑一個。把它想成租屋平台:系統能依預算與通勤排序,卻不能替你判斷隔音是否合格。

Magnitude 本機 Agent 到底做了哪 5 件事?
- 辨認硬體:讀取處理器、架構、記憶體,以及可用的 Metal/CUDA 能力。
- 模型無關校準:量測硬體特性,再由規劃器預測模型放入後的解碼表現;此時不會先下載每個候選來跑推論。
- 先做硬限制:權重、KV cache 等估計放不進扣除安全預留後的正規化物理記憶體容量,先被排除。
- 再做偏好排序:綜合外部模型能力指標、預估速度與量化保真,產生 Fast/Balanced/Smart 候選。
- 完成接線:下載並載入模型,再替支援的 Agent 寫入本機 endpoint 與模型設定。
最容易誤會的是第 2 步。官方效能估算設計明寫,校準不讀取模型 tensor,也不跑模型 benchmark;它估的是單一序列在不同 context 深度的解碼速度,沒有包含 prompt prefill、抽樣、傳輸、投機解碼接受率與多人並行排程。因此畫面上的 tok/s 範圍是模型化預測,不是你機器上的實測信賴區間。

步驟一:安裝前先留一條回頭路
官方入門文件目前支援 macOS、Linux;原生 Windows 不支援,Windows 使用者走 WSL。先確認 Node.js 與 npm 可用,再把版本固定,避免幾天後重跑卻拿到不同 catalog 或 connector 行為。
node --version
npm --version
npm install -g @magnitudedev/cli@0.0.11
magnitude --version
magnitude setup
magnitude setup 是互動式捷徑。若你想留下可稽核記錄,可改跑分段流程,並先把推薦輸出存檔:
magnitude service install
magnitude service start
magnitude catalog status
# 約每 10 秒重查;Discovery 與 Assessment 都是 Complete 才繼續
magnitude catalog recommendations --preference balanced --limit 10 \
| tee magnitude-balanced.txt
同時保存日期、作業系統、CPU/GPU、系統回報的實體與可用記憶體、Magnitude 辨識容量、版本,以及推薦卡上的 model ID、quant、context、容量與速度範圍。若兩邊容量差很多,先停下來;一則仍開啟的官方 issue #44就記錄過特定 AMD Strix Halo 配置辨識異常的個案。它不能代表所有機器,卻足以說明硬體 profile 也要交叉核對。
步驟二:下載、載入,再接上 Codex/Claude Code/Hermes
從清單選定完整的 <model-id> 後,依官方 CLI reference執行:
magnitude catalog pull <model-id>
magnitude models status <model-id>
# 重查到 Installation 顯示 Installed,再執行下一步
magnitude models load <model-id>
# 重查到 runtime 顯示 Ready,才連接 Agent
magnitude models status <model-id>
# 三選一;先只接你真正要測的 Agent
magnitude connections add codex --set-model <model-id> --install-skill
magnitude connections add claude-code --set-model <model-id> --install-skill
magnitude connections add hermes --set-model <model-id> --install-skill
不要把「OpenAI-compatible」當成萬用插頭。Magnitude 公開的本機服務同時提供 OpenAI Chat Completions、OpenAI Responses 與 Anthropic Messages 相容路徑;但每個 Agent 要的協定不同。Codex 現行設定的自訂 provider 使用 Responses API,只有 /v1/chat/completions 不夠;Hermes 的 custom provider 則可走 Chat Completions。想先理解 Agent 與執行層的差別,可搭配Agent Harness 是什麼。
Claude Code 要多一層紅線。Magnitude 會建立 Anthropic Messages 相容轉接,技術上可連線;但 Anthropic 的官方 LLM gateway 文件明確說,透過 gateway 使用非 Claude 模型不受支援。也就是說,「接得上」不等於上游承諾所有 streaming、tool call、thinking 或 beta 欄位都相容。要穩定使用本機開源模型,Codex 或 Hermes 是較清楚的驗收起點;Claude Code 路徑應視為實驗性相容,升級後重測。可再讀Claude Code 與 Codex 比較與Hermes Agent 教學。
步驟三:先做 3 層 smoke test
- Endpoint 層:服務啟動、模型狀態為已載入,簡短 prompt 能回覆。
- 工具層:讓 Agent 只讀一個測試 repo、列出三個檔名,再執行一個無副作用命令;確認 tool call 沒有變成普通文字。
- 任務層:交付一個可自動驗收的小修正,例如讓單一失敗測試通過;保留 git diff、測試結果、耗時與失敗原因。
只在可丟棄的 repo 做第一次測試,網路工具、雲端 provider 和不必要的寫入權限先關掉。本機推論代表模型請求可以留在 loopback,不代表 Agent 被沙箱隔離:它仍可能讀寫檔案、執行 shell,而 session 與 log 也可能留有敏感內容。若你的目標是離線,需先在有網路時完成 CLI、runtime 與模型下載,再關閉 web/search 工具和雲端 provider,斷網後重跑同一套驗收;「Wi-Fi 關掉仍完成一次任務」只能證明那次路徑,不是永久隱私保證。
Magnitude 本機 Agent 怎麼和手動設定公平 A/B?
先決定你要回答哪一題。選型 A/B是比較「推薦模型」和「你手挑的模型」,因此必須沿用同一 Magnitude runtime、同一 Agent、同一 context;整套 A/B才是把 Magnitude 組合拿去對 Ollama/llama.cpp,結果同時包含模型選擇、推論引擎與接線差異。兩種結果不能混成「推薦器比較準」。

較公平的最小 smoke test,是固定 repo snapshot、prompt 與歷史、工具 schema、Agent/runtime 版本、context、sampling/reasoning/輸出上限和評分規則;準備 5 個有確定答案的任務,每組跑 3 次,交錯使用 A→B、B→A,並把冷啟動和暖機後分開。這不足以宣稱全面優勝,每一輪至少記:
- 做得對:測試是否通過、diff 是否越界、工具呼叫是否完整、是否需要人工救援。
- 等得起:載入時間、首 token 等待、整題牆鐘時間、重試與 timeout。
- 跑得動:峰值 RAM/VRAM/統一記憶體、是否 swap、長 context 是否崩潰或卸載重載。
最後先比任務完成率與總耗時,再看 tok/s。寫程式時,會快速產生錯誤工具呼叫的模型,可能比慢一點但一次通過的模型更浪費時間。若要進一步設計可重跑的模型對照,可沿用本機模型同題 A/B 方法;想理解 context 為何吃記憶體,先看本機 LLM VRAM 指南。
步驟四:故障演練與回滾
正式使用前,刻意測四個失敗:模型下載中斷、服務停止、超長輸出/context、可用記憶體不足。觀察 Agent 是否清楚報錯、模型是否被重載、工作目錄有沒有留下半成品。載入後拔網路再重跑離線任務,則能抓出隱藏的 web tool 或雲端 fallback。
# 只移除你先前接上的那一個,然後重啟該 Agent
magnitude connections remove <harness-id>
不要只停止 Magnitude service 就以為完成回滾;已接線的 Agent 仍會指向本機 endpoint,結果只會是連線失敗。依官方 troubleshooting移除 connection、重啟 Agent,再確認 Magnitude 管理的 gateway/provider 已移除,並人工檢查最後選中的模型;既有設定能否恢復取決於 connector 寫入前的狀態。正式 repo 也應先 commit 或建立 worktree,讓錯誤修改可以乾淨丟棄。
誰適合用 Magnitude?誰先手動?
- 選 Magnitude:你不熟 quant、KV cache 與不同 Agent 協定,希望先得到可運作的候選,再願意自行驗收。
- 選 Ollama/LM Studio:你只想快速跑已知模型,並使用 Codex 既有的本機 provider 路徑,不需要跨模型排序。
- 選 llama.cpp/MLX:你要控制每個 runtime 參數、重現效能測量,願意自己處理模型與 Agent 接線。
- 暫時不要導入:你需要受支援的 Claude Code 非 Claude 模型路徑、可稽核沙箱,或尚未容許 0.0.x 工具快速變動。
其實不用二選一:先讓 Magnitude 產生候選,再以你原本熟悉的 runtime 做整套 A/B,就能把「省下選型時間」和「是否真的更好」分開。若想從推論引擎原理補課,可接著讀LLM 推論引擎完整解析。
常見問題 FAQ
1. Magnitude 真的會自動選出最佳模型嗎?
不會保證。它依記憶體適配、能力、預估速度與量化保真產生排序,使用者仍選偏好與模型;你的任務品質要另外測。
2. 推薦卡的 tok/s 是實測嗎?
不是模型實測。目前設計是模型無關的硬體校準加規劃器預測,不能直接當作實際 prefill、Agent 全程速度或統計信賴區間。
3. Magnitude 比 Ollama 或 llama.cpp 快嗎?
不能由現有公開資料下結論。截至本文查核日,我們在 commit 0851902 的官方 benchmark 目錄未找到固定機器、任務、模型與 Agent 的推薦對手動結果檔;這是對該版本目錄的有限查核,不代表未來不會發布,請在自己的機器做整套 A/B。
4. 可以完全離線使用嗎?
下載完成後,核心本機推論可以離線驗證。但安裝、runtime 與模型下載需要網路;Agent 的 web/search 工具、雲端 provider、更新檢查也可能產生流量。
5. 本機跑就代表資料一定安全嗎?
不代表。本機 inference 減少把 prompt 送給模型供應商的需求,卻沒有自動限制 Agent 的檔案、shell、網路權限,也不會替你清除 log。
6. Windows 可以直接安裝嗎?
原生 Windows 目前不支援。官方文件提供的是 WSL 路徑;仍應用你的 GPU driver、WSL 記憶體與模型組合實測。
7. Claude Code 接上本機模型就是官方支援嗎?
不是。Magnitude 有相容轉接,但 Anthropic 明確不支援透過 gateway 使用非 Claude 模型;更新 Claude Code 或 Magnitude 後都要重新驗收。
8. 新手第一次測幾題才夠?
5 題各 3 次只夠篩掉明顯不合格組合。要公開宣稱誰更好,需要更多代表性任務、盲評或自動評分、版本與模型 hash、重複測量,以及完整失敗紀錄。
給新手的 4 個重點
- 推薦清單回答「值得先試誰」,不回答「誰一定完成你的任務」。
- 先做同 runtime 的選型 A/B,再做 Magnitude 對其他 runtime 的整套 A/B。
- 模型下載完成、斷網仍可推論,不等於 Agent 已被沙箱隔離。
- 固定版本、model ID、repo snapshot 與驗收規則,否則結果無法重現。
想把這套方法延伸成完整的 Agent 工程流程,可以從動手打造 Agent Harness開始;若想有系統地學習 AI 工具與工作流,可查看 AlphaLab 的線上課程與AI 專區。
接著閱讀
左右滑動查看更多推薦
結語:先信流程,再信推薦
Magnitude 最有價值的地方,是把散落的硬體、量化、模型、endpoint 與 Agent 設定收進同一條路徑;它目前最缺的,則是能證明推薦優於手動選擇的公開同機結果。回到那條式子:跑得動 × 等得起 × 做得對,缺一項都不是最佳本機模型。你的下一步不是一次下載十個模型,而是固定 0.0.11、保存第一份 Balanced 清單,選一個可丟棄 repo 完成 5 題 × 3 次的小型 A/B,再讓資料決定要留下 Magnitude,還是回到熟悉的手動組合。






