跳到主要內容

Qwen3.8-27B 本機 Agent|80 次工具呼叫證明了什麼?(2026)

最後更新: ·
Qwen3.8-27B 本機 Agent 80 次工具呼叫案例,來源截圖顯示 74 則訊息與 80 次呼叫

2026 年 8 月 20 日,Reddit 使用者 u/synth_mania 在 r/LocalLLaMA 發布〈Qwen3.8-27b has the highest level of “agency” I’ve ever seen in a local model〉。作者稱,一個量化後的 Qwen3.8-27B 本機 Agent在單張 RTX 3090 上,沒有中途人工介入,執行 80 次工具呼叫後產出使用者的大學課表。這也把一個重要問題推到眼前:消費級硬體上的本機 Agent,是否已經跨過「只能聊天」的門檻?

AlphaLab 深讀貼文、截圖與作者後續說明,再對照 Qwen 官方模型卡、硬體重現專案、公開多次試驗與 Agent 安全資料。先說結論:作者回報、而附圖也支持這套 stack 曾產出一條 80-call 長流程;完整 trace、硬體 log 與獨立 ground truth 未公開,因此它仍是值得重視、但尚未重現的單次現場紀錄。它沒有證明 80 次呼叫都正確、同一任務能穩定重跑,更沒有證明這樣的 Agent 適合帶著真實憑證無人看管。

Reddit 上 Qwen3.8-27B 本機 Agent 80 次工具呼叫貼文與附圖
Reddit 原貼與作者附圖;瀏覽器框架由 AlphaLab 製作。截圖/Reddit、u/synth_mania

原文其實講了兩次不同的 Agent 任務

第一個也是證據最多的案例,是大學課表。使用者只送出一個 Prompt,要求 Agent 用 Playwright 查出新學期課程;Prompt 內附已遮蔽的登入資料,並明確告知既有 Outlook 腳本已有 Duo 行動驗證,請它設法重用該 token。作者在正文把這項回報寫得很直接:

It needed no human intervention, and executed 80 tool calls.

中文:它不需要人工介入,並執行了 80 次工具呼叫。

u/synth_mania,Reddit 原貼

附圖的折疊列則顯示 74 則訊息、80 次工具呼叫,以及 Qwen3.8 27B (local)

最終回答列出五門課、共 13 學分,並聲稱從 DegreeWorks 與 D2L 交叉核對。截圖同時揭露一個不能略過的細節:Agent 表示它重用了 OWA Playwright profile 裡的 Microsoft KMSI 登入狀態與 Duo browser-trust cookies,再一路經過校方 ADFS、Azure AD 與校務系統。這不是模型自行繞過 MFA;是使用者先給了重用既有登入狀態的授權。

Qwen3.8-27B 本機 Agent 截圖顯示 74 則訊息與 80 次工具呼叫
原始附圖顯示「74 messages · 80 tool calls」;完整工具過程並未展開。圖/u/synth_mania(Reddit)

第二個案例是社群調查。作者回報,Agent 找到一支公開影片,下載後抽幀、安裝 OpenAI Whisper、轉錄語音,再放大與提亮畫面。作者在後續留言補充,這個範圍其實由自訂 research skill 先規定要檢查每一則公開貼文,而該帳號只有一支公開影片。因此,值得注意的是它把一條深度處理流程跑完,而不是模型自己決定去監控某個陌生人。這次任務沒有公開原始 Prompt、工具紀錄、影片、逐字稿或完整 session,證據強度低於課表案例。

截圖能支持什麼,又缺了什麼?

這張 1080 × 4212 的截圖讓故事比純文字傳聞更具體:它確實顯示初始 Prompt、模型標籤、74 則訊息、80 次工具呼叫,以及一份看似完整的課表回答。但「Process details」是收合的;讀者看不到每次呼叫的參數、回傳、錯誤、重試、等待時間與任何中途 steering。受保護的校務資料也無法由外部查核,所以「課表正確」與「兩個系統都驗過」仍是作者接受的模型輸出,不是獨立驗證。

  • 有公開:一張結果截圖、作者的硬體與取樣參數、Pi/pi-web 專案連結,以及零散的設定說明。
  • 沒有公開:展開後的 80 次工具 trace、錯誤與重試紀錄、LM Studio 版本、完整 AGENTS.md、自訂 skill/plugin,以及多次重跑結果。作者提供了 Unsloth Q4_K_S 標籤,但沒有完整檔名、revision 與 SHA-256,無法鎖定實際 artifact。
  • 因此能說:作者回報這個 stack 曾產出一次長流程,截圖讓這項回報更具體。
  • 不能直接說:Qwen3.8-27B 已被證明能穩定、安全地自主完成 80 步任務。

作者自己也把這篇定位成代表其日常體感的 anecdote,而不是嚴謹的測試套件。最準確的證據等級不是 benchmark,而是有截圖佐證、但尚未重現的單次 field report

Qwen3.8-27B 本機 Agent:單張 RTX 3090 在硬體上合理嗎?

Qwen 官方 repository記錄 Qwen3.8-27B 於 2026 年 8 月 14 日公開;官方模型卡把它定位為 27B dense、原生多模態、Apache-2.0 授權的開放權重模型,原生 context 為 262,144 tokens,可透過 YaRN 延伸至 100 萬。它不是同系列的 Qwen3.8-2.4T-A95B 超大型版本。

官方 BF16 權重約 55.6 GB,FP8 版本約 30.9 GB,兩者光檔案就超過 RTX 3090 的 24 GB GDDR6X;原貼使用的是第三方 Unsloth Q4_K_S 權重量化與 Q8 KV cache,才可能把部署壓進消費級顯卡。作者另回報 150K context 與關閉 MTP,但沒有公布可重現的模型 artifact、峰值 VRAM 或 runtime log,因此無法獨立驗證這次執行的精確記憶體配置。

硬體可行性倒有接近的獨立證據。syv-ai 的公開重現專案用不同的 AutoRound W4A16/vLLM stack,在單張 RTX 3090 上展示同模型家族的 150K context;它支持「3090 路線在技術上可行」,卻沒有重現原貼的 Unsloth GGUF、Pi harness、精確記憶體分配或校務任務。換句話說,硬體路線可行,不等於那 80 次呼叫已被重現。4-bit 權重與 Q8 KV 又是兩個不同的有損變因,長流程工具品質仍要對照較高精度 baseline 重複測試。

真正執行任務的不是模型,而是一整套 Agent stack

Qwen3.8-27B 能依 chat template 產生 tool call,也能在多輪歷史中接收 tool result;但它本身不含瀏覽器、Bash、Playwright、搜尋引擎或大學帳號。作者表示用 LM Studio 提供推論,Pi Agent 與 pi-web 維持迴圈;其一般 Pi 環境另裝有 Brave Search、Reddit Research、command line 與 homelab plugins,AGENTS.md 也要求使用外部資源確認資訊。由於 trace 未公開,不能判定每一項是否都參與這次課表任務。

一次 Agent 結果 = 模型 × 量化 × Runtime × Harness × 工具 × 權限 × 起始環境

這個乘法關係也解釋了為何不能把 80 次呼叫全部記在模型名下。Pi 決定哪些工具可用、如何保存歷史、何時壓縮 context、失敗後是否重試;瀏覽器內既有的登入狀態又大幅降低任務難度。Qwen 的長流程規劃能力可能是必要條件,但不是完整因果。

Qwen 官方自報數據確實支持「這代針對 Agent 強化」:模型卡列出 Terminal-Bench 2.1 為 73.0、SWE-bench Pro 為 61.7,內部 CoWorkBench 為 70.7;同一張表也顯示它並非每項都領先比較模型。這些結果尚未在此由第三方全面複驗,部分採用 Claude Code harness,部分 benchmark 由 Qwen 自建,因此只能支持「值得測」,不能支持「本機模型中 agency 最高」這種總體排名。

Qwen3.8-27B 本機 Agent:80 次呼叫代表長度,不代表可靠度

80 是一個很吸睛的數字,但它先衡量的是活動量與任務 horizon。沒有 trace 時,我們無法把有效步驟、重試、繞路、解析失敗與恢復動作拆開。一次被作者接受的結果可以支持 capability 曾出現;可靠度要看同樣起始條件下,成功能否反覆出現。τ-bench之所以同時檢查資料庫 end state 與多次執行的一致性,正是因為單次 pass 與可依賴的行為不是同一個量。

一個很好的反例來自 sandst1 的公開四次執行 benchmark。這是由 reviewer model 評分的單一自訂工程任務,不是標準化總榜;但在同一個 qwen3.8-27b-4bit-reasoning-medium 設定下,四次分數仍落在 27.5 到 37.5/40。其中一次過早標記狀態,失敗時可能永久漏送,另一次遇到既有資料庫便 crash。這份測試和課表任務不同,卻剛好說明:有能力完成,與每次都以正確操作語意完成,是兩個問題。

因此,更有用的後續指標不是「最多呼叫幾次」,而是固定任務的 pass@1、連續成功率、錯誤恢復率、人工介入次數與 unintended side effects。完整 trace 也應保留每一筆 tool arguments、result、error、retry、時間戳與最終環境狀態。

最值得警惕的不是模型大小,而是授權範圍

原案例的危險點不是「Qwen 偷了 token」;使用者在 Prompt 裡主動要求它重用 Duo 狀態。真正的問題是,同一個 Agent 同時握有真實登入資訊、可信任的 browser profile、任意 Bash、安裝套件能力、開放網路與多個 homelab plugin。Pi 官方安全文件明載它沒有 built-in sandbox,工具與 extensions 以啟動 Pi 的使用者權限執行;若未另外加上 OS/VM/container 或 policy extension,Pi 本身不是隔離邊界。

NIST 的 Agent 工具分類把權限(read-only/constrained write/write)與環境信任程度分開評估;瀏覽公開網頁、持有登入狀態又能執行命令,正是需要額外邊界的組合。Prompt injection 安全建議也強調只提供任務所需資料、縮小指令範圍,並在重要動作前要求確認。

  • 把讀與寫拆開:課表查詢只給 read-only wrapper,不讓瀏覽器任意點選加退選、付款或發訊息。
  • 把憑證移出 Prompt:使用專用帳號、短效且可撤銷的 scoped token,由可信任 proxy 注入,不讓 Agent 直接讀取主瀏覽器 profile。
  • 把網路與主機隔離:專用 VM/browser profile、domain allowlist、egress 控制;查網站的 Agent 不需要同時擁有任意套件安裝權。
  • 把確認寫成程式規則:任何改變帳號狀態的動作,都由 LLM 外部的 deterministic gate 阻擋並交給人確認。
  • 測完撤銷 session:保留 audit log,清除 cookies/token,檢查帳號狀態沒有非預期變更。

本機推論的確能讓 Prompt 與推理不必送到雲端模型供應商,這是實質隱私優勢;但這次 Agent 仍連線到 Microsoft、校務系統、搜尋與其他網站。「local」描述模型在哪裡算,不代表整個工作流 offline,更不代表憑證與資料天然安全。

AlphaLab 判斷:門檻真的下降了,證據標準不能跟著下降

我們同意原文最有價值的直覺:一個可下載的 27B 模型,經 4-bit 量化後,已能在單張 24GB 消費級顯卡上參與很長的工具流程。這會讓私有資料、本機客製與固定成本的 Agent 實驗進入更多個人工作站,不再只屬於雲端 frontier model。

但我們不同意把這張截圖升格成「可靠自主性已解決」。它沒有公開過程、重跑分布、獨立 ground truth,也沒有隔離模型、harness、既有登入狀態與廣泛權限的貢獻。80 次呼叫可能同時代表 persistence、繞路與復原;沒有 trace,三者無法分開。

最公平的結論是:Qwen3.8-27B 的 80-call 案例是一個令人印象深刻、由作者回報且有結果截圖支持的單次可行性展示;它足以改變我們「本機 Agent 值不值得認真測」的答案,還不足以改變「能不能放心交付真實權限」的答案。

如果要把驚嘆變成證據,下一次應該怎麼測?

先把真實校務帳號換成可重置的測試環境,固定模型 revision、GGUF SHA-256、runtime、tool parser、system prompt、sampling、context/KV 設定與起始 browser state。再用同一任務先跑 5 到 10 個 fresh sessions,預先定義正確答案、禁止的副作用、何時算人工介入,以及超時/超出工具預算的失敗規則;所有成功與失敗都保留,不能只挑最好的一張截圖。這只能當初步不穩定篩查,不能拿來宣稱 99% 可靠度。

若你手上已有 Qwen3.8-27B,可直接接著用 AlphaLab 的本機 Agent 六關驗收協定檢查 tool call、history replay 與 runtime;還在選量化與 context,先讀本機 LLM 顯存指南GGUF 量化指南。真正的進步,不是把 80 變成 800,而是讓每一步都可查、可重跑、可限制、可撤銷。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。