這篇 UI-Mate 教學要回答的,不是「影片看起來多厲害」,而是:同一個 GUI Agent 多拿到一次操作示範,究竟有沒有比較容易把跨 App 工作做完?答案是「可能有幫助,但一次示範不是保證」。UI-Mate 會把成功操作整理成子任務流程,再依目前畫面重新找按鈕、輸入內容與判斷是否完成;它不是把舊座標原封不動重播。
你會在這篇學會三件事:分清 instruction、demonstration trace 與即時畫面各自扮演什麼角色;用官方桌面 App 錄製、整理並套用一次示範;最後以同一份沙盒任務做 zero-shot/one-demo A/B 驗收,記錄成功、進度、耗時、錯步與人工介入。本文依據 2026 年 8 月 19 日可查的官方程式庫、App 使用指南與技術報告;AlphaLab 本次未在可用硬體上部署 27B DemoCUA,因此不會把作者結果寫成本站重現。
先校正名稱:題目線索裡的「UI-Mate-2.7B」少了一個數量級。官方公開的是通用版 UI-Mate-9B、UI-Mate-27B,以及專門吃示範流程的 UI-Mate-democua-27B。這篇談的 one-demo 功能指第三個 27B checkpoint,不是 2.7B 小模型。
先說結論:錄一次,是多一張流程地圖,不是錄製巨集
🧭 記憶把手:UI-Mate 示範學習=文字目標+可編輯的子任務地圖+每一步的即時畫面。
示範告訴 Agent「大致該怎麼走」;目前畫面才決定「這一步要點哪裡」。如果畫面、資料或視窗位置改變,Agent 應重新定位,而不是照抄過去的滑鼠座標。
- 適合試:有固定意圖、步驟偏長、需要在兩個以上 App 搬運資訊,而且你能先在測試資料上示範一次。
- 先別用於:付款、刪除、寄信、發布或帳戶設定等不可逆工作;官方安全章節也要求敏感操作由人確認。
- 判斷重點:別只看「最後有沒有完成」。進度、錯步、人工救援與真正存出的檔案,都要一起驗收。
UI-Mate 教學第一課:instruction、demo trace、畫面怎麼配對?
把它想成第一次帶新同事做報表。Instruction 是交付目標,例如「把待處理專案整理到簡報第 2 頁」;demonstration trace 是資深同事做對一次後留下的操作軌跡;live screenshot 則是新人此刻真正看到的桌面。三者缺一,Agent 都可能知道目的卻找不到路,或記得路卻看錯現場。

官方流程會保留每次鍵盤/滑鼠動作及動作前後畫面,再把 trace 正規化、補上畫面語意、切成有「目標+完成條件」的子任務。執行到某一段時,只把目前子任務與關鍵步驟放進上下文;模型回報 subtask_complete 後,指標才移到下一段。這和AI Agent Harness的概念相通:模型負責判斷,外層 harness 負責畫面、動作、歷史與狀態推進。
關鍵差別是:demo 裡的座標不被當成答案。若示範時「貼上」在右上角、測試時按鈕移到左側,Agent 應從新畫面找目標。這正是 UI-Mate 比傳統巨集更有彈性的地方,也是它可能誤判的來源;畫面線索不清、彈窗插入或同名按鈕太多,都可能讓重規劃走錯。
先選對模型:三個 checkpoint 不是同一種用法
UI-Mate-9B:通用 computer use,適合先確認端點、畫面理解與基本動作鏈。UI-Mate-27B:較大的通用 computer-use checkpoint,仍是 instruction-only 路線。UI-Mate-democua-27B:經過 demonstration-augmented 訓練,才是本文的 demo-in-the-loop 路線。官方 README 明寫,通用 checkpoint 即使收到同樣提示,也不會表現出這套受訓的 workflow 行為。
換句話說,把 JSON 示範塞給通用 27B,不等於切換成 DemoCUA。若你只是想先檢查本機模型能不能穩定呼叫工具,可先照27B 本機 Agent 驗收建立小型 fixture;若目標是學一次示範,就要把桌面 App 連到 DemoCUA checkpoint 的 OpenAI-compatible endpoint。
上手前準備:App 只是控制台,模型服務要另外接
截至 2026 年 8 月 19 日,官方 App 指南列出的安裝環境是 Apple Silicon Mac 與 macOS 13 以上,並要求開啟 Screen Recording、Accessibility 權限。官方也把 App 定義成 OpenAI-compatible client,而不是內建推論引擎:它可以連託管、自架或裝置端模型,但模型與算力要由你準備。Windows 客戶端在官方 README 標示為開發中;這是 App 發布狀態,不代表論文裡的 Windows benchmark 被取消。

1. 啟動 DemoCUA 端點,再核對 model name
痛點:App 填對網址,仍可能因服務端名稱不同而拿到空回應。解法:按官方 README 啟動 UI-Mate-democua-27B,再查 /v1/models。以下是官方的 vLLM 範例;/path/to/... 必須換成你的模型路徑,tensor parallel 數量則要符合自己的 GPU 拓樸。
vllm serve /path/to/UI-Mate-democua-27B \
--trust-remote-code \
--served-model-name UI_Mate \
--port 8000 \
--tensor-parallel-size 2 \
--gpu-memory-utilization 0.85 \
--mm-encoder-tp-mode data \
--chat-template-content-format openai \
--limit-mm-per-prompt '{"image":6,"video":0}'
curl -s http://127.0.0.1:8000/v1/models
在 App 選 UI-Mate agent,Base URL 填 http://127.0.0.1:8000/v1,model name 要與查詢結果一致,再按 Test Connection。看到連線成功只代表端點可回應;下一步仍要用一張無敏感資訊的測試畫面確認它能產生有效動作。
2. 錄一次成功流程,不要先錄真實客戶資料
痛點:示範若夾帶姓名、地址、token 或通知內容,後續每次套用都可能把敏感畫面送進模型上下文。解法:先做一份合成試算表和空白簡報,在 Demo Library → Record Demo 開始錄製;完成後按 ⌘⇧S 停止,再選 Process to Reusable。驗收時只需要知道「同一流程是否能轉移」,不需要真實資料。

3. 編輯 trace:留下意圖,刪掉偶發雜訊
痛點:錄製時切錯視窗又切回來,Agent 可能把這段繞路也學成流程。解法:在 Recording Detail 逐步看 before/after 畫面、動作、caption 與狀態;刪除誤點、重排步驟,並把 caption 改成可跨資料重用的意圖,例如「選出待處理列」而非「點第 7 列」。可觀察的成果是:每個子任務都有明確完成條件,且任何一步都不依賴某個固定座標。

4. 套用示範,但把提交權留給人
痛點:Agent 可能已完成 90%,最後卻存錯檔名或按到寄送。解法:以 Apply 或 /demo 附上 workflow,輸入目標指令後啟動;把「儲存、覆寫、提交、寄送」設成人工確認點,利用 App 的 pause、resume 與 user interjection 修正。驗收標準不是聊天室顯示 finished,而是回到檔案系統或目標 App 檢查真正產物。
UI-Mate 教學核心:怎麼做 zero-shot vs one-demo A/B 驗收?
最容易自我欺騙的做法,是 zero-shot 用難資料、one-demo 用簡單資料,然後宣稱示範有效。比較時只改一個變因:是否附上 demo。任務文字、起始檔案、視窗狀態、步數上限、模型 checkpoint、抽樣設定與完成檢查都要相同。這和AI Evals的核心一樣:先寫 verifier,再按 Run。
- 先做兩套沙盒 fixture。建立 A、B 兩份欄位相同、內容不同的試算表與簡報;在 A 上錄示範,在 B 上正式比較。這是在測 related-but-nonidentical 的流程轉移,難度高於重跑同一份檔案。
- 把成功寫成機器外可檢查條件。例如 B 的待處理列全數出現在第 2 張投影片、標題正確、來源檔未改、輸出檔名正確,而且沒有碰到其他視窗。
- 跑 zero-shot。重置 B 的檔案與視窗,只給同一段 instruction;記錄 strict success、完成檢查數、總耗時、錯步、人工介入與最後產物。
- 跑 one-demo。再次重置完全相同的 B,使用同一 checkpoint 與設定,只多附 A 的 demo;套用前先確認 trace 沒有 A 的敏感值或固定座標。
- 交換順序並重複。若資源允許,交替先跑哪一組,至少不要永遠先跑 zero-shot;每次都從乾淨副本開始,避免上一輪留下的檔案或快取幫到下一輪。

官方最完整的量化比較來自 33 個 same-task self-demo 配對:同一個 DemoCUA checkpoint、相同目標、環境、budget 與 verifier,只切換有無示範。設計圖列出作者報告的 strict success 與 progress;這是「同任務成功軌跡能否提供指引」的證據。對 45 個 related-but-nonidentical variant-demo 任務,論文描述的是集合與小型探索,未提供同等完整的整體結果,因此不能把 self-demo 的提升直接套到你的 Excel→PowerPoint、CAD 或其他工作流。
結果怎麼讀:成功率之外,還要看三種代價
- 錯步代價:多開一個 App、改錯儲存格、貼錯投影片都要記。只要最後人工救回來,strict success 仍應判失敗,另記 progress。
- 人工代價:每次 pause、重新提示與替它點擊都算 intervention。若 one-demo 少走彎路卻需要更多救援,不能只用時間宣布勝出。
- 示範維護代價:App 版面或流程變動後,舊 trace 可能誤導。要把 demo 視為可版本化的測試工件,而不是永久知識。
作者報告也顯示 demonstration 並非每題都變好;論文的部分 OSWorld 與 GameDev 任務出現下降。最合理的解讀不是「demo 無效」,而是「流程建議和現場衝突時,額外上下文也可能把 Agent 帶偏」。這就是為什麼你要保留 zero-shot baseline,以及完整 session trace。想進一步把 trace 變成可靠的工程證據,可接著讀Agent Harness 實作與Context Compaction 驗收。
選 one-demo、zero-shot,還是傳統自動化?
- 選 zero-shot:任務短、只做一次、畫面線索清楚,錄製與維護 demo 的成本高於可能省下的探索。
- 選 one-demo:同類流程會重複、跨 App、有多個不可從單一畫面推知的中間步驟,而且你能提供乾淨的成功示範。
- 選 API/RPA:系統有穩定介面、欄位與規則,且結果必須高度可稽核。GUI Agent 的價值在於適應介面,不是取代所有確定性整合。
簡單決策樹是:能用可靠 API 完成嗎?能就先用 API;否則問任務是否會重複且需要跨畫面推理?不會就試 zero-shot;會則錄一份去識別化 demo,再用上面的 A/B fixture 決定是否值得維護。別用模型排行榜替代自己的驗收;不同 benchmark、版本與環境不可直接互比,這也是AI 模型排行榜教學最重要的閱讀方法。
六個常見坑:真正危險的往往是最後一步
- 把 27B 看成 2.7B:會嚴重低估部署規模;先在 Hugging Face model card 核對 checkpoint 名稱與檔案。
- 把 demo 當座標巨集:caption 寫「點右上角」會綁死版面;改寫成「開啟匯出選單」,並讓完成條件可觀察。
- 錄到敏感畫面:先關通知、登出無關帳號,使用合成資料;錄完逐幀檢查 before/after screenshot。
- 只看 Agent 自稱完成:回到目的檔案驗證名稱、頁數、內容與來源檔狀態;對外送出前暫停。
- 沒有乾淨重置:上一輪建立的檔案會讓下一輪看似更快;每次從同一快照或複製品開始。
- 拿官方聚合分數保證自己的 App:OSWorkerBench 是作者提出並評估的 benchmark;你的 OS、模型服務、App 版本與任務都可能不同,必須保留本地 verifier。
官方Safety 章節明確提醒 computer-use agent 可能誤操作、遭遇 prompt injection 或觸發具後果的行為,建議隔離環境、避開高風險已登入工作流、檢查 trajectory、敏感操作由人確認,並驗證真實最終狀態。這不是文章尾端的形式提醒,而是 A/B fixture 的一部分。
FAQ:UI-Mate 一次示範最常被誤會的 8 件事
1. UI-Mate 是 2.7B 小模型嗎?
不是。官方 checkpoint 是 9B、27B 與 DemoCUA 27B;本文 one-demo 路線使用 UI-Mate-democua-27B。
2. 看過一次就一定會做嗎?
不一定。示範提供程序線索,但即時畫面仍可能出現不同彈窗、版面與資料;官方報告裡也有示範後分數下降的個別任務。
3. 通用 UI-Mate-27B 也能直接吃 demo 嗎?
不等價。官方把 workflow consumption 與 subtask_complete列為 DemoCUA checkpoint 經 demonstration-augmented 訓練學到的行為。
4. Windows 現在能安裝官方桌面 App 嗎?
截至 2026 年 8 月 19 日,官方 README 把 Windows support 標為 in progress。目前使用指南提供 Apple Silicon Mac 的安裝與權限流程;WindowsAgentArena 分數是 benchmark 證據,不能反推 Windows 客戶端已發布。
5. 下載 App 就含模型嗎?
不含。官方把它定位為 OpenAI-compatible client;你要另外連託管、自架或裝置端模型服務。
6. demo 會重播原本的滑鼠座標嗎?
不會照座標重播。官方實作把 live screenshot 視為權威,demo 供應的是目前子任務、完成條件與關鍵步驟。
7. 官方數字能證明 Excel→PowerPoint 或 CAD 都有效嗎?
不能這樣外推。最完整的 one-demo 聚合數字是 same-task self-demo;跨內容、跨版面或跨軟體的 variant transfer 要用自己的 fixture 驗收。
8. 實際速度可以從展示影片估嗎?
不能只看影片。技術報告在作者裝置上記錄自架 27B 每步約 3–5 秒、優化後約 2–3 秒,App tuned endpoint 的中位數約 3.03 秒;這些是作者環境快照,不是你硬體的承諾。A/B 時應從送出到驗證產物自行計時。
給新手的 5 個重點
- one-demo 用的是
UI-Mate-democua-27B,不是 2.7B,也不是通用 27B 的同義詞。 - 把示範當「子任務地圖」,不要當固定座標巨集。
- 先用合成資料錄製,逐幀刪除敏感資訊與偶發誤點。
- A/B 只切換有無 demo,其餘環境、目標、budget 與 verifier 全部固定。
- 最後看真實產物,並在覆寫、提交、寄送等動作前保留人工確認。
接著閱讀
左右滑動查看更多推薦
結語:先錄一張好地圖,再用同一把尺驗收
UI-Mate 最值得學的,不是「Agent 看一次就無所不能」,而是把成功操作轉成可檢查、可修改、可附加的程序提示。真正可靠的下一步,是今天就做一組無敏感資料的 A/B fixture:先寫五個完成條件,分別跑 instruction-only 與 one-demo,逐項核對產物、錯步與人工介入。如果示範確實讓同類任務穩定少繞路,再把它納入版本化工作流;如果沒有,就保留 zero-shot 或改走 API/RPA。錄製不是終點,能被同一把尺反覆驗收才是。






