跳到主要內容

【2026 最新】UI-Mate 教學:錄一次就會做?DemoCUA 設定、示範錄製與 A/B 驗收

最後更新: ·
UI-Mate 教學首圖,以官方產品圖示搭配錄一次 Agent 就會做的提問

這篇 UI-Mate 教學要回答的,不是「影片看起來多厲害」,而是:同一個 GUI Agent 多拿到一次操作示範,究竟有沒有比較容易把跨 App 工作做完?答案是「可能有幫助,但一次示範不是保證」。UI-Mate 會把成功操作整理成子任務流程,再依目前畫面重新找按鈕、輸入內容與判斷是否完成;它不是把舊座標原封不動重播。

你會在這篇學會三件事:分清 instruction、demonstration trace 與即時畫面各自扮演什麼角色;用官方桌面 App 錄製、整理並套用一次示範;最後以同一份沙盒任務做 zero-shot/one-demo A/B 驗收,記錄成功、進度、耗時、錯步與人工介入。本文依據 2026 年 8 月 19 日可查的官方程式庫App 使用指南技術報告;AlphaLab 本次未在可用硬體上部署 27B DemoCUA,因此不會把作者結果寫成本站重現。

先校正名稱:題目線索裡的「UI-Mate-2.7B」少了一個數量級。官方公開的是通用版 UI-Mate-9BUI-Mate-27B,以及專門吃示範流程的 UI-Mate-democua-27B。這篇談的 one-demo 功能指第三個 27B checkpoint,不是 2.7B 小模型。

先說結論:錄一次,是多一張流程地圖,不是錄製巨集

🧭 記憶把手:UI-Mate 示範學習=文字目標+可編輯的子任務地圖+每一步的即時畫面。
示範告訴 Agent「大致該怎麼走」;目前畫面才決定「這一步要點哪裡」。如果畫面、資料或視窗位置改變,Agent 應重新定位,而不是照抄過去的滑鼠座標。

  • 適合試:有固定意圖、步驟偏長、需要在兩個以上 App 搬運資訊,而且你能先在測試資料上示範一次。
  • 先別用於:付款、刪除、寄信、發布或帳戶設定等不可逆工作;官方安全章節也要求敏感操作由人確認。
  • 判斷重點:別只看「最後有沒有完成」。進度、錯步、人工救援與真正存出的檔案,都要一起驗收。

UI-Mate 教學第一課:instruction、demo trace、畫面怎麼配對?

把它想成第一次帶新同事做報表。Instruction 是交付目標,例如「把待處理專案整理到簡報第 2 頁」;demonstration trace 是資深同事做對一次後留下的操作軌跡;live screenshot 則是新人此刻真正看到的桌面。三者缺一,Agent 都可能知道目的卻找不到路,或記得路卻看錯現場。

UI-Mate 將文字目標、一次示範、子任務流程與即時畫面組合成下一步 GUI 動作的概念圖
示範先被整理成可讀的子任務;執行時仍以即時畫面為準,再做動作與完成檢查。

官方流程會保留每次鍵盤/滑鼠動作及動作前後畫面,再把 trace 正規化、補上畫面語意、切成有「目標+完成條件」的子任務。執行到某一段時,只把目前子任務與關鍵步驟放進上下文;模型回報 subtask_complete 後,指標才移到下一段。這和AI Agent Harness的概念相通:模型負責判斷,外層 harness 負責畫面、動作、歷史與狀態推進。

關鍵差別是:demo 裡的座標不被當成答案。若示範時「貼上」在右上角、測試時按鈕移到左側,Agent 應從新畫面找目標。這正是 UI-Mate 比傳統巨集更有彈性的地方,也是它可能誤判的來源;畫面線索不清、彈窗插入或同名按鈕太多,都可能讓重規劃走錯。

先選對模型:三個 checkpoint 不是同一種用法

  • UI-Mate-9B通用 computer use,適合先確認端點、畫面理解與基本動作鏈。
  • UI-Mate-27B較大的通用 computer-use checkpoint,仍是 instruction-only 路線。
  • UI-Mate-democua-27B經過 demonstration-augmented 訓練,才是本文的 demo-in-the-loop 路線。官方 README 明寫,通用 checkpoint 即使收到同樣提示,也不會表現出這套受訓的 workflow 行為。

換句話說,把 JSON 示範塞給通用 27B,不等於切換成 DemoCUA。若你只是想先檢查本機模型能不能穩定呼叫工具,可先照27B 本機 Agent 驗收建立小型 fixture;若目標是學一次示範,就要把桌面 App 連到 DemoCUA checkpoint 的 OpenAI-compatible endpoint。

上手前準備:App 只是控制台,模型服務要另外接

截至 2026 年 8 月 19 日,官方 App 指南列出的安裝環境是 Apple Silicon Mac 與 macOS 13 以上,並要求開啟 Screen Recording、Accessibility 權限。官方也把 App 定義成 OpenAI-compatible client,而不是內建推論引擎:它可以連託管、自架或裝置端模型,但模型與算力要由你準備。Windows 客戶端在官方 README 標示為開發中;這是 App 發布狀態,不代表論文裡的 Windows benchmark 被取消。

UI-Mate 官方桌面 App 的 Model Configuration 畫面,Agent type 已選 UI-Mate,並顯示 Kimi 選項與 Max steps 欄位
先選擇 UI-Mate agent;再在同一設定區填入 endpoint、API Key 與服務端實際暴露的 model name。

1. 啟動 DemoCUA 端點,再核對 model name

痛點:App 填對網址,仍可能因服務端名稱不同而拿到空回應。解法:按官方 README 啟動 UI-Mate-democua-27B,再查 /v1/models。以下是官方的 vLLM 範例;/path/to/... 必須換成你的模型路徑,tensor parallel 數量則要符合自己的 GPU 拓樸。

vllm serve /path/to/UI-Mate-democua-27B \
  --trust-remote-code \
  --served-model-name UI_Mate \
  --port 8000 \
  --tensor-parallel-size 2 \
  --gpu-memory-utilization 0.85 \
  --mm-encoder-tp-mode data \
  --chat-template-content-format openai \
  --limit-mm-per-prompt '{"image":6,"video":0}'

curl -s http://127.0.0.1:8000/v1/models

在 App 選 UI-Mate agent,Base URL 填 http://127.0.0.1:8000/v1,model name 要與查詢結果一致,再按 Test Connection。看到連線成功只代表端點可回應;下一步仍要用一張無敏感資訊的測試畫面確認它能產生有效動作。

2. 錄一次成功流程,不要先錄真實客戶資料

痛點:示範若夾帶姓名、地址、token 或通知內容,後續每次套用都可能把敏感畫面送進模型上下文。解法:先做一份合成試算表和空白簡報,在 Demo Library → Record Demo 開始錄製;完成後按 ⌘⇧S 停止,再選 Process to Reusable。驗收時只需要知道「同一流程是否能轉移」,不需要真實資料。

UI-Mate 官方 Demo Library 畫面,可按 Record Demo 錄製一次成功的桌面操作
Demo Library 讓你錄製一次成功操作,並保留成可再次套用的 workflow。

3. 編輯 trace:留下意圖,刪掉偶發雜訊

痛點:錄製時切錯視窗又切回來,Agent 可能把這段繞路也學成流程。解法:在 Recording Detail 逐步看 before/after 畫面、動作、caption 與狀態;刪除誤點、重排步驟,並把 caption 改成可跨資料重用的意圖,例如「選出待處理列」而非「點第 7 列」。可觀察的成果是:每個子任務都有明確完成條件,且任何一步都不依賴某個固定座標。

UI-Mate 官方 Recording Detail 畫面,顯示示範步驟、動作前後截圖、caption 與編輯控制
逐步清掉誤點與偶發彈窗,讓 caption 描述操作意圖,而不是硬編碼某個位置。

4. 套用示範,但把提交權留給人

痛點:Agent 可能已完成 90%,最後卻存錯檔名或按到寄送。解法:Apply/demo 附上 workflow,輸入目標指令後啟動;把「儲存、覆寫、提交、寄送」設成人工確認點,利用 App 的 pause、resume 與 user interjection 修正。驗收標準不是聊天室顯示 finished,而是回到檔案系統或目標 App 檢查真正產物。

UI-Mate 教學核心:怎麼做 zero-shot vs one-demo A/B 驗收?

最容易自我欺騙的做法,是 zero-shot 用難資料、one-demo 用簡單資料,然後宣稱示範有效。比較時只改一個變因:是否附上 demo。任務文字、起始檔案、視窗狀態、步數上限、模型 checkpoint、抽樣設定與完成檢查都要相同。這和AI Evals的核心一樣:先寫 verifier,再按 Run。

  1. 先做兩套沙盒 fixture。建立 A、B 兩份欄位相同、內容不同的試算表與簡報;在 A 上錄示範,在 B 上正式比較。這是在測 related-but-nonidentical 的流程轉移,難度高於重跑同一份檔案。
  2. 把成功寫成機器外可檢查條件。例如 B 的待處理列全數出現在第 2 張投影片、標題正確、來源檔未改、輸出檔名正確,而且沒有碰到其他視窗。
  3. 跑 zero-shot。重置 B 的檔案與視窗,只給同一段 instruction;記錄 strict success、完成檢查數、總耗時、錯步、人工介入與最後產物。
  4. 跑 one-demo。再次重置完全相同的 B,使用同一 checkpoint 與設定,只多附 A 的 demo;套用前先確認 trace 沒有 A 的敏感值或固定座標。
  5. 交換順序並重複。若資源允許,交替先跑哪一組,至少不要永遠先跑 zero-shot;每次都從乾淨副本開始,避免上一輪留下的檔案或快取幫到下一輪。
UI-Mate zero-shot 與 one-demo A/B 驗收卡,列出固定變因、成功指標與作者 self-demo 子集結果
上半部是你可重跑的 A/B 規格;下半部是作者在 same-task self-demo 子集的報告,不能外推成跨任務必勝。

官方最完整的量化比較來自 33 個 same-task self-demo 配對:同一個 DemoCUA checkpoint、相同目標、環境、budget 與 verifier,只切換有無示範。設計圖列出作者報告的 strict success 與 progress;這是「同任務成功軌跡能否提供指引」的證據。對 45 個 related-but-nonidentical variant-demo 任務,論文描述的是集合與小型探索,未提供同等完整的整體結果,因此不能把 self-demo 的提升直接套到你的 Excel→PowerPoint、CAD 或其他工作流。

結果怎麼讀:成功率之外,還要看三種代價

  • 錯步代價:多開一個 App、改錯儲存格、貼錯投影片都要記。只要最後人工救回來,strict success 仍應判失敗,另記 progress。
  • 人工代價:每次 pause、重新提示與替它點擊都算 intervention。若 one-demo 少走彎路卻需要更多救援,不能只用時間宣布勝出。
  • 示範維護代價:App 版面或流程變動後,舊 trace 可能誤導。要把 demo 視為可版本化的測試工件,而不是永久知識。

作者報告也顯示 demonstration 並非每題都變好;論文的部分 OSWorld 與 GameDev 任務出現下降。最合理的解讀不是「demo 無效」,而是「流程建議和現場衝突時,額外上下文也可能把 Agent 帶偏」。這就是為什麼你要保留 zero-shot baseline,以及完整 session trace。想進一步把 trace 變成可靠的工程證據,可接著讀Agent Harness 實作Context Compaction 驗收

選 one-demo、zero-shot,還是傳統自動化?

  • 選 zero-shot:任務短、只做一次、畫面線索清楚,錄製與維護 demo 的成本高於可能省下的探索。
  • 選 one-demo:同類流程會重複、跨 App、有多個不可從單一畫面推知的中間步驟,而且你能提供乾淨的成功示範。
  • 選 API/RPA:系統有穩定介面、欄位與規則,且結果必須高度可稽核。GUI Agent 的價值在於適應介面,不是取代所有確定性整合。

簡單決策樹是:能用可靠 API 完成嗎?能就先用 API;否則問任務是否會重複且需要跨畫面推理?不會就試 zero-shot;會則錄一份去識別化 demo,再用上面的 A/B fixture 決定是否值得維護。別用模型排行榜替代自己的驗收;不同 benchmark、版本與環境不可直接互比,這也是AI 模型排行榜教學最重要的閱讀方法。

六個常見坑:真正危險的往往是最後一步

  1. 把 27B 看成 2.7B:會嚴重低估部署規模;先在 Hugging Face model card 核對 checkpoint 名稱與檔案。
  2. 把 demo 當座標巨集:caption 寫「點右上角」會綁死版面;改寫成「開啟匯出選單」,並讓完成條件可觀察。
  3. 錄到敏感畫面:先關通知、登出無關帳號,使用合成資料;錄完逐幀檢查 before/after screenshot。
  4. 只看 Agent 自稱完成:回到目的檔案驗證名稱、頁數、內容與來源檔狀態;對外送出前暫停。
  5. 沒有乾淨重置:上一輪建立的檔案會讓下一輪看似更快;每次從同一快照或複製品開始。
  6. 拿官方聚合分數保證自己的 App:OSWorkerBench 是作者提出並評估的 benchmark;你的 OS、模型服務、App 版本與任務都可能不同,必須保留本地 verifier。

官方Safety 章節明確提醒 computer-use agent 可能誤操作、遭遇 prompt injection 或觸發具後果的行為,建議隔離環境、避開高風險已登入工作流、檢查 trajectory、敏感操作由人確認,並驗證真實最終狀態。這不是文章尾端的形式提醒,而是 A/B fixture 的一部分。

FAQ:UI-Mate 一次示範最常被誤會的 8 件事

1. UI-Mate 是 2.7B 小模型嗎?

不是。官方 checkpoint 是 9B、27B 與 DemoCUA 27B;本文 one-demo 路線使用 UI-Mate-democua-27B

2. 看過一次就一定會做嗎?

不一定。示範提供程序線索,但即時畫面仍可能出現不同彈窗、版面與資料;官方報告裡也有示範後分數下降的個別任務。

3. 通用 UI-Mate-27B 也能直接吃 demo 嗎?

不等價。官方把 workflow consumption 與 subtask_complete列為 DemoCUA checkpoint 經 demonstration-augmented 訓練學到的行為。

4. Windows 現在能安裝官方桌面 App 嗎?

截至 2026 年 8 月 19 日,官方 README 把 Windows support 標為 in progress。目前使用指南提供 Apple Silicon Mac 的安裝與權限流程;WindowsAgentArena 分數是 benchmark 證據,不能反推 Windows 客戶端已發布。

5. 下載 App 就含模型嗎?

不含。官方把它定位為 OpenAI-compatible client;你要另外連託管、自架或裝置端模型服務。

6. demo 會重播原本的滑鼠座標嗎?

不會照座標重播。官方實作把 live screenshot 視為權威,demo 供應的是目前子任務、完成條件與關鍵步驟。

7. 官方數字能證明 Excel→PowerPoint 或 CAD 都有效嗎?

不能這樣外推。最完整的 one-demo 聚合數字是 same-task self-demo;跨內容、跨版面或跨軟體的 variant transfer 要用自己的 fixture 驗收。

8. 實際速度可以從展示影片估嗎?

不能只看影片。技術報告在作者裝置上記錄自架 27B 每步約 3–5 秒、優化後約 2–3 秒,App tuned endpoint 的中位數約 3.03 秒;這些是作者環境快照,不是你硬體的承諾。A/B 時應從送出到驗證產物自行計時。

給新手的 5 個重點

  1. one-demo 用的是 UI-Mate-democua-27B,不是 2.7B,也不是通用 27B 的同義詞。
  2. 把示範當「子任務地圖」,不要當固定座標巨集。
  3. 先用合成資料錄製,逐幀刪除敏感資訊與偶發誤點。
  4. A/B 只切換有無 demo,其餘環境、目標、budget 與 verifier 全部固定。
  5. 最後看真實產物,並在覆寫、提交、寄送等動作前保留人工確認。

接著閱讀

左右滑動查看更多推薦

結語:先錄一張好地圖,再用同一把尺驗收

UI-Mate 最值得學的,不是「Agent 看一次就無所不能」,而是把成功操作轉成可檢查、可修改、可附加的程序提示。真正可靠的下一步,是今天就做一組無敏感資料的 A/B fixture:先寫五個完成條件,分別跑 instruction-only 與 one-demo,逐項核對產物、錯步與人工介入。如果示範確實讓同類任務穩定少繞路,再把它納入版本化工作流;如果沒有,就保留 zero-shot 或改走 API/RPA。錄製不是終點,能被同一把尺反覆驗收才是。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多兩封,收到週報精選與關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。