跳到主要內容

Holo4 開放權重 Agent:61.7% 跑分背後,模型與 Harness 各做了什麼?(2026)

最後更新: ·
Holo4 開放權重 Agent:H Company 官方封面與跨介面代理主題

2026 年 9 月 28 日,H Company 在官網發布了〈Holo4: powering generalist computer-use agents〉,介紹 Holo4 開放權重 Agent:27B 密集模型與 35B-A3B 混合專家模型,目標是讓同一個代理在螢幕、程式碼、MCP 與 API 之間切換。原文最醒目的數字是 27B 在 OSWorld 2.0 得到 61.7%;要理解它,還得看同列的完整成功率 41.5%、執行工具,以及測試由誰完成。

Holo4 開放權重 Agent 原始發布文章頁首截圖
點圖閱讀 H Company 原始發布文章。圖/H Company 官網截圖

這篇先還原 H Company 做了什麼與如何測量,再拆開模型、Harness 和評分指標,最後看開放權重究竟替使用者打開了哪些選擇。

Holo4 開放權重 Agent 的核心主張:一個模型,多種介面

It uses whichever fits the task.

中文:它會依任務選擇合適的操作介面。

H Company,〈Holo4: powering generalist computer-use agents〉

原文把電腦操作看成連續任務:能用 API 直接取資料時就呼叫 API;遇到沒有 API 的舊系統,就看畫面、點擊和輸入;需要加工資料時改用程式碼。H Company 說,Holo4 也可在桌面、網頁、Android、程式碼沙盒和商業 API 工作,而呼叫的是同一個模型。這是產品設計主張;讀者仍需在自己的應用裡檢查工具權限與執行環境。

It is the same model in each case and it is called the same way.

中文:每個場景用的是同一個模型,呼叫方式也相同。

H Company,〈Holo4: powering generalist computer-use agents〉

這比「會點滑鼠」更具體:一段工作流程可以跨越畫面與結構化工具。它也把問題從單次回答是否漂亮,轉到數百步之後是否保住目標、狀態與限制。

61.7% 是什麼:部分得分、完整成功率與成本要分開

Holo4 原文 benchmark 表格,顯示 OSWorld 2.0 得分與完整成功率
H Company 原文的比較表;61.7% 是 OSWorld 2.0 部分得分,下一行的 41.5% 才是完整成功率。圖/H Company 官網截圖

H Company 的原始表格列出:Holo4 27B 在 OSWorld 2.0 的平均部分得分為 61.7%,完整成功率 41.5%,按 H Models API 牌價估算每題 1.22 美元;35B-A3B 分別是 30.9%、12.3% 與 0.61 美元。前兩個百分比回答不同問題:部分得分容許完成一部分,完整成功率要求把整個工作做完。只拿 61.7% 說成「六成任務成功」,會高估結果。

OSWorld 2.0 原始論文定義的是 108 個長流程電腦任務。H Company 的註腳則說,OSWorld 2.0 成績只跑一次;表中其他公司結果來自不同 Harness、努力程度,GPT-6 Astra 還使用 82 題離線子集。這張表能指出 Holo4 自家測試的表現,不能當作所有模型在同一設定下的排名。原文另列 OSWorld 85.2%,那是另一個基準,不能和 OSWorld 2.0 的 61.7% 互換。

真正變動的不只是模型:Harness 也在推高分數

H Company 說,它先用約 127B token 監督式微調,再訓練分別偏重桌面/網頁與終端機/MCP/API 的兩組 LoRA 專家,最後合併成一個模型。這段訓練細節目前是團隊自行披露。

原文的另一條曲線更值得看:團隊重建了代理執行迴圈,讓 shell 跑在桌面機器上、改善長任務記憶、修正視覺服務錯誤,並把步數與時限逐步放寬。這些變動可能讓同一個模型拿到不同分數。H Company 提供的曲線展示其開發過程,卻沒有單獨隔離每項變動的因果效果;因此 61.7% 是「模型+Harness+測試設定」的系統結果。

公司還說 Agentic Task Factory 已建立約一萬個任務,先從文件、網站截圖或軟體建環境與驗證器,再由代理實際執行。它描述的重點是「用可檢查的狀態變化評分」,不是讓另一個語言模型看文字後憑印象打分。這套內部任務的規模與品質仍以團隊披露為準。

開放權重與可檢查軌跡,給了什麼、沒有給什麼?

27B 模型卡及 35B-A3B 模型卡列出可取得的權重。兩者的權限不同:27B 標示 CC BY-NC 4.0,35B-A3B 標示 Apache 2.0。若要在商業產品部署,不能只看「open weight」三個字,還得對照所選權重的授權。模型卡的存在能確認發布與授權標示,不能替代理完成率背書。

H Company 也公開 benchmark 任務軌跡資料集與重播入口。軌跡讓外界追問代理在失敗前點了什麼、執行了哪些工具,證據強度高於只看一張跑分表;但公開紀錄仍需有人檢查題目版本、評分器與漏掉的錯誤。本文沒有把這些軌跡重新跑成 AlphaLab 的獨立成績。

AlphaLab 的判讀:為什麼這次發布值得看,也要留住疑問

介面切換減少工作流的斷點

企業系統常同時有 API、舊式桌面程式和只能點擊的後台。若一個代理能在相同狀態下選擇較可靠的路徑,任務就少了一次「換代理、重講上下文」的交接。Holo4 的設計方向貼近這種混合環境。真正的門檻仍在於切換後能否記住限制、取得正確授權並驗收結果。

61.7% 有訊號,但 41.5% 更接近交付問題

部分得分能告訴研究者模型是否朝正確方向前進;若工作是把一份報表完整匯出並寄到指定位置,使用者關心的是整件事是否完成。H Company 自己在同一列給出 41.5% 完整成功率,這比單一大數字更能約束「已能代人工作」的想像。

成本優勢要連同失敗後的人力一起算

表格的每題美元數是依指定 API 牌價與測試 token 量計算,不含你為重試、查錯、審核或補救失敗支付的工時。若便宜一次卻需多次重做,總成本可能逆轉;若你的任務容易自動驗收,低單次成本才更有機會轉為可用優勢。

我同意什麼,仍存疑什麼

我同意 H Company 把「跨介面執行」與可重播軌跡放到檯面,這比只公布排行榜名次更接近真實代理工程。我仍存疑:單次 OSWorld 2.0 自測、跨 Harness 對照,以及內部任務集,尚不足以推論其他團隊部署後也能得到相近的完整成功率。這些疑問可以由相同題目、相同權限、相同預算的外部複測來縮小。

讀者下一步:用三種任務驗收,而非只比較排行榜

  • 挑一件純 GUI 工作、一件 API 可直達的工作、一件需要跨兩種介面的工作;事先寫下完成狀態與不許碰的資料。
  • 固定任務、步數、時限與成本上限,記錄完整成功率、錯誤寫入、人工接手時間;再看每一步軌跡是否能解釋失敗。
  • 研究或個人非商用實驗可先讀 27B 模型卡;商用評估先看 35B-A3B 的授權與自身任務表現,別把兩種權重當成同一種許可。

若你的問題已從「模型會做什麼」走到「多個本機模型如何派工」,可接著讀 三台本機 AI 的 Gateway 與 Agent 派工教學;若你最怕的是工具回報成功、外部狀態卻沒變,MCP 逾時結果驗證給了可操作的收據設計。

接著閱讀

左右滑動查看更多推薦

先用一件可回放、可檢查結果的小任務對照 Holo4 與現有流程;若完整成功率和人工補救時間都有改善,再擴大到更長的工作。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。