2026 年 8 月 18 日,TrueFoundry 工程部落格作者 Shubham Agarwal 在〈Introducing TrueForge: the open-source agent harness we run in production〉公開 TrueForge Agent Harness,主張把團隊實際使用的 agent runtime 以 MIT 授權釋出。真正值得追問的不是「又多一個 agent 框架」,而是三件事:它到底開源了哪些 production 元件、vendor-neutral 的邊界在哪裡,以及省 30%/75% 的 benchmark 能證明多少。

以下先拆解 runtime,再重算 benchmark,最後把「one command」到 production 之間缺的驗收工作補齊。如果你還不熟悉這一層,可先把 AI Agent Harness 理解成模型外圍的執行與控制系統,而不是另一個模型。
TrueForge Agent Harness 公開了什麼?
The harness is the runtime that bridges that gap.
中文:Harness 就是跨過這道落差的 runtime。
Shubham Agarwal,TrueFoundry
一個語言模型可以推理與產生文字,卻不會自動替你維持 session、反覆呼叫工具、執行程式、在破壞性操作前等待批准,或在長任務中整理 context。這些責任才是 harness。TrueForge 把它分成三個可自架部分:
- Core server:執行 model → tool → result 的 agent loop,處理串流、subagent、context compaction、approval 與 session persistence。
- HTTP API 與 TypeScript SDK:讓產品不用綁死內建介面,也能從程式建立 agent、session 與 turn。
- Chat UI 與 UI SDK:提供可直接使用、換主題或嵌入產品的前端。

公開 repository 的 MIT 授權不只覆蓋一個薄 SDK;server、API、SDK、UI、Docker Compose 與 Helm 資產都在同一套程式碼中。本機模式用單一程序與 SQLite,distributed mode 則為 Postgres、Redis 與多個 replica 設計。這個「把零散 primitive 包成完整產品面」才是 TrueForge 最實在的差異,而不是發明 tool calling 或 compaction。
也要把開源 runtime 與商業控制平面分開:原文提到的細粒度 RBAC、budgets、PII guardrails、credential rotation 與 unified traces,是另一項 TrueFoundry AI Gateway 服務;MIT repository 目前提供的是較基本的 OIDC、admin/user 角色、approval policy 與 session events。這種分層本身很常見,但不能把付費 gateway 的治理能力算成 OSS harness 已內建。
Vendor-neutral 在哪裡成立,哪裡還沒成立?
Model providers, MCP servers, and sandbox are all bring-your-own.
中文:模型供應商、MCP server 與 sandbox 都由使用者自行選擇。
Shubham Agarwal,TrueFoundry
這句話一半很強,一半說得太滿。模型文件列出多家 provider,也可接 OpenAI-compatible endpoint;MCP server 可填自訂遠端 URL。這兩層的可替換性是真的。可是 sandbox 官方文件同時明寫:目前可配置的 hosted provider 只有 Daytona,其他 provider 仍在規劃。0.1.4 changelog 與 source 已加入在支援 macOS/Linux host、runtime probe 成功時啟用的 standalone local process fallback;sandbox/roadmap 文件尚未同步,仍把 local execution 寫成 planned。這個 fallback 不是第二個可替換的遠端 provider adapter。
| 介面 | 目前公開證據 | AlphaLab 判讀 |
|---|---|---|
| 模型 | 多家原生 provider+OpenAI-compatible endpoint | 設定可攜性高;換模型後仍要重跑品質與工具 eval |
| MCP | 可自訂 remote server,agent 可選擇 connector | 協定層可攜性成立,權限與 tool annotation 仍須自行治理 |
| Sandbox | Hosted 配置目前只有 Daytona;standalone 另有本機 process fallback | 尚不能稱 hosted provider-neutral |
| Runtime 與狀態 | 可自架 SQLite/Postgres,但 API、event 與 session schema 為 TrueForge 自有 | 比閉源服務更可控,不等於零遷移成本 |
TrueForge 更具體的設計差異,是把 sandbox 當成按需工具:agent loop 與 model/MCP credentials 留在 server,只有 code、file 與 shell 工作進 sandbox;一般問答或直接 MCP call 不必啟動 sandbox,conversation state 也不隨 sandbox crash 一起消失。這能降低閒置隔離環境的成本,但 Daytona 遠端環境與 local host-process fallback 是兩種不同 isolation model,必須分開做資料流與安全驗收。

Provider endpoint 的切換在設定層確實較容易,但不保證行為等價。不同模型對 structured output、multimodal、tool schema、重試與長 context 的支援不同。真正的可攜性測試不是設定頁能不能選另一個名稱,而是同一批 production 任務換模後,正確率、tool side effect 與失敗模式是否仍在門檻內。
30% 與 75%:benchmark 真正量到什麼?
TrueForge was 30% cheaper.
中文:TrueForge 便宜了 30%。
Shubham Agarwal,TrueFoundry
TrueFoundry 公開了可改裝重跑的 benchmark kit。公開 runner 的設計意圖,是讓三個 harness 使用 Enterprise-Bench 的 14 個 L1–L2 跨系統任務、共用同一份 benchmark system prompt 與 MCP 介面、每個 task 開新 session,再由看不到 harness 標籤的單一 LLM judge 評分。它不是已發布結果的完整證據包;官方五組摘要表自報的數字如下:
| 設定 | 自報試驗數 n | 自報平均解出/14 | 每 task-cell 模型 token 成本 | 報告顯示 tokens/run* |
|---|---|---|---|---|
| Claude Managed Agents・Opus 4.8 | 3 | 10.7 | US$11.8 | 10.0M |
| TrueForge・Opus 4.8 | 3 | 10.7 | US$8.6 | 3.7M |
| TrueForge・GLM-5.2 | 3 | 11.7 | US$3.0 | 3.8M |
| deepagents・Opus 4.8 | 3 | 10.0 | US$21.2 | 16.5M |
| deepagents・GLM-5.2 | 3 | 12.0 | US$9.1 | 11.9M |
只做表內算術,repository 的同模型 US$8.6 對 US$11.8 是低約 27.1%,作者概稱近 30%;GLM-5.2 的 US$3.0 對 US$11.8 則低約 74.6%。能安全保留的結論只有:TrueFoundry 自報的每題 n=3、每組 42 個 task-cells 摘要中,TrueForge+Opus 與 CMA+Opus 的 aggregate 都是 10.7/14;依公開公式與費率假設、但未公開的 raw token 分項換算,前者模型 token 成本約低 27%。這不是 AlphaLab 重現,也還不是可獨立稽核的品質等價或成本證明。
七個限制,會改變你怎麼讀這張表
- 可重跑骨架,不是結果證據包。官方文件公開 aggregate 與 per-task pass counts,因此讀者可以重加 Solved/14;但 repository 排除 results、實際 dataset/MCP config/環境、answers、judge reasoning 與 raw token 分項,無法驗證每次 PASS,也無法獨立重算成本與 token 欄。
- 它比較的是三套完整系統,不是單一變因。TrueForge 組明確開啟 500 iterations、dynamic subagents、sandbox、60k compaction 與 large-response offload;CMA 與 deepagents 使用各自 defaults。題目與工具介面相同,不代表 harness 內部 setup identical。
- 樣本不適合證明品質等價。TrueFoundry 自報每題三次,沒有公開隨機化、信賴區間或 non-inferiority test;DevRev 公開方法則要求每題 10 次獨立 trial,以觀察可靠度。
- Judge 只對 harness 標籤盲測,不代表與 canonical Harbor 同口徑。TrueForge 的自訂 judge把整份 criteria YAML(含帶有部分預期值的 weighted criteria)包在
REQUIRED CRITERIA下,答案超過 60,000 字元還會截斷;judge model 由環境決定,公開範例預設 Opus 4.8,但實跑值未公開。DevRev canonical 方法則明定只有 required criteria 決定 PASS,weighted criteria 只做診斷。沒有 raw answer 與 judge reasoning,兩套分數不能直接視為同口徑。 - Token 欄不是 apples-to-apples。聚合器知道 TrueForge 的 input 含 cache subset、CMA 的 input 不含,成本公式有分流;顯示 token 時卻都只加 input+output,所以 10.0M 對 3.7M 不能支持「只用約 40% tokens」。
- 原文的「每個正確答案成本」有 14 倍單位錯誤。聚合器的 US$/run 是每個 task-cell 平均成本,Solved/14 才是 14 題 trial 的通過數。正確公式應是成本除以通過率,而不是成本除以通過題數;依 README 數字,CMA 約為 US$15.44、TrueForge+Opus 約 US$11.25,而不是原文的 US$1.10/US$0.80。
- 模型 token 成本也不是 TCO。Runner 最多重試三次,卻只保存最後成功 attempt 的 metrics;timeout/crash 前已發生的費用可能不進 aggregate。GLM-5.2 的實際 provider 與帳單未公開;repository 只公開一組費率假設,所以 US$3.0 是依假設換算的模型帳單,不是所有 provider 都可取得的報價。Anthropic 官方定價另列 CMA 每個 running session-hour US$0.08;TrueForge 端則還有 sandbox、資料庫、Redis、observability、維運與 on-call。
這不是說測試沒有價值。它提出了一個值得獨立驗證的工程假說:精簡初始 payload、減少 tool round-trip、compaction 與大型 response offload,可能降低 agent loop 的模型帳單。但公開資料沒有 ablation,還無法把各機制與節省幅度做因果對應。最有說服力的後續不是再畫一張摘要圖,而是發布完整 run manifest、raw rows、answer/judge artifacts、失敗重試與可由第三方驗證的 Harbor job。
從 one command 到 production,中間還有四道門
npx @truefoundry/trueforge 的價值是縮短試跑時間,不是替 production 驗收蓋章。官方驗證文件指出,standalone/local 模式會忽略 OIDC,只適合 localhost;hosted Helm 也預設關閉 OIDC,未啟用前任何可連線者都是 shared admin。Chart 安全警告要求啟用 OIDC、以 Secret 取代已知 Postgres 密碼,並把 bundled、無 authentication 的 Redis 限在 ClusterIP+NetworkPolicy,或改用外部 passworded Redis。TLS、resource limits、PDB 與 production-grade data stores 也仍是部署團隊的責任。
Approval 同樣不能只看功能名稱。TrueForge 確實能在 tool call 前暫停、保存決定並繼續執行;預設 @write/@destructive selector 卻依賴 MCP tool annotations。截至 2026 年 8 月 21 日,官方 issue #318仍記錄一個 Code Mode 對完全沒有 annotations 的 tool 可能 fail-open 的 edge case,對應修正 PR #373尚未合併。高風險或未標註工具應改用 literal selector 或 @all,並拆開 connector/agent、縮限底層 credential;不能只依賴預設標籤。
團隊仍要自行完成以下四關:
- 品質門:用自己最常見、最昂貴、最危險的 20–50 個任務建立 eval;模型、prompt、MCP 或 harness 升級都重跑。
- 權限門:逐個核對 MCP tool 的 read/write/destructive annotation、approval policy、secret scope,以及哪些 tool result 會進入遠端或本機 sandbox。
- 可靠度門:實測 session 重連、pod/DB/Redis 故障、長 turn recovery、重試後 side effect 是否 idempotent,並演練 backup、restore 與 rollback。
- 成本門:同時計入 tokens、session runtime、sandbox、儲存、網路、監控與人力;再用每個「正確完成的任務」而非單次 API 帳單比較。
截至 2026 年 8 月 21 日,@truefoundry/trueforge server package manifest為 0.1.4,公開 GitHub 歷史始於 2026 年 7 月 23 日,官方 roadmap仍把 evaluation pipeline in CI/CD 列為未來項目。它已有 production-oriented 的結構,也有 TrueFoundry 自家 AskTFY 的 first-party dogfooding;這些證據支持供應商自報的早期 self-use,還不是大量外部工作負載驗證過的成熟平台。Security policy 目前也只維護 latest release,production 團隊必須先驗證快速 upgrade 與 rollback。
AlphaLab 的判讀:最值錢的是控制權,不是折扣標籤
我同意原文最核心的方向:當 agent 開始碰企業資料、工具 side effect 與長 session,harness 不再只是可替換膠水。把 loop、state、API 與 UI 留在可審計、可自架的 MIT 程式碼裡,能增加議價能力,也讓團隊自行修補與量測。
我不接受的,是把這一步直接等同於「整套 vendor-neutral」或「production 必然省 30%」。Hosted 可配置的遠端 sandbox provider 目前只有 Daytona;standalone 0.1.4 另有本機 process fallback;runtime protocol 與 state schema 也仍有遷移成本。再加上 benchmark 的 n=3、單一 judge 與 token-only cost,現有證據還撐不起普遍化結論。這些不是挑語病,而是決定 architecture risk 與採購預算的邊界。
這些 primitive 也不是第一次出現。LangGraph 把自己定位為低階 orchestration framework,核心包含 durable execution、persistence 與 human-in-the-loop;Mastra 則提供 TypeScript agents、workflows 與 deployment 工具。TrueForge 當前差異在於把 server、API、chat UI、settings 與 Helm 包成一套可自架產品面,而不是 agent loop 或 persistence 前所未有。選擇點是整合度,對上 framework 的可塑性與團隊既有 ops stack。
| 你的情境 | 現在較合理的動作 |
|---|---|
| 已有多家模型、MCP 與平台工程能力 | 做小規模 pilot;TrueForge Agent Harness 值得列入候選 |
| 需要自架、可查 API/state、可嵌入 UI | 先驗證資料流與升級路徑,再和自組 LangGraph/Mastra 類方案比較 |
| 只想零維運、立刻取得成熟 SLO | 先比較 managed harness;開源授權不會自動消除 operation |
| 希望換模型後不用測試 | 不要上線;provider portability 絕不等於 behavior portability |
GitHub API 在 2026 年 8 月 20 日 22:22 UTC 的快照顯示 2,451 stars、181 forks。這是推出後很快獲得注意的訊號,卻不是 uptime、安全性或 production reliability 的證明。接下來最能提高可信度的,不是更多 stars,而是外部重跑 benchmark、多 sandbox adapter、已落地的 eval CI、版本相容政策,以及能公開失敗與復原數據的客戶案例。
接著閱讀
左右滑動查看更多推薦
最好的下一步不是相信或否定 TrueForge 的折扣數字,而是拿同一批真實任務做一次可反駁的內部測試:固定模型比較 harness,再固定 harness 比較模型,最後把故障與人力算進去。若它仍能維持品質、降低總成本並通過權限與復原演練,TrueForge 才從一個漂亮的開源發布,變成你的 production 選項。





