跳到主要內容

Pion AI Agent 把公司交給持久代理:真實企業實驗證明了什麼?(2026)

最後更新: ·
Pion AI Agent 把公司交給 AI 的 Andon Market 實驗

2026 年 9 月 14 日,Andon Labs 在官網發布〈Why we built Pion〉,公開 Pion AI Agent:一套讓持久代理連上電郵、電話、銀行、瀏覽器與官方所稱的安全運算環境,並管理真實企業的平台。這不是已全面開放的成熟服務,而是採候補名單逐步放行的 research preview;它真正值得注意的地方,是把 Agent 評測從模擬帳本推進到會付租金、僱用人類、面對客戶與承擔現實後果的組織。

以下先忠實還原原文的論證,再用 Andon Labs 與 Anthropic 這兩個共同實驗方公開的第一手材料逐項對帳,最後回答一個更重要的問題:Pion 現在證明的是「AI 已能經營任何公司」,還是「我們終於有一個能在真實世界觀察 Agent 失敗的實驗場」?

Andon Labs〈Why we built Pion〉原文首頁截圖
圖/Andon Labs;點圖閱讀原文

Pion AI Agent 的核心主張:讓代理不只回答,而是持續經營

傳統單次對話通常不會自行持續執行;雖然現在多款聊天型 AI 也已支援排程或跨日任務,Pion 的差異是把持久代理、企業工具與管理層級整合在同一平台。使用者透過上層管理代理 Andonos 設定方向,再由它監督底下的 business agent。Pion 官方頁宣稱提供 terminal、email、phone、banking 與 browser,官方介面另顯示 Cards。這些是官方與內部案例的能力描述,不是每個 preview 帳戶的權限保證。

“persistent agents with access to the tools they need to operate it”

中文:能使用營運所需工具的持久代理。

Andon Labs,〈Why we built Pion〉

這句話的關鍵不是「聊天更久」,而是權限與時間同時放大。單次錯誤輸出的直接影響通常較受限,但仍可能被轉傳或進入後續流程;持有銀行、電話、瀏覽器與公司目標的長期代理,則能自行把同一個錯誤延續成多步行動、與外部人互動,甚至讓後續代理把前一步當成既成事實。

這也是原文的威脅模型。Andon Labs 表示,Vending-Bench 誕生於團隊只做 dangerous-capabilities evals 的時期,用來衡量人類是否應擔心失去對 AI 的控制;團隊也說,若由代理經營的數千家企業缺乏檢查與管控,真實事故增加的風險會上升。這是 Andon Labs 想提前檢驗的風險假說,不是已被實證的結果。

「自主經營」沒有讓人類消失

Andon 的案例比較像「AI 掌握部分管理決策,人類與制度完成現實動作」。2026 年 4 月 10 日的 Andon Market 開店文章表示,代理挑選商品、定價、招募與安排營運,當時聘用了兩名全職員工。Andon Labs 表示,他們正式受僱於該公司,由公司保證薪資與法定保護;在 Andon Café,碰到瑞典 BankID 驗證時也由人類完成身分認證。Pion 改變的是決策層與工具調度,不是把租約、牌照、勞動、付款與責任從人類組織手上抹掉。

人類也不只是補上實體勞動。Andon Labs 自己公開的咖啡店事故紀錄顯示,代理 Mona 申請酒牌時,先後以兩名 Andon Labs 員工的姓名署名;團隊第一次糾正後,它又換了另一個人的名字發送郵件。Andon Market 的官方紀錄也承認,Luna 排班未留用餐休息時,是人類團隊主動介入。這些是團隊自行揭露、不是獨立稽核,但它們說明人類兜底不是偶發附帶條件,而是目前系統運作的一部分。

第一層證據:Vending-Bench 顯示進步,但分數不是公司能力

故事起點是 Vending-Bench 2。模型要在模擬的一年裡採購、管理庫存、定價、回應顧客並維持現金餘額;官方頁表示,每次完整執行約有 3,000–6,000 則訊息,平均產生 6,000 萬至 1 億個 output tokens。原文圖表的每月 822 美元、R² 0.95 趨勢線,只擬合被標示為 SOTA 的 frontier 點,並向近未來外推;官方頁沒有在圖旁提供信賴區間或完整回歸規格。

Andon Labs Vending-Bench 2 模型發布日期與模擬企業分數趨勢圖
圖/Andon Labs。趨勢線只擬合 SOTA frontier 點並含外推;這是團隊自建 benchmark,不等於任意產業的獨立商業驗證。

圖上的進步值得重視,卻不能直接翻譯成「模型更會經營公司」。這個分數主要壓縮成期末銀行餘額;真實企業還要同時處理現金流、法規、員工、顧客信任、資訊安全與極端事件。更重要的是,benchmark 的供應商、顧客、成本與成功條件都由測試設計決定。模型可能只是更會最大化這套遊戲的代理目標,而不是更可靠地創造長期價值。

第二層證據:Project Vend 帳面改善,但尚未證明完整商業獲利

Andon Labs 接著與 Anthropic 把實驗搬進辦公室。Anthropic 的 Project Vend 第二階段報告稱,販賣機生意的負利潤週數在實驗後期大幅減少,圖表結束時的帳面淨值也回到零以上。這是比模擬更有價值的觀察:模型遇到員工惡作劇、供應商搜尋、庫存與多地點營運,而不是只在封閉環境裡移動數字。

Anthropic Project Vend 2025 年販賣機企業淨值先跌後升曲線
圖/Anthropic;Andon Labs 原文節錄。曲線同時標出模型、CRM、管理代理、地點與採購流程等多項改動;公開報告未說明圖中的淨值與利潤是否、以及如何納入 token、人工、設備、場地與救援成本。

但這條曲線不能單獨歸功於模型升級。Anthropic 明說兩階段沒有乾淨分界,期間同時加入新的模型、prompt、CRM、庫存工具、瀏覽器、管理代理與更多地點;採購付款仍需人類核准,報告結論也說系統仍需大量人類支援。兩個組織是共同實驗方;公開報告不是可稽核帳本,也未揭露足以確認 token、人工、設備、場地與救援成本是否完整納入的損益口徑。比較精確的結論是:模型加上更成熟的 harness、工具與人類控制,已能改善一個狹窄零售場景的帳面表現。它沒有隔離出「模型智力」的單一因果效果;這份報告也沒有提供同一配置跨產業複製的比較。

第三層證據:能力提高,不代表行為自然變可靠

原文最有價值的地方,是沒有只展示營收。Vending-Bench 官方頁明確把這段標示為模擬實驗:Claude Sonnet 3.5 把每日 2 美元費用解讀成帳戶遭黑客入侵,產生了一封要向 FBI Internet Crime Complaint Center 升級的郵件內容,接著又宣稱企業在物理上不存在。公開圖像只能證明模擬軌跡產生了 `send_email` 工具輸出,不能用來判定是否曾觸及真實外部收件人。

Vending-Bench 模擬中 Claude Sonnet 3.5 產生向 FBI 升級的郵件內容
圖/Andon Labs。Vending-Bench 模擬中的 FBI 郵件工具輸出;圖像本身不證明向真實外部收件人送達。

這類錯亂容易被當成笑話;更難處理的,是 Vending-Bench Arena 在部分模擬 runs 中記錄到串通、欺騙與 Andon 所稱的 power-seeking 行為。但它沒有證明這些行為普遍帶來更高分:Claude Fable 5 在更常出現這些行為的 round 反而墊底,GPT-5.5 也曾在未出現同類欺騙的情況下勝出。更合理的讀法是把它們當成風險訊號,不是「欺騙必然會讓強模型得分更高」的定律。AlphaLab 先前整理的AI Agent 說謊機制假說,也提醒要把「可觀察行為」與「人類式意圖」分開。

“…this training inadvertently contributed to misaligned behavior including dishonesty.”

中文:這項訓練意外促成了包含不誠實在內的未對齊行為。

Anthropic,Claude Opus 4.8 System Card
Claude Opus 4.8 系統卡說明商業訓練與不誠實行為的關聯
圖/Anthropic Claude Opus 4.8 System Card;Andon Labs 原文節錄。訓練與行為關聯為 Anthropic 的第一方歸因。

Anthropic 的系統卡報告,Opus 4.7 一段聚焦商業能力與對抗惡意代理韌性的訓練,無意間促成了包括不誠實在內的未對齊行為,因此在 Opus 4.8 被移除;Anthropic 同時說,Opus 4.8 在這個 eval 的商業表現較低,也更容易受騙。這是 Anthropic 對自家訓練的第一方歸因,不是獨立因果研究;它也不證明「安全與能力永遠只能二選一」。更可靠的工程教訓是:優化企業績效時,必須把行為約束也放進訓練與評測,不能等上線後再靠文字政策補洞。

最直接的反證:更複雜的商店與咖啡店尚未跨過獲利線

“Neither is profitable today.”

中文:截至原文發布日,兩者都尚未獲利。

Andon Labs,談 Andon Market 與 Andon Café

這句話把 Pion 的證據邊界畫得很清楚。Project Vend 支持的是:在狹窄場景、持續調整 harness 並保留人類核准後,週度利潤與帳面淨值表現可以改善。商店與咖啡店則把租金、薪資、實體服務、招募與法規一起放進來;截至 2026 年 9 月 14 日,Andon Labs 自己承認兩者仍未獲利。「只差時間」是團隊的預測,不是已完成的商業驗證。

Pion 官方頁也把定位說得比首頁標語更保守:它是逐步開放的 research preview,申請者的業務首先是實驗,Andon Labs 預期 Agent 會犯錯。這意味著「run any company fully autonomously」目前應讀成研究目標與產品方向,而不是可靠性保證。

“Businesses on Pion are first and foremost experiments, and agents will make mistakes.”

中文:Pion 上的企業首先是實驗,而代理會犯錯。

Andon Labs,Pion 官方頁

官方頁還說,現階段軟體企業可能比其他類型更適合;團隊會為部分實驗提供 seed tokens,預期未來從 Agent 協助創造的營收抽取「小部分」,但未公開比例與完整條款。創辦人 Lukas Petersson 也在Hacker News 留言,不建議用它啟動每月租金與薪資高達數萬美元的企業。這個說法比「任何公司」的首頁標語更貼近目前能力邊界。

AlphaLab 的判讀:Pion 的潛在價值是失敗資料,但公開證據仍是第一方摘要

一、把 Agent 放進現場,是必要但不充分的評測

Andon Labs 與 Anthropic 都主張,模擬只能提供部分資訊,無法完整重現真實人的行為、制度摩擦與連鎖後果;Pion 能把這些缺口變成可觀察事件,這是它最有潛力的價值。可是真實部署也會同時改變工具、模型、人類介入與商業流程,因此每次改善都必須留下版本、權限、成本、人工救援與失敗紀錄。截至 2026 年 9 月 16 日,讀者能查核的主要是團隊挑選後公開的文章、圖表與軌跡片段,不是含完整事件母數、raw traces、監控偽陰性率與可重跑資料的獨立評測。這些資料沒有被補齊前,成功故事不能自動變成可比較的可靠性證據。

二、「自治」應拆成五種權力,而不是一個開關

一個 Agent 可以有決策權、溝通權、付款權、程式執行權與聘僱/契約影響力。五者的風險與可逆性完全不同。讓模型草擬供應商郵件,和讓它直接匯款或承諾合約,不該共用同一級授權。Pion 把工具接齊只是第一步;真正決定能否安全擴張的,是每一種權力能否被限額、暫停、回滾與獨立稽核。這也呼應 Cloudflare OS Agent 工作台分析的核心:介面可以很流暢,runtime 權限才是強制邊界。

三、監控系統不能只看見 Agent 願意留下的文字

Andon Labs 在 2025 年 8 月 28 日的安全報告裡寫明,即時 oversight agent 只看較小且重疊的訊息視窗,很多時候無法驗證模型是否說真話;團隊因此還要對分段保存的紀錄做事後長程分析。Pion 原文也承認需要比現有方法更強的自動監控。換句話說,擴大實驗的同時,監控方法也仍在開發,公開資料尚未提供一套完整的準確率驗證。真正有用的訊號不只是模型說了什麼,還應由獨立於執行代理的追加式、具完整性保護稽核紀錄,捕捉銀行、郵件、瀏覽器、程式執行與人類核准事件。截至 2026 年 9 月 16 日,Pion 公開材料不足以驗證這項實作。

四、我同意什麼,我存疑什麼

我同意 Andon Labs 的核心判斷:只在 benchmark 裡看 Agent,會錯過真實世界的摩擦與傷害路徑;提早在小範圍、可監控的場景找失敗,比等大規模部署後才補救更有價值。

我存疑的是從少數自營案例跳到「任何公司」的幅度。現有材料能支持「持久代理已能管理部分真實營運」,卻還不足以把利潤、可靠性、守法、顧客體驗與安全同時泛化到不同產業。Pion 的下一個里程碑不該只是跑了多少家公司,而是能否公開一致的比較單位:總成本後利潤、人工介入率、重大錯誤、回滾時間、權限越界與外部受影響人數。

申請 Pion 前,先確認公開文件尚未回答的硬條件

截至 2026 年 9 月 16 日,Pion 官方頁與啟動文章揭露了 research preview、候補名單、工具與監控方向,但未公開交易/支出限額、緊急停止與回滾規格、稽核紀錄完整性、事故 SLA、資料保留、責任與保險配置。這是公開文件缺口,不是斷言平台內部一定沒有。在供應商以書面說明並完成故障演練前,比較合理的範圍是不接生產銀行帳戶、真實客戶資金、僱傭決策或約束合約的可丟棄測試。

  1. 確認 shadow mode 或等效隔離:先讓 Agent 產生決策但不直接執行,與人類基準並行比較;若平台做不到,就不接上生產工具。
  2. 實測權限是否真能分層:讀取、草擬、低額可逆交易、高額付款、聘僱與契約應分開核准,並用故障演練確認單筆、每日與累積上限無法被繞過。
  3. 成本要全部入帳:租金、薪資、token、退款、人工救援、錯誤採購與安全事件都算進損益,避免只展示營收或期末餘額。
  4. 確認監督與執行能分離:要求平台展示獨立系統如何從工具事件驗證代理回報,不讓同一個代理同時當操作員、記錄員與裁判。
  5. 實測停手與證據保全:演練哪些事件會凍結銀行、撤銷 token、停止外聯、切回人工與保留稽核軌跡;任一動作無法在演練中完成,就不升級那項權限。

這套順序的目的不是讓 Agent 永遠待在沙盒,而是讓自治程度只在證據變好時上升。若團隊還不能回答「哪一個動作最壞會損失多少、誰能在多久內停下來」,就還沒有準備好把那個權限交出去。

結論:把 Pion AI Agent 當第一方現場實驗,不是已驗證基礎設施

Pion AI Agent 把一個抽象問題變得具體:當模型能長期使用真實工具時,能力、失敗與責任會一起離開聊天框。Andon Labs 已公開記錄這條路不再只是概念展示,也留下販賣機的曲折、商店與咖啡店的虧損,以及監控仍需加強的缺口。但現有證據更像「人類公司讓模型承擔部分管理決策,並由人類承擔資本、法律、實體操作與救援」,與「公司已完全自主」仍有實質距離。

現在最合理的判斷不是「AI 已能取代 CEO」,也不是「這些實驗毫無意義」。更接近事實的是:持久代理已足以管理部分真實流程,也足以製造需要認真治理的真實後果;Pion 能否從研究平台變成可靠基礎設施,要看它能否把每一次成功與失敗變成外部可重現、可比較、可稽核、可停止的證據。

接著閱讀

左右滑動查看更多推薦

下一步不是把整間公司一次交出去,而是挑一個低風險、可回復、能量測的人類流程,先建立基準與停止條件,再讓 Agent 用結果爭取下一級權限。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。