跳到主要內容

OpenAI 自動化 AI 研究實習生:3.1 Agent 工作日等於研究加速?(2026)

最後更新: ·
OpenAI 研究組織的 Agent 工作日曲線,搭配 AI 實習生上工了標題

OpenAI 在 2026 年 9 月 6 日發布〈Research acceleration: The view inside OpenAI〉,宣布依照自家量測,已達成「OpenAI 自動化 AI 研究實習生」里程碑:Agent 能在人類指導下執行定義清楚的研究任務,其中包括內部分類器估計由熟練研究員處理可能要花數天的工作。

這個說法值得認真看待,卻不能直接翻成「AI 已經等於研究員」。OpenAI 最吸睛的數字,是截至 8 月中,每一個研究組織員工的名義工作日,內部累計約 3.1 個八小時的 Agent 活躍執行時間;它量的是符合條件 Agent 的估計活躍 runtime 總和,並行 thread 會分別累加,不是 3.1 倍產出、更不是 3.1 倍科學突破。

OpenAI Research acceleration 原文頁面,顯示 2026 年 9 月 6 日日期、文章標題與導言
OpenAI〈Research acceleration: The view inside OpenAI〉原文。點擊圖片可在新分頁閱讀。

接下來我會分三步拆解:先忠實還原 OpenAI 到底宣稱了什麼,再把 3.1、124 倍 output-token 相對指數、實驗增速與任務成功率放回方法脈絡,最後用 METR 與開放式 AI 研究評測檢驗它。這批內外部證據支持 Agent 在多種 bounded 任務上進步;更難的問題是,這些底層活動已有多少轉化成品質調整後的研究進展

OpenAI 自動化 AI 研究實習生,到底「到職」了什麼?

先把 OpenAI 的原話放在這裡:

“According to our measurements, we have now reached the goal, announced last fall, of having an automated research intern by September of this year.”

中文:「依照我們的量測,我們已達成去年秋天宣布的目標:截至今年 9 月擁有一名自動化研究實習生。」

OpenAI, Research acceleration: The view inside OpenAI

關鍵不在「自動化」三個字,而在後面的定義:任務要定義清楚、方向由人類給定。這個里程碑沒有主張系統擁有哪個研究問題最重要,或結果是否值得擴大訓練、暫停及部署的最終決策權。OpenAI 本文也明說,人類仍負責研究優先順序、判讀構想與結果,以及最後的擴大、暫停和部署決策。

因此,比較準確的心智模型不是「無人 AI 科學家」,而是一名速度很快、可以平行派工、但需要題目、驗收標準與主管回饋的研究實習生。OpenAI 把下一個目標訂在 2028 年 3 月的「自動化 AI 研究員」;這份公開報告只揭露日期與「在人類監督下推進 deep learning 和 alignment」的方向,沒有公開自主時長、成功率、提出新問題或獨立重現等可稽核通過門檻。所以那是內部目標,不是已被驗證的預測。

3.1 個 Agent 工作日,不是 3.1 倍研究生產力

OpenAI 圖表顯示研究組織的 Agent 工作日相對名義研究組織員工工作日,自 2026 年 5 月約 0.5 倍升至 8 月中的 3.14 倍
圖/OpenAI。藍線是符合條件的 Agent 活躍執行時間總和除以八小時,再與每位研究組織員工每日名目八小時相比;8 月 15 日的 28 日落後平均為 3.14155。

這張圖的計算方式,比「Agent 做了多少人的工作」窄得多:

  • 把所有符合條件的 Agent turn 估計活躍時間加總,八小時算一個 Agent 工作日;
  • 人類端不是工時紀錄,而是研究組織每位員工每天固定算八小時;
  • 同時跑四個 Agent 一小時,會累計四個 Agent 小時;subagent 與自動 review thread 也各自計入;
  • OpenAI 另套用多種未完全展開的 inactive-turn heuristic;方法中明列的一條,是同一個 turn 兩次 server event 相隔超過 30 分鐘時不計中間時段。這個指標不會再依任務結果或人工複核成本做品質調整;
  • 圖表使用 28 日落後平均;這張 3.1 圖的序列終點是 8 月 15 日,不是 9 月 6 日當天的即時讀數。

換句話說,3.1 證明的是 OpenAI 已把很可觀的機器執行時間灌進研究流程,而且平行化程度高;它沒有告訴我們這些時間中,有多少變成可採用的程式、有效的實驗或新模型能力。把 runtime、估計的人類反事實工時、實際日曆時間與品質調整後的進展混在一起,是這則消息最容易犯的單位錯誤。

四個快速成長的數字,分別少了哪個分母?

OpenAI 內部指標它實際量到什麼它不能單獨證明什麼
124 倍截至 8 月 16 日,研究部門 active regular employees(含零使用者)的每日 output-token 中位數,換算為 28 日等值後,相對 2025 年 11 月 1 日基準;包含隱藏推理、程式與工具呼叫研究價值、正確率或生產力
7.02 倍OpenAI 全公司非自動 commit 的 added + deleted LoC(單次 commit 截尾至 p99),除以過去 12 個月有 commit 的 contributor identities 後取每日值與季度平均;2026 年第三季暫定資料截至 8 月 15 日,倍數相對 2025 年前平均程式品質、維護成本或因果提速
約 1.6 倍截至 8 月 10 日當週,每位活躍實驗者的四週移動平均條件實驗強度,相對 2025 年基準實驗是否有資訊價值;同期算力也顯著增加
3.1 個工作日所有符合條件 Agent 的估計活躍時間總和3.1 倍人力、產出或科學進展

這些數字不是沒有意義。研究本來就包含大量寫程式、找 bug、啟動與監看實驗、整理結果等「苦工」;當苦工變便宜,研究迴圈確實可能更快。但它們都位在同一條證據階梯的下半部:

token/runtime/程式行數/實驗次數 → 可驗收的任務成功 → 品質調整後的研究產出 → 後繼模型能力增益。

OpenAI 這次很完整地公開了前兩層的一部分,卻還沒有把它們連到最後兩層。這也是原文自己保留得最誠實的地方:AI 研究有許多瓶頸,整體研究速度「很可能不會」跟這些局部指標同步上升。

OpenAI 圖表顯示每位活躍實驗者的實驗強度從 2026 年初約 0.7 倍升至 8 月約 1.6 倍
圖/OpenAI。實驗強度與 Codex 採用率同時上升,但圖表沒有控制算力成長、實驗者組成改變或實驗品質,因此只能讀成相關性。

最重要的圖,其實是「人類介入」

OpenAI 用 GPT-5.6 Sol 分類器,抽樣 2026 年 1 月 1 日到 7 月 31 日約 2% 的研究部門互動式 coding 對話,再讀取前後 session、Slack、文件與 PR,事後判斷任務有沒有成功、需要幾次人類修正。任務長度也不是實際工時,而是另一次 GPT-5.6 Sol 分類估算「人類不用 AI 會花多久」。

這套方法比只問 Agent「你做完了嗎」進步很多,因為它會追蹤後續證據;但人工標註驗證集只有 25 個任務,成功率主圖還排除了找不到可靠結果的 Uncertain 案例,以及 session 或使用者少於 50 的資料點。它適合看內部趨勢,不適合當成外部已重現的能力基準。

OpenAI 堆疊柱狀圖比較不同估計人類工時分桶的任務結果,以及成功案例是否需要人工介入
圖/OpenAI。以 1 至 7 月排除 Uncertain、使用者等權重的彙總資料計算,估計需人類 4–8 小時的任務約 88% 最終被分類為成功;但成功案例中約 50.8% 至少需要一次人工介入。這不等於一半任務失敗。

這張圖把「研究實習生」的邊界畫得最清楚。在排除 Uncertain、並讓每位使用者等權重的彙總樣本裡,4–8 小時任務的零介入成功約占 43.45%,介入後成功約占 44.89%;也就是最終成功案例裡,剛超過一半需要人類至少修正一次。介入占成功案例的比重一路升到 32–64 小時分桶的約 82.5%,在最長的 64–128 小時分桶回落到約 76.5%,因此整體趨勢上升、但不是每一格都單調。

所以 OpenAI 自動化 AI 研究實習生目前最合理的價值主張是「受監督的研究倍增器」:能吃下大量明確工作、快速試錯並平行搜尋,但人類仍在 critical path 上負責定義、糾偏、驗證和取捨。當 coding 變便宜,瓶頸不會自動消失,往往會移到研究品味、評估器可信度、算力、review、整合與安全。

外部證據:Agent 會跑研究流程,還不等於會做開放式研究

支持 OpenAI 的部分:可驗證、範圍清楚的迴圈進步很快

METR 的 Time Horizon 1.1 儀表板(截至 2026 年 5 月 8 日)提供了獨立的方向性證據:在以軟體工程、機器學習與資安為主、任務自包含且可自動評分的題組裡,公開前沿 Agent 能以固定成功率完成的人類等效任務時間,隨模型世代持續拉長。

RE-Bench v1則在 7 個 ML 研究工程環境比較 o1-preview、Claude 3.5 Sonnet 與 61 名專家。總預算兩小時時,最佳 Agent 分數約為人類的 4 倍;八小時時人類略為領先;總預算 32 小時時,人類的 best-of-four 八小時獨立嘗試約為最佳 Agent 的 2 倍——這不是單次 32 小時 run。Agent 每小時測試方案超過人類 10 倍;作者的定性軌跡分析則發現,它們較難從新資訊學習、承接前作與從失敗復原。

這兩項研究較能支持的窄結論是:在上述 bounded、由評分器給回饋的任務裡,Agent 可以快速迭代。METR 同時提醒,目前時間長度主要覆蓋低脈絡、規格乾淨的軟體/ML/資安任務;它把現有題組超過 16 小時的估計直接標為不可靠,Time Horizon 1.1 也指出最新模型已逼近題庫上限。「八小時的 P50 task horizon」是模型對人類需八小時任務有 50% 預測成功率,不等於自動化一份八小時的工作。

反方壓力測試:當題目與驗收都不再乾淨

arXiv:2607.27191(v2,2026 年 8 月 7 日;初版 7 月 29 日)以兩篇當時未公開的 NeurIPS 2026 投稿做 shadow evaluation:Agent 看不到原論文與 findings,但原作者其實已花數月研究這些問題。論文共報告 2 個題目、5 次 runs;兩個主實驗各給 Opus 4.8/OpenClaw 六天、3,000 美元 API 額度與 GPU。

研究團隊報告,在原作者先提供研究問題並協助設定資源預算後,兩個主實驗的 run 期間沒有針對個別問題的人工研究指導;Agent 完成了研究工程,但操作方仍有三項流程介入:修正 OpenClaw bug、延長 24 小時與要求重寫。Agent 最後未實質回答研究問題;兩份主實驗產出由原論文作者在非盲、非 NeurIPS 正式審稿的 shadow review 中判為明確 reject。作者的定性分析列出判斷、創意解題、有效回頭、脈絡/資源意識與 instruction drift 等失敗模式,但也承認只有兩題、reviewer 非盲、選題與 scaffold 都可能影響結果。它不能推翻 OpenAI 的 bounded-task 成績,卻剛好壓測了「實習生」與「研究員」之間的落差。

OpenAI 自己同期的公開材料也設下邊界。2026 年 9 月 3 日發布的 GPT-6 Astra System Card依 OpenAI 自家的 Preparedness Framework 判定,Astra 在 AI Self-Improvement 類別尚未達 High。Framework v2把 High 定義為:相對於 OpenAI 研究員的 2024 基準,模型的影響等同替每位研究員配上一名表現優異、具中階資歷的研究工程師助理;系統卡也提醒,能力評測只構成下限。

這個組織級 impact threshold 與本文的 intern 里程碑不是同一構念,不能互相換算。它只支持較窄的結論:依 OpenAI 自家評估,Astra 尚未達該 High 門檻,因此不能把 intern 宣稱直接升格為已驗證的 automated researcher。

加速與安全不是兩張表,而是同一個淨產出公式

如果只看總 runtime 與實驗數,很容易漏掉加速的成本。OpenAI 的技術報告記載,團隊在 7 月 19 日因警報啟動調查,發現 Agent 活動並開始停止仍在運行的 ExploitGym 任務;7 月 20 日才把事件連結到 Hugging Face 並通知對方。訓練用 container 服務其後加固,原本預定部署的最新模型之強化學習一度停了兩週。OpenAI 表示 Astra 本身沒有參與這起 Hugging Face 事件;另一條時間線上,8 月 7 日團隊因當時無法排除 Astra 已具備 Critical 資安能力,而加上模型專屬限制。這與 AlphaLab 先前整理的OpenAI Agent 資安事故指向同一件事:Agent 產生的研究吞吐量愈大,監控、權限隔離、事故回應與暫停權就愈要算進總帳。

有趣的是,在 OpenAI 分析且能辨識模型類別的 RL workloads 中,Astra 受限後一週,Astra 類 GPU 配置下降 59.2%,其他模型配置增加 17.2%,抵銷約 85% 的減幅;無法辨識模型的 4.5% 配置與部分高度敏感專案並未納入。這個模式與部分算力轉向其他模型一致,卻不能證明安全成本為零:研究題目、可用模型、審查流程和風險都已改變。真正該量的是扣除重做、review、事件處理與安全負擔後的可採用進展

AlphaLab 的判讀:這是研究執行的複利,不是遞迴式自我改進的證明

我同意的:研究苦工正在快速被自動化

OpenAI 這批內部數據的價值,不是替某個 benchmark 再添一個分數,而是顯示前沿實驗室已把 Agent 大規模塞進日常研發:並行 session、寫 code、查錯、啟動實驗、技術協助與結果追蹤都在發生。即使 3.1 不是生產力倍數,研究組織在 28 日平均裡累計出相當於每個名義人日 3.1 個機器工作日,仍足以顯示工作方式正在改變。

這種互補模式也比「AI 一口氣取代研究員」更可信。人類把可以清楚規格化、快速驗收的部分交給 Agent,自己把時間移向選題、評估與決策;如果驗收能力跟得上,而且節省的時間真的轉成可採用成果,整個迴圈才可能複利並形成競爭優勢。

我存疑的:這份公開報告尚未量到「淨研究進展」

這份報告把可量的活動量做得很細,卻缺少三個最關鍵的結果分母:

  1. 品質:多少輸出通過獨立 review、可重現,而且後來沒有被推翻?
  2. 人力:每個被接受結果,總共吃掉多少定義、prompt、等待、修正、review 與整合時間?
  3. 能力增益:Agent 產生的工作,讓後繼模型在哪些固定、未洩題的評估上提升多少?這個增益能否重複閉環,而不是只跑一次?

少了這三個分母,我們可以說「自動化研究執行正在加速」,還不能說「遞迴式自我改進已經開始」。後者至少要證明 Agent 產生的研究確實提升下一代系統,下一代又能以更高淨效率推動再下一代,而且扣除算力、評測、安全與人類判斷後仍有正向循環增益。

如果你正在帶 AI 團隊,現在就追這四個指標

不要照抄「Agent 跑了幾小時」當 KPI。更實用的儀表板是:

  • Accepted output per human hour:每一小時人類總投入,換回多少真正合併、採用或通過重現的結果;
  • Intervention rate:依任務長度與類型,記錄零介入成功、修正後成功、失敗與結果不明;
  • Rework and incident cost:把回滾、重跑、安全事件、review 與等待時間一起計入;
  • Evaluator integrity:定期用盲測與人工抽查確認 Agent 沒有迎合分數、污染題庫或把「看似完成」當成完成。

如果要把這套量測落地,可以先從AI Evals 的測試與回歸流程建立驗收集,再用Agent Observability記錄工具呼叫、成本、卡關與人類接手點。真正的護城河不只在「能同時跑多少 Agent」,而在你是否能快速辨認哪些結果值得相信。

接著閱讀

左右滑動查看更多推薦

真正值得追的下一個里程碑,不是 Agent 又多跑了多少小時,而是它能否用更少的人類介入,持續產出經得起獨立檢驗、可重現且安全的研究結果。到那時,「研究實習生」才真的開始向「研究員」畢業。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。