OpenAI 在 2026 年 9 月 6 日發布〈Research acceleration: The view inside OpenAI〉,宣布依照自家量測,已達成「OpenAI 自動化 AI 研究實習生」里程碑:Agent 能在人類指導下執行定義清楚的研究任務,其中包括內部分類器估計由熟練研究員處理可能要花數天的工作。
這個說法值得認真看待,卻不能直接翻成「AI 已經等於研究員」。OpenAI 最吸睛的數字,是截至 8 月中,每一個研究組織員工的名義工作日,內部累計約 3.1 個八小時的 Agent 活躍執行時間;它量的是符合條件 Agent 的估計活躍 runtime 總和,並行 thread 會分別累加,不是 3.1 倍產出、更不是 3.1 倍科學突破。

接下來我會分三步拆解:先忠實還原 OpenAI 到底宣稱了什麼,再把 3.1、124 倍 output-token 相對指數、實驗增速與任務成功率放回方法脈絡,最後用 METR 與開放式 AI 研究評測檢驗它。這批內外部證據支持 Agent 在多種 bounded 任務上進步;更難的問題是,這些底層活動已有多少轉化成品質調整後的研究進展。
OpenAI 自動化 AI 研究實習生,到底「到職」了什麼?
先把 OpenAI 的原話放在這裡:
“According to our measurements, we have now reached the goal, announced last fall, of having an automated research intern by September of this year.”
中文:「依照我們的量測,我們已達成去年秋天宣布的目標:截至今年 9 月擁有一名自動化研究實習生。」
OpenAI, Research acceleration: The view inside OpenAI
關鍵不在「自動化」三個字,而在後面的定義:任務要定義清楚、方向由人類給定。這個里程碑沒有主張系統擁有哪個研究問題最重要,或結果是否值得擴大訓練、暫停及部署的最終決策權。OpenAI 本文也明說,人類仍負責研究優先順序、判讀構想與結果,以及最後的擴大、暫停和部署決策。
因此,比較準確的心智模型不是「無人 AI 科學家」,而是一名速度很快、可以平行派工、但需要題目、驗收標準與主管回饋的研究實習生。OpenAI 把下一個目標訂在 2028 年 3 月的「自動化 AI 研究員」;這份公開報告只揭露日期與「在人類監督下推進 deep learning 和 alignment」的方向,沒有公開自主時長、成功率、提出新問題或獨立重現等可稽核通過門檻。所以那是內部目標,不是已被驗證的預測。
3.1 個 Agent 工作日,不是 3.1 倍研究生產力

這張圖的計算方式,比「Agent 做了多少人的工作」窄得多:
- 把所有符合條件的 Agent turn 估計活躍時間加總,八小時算一個 Agent 工作日;
- 人類端不是工時紀錄,而是研究組織每位員工每天固定算八小時;
- 同時跑四個 Agent 一小時,會累計四個 Agent 小時;subagent 與自動 review thread 也各自計入;
- OpenAI 另套用多種未完全展開的 inactive-turn heuristic;方法中明列的一條,是同一個 turn 兩次 server event 相隔超過 30 分鐘時不計中間時段。這個指標不會再依任務結果或人工複核成本做品質調整;
- 圖表使用 28 日落後平均;這張 3.1 圖的序列終點是 8 月 15 日,不是 9 月 6 日當天的即時讀數。
換句話說,3.1 證明的是 OpenAI 已把很可觀的機器執行時間灌進研究流程,而且平行化程度高;它沒有告訴我們這些時間中,有多少變成可採用的程式、有效的實驗或新模型能力。把 runtime、估計的人類反事實工時、實際日曆時間與品質調整後的進展混在一起,是這則消息最容易犯的單位錯誤。
四個快速成長的數字,分別少了哪個分母?
| OpenAI 內部指標 | 它實際量到什麼 | 它不能單獨證明什麼 |
|---|---|---|
| 124 倍 | 截至 8 月 16 日,研究部門 active regular employees(含零使用者)的每日 output-token 中位數,換算為 28 日等值後,相對 2025 年 11 月 1 日基準;包含隱藏推理、程式與工具呼叫 | 研究價值、正確率或生產力 |
| 7.02 倍 | OpenAI 全公司非自動 commit 的 added + deleted LoC(單次 commit 截尾至 p99),除以過去 12 個月有 commit 的 contributor identities 後取每日值與季度平均;2026 年第三季暫定資料截至 8 月 15 日,倍數相對 2025 年前平均 | 程式品質、維護成本或因果提速 |
| 約 1.6 倍 | 截至 8 月 10 日當週,每位活躍實驗者的四週移動平均條件實驗強度,相對 2025 年基準 | 實驗是否有資訊價值;同期算力也顯著增加 |
| 3.1 個工作日 | 所有符合條件 Agent 的估計活躍時間總和 | 3.1 倍人力、產出或科學進展 |
這些數字不是沒有意義。研究本來就包含大量寫程式、找 bug、啟動與監看實驗、整理結果等「苦工」;當苦工變便宜,研究迴圈確實可能更快。但它們都位在同一條證據階梯的下半部:
token/runtime/程式行數/實驗次數 → 可驗收的任務成功 → 品質調整後的研究產出 → 後繼模型能力增益。
OpenAI 這次很完整地公開了前兩層的一部分,卻還沒有把它們連到最後兩層。這也是原文自己保留得最誠實的地方:AI 研究有許多瓶頸,整體研究速度「很可能不會」跟這些局部指標同步上升。

最重要的圖,其實是「人類介入」
OpenAI 用 GPT-5.6 Sol 分類器,抽樣 2026 年 1 月 1 日到 7 月 31 日約 2% 的研究部門互動式 coding 對話,再讀取前後 session、Slack、文件與 PR,事後判斷任務有沒有成功、需要幾次人類修正。任務長度也不是實際工時,而是另一次 GPT-5.6 Sol 分類估算「人類不用 AI 會花多久」。
這套方法比只問 Agent「你做完了嗎」進步很多,因為它會追蹤後續證據;但人工標註驗證集只有 25 個任務,成功率主圖還排除了找不到可靠結果的 Uncertain 案例,以及 session 或使用者少於 50 的資料點。它適合看內部趨勢,不適合當成外部已重現的能力基準。

這張圖把「研究實習生」的邊界畫得最清楚。在排除 Uncertain、並讓每位使用者等權重的彙總樣本裡,4–8 小時任務的零介入成功約占 43.45%,介入後成功約占 44.89%;也就是最終成功案例裡,剛超過一半需要人類至少修正一次。介入占成功案例的比重一路升到 32–64 小時分桶的約 82.5%,在最長的 64–128 小時分桶回落到約 76.5%,因此整體趨勢上升、但不是每一格都單調。
所以 OpenAI 自動化 AI 研究實習生目前最合理的價值主張是「受監督的研究倍增器」:能吃下大量明確工作、快速試錯並平行搜尋,但人類仍在 critical path 上負責定義、糾偏、驗證和取捨。當 coding 變便宜,瓶頸不會自動消失,往往會移到研究品味、評估器可信度、算力、review、整合與安全。
外部證據:Agent 會跑研究流程,還不等於會做開放式研究
支持 OpenAI 的部分:可驗證、範圍清楚的迴圈進步很快
METR 的 Time Horizon 1.1 儀表板(截至 2026 年 5 月 8 日)提供了獨立的方向性證據:在以軟體工程、機器學習與資安為主、任務自包含且可自動評分的題組裡,公開前沿 Agent 能以固定成功率完成的人類等效任務時間,隨模型世代持續拉長。
RE-Bench v1則在 7 個 ML 研究工程環境比較 o1-preview、Claude 3.5 Sonnet 與 61 名專家。總預算兩小時時,最佳 Agent 分數約為人類的 4 倍;八小時時人類略為領先;總預算 32 小時時,人類的 best-of-four 八小時獨立嘗試約為最佳 Agent 的 2 倍——這不是單次 32 小時 run。Agent 每小時測試方案超過人類 10 倍;作者的定性軌跡分析則發現,它們較難從新資訊學習、承接前作與從失敗復原。
這兩項研究較能支持的窄結論是:在上述 bounded、由評分器給回饋的任務裡,Agent 可以快速迭代。METR 同時提醒,目前時間長度主要覆蓋低脈絡、規格乾淨的軟體/ML/資安任務;它把現有題組超過 16 小時的估計直接標為不可靠,Time Horizon 1.1 也指出最新模型已逼近題庫上限。「八小時的 P50 task horizon」是模型對人類需八小時任務有 50% 預測成功率,不等於自動化一份八小時的工作。
反方壓力測試:當題目與驗收都不再乾淨
arXiv:2607.27191(v2,2026 年 8 月 7 日;初版 7 月 29 日)以兩篇當時未公開的 NeurIPS 2026 投稿做 shadow evaluation:Agent 看不到原論文與 findings,但原作者其實已花數月研究這些問題。論文共報告 2 個題目、5 次 runs;兩個主實驗各給 Opus 4.8/OpenClaw 六天、3,000 美元 API 額度與 GPU。
研究團隊報告,在原作者先提供研究問題並協助設定資源預算後,兩個主實驗的 run 期間沒有針對個別問題的人工研究指導;Agent 完成了研究工程,但操作方仍有三項流程介入:修正 OpenClaw bug、延長 24 小時與要求重寫。Agent 最後未實質回答研究問題;兩份主實驗產出由原論文作者在非盲、非 NeurIPS 正式審稿的 shadow review 中判為明確 reject。作者的定性分析列出判斷、創意解題、有效回頭、脈絡/資源意識與 instruction drift 等失敗模式,但也承認只有兩題、reviewer 非盲、選題與 scaffold 都可能影響結果。它不能推翻 OpenAI 的 bounded-task 成績,卻剛好壓測了「實習生」與「研究員」之間的落差。
OpenAI 自己同期的公開材料也設下邊界。2026 年 9 月 3 日發布的 GPT-6 Astra System Card依 OpenAI 自家的 Preparedness Framework 判定,Astra 在 AI Self-Improvement 類別尚未達 High。Framework v2把 High 定義為:相對於 OpenAI 研究員的 2024 基準,模型的影響等同替每位研究員配上一名表現優異、具中階資歷的研究工程師助理;系統卡也提醒,能力評測只構成下限。
這個組織級 impact threshold 與本文的 intern 里程碑不是同一構念,不能互相換算。它只支持較窄的結論:依 OpenAI 自家評估,Astra 尚未達該 High 門檻,因此不能把 intern 宣稱直接升格為已驗證的 automated researcher。
加速與安全不是兩張表,而是同一個淨產出公式
如果只看總 runtime 與實驗數,很容易漏掉加速的成本。OpenAI 的技術報告記載,團隊在 7 月 19 日因警報啟動調查,發現 Agent 活動並開始停止仍在運行的 ExploitGym 任務;7 月 20 日才把事件連結到 Hugging Face 並通知對方。訓練用 container 服務其後加固,原本預定部署的最新模型之強化學習一度停了兩週。OpenAI 表示 Astra 本身沒有參與這起 Hugging Face 事件;另一條時間線上,8 月 7 日團隊因當時無法排除 Astra 已具備 Critical 資安能力,而加上模型專屬限制。這與 AlphaLab 先前整理的OpenAI Agent 資安事故指向同一件事:Agent 產生的研究吞吐量愈大,監控、權限隔離、事故回應與暫停權就愈要算進總帳。
有趣的是,在 OpenAI 分析且能辨識模型類別的 RL workloads 中,Astra 受限後一週,Astra 類 GPU 配置下降 59.2%,其他模型配置增加 17.2%,抵銷約 85% 的減幅;無法辨識模型的 4.5% 配置與部分高度敏感專案並未納入。這個模式與部分算力轉向其他模型一致,卻不能證明安全成本為零:研究題目、可用模型、審查流程和風險都已改變。真正該量的是扣除重做、review、事件處理與安全負擔後的可採用進展。
AlphaLab 的判讀:這是研究執行的複利,不是遞迴式自我改進的證明
我同意的:研究苦工正在快速被自動化
OpenAI 這批內部數據的價值,不是替某個 benchmark 再添一個分數,而是顯示前沿實驗室已把 Agent 大規模塞進日常研發:並行 session、寫 code、查錯、啟動實驗、技術協助與結果追蹤都在發生。即使 3.1 不是生產力倍數,研究組織在 28 日平均裡累計出相當於每個名義人日 3.1 個機器工作日,仍足以顯示工作方式正在改變。
這種互補模式也比「AI 一口氣取代研究員」更可信。人類把可以清楚規格化、快速驗收的部分交給 Agent,自己把時間移向選題、評估與決策;如果驗收能力跟得上,而且節省的時間真的轉成可採用成果,整個迴圈才可能複利並形成競爭優勢。
我存疑的:這份公開報告尚未量到「淨研究進展」
這份報告把可量的活動量做得很細,卻缺少三個最關鍵的結果分母:
- 品質:多少輸出通過獨立 review、可重現,而且後來沒有被推翻?
- 人力:每個被接受結果,總共吃掉多少定義、prompt、等待、修正、review 與整合時間?
- 能力增益:Agent 產生的工作,讓後繼模型在哪些固定、未洩題的評估上提升多少?這個增益能否重複閉環,而不是只跑一次?
少了這三個分母,我們可以說「自動化研究執行正在加速」,還不能說「遞迴式自我改進已經開始」。後者至少要證明 Agent 產生的研究確實提升下一代系統,下一代又能以更高淨效率推動再下一代,而且扣除算力、評測、安全與人類判斷後仍有正向循環增益。
如果你正在帶 AI 團隊,現在就追這四個指標
不要照抄「Agent 跑了幾小時」當 KPI。更實用的儀表板是:
- Accepted output per human hour:每一小時人類總投入,換回多少真正合併、採用或通過重現的結果;
- Intervention rate:依任務長度與類型,記錄零介入成功、修正後成功、失敗與結果不明;
- Rework and incident cost:把回滾、重跑、安全事件、review 與等待時間一起計入;
- Evaluator integrity:定期用盲測與人工抽查確認 Agent 沒有迎合分數、污染題庫或把「看似完成」當成完成。
如果要把這套量測落地,可以先從AI Evals 的測試與回歸流程建立驗收集,再用Agent Observability記錄工具呼叫、成本、卡關與人類接手點。真正的護城河不只在「能同時跑多少 Agent」,而在你是否能快速辨認哪些結果值得相信。
接著閱讀
左右滑動查看更多推薦
真正值得追的下一個里程碑,不是 Agent 又多跑了多少小時,而是它能否用更少的人類介入,持續產出經得起獨立檢驗、可重現且安全的研究結果。到那時,「研究實習生」才真的開始向「研究員」畢業。






