Ornith-1.5 由 Ornith Team 於 2026 年 8 月 19 日在官方 X 公布;同月的技術文章〈Ornith-1.5: From Self-Scaffolding to Self-Improvement〉說明了 9B、35B-A3B 與 397B 三款模型權重,以及一個比 benchmark 更大的主張:模型不只解題,還會在訓練期間生成新題目、替題目搭建 scaffold/harness,再用解題結果回頭更新三個環節。這確實把 AI post-training 往前推了一步;但它更精確的名字是「有邊界的自生課程與 agent harness 聯合優化」,不是模型已能脫離人類、無限遞迴地改寫自己。

先說結論:Ornith-1.5 最值得注意的,不是供應商自報的 86.1 或 70.6,而是它把「出題者、agent 架構師、解題者」放進同一條 reward-driven 訓練迴圈。這也把最難的問題推到檯面上:當裁判與選手一起學,分數變高究竟代表能力增加,還是系統更會迎合裁判?
“Today, we are introducing Ornith-1.5, a major step toward building foundation models through end-to-end self-improvement.”
中文:今天,我們推出 Ornith-1.5,朝以端到端自我改進建立基礎模型邁進一大步。
Ornith Team,〈Ornith-1.5: From Self-Scaffolding to Self-Improvement〉
Ornith-1.5 發布了什麼?先把「開源」說精確
三個官方 Hugging Face repository 都能免申請下載 BF16 checkpoint:9B 是 dense 模型,35B-A3B 與 397B 是 MoE。模型 metadata 顯示的參數量分別約為 9.4B、36.0B 與 396.8B;35B 版本每個 token 約啟用 3B 參數。
| 版本 | 架構 | 適合先觀察什麼 |
|---|---|---|
| Ornith-1.5-9B | Dense,約 9.4B | 小模型能否保留 agent coding 能力 |
| Ornith-1.5-35B-A3B | MoE,總量約 36.0B、每 token 約 3B active | active parameters 與系統能力的效率 |
| Ornith-1.5-397B | MoE,約 396.8B | 訓練迴圈在旗艦規模是否仍有效 |
授權要保守一點說。三個 model card 的 metadata 都標示 mit;不過截至 2026 年 8 月 21 日,頁面所連的 LICENSE 全文仍回傳 404。因而現階段最精確的描述是「公開、免申請下載,且 metadata 標示 MIT 的模型權重」,而不是「完整可重現的開源自我改進系統」。後者還需要訓練程式、資料資訊、生成軌跡與完整 recipe。
Ornith-1.5 真正的新東西:同一個模型輪流當出題者、架構師與解題者
Ornith-1.0 已經把 scaffold 與 solution rollout 放進 RL;1.5 再把 task generation 納入。你可以把一次訓練循環理解成三個角色:
- 出題者:根據環境或 codebase、高階題型指令,以及過去解題紀錄,生成接近能力邊界的新任務。
- Agent 架構師:替任務產生或修正 scaffold/harness,包括指令、工具、拆解策略、orchestration 與驗收方式。若你還不熟這一層,可以先讀 AI Agent Harness 白話教學。
- 解題者:在題目與 scaffold 條件下產生多條 solution rollout,再把結果當成訓練訊號。

出題 reward 寫成 R_task = V × D × N:題目要可驗證(validity)、落在當前能力前沿(difficulty)、又不能只是舊題變形(novelty)。團隊把目標成功率設為 p*=0.2,也就是偏好「大多數會失敗,但仍能產生少量成功軌跡」的題目。Harness reward 則同時考慮任務一致性、reward fidelity 與抗 reward hacking;三個角色都以 GRPO 更新。
“A useful task must form a well-defined learning environment.”
中文:有用的任務,必須形成一個定義清楚的學習環境。
Ornith Team,〈Ornith-1.5: From Self-Scaffolding to Self-Improvement〉
這句話其實比「self-improvement」更重要。因為任務不是憑空出現:人仍先給環境、codebase、題型指令、reward 結構、算力與信任邊界。整個機制發生在 post-training;下載到本機的是訓練後 checkpoint,不能把它誤讀成部署後會持續自行更新權重。
分數很漂亮,但每一個都是「模型 × harness × 預算」
官方主視覺最醒目的三個數字是:397B 在 Terminal-Bench 2.1 得 86.1、在 DeepSWE 得 56.0;9B 在 SWE-bench Verified 得 70.6。這些都是 Ornith 團隊自報、五次執行的平均,不是 AlphaLab 實測,也還不是相應 benchmark 官方榜的獨立重跑結果。

把設定攤開後,三個數字代表的東西並不一樣:
- Terminal-Bench 2.1:86.1——397B 搭配 Terminus-2、128K context、每次最多 4 小時與 32 CPU/48GB RAM;團隊還調整 Qwen chat template 與 Harbor 的
reasoning_content適配。官方榜截至 8 月 21 日尚未收錄 Ornith。 - DeepSWE:56.0——Ornith 使用 Claude Code harness、256K context;但 DeepSWE 官方榜統一使用 mini-swe-agent 協議。因此 56.0 不能直接與另一套 harness 的榜上數字排名。
- SWE-bench Verified:70.6——9B 搭配 OpenHands、256K context,團隊稱已移除 git history 並斷網;這篇技術文沒有附上 predictions、完整 trajectories、OpenHands 版本與 benchmark commit。這裡的「Verified」是 500 題資料集的名稱,不表示這筆提交已獲官方驗證。

「接近 Opus 4.8」目前不能當成已對齊的結論
Ornith 的表格把自家 Terminal-Bench 86.1 與 Claude Opus 4.8 的 85.0 並列;但 Anthropic 的 Opus 4.8 系統卡在官方 Terminus-2 protocol 報告的是 74.6。兩份材料沒有提供足夠資訊解釋這 10.4 點落差。合理的處理不是任選一個數字,而是把「追平 Opus」限定為 Ornith 自己表格內的比較,等雙方 protocol、版本、推論端點與 trajectories 能被對齊後再下判斷。
SWE-bench 本身也不是無瑕的尺。OpenAI 在 138 個高失敗率 Verified 任務的稽核中,發現 59.4% 有實質題意或測試問題;這個比例不能外推成整個 500 題都壞掉,卻足以提醒我們:到了 70%~80% 區間,題庫污染、測試設計與 agent scaffold 都可能比小數點後的差距更重要。想建立可持續的評測,應把模型、harness、提示、工具與預算分欄記錄;實作方式可參考 AlphaLab 的 AI Evals 七步框架。
當裁判與選手一起學,reward 才是整套系統的「憲法」
自生課程的吸引力很直觀:模型變強後,舊題成功率上升,difficulty reward 下降,出題者便被推向更難的題目;新成功軌跡又餵回 solver。這可能讓訓練資料跟著能力前沿移動,而不必永遠等人類逐題撰寫。
但乘法公式只說明「希望 reward 測量什麼」,不等於證明它真的測到了。若 verifier 把捷徑當成功、novelty 模型把改寫當新題,或 scaffold 學會迎合判分器,三個角色就可能互相強化同一個錯誤。Ornith-1.0 曾討論不可由模型修改的外層邊界、deterministic monitor 與 frozen-LLM veto;1.5 技術文列出 alignment、fidelity、hack resistance 三個目標,卻未交代足以獨立檢驗的具體計算、攻擊測試與 ablation。
這正是 Ornith-1.5 最有價值也最脆弱的地方:人類工作不是消失,而是從「寫每一題答案」上移到「設計世界、裁判與邊界」。若裁判不可靠,自動化只會讓錯誤更快累積。
AlphaLab 判斷:這是 bounded self-improvement,不是完整 RSI
「遞迴式自我改進」常把三種程度完全不同的系統混在一起:
- 自生資料:模型生成 instruction、答案或偏好資料,再由既定流程訓練。
- 有邊界的閉環:系統在固定環境、reward、optimizer 與算力內,聯合改善題目、scaffold 與 policy。Ornith-1.5 的公開描述落在這一層。
- 強 RSI:AI 能持續改善 AI 研發本身,包括選研究方向、設計並驗證新演算法、建立後繼系統,且回饋足以自我維持。
METR 也提醒,RSI 一詞同時被用來指任何能力回饋、自我維持的加速,甚至完全自主成長;若不先說定義,討論很容易失真。Ornith-1.5 已展示的是第二層的工程提案與供應商評測,不是第三層已經發生。想把這條界線放進更完整的脈絡,可接著讀 AlphaLab 對 AI 遞迴式自我改進的分析。
接下來要看什麼?四個能真正提高可信度的測試
- 同算力 ablation:固定模型與 compute,分別關掉 task generation、scaffold generation、rollout learning,確認增益究竟來自哪一層。
- 公開每輪曲線與樣本:不只給終點分數,也給題目難度、成功率、novelty、被擋下的 reward hack,以及代表性 trajectories。
- 鎖定 harness 的 fresh/private repo 測試:避免公開題庫污染,並讓所有模型使用相同 agent、工具、timeout 與 token budget。
- 第三方重跑:把 Terminal-Bench、DeepSWE、SWE-bench 的 predictions 與設定送進官方流程,讓外部團隊能重現。
如果你想先試 9B 或 35B,最有資訊量的做法不是拿官方圖表當採購單,而是建立 20~50 個自己的真實任務,鎖住 harness 與採樣參數,分開記錄成功率、成本、時間與人工修正次數。這樣測到的才是你的系統能力,而不是別人的展示配置。
結論:模型開始自己出題,但人類仍在設計考場
Ornith-1.5 的方向值得認真看待。它不只是又一組 open-weight checkpoint,而是嘗試把 task、agent scaffold 與 solution rollout 三個原本常由人固定的層級,移進同一套 RL 迴圈。若這條路能經過 ablation、獨立 verifier 與第三方重跑,它可能大幅改變 post-training 的資料生產方式。
但今天最誠實的判讀仍是:這是一個有邊界的自我改進訓練系統,公開證據主要來自團隊自己的 benchmark。它把「誰來出題」自動化了一部分,卻沒有取消人類對環境、reward、算力與信任邊界的責任。真正的突破,不會只是一條更高的橘色長條;而是第三方換一個考場、鎖住同一位裁判後,進步仍然存在。
接著閱讀
左右滑動查看更多推薦






