AI · 第 2 頁
Latest AI
最新 AI 文章 · 第 2 頁
共 71 頁

GPT-6.1 Sol 的外部評測顯示,綜合指標與 Astra 只差 1 分,單題成本約為 0.72 對 3.26 美元。這篇對照官方資料與測試邊界,教你用合格任務的總成本判斷是否值得換模型。

從 OpenRig 官方 first-project 兩個 Codex 座位起步:先盤點 setup 與 Hooks 寫入,再用小型 repo 任務核對 queue、checker 和卡住後的復原證據。

從 Claude Design 核准單頁網站,到 Claude Code 實作與桌機手機截圖驗收;附可複製的核准表、交接施工單和返工格式。

HTTP 擋住了,DNS 查詢還會到外部嗎?用自有網域與三張前後對照收據,驗收 Agent 沙盒的解析路徑、日誌和阻擋規則。

用三種真任務比較 Claude Sonnet 5.5 與 Opus 5.5:固定條件、調整 Effort,依合格成果與完整投入建立自己的 Claude Code 路由表。

用兩個假資料專案與一般聊天,檢查 Claude 的專案記憶、帳號記憶與舊聊天搜尋,記錄來源並清理測試條目。

H Company 發布 Holo4 27B 與 35B-A3B:同一模型跨 GUI、程式碼、MCP 與 API。拆解 OSWorld 2.0 的 61.7% 部分得分、41.5% 完整成功率、Harness 影響與兩種權重授權。

Meta 宣布 Meta Enterprise Platform,並找來 MongoDB 前執行長 CJ Desai。現有 Agent 與 API 能否成為企業可部署、可驗收的產品?

Fireworks 聲稱 Ember-1 保持 Kimi K3 相近品質、少用約 40% token;拆解客戶 A/B、基準測試、相同 API 標價與長流程 Agent 的真實成本。