AI · 第 6 頁
Latest AI
最新 AI 文章 · 第 6 頁
共 74 頁

用三種真任務比較 Claude Sonnet 5.5 與 Opus 5.5:固定條件、調整 Effort,依合格成果與完整投入建立自己的 Claude Code 路由表。

用兩個假資料專案與一般聊天,檢查 Claude 的專案記憶、帳號記憶與舊聊天搜尋,記錄來源並清理測試條目。

H Company 發布 Holo4 27B 與 35B-A3B:同一模型跨 GUI、程式碼、MCP 與 API。拆解 OSWorld 2.0 的 61.7% 部分得分、41.5% 完整成功率、Harness 影響與兩種權重授權。

Meta 宣布 Meta Enterprise Platform,並找來 MongoDB 前執行長 CJ Desai。現有 Agent 與 API 能否成為企業可部署、可驗收的產品?

Fireworks 聲稱 Ember-1 保持 Kimi K3 相近品質、少用約 40% token;拆解客戶 A/B、基準測試、相同 API 標價與長流程 Agent 的真實成本。

Claude Sonnet 5.5 與前代同價,Anthropic 宣稱每件任務最多省三成。對照官方 Terminal-Bench 與 Vals AI 外部測試,拆解跑分、fallback 和真正的成本。

Cloudflare 推出為 Agent 設計的 cf CLI,宣稱涵蓋逾 3,000 項 API 操作。48% Wrangler 使用來自 Agent 是公司內部統計;本文核對公開功能、遷移承諾與權限邊界。

想讓 AI Agent 只讀一份 Google 試算表?先看 OAuth 範圍與帳號,用兩份假表驗收,再逐層撤銷 Connector、Google 授權與檔案分享。

三台裝置各跑一個本機模型,單一 API 入口和任務派工是兩回事。用 LiteLLM、Planner/Worker 與斷線驗收,從零建出可檢查的三機流程。