AI Agent 與開發 第 6 頁
所有文章 · 第 6 頁

AI 模型突然變笨,原因不一定在模型。用固定 10 題、三次重跑與盲評,分清品質回歸、服務塞車、路由、effort、快取與配額變化。

單機 Prefix Cache 命中,多 Worker 仍可能因路由、排隊與搬運變慢。本篇用分層驗收矩陣、route receipt 與五場故障演練,教你驗收跨 Worker Agent KV Cache。

RTK 能把命令輸出壓短,卻不保證任務更便宜。這篇用同 Repo 的 ON/OFF 工作簿,教你同時計算成功率、Token、重試、recall 與每次成功成本。

LiteLM 把多供應商 routing 與格式轉換縮進約 3,100 行 Python,但它不是完整 Gateway。本文用本機 contract tests、故障注入與 trace 收據,教你判斷何時能用、何時要補 Proxy 與控制面。

小模型猜得準仍可能變慢。這篇用 Qwen3-8B+DFlash 拆解 draft-and-verify,提供固定版本、負載與 VRAM 的五步 A/B,讓你用 SLO 決定開或關。

測試全綠仍可能累積重複與複雜度。這篇用 Code Sloppiness 的 Verbosity、Erosion 建 baseline,教你把 AI 大型 PR 做成可抽查、可逐步收緊的 CI Budget。

同一 model slug 回 200 OK,不代表拿到可用內容或相同能力。這篇提供六道可重跑的 OpenRouter Provider 契約 gate、Node.js 核心 runner 與 release policy,讓你在正式環境前抓出工具、歷史、視覺與路由故障。

從四個核心物件開始,用 Python 建立 OpenAI Agents API 雲端 Agent,實際演練 stream 中斷、saved items 復原、取消、artifact 與 hosted/self-hosted 安全邊界。

不用三張 GPU,先用 Python Mock 拆解 Gander 的小腦、Runtime 與大腦,實作插話、取消、逾時、去重與雙重交付閘門。