AI Agent 與開發 第 17 頁
所有文章 · 第 17 頁

短 benchmark 很快,不代表本機 Agent 跑到第 30 輪還快。這篇用 8K、32K、128K 累積上下文,帶你驗證 oMLX 的 RAM/SSD Prefix Cache、重啟復用、MTP 與答案正確性。

AI Eval 若能存取 answer key,pass rate 可能失真。這篇用合成 Canary、網路白名單、獨立 scorer 與 Trace auditor,教你建立可重跑的防洩漏測試。

TrueForge 把 agent loop、MCP、skills、sandbox、approval、API 與 UI 以 MIT 授權開源,並稱同模型成本低近 30%。我們查核官方程式碼與 benchmark,發現 sandbox 可攜性、統計方法、成本公式與 production 安全仍有關鍵邊界。

AI 改遊戲場景很快,難的是判斷畫面進步或退步。本篇從零建立 Unity/Godot 可重跑的 Golden Scene:鎖定 seed、鏡頭與解析度,用 ImageMagick 分層 diff,再用 Claude 盲式 A/B rubric 輔助判斷,最後由人類批准基準。

用虛構 API 遷移案實作 Semantica Context Graph:建立決策節點、證據邊與來源譜系,查 precedent、impact、conflict、lineage,再匯出 JSON 與 PROV-O。

CI Root-Cause Agent 校準怎麼做?從 Brier、log loss、校準曲線與 risk–coverage 開始,實作資料切分、temperature scaling、成本門檻、人工升級與 decision receipt,並下載可重現的 Python toy lab。

SQL 沒報錯不代表答案正確。本篇從零建立活資料真值 Eval:固定資料快照、當下重算 reference query、正規化 rows、保存 diff 與 replay artifact,並附 SQLite 實作。

Agent 上線後才遇到新型注入?本篇教你把生產 Trace 去識別,重建無副作用 mock world,以工具、權限、資料流與狀態 assertion 判定成敗,再把六階段安全測例接進 CI。

把 Skill 池從 5 擴到 100,為什麼 Agent 會拿錯、沒啟用或做錯?本文提供可重跑的 A/B Test:四道閘門、固定測試集、Promptfoo 指令、程序錨定與安全 canary。