跳到主要內容
← AI

AI Agent 與開發 17

所有文章 · 第 17 頁

AI Agent 與開發
【2026 最新】oMLX 長對話驗收怎麼做?Mac Agent 的 Prefix Cache 6 關教學

短 benchmark 很快,不代表本機 Agent 跑到第 30 輪還快。這篇用 8K、32K、128K 累積上下文,帶你驗證 oMLX 的 RAM/SSD Prefix Cache、重啟復用、MTP 與答案正確性。

最後更新:2026年8月21日
AI Agent 與開發
【2026 最新】AI Eval 防洩漏測試:Canary+網路白名單+Trace 審計

AI Eval 若能存取 answer key,pass rate 可能失真。這篇用合成 Canary、網路白名單、獨立 scorer 與 Trace auditor,教你建立可重跑的防洩漏測試。

最後更新:2026年8月21日
AI Agent 與開發
TrueForge Agent Harness 開源:省 30% 的證據夠嗎?(2026)

TrueForge 把 agent loop、MCP、skills、sandbox、approval、API 與 UI 以 MIT 授權開源,並稱同模型成本低近 30%。我們查核官方程式碼與 benchmark,發現 sandbox 可攜性、統計方法、成本公式與 production 安全仍有關鍵邊界。

最後更新:2026年8月21日
AI Agent 與開發
【2026 最新】Claude 遊戲視覺回歸怎麼做?固定鏡頭+Golden Scene+盲評 7 步實戰

AI 改遊戲場景很快,難的是判斷畫面進步或退步。本篇從零建立 Unity/Godot 可重跑的 Golden Scene:鎖定 seed、鏡頭與解析度,用 ImageMagick 分層 diff,再用 Claude 盲式 A/B rubric 輔助判斷,最後由人類批准基準。

最後更新:2026年8月21日
AI Agent 與開發
【2026 最新】Semantica Context Graph 怎麼做?新手建立 Agent 決策稽核軌跡

用虛構 API 遷移案實作 Semantica Context Graph:建立決策節點、證據邊與來源譜系,查 precedent、impact、conflict、lineage,再匯出 JSON 與 PROV-O。

最後更新:2026年8月20日
AI Agent 與開發
【2026 最新】CI Root-Cause Agent 校準怎麼做?5 個部署閘門+Python 實作

CI Root-Cause Agent 校準怎麼做?從 Brier、log loss、校準曲線與 risk–coverage 開始,實作資料切分、temperature scaling、成本門檻、人工升級與 decision receipt,並下載可重現的 Python toy lab。

最後更新:2026年8月20日
AI Agent 與開發
【2026 最新】Text-to-SQL Agent Eval:用活資料真值抓出「查得到但答錯」

SQL 沒報錯不代表答案正確。本篇從零建立活資料真值 Eval:固定資料快照、當下重算 reference query、正規化 rows、保存 diff 與 replay artifact,並附 SQLite 實作。

最後更新:2026年8月20日
AI Agent 與開發
【2026 最新】Prompt Injection 回歸測試怎麼做?六步把可疑 Trace 變安全測例

Agent 上線後才遇到新型注入?本篇教你把生產 Trace 去識別,重建無副作用 mock world,以工具、權限、資料流與狀態 assertion 判定成敗,再把六階段安全測例接進 CI。

最後更新:2026年8月20日
AI Agent 與開發
【2026 最新】Agent Skill 評測怎麼做?用 5→100 個 Skills 做路由與失敗 A/B Test

把 Skill 池從 5 擴到 100,為什麼 Agent 會拿錯、沒啟用或做錯?本文提供可重跑的 A/B Test:四道閘門、固定測試集、Promptfoo 指令、程序錨定與安全 canary。

最後更新:2026年8月20日