跳到主要內容
← AI

AI Agent 與開發 3

所有文章 · 第 3 頁

AI Agent 與開發
【2026 最新】SoL-Pi 教學:四機制逐一 A/B、隱私檢查與回滾

SoL-Pi 實作續篇:從四開關全關的 baseline 出發,逐一驗證 Token、成功率、證據回讀、隱私資料流與可復原回滾。

最後更新:2026年9月20日
AI Agent 與開發
【2026 最新】Ordewell 教學:可編輯 Agent 任務圖真的比 Worktree 穩嗎?

Ordewell 把模糊目標拆成可編輯的 Agent 任務圖,但 completion marker 不等於正確。本文教你安裝、審查依賴、接上外部 Oracle,並公平比較平行 Worktree。

最後更新:2026年9月20日
AI Agent 與開發
【2026 最新】Claude Code 壓縮摘要安全教學:Hook、決策收據與回歸測試

Claude Code 壓縮摘要不能直接當權威狀態。用 PreCompact Hook 保存最小 checkpoint、DECISIONS.md 記錄否決理由,再以三類摘要 mutation regression 驗證 audit 分流與人工恢復。

最後更新:2026年9月20日
AI Agent 與開發
【2026 最新】Claude Mods 是什麼?Function Hooks、Skills、Classic Hooks 差在哪(低風險試作+能力盤點)

Claude Mods 仍在 early access;本文用 Claude Code 2.1.278 分清 Skill、Classic Hook、Function Hook 與 Plugin,實作只顯示狀態的低風險 Mod,完成能力盤點、測試、版本釘選與退場方案。

最後更新:2026年9月20日
AI Agent 與開發
【2026 最新】OpenSpec vs Claude Code vs Spec Kit:規格稅 A/B Test 評估教學

同一個 Repo、同一組 Hidden Oracle,如何公平比較 plain Claude Code、OpenSpec 與 Spec Kit?從版本固定、三次重跑到規格稅決策樹,一次學會。

最後更新:2026年9月20日
AI Agent 與開發
【2026 最新】LLM-as-a-Judge 校準教學:100 題驗收 AI 評審、Abstain 與 CI 閘門

從 100 題 human-labeled 校準集開始,驗收 LLM Judge 的 agreement、position bias、重跑穩定性與 false pass,再把 abstain、人工複核和 deterministic gates 接進 CI。

最後更新:2026年9月19日
AI Agent 與開發
【2026 最新】Agent Experience(AX)是什麼?用 3 個 Coding Agent 驗收網站

Agent Experience(AX)不是 llms.txt 或掃描分數。用 3 個 Coding Agent、3 項任務與前後比較,驗收網站的任務結果、流量成本、臆造網址與安全邊界。

最後更新:2026年9月19日
AI Agent 與開發
【2026 最新】Agent Harness A/B Test:Plan、Bash、Context 三旋鈕教學

同一模型換了 Harness 就像換腦?本文把 176 組研究設定拆成可在自己 repo 重跑的 Plan/Tools/Context 受控消融,附工作表、指標與決策規則。

最後更新:2026年9月19日
AI Agent 與開發
【2026 最新】Claude Code AGENTS.md 教學:CLAUDE.md 該留、該刪,還是雙軌?

Claude Code 2.1.277 支援 AGENTS.md,但預設並不會和 CLAUDE.md 合併。用三條遷移路徑與四組 canary,選出最穩健的跨 Agent 指令架構。

最後更新:2026年9月19日