AI Agent 與開發 第 3 頁
所有文章 · 第 3 頁

SoL-Pi 實作續篇:從四開關全關的 baseline 出發,逐一驗證 Token、成功率、證據回讀、隱私資料流與可復原回滾。

Ordewell 把模糊目標拆成可編輯的 Agent 任務圖,但 completion marker 不等於正確。本文教你安裝、審查依賴、接上外部 Oracle,並公平比較平行 Worktree。

Claude Code 壓縮摘要不能直接當權威狀態。用 PreCompact Hook 保存最小 checkpoint、DECISIONS.md 記錄否決理由,再以三類摘要 mutation regression 驗證 audit 分流與人工恢復。

Claude Mods 仍在 early access;本文用 Claude Code 2.1.278 分清 Skill、Classic Hook、Function Hook 與 Plugin,實作只顯示狀態的低風險 Mod,完成能力盤點、測試、版本釘選與退場方案。

同一個 Repo、同一組 Hidden Oracle,如何公平比較 plain Claude Code、OpenSpec 與 Spec Kit?從版本固定、三次重跑到規格稅決策樹,一次學會。

從 100 題 human-labeled 校準集開始,驗收 LLM Judge 的 agreement、position bias、重跑穩定性與 false pass,再把 abstain、人工複核和 deterministic gates 接進 CI。

Agent Experience(AX)不是 llms.txt 或掃描分數。用 3 個 Coding Agent、3 項任務與前後比較,驗收網站的任務結果、流量成本、臆造網址與安全邊界。

同一模型換了 Harness 就像換腦?本文把 176 組研究設定拆成可在自己 repo 重跑的 Plan/Tools/Context 受控消融,附工作表、指標與決策規則。

Claude Code 2.1.277 支援 AGENTS.md,但預設並不會和 CLAUDE.md 合併。用三條遷移路徑與四組 canary,選出最穩健的跨 Agent 指令架構。