AI Agent 與開發 第 9 頁
所有文章 · 第 9 頁

從零外掛 baseline 開始,用同一組五題 smoke eval 逐層檢查規則檔、Skill、Hook 與 MCP;附可複製模板、記分卡與刪除條件。

看到 Prompt Injection 警告,先別怪模型或猜套件遭入侵。本篇用來源指紋、parent span、決策者與 action lineage,教你追出第一個不可信輸入,分清誤報、誤歸因與 Harness 防線。

Spotify Shunt 的「省 90%」其實是三個 bulk-read 案例的 Claude 主上下文估算。本文拆解 Portal/AiKA 前提,示範 exit-2 Read 護欄、worker 證據合約與可停止的同任務 A/B。

把 Claude Code 的「修好了」變成可重跑證據:隔離 Chrome、收集 Console/Network/DOM/截圖與 trace,寫出 assertion,再輸出修補前後的驗收 receipt。

用 human-only baseline 與 AI Shadow Mode 跑一場可重置的 Coding Agent 事故回復演練,量根因證明、錯誤假設、測試污染與人類能力保留。

GPT‑6 Astra 能操作 KiCad,不代表電路已可製造。用 5V LED 小板,把需求、ERC、SPICE、BOM、footprint、DRC 與人工簽核串成可重跑的 7 道驗收閘門。

用 Ollama、Firecrawl 與 Kiwix 組出可連網、半離線與完全斷網的研究 Agent,從來源信封、引用三關到五種故障注入,完整建立可重跑的研究收據。

MCP 真的值得上 Production 嗎?從 API/CLI 選路、TypeScript SDK v2 handler,到 OAuth、CORS、CIMD/DCR、SSRF、撤銷與跨 client 故障矩陣,逐關建立可稽核的放行證據。

Magnitude 會掃描硬體、估算本機模型並替 Agent 接線,但推薦真的比手動 Ollama/llama.cpp 準嗎?這篇從安裝、協定限制到同機 A/B,一步步教你自己驗證。