所有文章
共 1175 篇文章

Claude Code 寫研究論文,不必把理解與責任一起外包。用 Ownership Budget、H/A/E 研究日誌、provenance receipt、乾淨環境復現、盲抽查與口頭驗收,守住假設、證據與結果的主導權。

從 NoBg 0.3.1 安裝到 Alpha 輸出,用同一張圖做預設 prompt vs 明確名詞 A/B,再以黑、白、青三色背景和四欄盲評,建立可重跑的 MultiMatte 去背交付流程。

RTK 能把命令輸出壓短,卻不保證任務更便宜。這篇用同 Repo 的 ON/OFF 工作簿,教你同時計算成功率、Token、重試、recall 與每次成功成本。

NCP 不是神經細胞自動機。這篇從零拆解 Next Concept Prediction 的三段架構、連續概念目標、VQ 支線與 8.94B checkpoint,並教你正確解讀 1.95× 收斂與 85% 算力主張。

同一個 World Model 名詞,可能指影片生成、機器人規劃或內部狀態。本文用 3 個零依賴格子世界實驗,建立 observation → state → action-conditioned dynamics → rollout 的判讀框架。

LiteLM 把多供應商 routing 與格式轉換縮進約 3,100 行 Python,但它不是完整 Gateway。本文用本機 contract tests、故障注入與 trace 收據,教你判斷何時能用、何時要補 Proxy 與控制面。

Dario Amodei 在研究員離職風波後提出 AI 減速三步驟:嵌入式第三方評估、民主國家協調與全球協調。本文逐條查證資安事件與能力預測,分析這套煞車機制真正能做什麼、又會在哪裡失靈,也檢驗外部評估員的獨立性、反壟斷風險,以及承諾是否落地的四個訊號。

Anthropic 表示,多數精選網攻案例已由 AI 直接執行或協調;同一節更列出約 200 家下游組織、2,100 多組 Azure AD token 與 34 小時操作。這些數字能信多少?真正該改的防線是什麼?

研究者把 RubyGems 五月套件洪水、RubyDoc 程式碼執行與 API key 探測連到 OpenAI agents;官方承認使用平台,卻未確認完整攻擊鏈。本文逐層核對哪些已證實、哪些仍是推論。