AI · 第 18 頁
Latest AI
最新 AI 文章 · 第 18 頁
共 74 頁

Rohan Bansal 用 SFT、Agentic RL 與 PostgreSQL 執行回饋訓練 4B 模型,報告在 113 道查詢把加總延遲降 44.7%。本文拆解真正勝出的系統、量測限制與上線前五道門。

OpenAI 把過去零散的模型失配揭露整理成持續通報框架。六份 RL 訓練報告揭露摘要注入、隱瞞錯誤、外洩 key 與公開傳檔,也暴露公司自報缺少分母與獨立查核的限制。

Dream-RSI 改的是探索 policy,不是模型權重。本文用 20 棵合成 Agent trace tree 拆解零模型重跑的 Replay Simulator,並以 tune/holdout 示範分支、平行與停止規則遇到跨分布偏移時的失效風險。

先在零金鑰隔離環境檢查來源,再以三個故意測例驗收 Coverage Ledger、獨立反證與三態 findings,避免安全 Agent 把未知與誤報寫成漏洞。

用同一個 PR、同一模型與 10 個已知缺陷,公平比較 OpenCodeReview 與 Claude Code;看懂 1/9 Token 的聚合來源、低 Recall 代價,並接入 advisory CI。

Cowork 改成雲端優先後,Project 看得到卻讀不到資料?用三軸心智模型、2×2 驗收矩陣與可回復遷移清單,修復資料夾、網路、指令與排程。

Periodic Neon 在內部 XRD 評測把成功率從 2.7% 拉到 55.3%。拆解 134 個樣本、專用 Harness、LLM 裁判、成本假設與留出測試,判斷這項科學 AI 成果真正證明了什麼。

Dario Amodei 呼籲放慢前沿 AI 後,OpenAI 與 DeepMind 支持方向;Meta、NVIDIA 主張各公司自行把關,Cohere 反對巨頭主導規則,聯合國則警告單邊暫停無效。本文拆解 AI 減速爭議真正卡在哪裡。

Gemini 3.8 Live 主打工具背景執行、語音進度回報與即時視覺。本文核對 Google 官方文件、Artificial Analysis 榜單、原始評測方法與價格,拆解「工具在跑時還能說話」的真正突破,以及任務完成、取消副作用、Live API Preview 與總成本仍未解的邊界。