跳到主要內容

AI · 第 18 頁

Latest AI

最新 AI 文章 · 第 18 頁

共 74 頁

AI 模型與研究
AI 查詢最佳化 QORL 實驗解讀:113 道查詢加總延遲少 44.7%(2026)

Rohan Bansal 用 SFT、Agentic RL 與 PostgreSQL 執行回饋訓練 4B 模型,報告在 113 道查詢把加總延遲降 44.7%。本文拆解真正勝出的系統、量測限制與上線前五道門。

最後更新:2026年9月18日
AI 產業與治理
OpenAI 模型失配通報框架:六份 Agent 個案證明了什麼?(2026)

OpenAI 把過去零散的模型失配揭露整理成持續通報框架。六份 RL 訓練報告揭露摘要注入、隱瞞錯誤、外洩 key 與公開傳檔,也暴露公司自報缺少分母與獨立查核的限制。

最後更新:2026年9月18日
AI 模型與研究
【2026 最新】Dream-RSI 是什麼?20 棵 Trace 零重跑 Replay Simulator

Dream-RSI 改的是探索 policy,不是模型權重。本文用 20 棵合成 Agent trace tree 拆解零模型重跑的 Replay Simulator,並以 tune/holdout 示範分支、平行與停止規則遇到跨分布偏移時的失效風險。

最後更新:2026年9月17日
AI Agent 與開發
【2026 最新】Cloudflare Security Audit Skill 教學:用 3 個測例驗收六階段 Agent 審計

先在零金鑰隔離環境檢查來源,再以三個故意測例驗收 Coverage Ledger、獨立反證與三態 findings,避免安全 Agent 把未知與誤報寫成漏洞。

最後更新:2026年9月17日
AI Agent 與開發
【2026 最新】OpenCodeReview 教學:同一個 PR 驗證 1/9 Token 與低 Recall

用同一個 PR、同一模型與 10 個已知缺陷,公平比較 OpenCodeReview 與 Claude Code;看懂 1/9 Token 的聚合來源、低 Recall 代價,並接入 advisory CI。

最後更新:2026年9月17日
AI 工具與應用
【2026 最新】Claude Cowork 雲端 vs 本機:Projects 資料夾、網路與排程救援教學

Cowork 改成雲端優先後,Project 看得到卻讀不到資料?用三軸心智模型、2×2 驗收矩陣與可回復遷移清單,修復資料夾、網路、指令與排程。

最後更新:2026年9月17日
AI 模型與研究
Periodic Neon 把實驗室變成訓練場:55.3% 科學分析成績證明了什麼?(2026)

Periodic Neon 在內部 XRD 評測把成功率從 2.7% 拉到 55.3%。拆解 134 個樣本、專用 Harness、LLM 裁判、成本假設與留出測試,判斷這項科學 AI 成果真正證明了什麼。

最後更新:2026年9月17日
AI 產業與治理
AI 減速爭議:科技巨頭分裂,聯合國為何說單邊暫停不夠?(2026)

Dario Amodei 呼籲放慢前沿 AI 後,OpenAI 與 DeepMind 支持方向;Meta、NVIDIA 主張各公司自行把關,Cohere 反對巨頭主導規則,聯合國則警告單邊暫停無效。本文拆解 AI 減速爭議真正卡在哪裡。

最後更新:2026年9月17日
AI 模型與研究
Gemini 3.8 Live:工具在跑時還能說話,真的更可靠嗎?(2026)

Gemini 3.8 Live 主打工具背景執行、語音進度回報與即時視覺。本文核對 Google 官方文件、Artificial Analysis 榜單、原始評測方法與價格,拆解「工具在跑時還能說話」的真正突破,以及任務完成、取消副作用、Live API Preview 與總成本仍未解的邊界。

最後更新:2026年9月17日