AI 模型與研究 第 2 頁
所有文章 · 第 2 頁

Anthropic 表示 Claude 已主導 26% 的內部 AI 研發工作。本文拆解自動化指數、30,000 個 Agent、59% 評分一致率與 METR 反例,判讀這項內部量測真正代表什麼。

Bonsai 2 27B 把 27B 語言模型壓到 5.95GB,卻不代表 6GB 裝置就能日用。本文拆解三元權重、98.2% 官方 benchmark、runtime 限制與 12 題驗收法。

Infinite-Parameter LLM 把即時資料轉成可重用的低秩權重。本文用玩具實驗比較長 Prompt、RAG 與 LoRA,拆解論文證據、限制與部署判斷。

NVIDIA 宣稱 AI Agent 已把 TileGym 24 個 Operator、約 40 個 GPU Kernel 轉成 CUDA Rust,平均達 cuTile Python...

Rohan Bansal 用 SFT、Agentic RL 與 PostgreSQL 執行回饋訓練 4B 模型,報告在 113 道查詢把加總延遲降 44.7%。本文拆解真正勝出的系統、量測限制與上線前五道門。

Dream-RSI 改的是探索 policy,不是模型權重。本文用 20 棵合成 Agent trace tree 拆解零模型重跑的 Replay Simulator,並以 tune/holdout 示範分支、平行與停止規則遇到跨分布偏移時的失效風險。

Periodic Neon 在內部 XRD 評測把成功率從 2.7% 拉到 55.3%。拆解 134 個樣本、專用 Harness、LLM 裁判、成本假設與留出測試,判斷這項科學 AI 成果真正證明了什麼。

Gemini 3.8 Live 主打工具背景執行、語音進度回報與即時視覺。本文核對 Google 官方文件、Artificial Analysis 榜單、原始評測方法與價格,拆解「工具在跑時還能說話」的真正突破,以及任務完成、取消副作用、Live API Preview 與總成本仍未解的邊界。

Jev AI 宣稱以 70–500 毫秒輸出型別化決策,每百萬輸入 token 只要 0.042 美元。本文深讀 TypeSafe 發表與 workflow eval,拆解速度、成本、正確率及「不會 hallucinate」的證據邊界,並提出 early access 階段真正該測的機率校準、延遲與失敗路徑。