跳到主要內容
← AI

AI 模型與研究 2

所有文章 · 第 2 頁

AI 模型與研究
Claude 主導 AI 研發 26%?Anthropic 內部指數真正量到什麼(2026)

Anthropic 表示 Claude 已主導 26% 的內部 AI 研發工作。本文拆解自動化指數、30,000 個 Agent、59% 評分一致率與 METR 反例,判讀這項內部量測真正代表什麼。

最後更新:2026年9月19日
AI 模型與研究
【2026 最新】Bonsai 2 27B 完整解析:5.9GB 真能保留 98.2% 能力?(含硬體預算+安裝+12 題驗收)

Bonsai 2 27B 把 27B 語言模型壓到 5.95GB,卻不代表 6GB 裝置就能日用。本文拆解三元權重、98.2% 官方 benchmark、runtime 限制與 12 題驗收法。

最後更新:2026年9月18日
AI 模型與研究
【2026 最新】Infinite-Parameter LLM 是什麼?新知寫進權重 vs RAG/長 Prompt

Infinite-Parameter LLM 把即時資料轉成可重用的低秩權重。本文用玩具實驗比較長 Prompt、RAG 與 LoRA,拆解論文證據、限制與部署判斷。

最後更新:2026年9月18日
AI 模型與研究
CUDA Rust:AI 翻譯 24 個 GPU Operator,99.5% 效能代表什麼?(2026)

NVIDIA 宣稱 AI Agent 已把 TileGym 24 個 Operator、約 40 個 GPU Kernel 轉成 CUDA Rust,平均達 cuTile Python...

最後更新:2026年9月18日
AI 模型與研究
AI 查詢最佳化 QORL 實驗解讀:113 道查詢加總延遲少 44.7%(2026)

Rohan Bansal 用 SFT、Agentic RL 與 PostgreSQL 執行回饋訓練 4B 模型,報告在 113 道查詢把加總延遲降 44.7%。本文拆解真正勝出的系統、量測限制與上線前五道門。

最後更新:2026年9月18日
AI 模型與研究
【2026 最新】Dream-RSI 是什麼?20 棵 Trace 零重跑 Replay Simulator

Dream-RSI 改的是探索 policy,不是模型權重。本文用 20 棵合成 Agent trace tree 拆解零模型重跑的 Replay Simulator,並以 tune/holdout 示範分支、平行與停止規則遇到跨分布偏移時的失效風險。

最後更新:2026年9月17日
AI 模型與研究
Periodic Neon 把實驗室變成訓練場:55.3% 科學分析成績證明了什麼?(2026)

Periodic Neon 在內部 XRD 評測把成功率從 2.7% 拉到 55.3%。拆解 134 個樣本、專用 Harness、LLM 裁判、成本假設與留出測試,判斷這項科學 AI 成果真正證明了什麼。

最後更新:2026年9月17日
AI 模型與研究
Gemini 3.8 Live:工具在跑時還能說話,真的更可靠嗎?(2026)

Gemini 3.8 Live 主打工具背景執行、語音進度回報與即時視覺。本文核對 Google 官方文件、Artificial Analysis 榜單、原始評測方法與價格,拆解「工具在跑時還能說話」的真正突破,以及任務完成、取消副作用、Live API Preview 與總成本仍未解的邊界。

最後更新:2026年9月17日
AI 模型與研究
Jev AI 把判斷變成軟體原語:TypeSafe 的速度與證據邊界(2026)

Jev AI 宣稱以 70–500 毫秒輸出型別化決策,每百萬輸入 token 只要 0.042 美元。本文深讀 TypeSafe 發表與 workflow eval,拆解速度、成本、正確率及「不會 hallucinate」的證據邊界,並提出 early access 階段真正該測的機率校準、延遲與失敗路徑。

最後更新:2026年9月17日