AI 模型與研究 第 10 頁
所有文章 · 第 10 頁

NVIDIA 回報 AVO 搭配 Claude Opus 5 跑完 ARC-AGI-3 公開 183 關,GPU kernel 特定設定最高領先 10.5%。但公開滿分不是私有評測,30%→100% 也不是受控實驗。本文拆清 Harness 真正證明了什麼。

Ox Alpha 的 95/95 GLM tokenizer 指紋有多強?本文更正「完整 113 題約 63%」的錯置說法,核對 58.4% 公開 run、超過 11 兆七日流量與匿名供應者資料風險。

Waymo 公開 5nm 客製 ASIC 與車載運算架構。本文拆解 1,000 TOPS、雙運算引擎、13 路相機與異構系統,說清楚哪些是工程進展、哪些仍只是公司自述。

一段未校正的單鏡頭人物影片,真的能變成自由視角 4D 人物嗎?拆解 4DAnyone 的方法、作者數字、公開程式碼與重現缺口。

Reddit 使用者回報在單張 RTX 3090 上執行量化 Qwen3.8-27B 本機 Agent,80 次工具呼叫後產出大學課表。本文查核模型規格、硬體可行性、harness、重現性與憑證風險,說清楚一次成功真正能證明什麼。

EnvHarness 讓 EnvRigger 分析 AI Agent 的成功與失敗軌跡,再以 wrapper 改造既有訓練環境。本文拆解作者報告的最高 +9.0 個百分點與 SWE-bench Verified 步數少 9.8%,也說清楚成本、負遷移、安全邊界與尚未獨立重現的缺口。

DeepSeek V4 Flash Vision 讓 Agent 能直接讀取工具回傳的截圖,但每張圖最高 384 tokens。本文拆解官方 API、Opus-4.8 benchmark、視覺壓縮取捨與實際導入測試方法。

DiffusionGemma 如何在 256-token Canvas 從隨機 token 反覆去噪?本篇拆解官方速度與品質數據,並提供可重跑的本機 A/B Test,檢查 TTFT、JSON 與 tool call。

Ornith-1.5 把任務生成、agent scaffold 與解題軌跡放進同一條 RL 訓練迴圈。本文核對三款公開權重與 headline benchmarks,說清楚這項 bounded self-improvement 的突破、證據限制與下一步驗證標準。