跳到主要內容
← AI

AI 模型與研究 10

所有文章 · 第 10 頁

AI 模型與研究
NVIDIA AVO 深度解讀:ARC-AGI-3 公開集 100% 真正證明什麼?(2026)

NVIDIA 回報 AVO 搭配 Claude Opus 5 跑完 ARC-AGI-3 公開 183 關,GPU kernel 特定設定最高領先 10.5%。但公開滿分不是私有評測,30%→100% 也不是受控實驗。本文拆清 Harness 真正證明了什麼。

最後更新:2026年8月23日
AI 模型與研究
Ox Alpha 深度解讀:95/95 GLM 指紋,63% 為何不是完整跑分?(2026)

Ox Alpha 的 95/95 GLM tokenizer 指紋有多強?本文更正「完整 113 題約 63%」的錯置說法,核對 58.4% 公開 run、超過 11 兆七日流量與匿名供應者資料風險。

最後更新:2026年8月24日
AI 模型與研究
Waymo 5nm ASIC 深度解讀:1,000 TOPS 只是系統一角(2026)

Waymo 公開 5nm 客製 ASIC 與車載運算架構。本文拆解 1,000 TOPS、雙運算引擎、13 路相機與異構系統,說清楚哪些是工程進展、哪些仍只是公司自述。

最後更新:2026年8月23日
AI 模型與研究
4DAnyone 深度解讀:一段影片真的能變成自由視角 4D 人物?(2026)

一段未校正的單鏡頭人物影片,真的能變成自由視角 4D 人物嗎?拆解 4DAnyone 的方法、作者數字、公開程式碼與重現缺口。

最後更新:2026年8月22日
AI 模型與研究
Qwen3.8-27B 本機 Agent|80 次工具呼叫證明了什麼?(2026)

Reddit 使用者回報在單張 RTX 3090 上執行量化 Qwen3.8-27B 本機 Agent,80 次工具呼叫後產出大學課表。本文查核模型規格、硬體可行性、harness、重現性與憑證風險,說清楚一次成功真正能證明什麼。

最後更新:2026年8月22日
AI 模型與研究
EnvHarness 是什麼?讓訓練環境追著 AI Agent 弱點改造(2026)

EnvHarness 讓 EnvRigger 分析 AI Agent 的成功與失敗軌跡,再以 wrapper 改造既有訓練環境。本文拆解作者報告的最高 +9.0 個百分點與 SWE-bench Verified 步數少 9.8%,也說清楚成本、負遷移、安全邊界與尚未獨立重現的缺口。

最後更新:2026年8月22日
AI 模型與研究
DeepSeek V4 Flash Vision 深度解析:384 tokens 看得清螢幕嗎?(2026)

DeepSeek V4 Flash Vision 讓 Agent 能直接讀取工具回傳的截圖,但每張圖最高 384 tokens。本文拆解官方 API、Opus-4.8 benchmark、視覺壓縮取捨與實際導入測試方法。

最後更新:2026年8月22日
AI 模型與研究
【2026 最新】DiffusionGemma 是什麼?看懂 256-token Canvas 與本機 A/B Test

DiffusionGemma 如何在 256-token Canvas 從隨機 token 反覆去噪?本篇拆解官方速度與品質數據,並提供可重跑的本機 A/B Test,檢查 TTFT、JSON 與 tool call。

最後更新:2026年8月21日
AI 模型與研究
Ornith-1.5 深度解讀:AI 真的開始「自我改進」了嗎?(2026)

Ornith-1.5 把任務生成、agent scaffold 與解題軌跡放進同一條 RL 訓練迴圈。本文核對三款公開權重與 headline benchmarks,說清楚這項 bounded self-improvement 的突破、證據限制與下一步驗證標準。

最後更新:2026年8月21日