跳到主要內容

追技術前沿

AI 模型與研究

用證據判讀 AI 模型、研究突破與技術限制。

模型發布與研究論文常被濃縮成一個分數或一句宣傳;這裡把架構、資料、Benchmark 與限制放回完整脈絡。

你可以用可核對的證據理解新模型真正改善了什麼、成本如何,以及哪些能力仍未被證明。

從這裡開始

所有文章

AI 模型與研究
Cursor Mixture-of-Kittens:開源 MoE megakernel 的 2.37× 真相(2026)

Cursor 開源 Mixture-of-Kittens,把 MoE 跨 GPU 通訊與專家計算壓進 Blackwell NVL72 megakernel。本文拆解 2.37× 廠商自測、Apache-2.0 程式碼與 SM103 限制,判斷它是通用突破,還是高度專用的系統工程。

最後更新:2026年8月6日
AI 模型與研究
Qwen3.8-Max 成為模型發布潮焦點|2.4 兆總參數、低價 API 與開放權重承諾(2026)

Qwen3.8-Max 已上線 QwenCloud API,官方稱 2.4 兆總參數、95B active 與 1M context;Max 權重預告下週公開,27B 也將開放權重但未明定時間。本文核對價格、benchmark 與長任務證據。

最後更新:2026年8月5日
AI 模型與研究
NVIDIA Alpamayo 2 Super 開放商用:34B 自駕模型真正開放了什麼?(2026)

NVIDIA 正式開放 Alpamayo 2 Super 權重與商業使用。從 34B 架構、OpenMDW 授權、資料限制到 H100 與 benchmark,完整判讀它真正降低了什麼門檻,又有哪些安全問題尚未被回答。

最後更新:2026年8月5日
AI 模型與研究
Opus 5 生成《魔戒》3D 世界:Karpathy 的長時程 Coding Agent 實驗(2026)

Karpathy 自述給 Opus 5《魔戒》開場、約 100 萬 token 任務預算,約兩小時後得到一個程序化 3D 世界。公開 source 證明了什麼,又為何仍不是可重現 benchmark?

最後更新:2026年8月3日
AI 模型與研究
OpenAI Astra 數學成果:十項論證,Lean 證書證明了什麼?(2026)

OpenAI 公布 Astra 產生的十項數學與理論資工論證、249 頁手稿與 Lean 證書。本文逐項拆解 OpenAI Astra 數學成果,釐清形式驗證、2,000 美元成本與外部審查的真正邊界。

最後更新:2026年8月3日
AI 模型與研究
Seedance 2.5 深度解讀:生成影片走向可反覆編輯的製作流程(2026)

ByteDance 推出 Seedance 2.5,把 30 秒音視訊、多素材引用、延伸與時間戳修改組成可迭代介面。本文拆解官方展示、API 狀態與物理、多角色限制,判斷它離真正製作工作流還差哪些驗收指標。

最後更新:2026年8月3日
AI 模型與研究
MiniMax H3 開放權重:33B Transformer 聲畫同生,但完整系統仍未全開(2026)

MiniMax H3 開放權重已在 Hugging Face 上線。33B 單流 Transformer 可同步生成聲畫,但完整部署還需 Qwen3-VL-32B encoder,Context-IR、2K 再生成與稀疏注意力也尚未隨權重公開;本文同時拆解授權與單張 RTX 5090 的真實條件。

最後更新:2026年8月5日
AI 模型與研究
Inkling-Small 完整權重釋出:12B active 真的追上 975B Inkling?(2026)

Thinking Machines 釋出 Inkling-Small 完整權重。本文核對 276B/12B active、1M context、公開與內部 benchmark、近 500 GiB 權重及授權限制,判斷它是否真的追上 975B Inkling。

最後更新:2026年8月2日
AI 模型與研究
DeepSeek V4 Flash 0731:後訓練把開放權重 Agent 性價比再推一步(2026)

DeepSeek V4 Flash 0731 沿用同一核心架構,AA 指數卻從 40 升至 50。本文拆解未公開 Harness、MIT 權重、1M context、API 成本與 84% 幻覺率的正確分母,判斷它何時真的能降低 Agent 成功任務成本。

最後更新:2026年8月3日