追技術前沿
AI 模型與研究
用證據判讀 AI 模型、研究突破與技術限制。
模型發布與研究論文常被濃縮成一個分數或一句宣傳;這裡把架構、資料、Benchmark 與限制放回完整脈絡。
你可以用可核對的證據理解新模型真正改善了什麼、成本如何,以及哪些能力仍未被證明。
從這裡開始
所有文章

Cursor 開源 Mixture-of-Kittens,把 MoE 跨 GPU 通訊與專家計算壓進 Blackwell NVL72 megakernel。本文拆解 2.37× 廠商自測、Apache-2.0 程式碼與 SM103 限制,判斷它是通用突破,還是高度專用的系統工程。

Qwen3.8-Max 已上線 QwenCloud API,官方稱 2.4 兆總參數、95B active 與 1M context;Max 權重預告下週公開,27B 也將開放權重但未明定時間。本文核對價格、benchmark 與長任務證據。

NVIDIA 正式開放 Alpamayo 2 Super 權重與商業使用。從 34B 架構、OpenMDW 授權、資料限制到 H100 與 benchmark,完整判讀它真正降低了什麼門檻,又有哪些安全問題尚未被回答。

Karpathy 自述給 Opus 5《魔戒》開場、約 100 萬 token 任務預算,約兩小時後得到一個程序化 3D 世界。公開 source 證明了什麼,又為何仍不是可重現 benchmark?

OpenAI 公布 Astra 產生的十項數學與理論資工論證、249 頁手稿與 Lean 證書。本文逐項拆解 OpenAI Astra 數學成果,釐清形式驗證、2,000 美元成本與外部審查的真正邊界。

ByteDance 推出 Seedance 2.5,把 30 秒音視訊、多素材引用、延伸與時間戳修改組成可迭代介面。本文拆解官方展示、API 狀態與物理、多角色限制,判斷它離真正製作工作流還差哪些驗收指標。

MiniMax H3 開放權重已在 Hugging Face 上線。33B 單流 Transformer 可同步生成聲畫,但完整部署還需 Qwen3-VL-32B encoder,Context-IR、2K 再生成與稀疏注意力也尚未隨權重公開;本文同時拆解授權與單張 RTX 5090 的真實條件。

Thinking Machines 釋出 Inkling-Small 完整權重。本文核對 276B/12B active、1M context、公開與內部 benchmark、近 500 GiB 權重及授權限制,判斷它是否真的追上 975B Inkling。

DeepSeek V4 Flash 0731 沿用同一核心架構,AA 指數卻從 40 升至 50。本文拆解未公開 Harness、MIT 權重、1M context、API 成本與 84% 幻覺率的正確分母,判斷它何時真的能降低 Agent 成功任務成本。