追技術前沿
AI 模型與研究 第 3 頁
用證據判讀 AI 模型、研究突破與技術限制。
所有文章 · 第 3 頁

Microsoft 用 MAI-Cyber-1-Flash 承接 MDASH 多數資安任務,最難部分才交給 GPT-5.4。本文查核 CyberGym 95.95%、80/90/95% 口徑與成本減半主張。

Black Forest Labs 的 FLUX 3 把影像、影片與音訊共同訓練,FLUX-mimic 再把同一骨幹接上機器人動作。本文拆解 20 秒有聲影片、Audi 現場測試、95% 內部評測,以及它離真正世界模型還有多遠。

Claude Opus 5 把前沿能力拉到 Opus 4.8 的價格,但真正改變工作流的是「驗證、修正、再執行」的代理迴圈。Benchmark 很亮眼,System Card 卻也揭露更高幻覺與過度自信風險。

Fable 被公開署名為 Jacobian Conjecture 三維反例的產生者。本文讀懂 Terence Tao 的推導、兩個可重現的精確證書、GPT‑5.6 的結構解釋與這次 AI 數學突破真正站得住腳的地方。

Moonshot AI 發布 2.8 兆參數的 Kimi K3,官方稱史上最大開源模型、在前端程式碼榜擊敗 Claude Fable 5。但它真的最強嗎?我們逐一查證後給你不吹不貶的獨立判讀。

GLM-5.2 是 Z.ai(智譜)最新的開放權重模型:以 51 分登上 Artificial Analysis 開源第一,真實任務逼平 GPT-5.5,價格只要約 1/6。但它真有那麼強嗎?本文逐一查證獨立評測與原廠自評,並給出公允判讀。

一張 Sean Emory 瘋傳的圖宣稱 GLM 5.2 超越剛被美國下架的 Claude Fable 5。但 GLM 5.2 發表時零 benchmark,圖中數字查無出處,且與真實 HLE 榜單(Fable 5 其實第一)完全相反。AlphaLab...

Anthropic 2026/6/9 推出凌駕 Opus 的「Mythos 級」模型:對外公開的 Claude Fable 5 與解除護欄的 Mythos 5。本文整理能力評測、$10/$50 定價、6/22 免費窗口與三道安全防護,並逐一查證哪些「最強」該打折。

Claude Opus 4.8 來了!2026/5/28 上線的 Anthropic 旗艦模型,SWE-bench Verified 衝上 88.6%、誠實度比 4.7 強 4 倍,還新增便宜 3 倍的 Fast Mode...