AI 模型與研究 第 9 頁
所有文章 · 第 9 頁

排行榜較高,不代表新模型已取代你的工作。用 12 題私有 Eval 與真實重抓驗證,決定舊模型該保留、冷封存、改為重抓,或永久刪除。

Qwen3.8-Flash-Next 不是 6B 小模型,而是 Qwen4 架構預覽。本文拆解約 180B 儲存權重、QSA、262K/1M Context,並查證第三方端點速度、輸出成本、授權與 runtime 成熟度。

Apodex 1.1 這波發布涵蓋完整託管版本(官方模型文件標示 397B)、35B Mini 開放權重與 FrontierAgent。本文拆解長任務設計、作者自報 benchmark,以及「Mini 追上前沿」仍需補上的證據。

Z.ai 正式揭曉 Ox Alpha 就是 GLM-5.3-Flash。從 320B/18B 架構、MIT 權重、1M context、獨立評測到 API 與自架成本,本文拆解它改寫了什麼,又沒有改寫什麼。

M5 Ultra 本機 AI 能靠 512GB 與 1.2TB/s 在桌面跑數千億參數模型嗎?本文深讀 Apple M6/M5 Ultra 發表,核對 M3 Ultra 前例、真實模型尺寸與第三方測試,說清楚容量、頻寬、首 token 與生成速度為何不能混為一談。

OpenAI Jalapeño 首測自報 1.5–1.9 倍峰值每瓦 mixed-token 吞吐、1.7–3.6 倍更低端到端延遲。本文拆解 InferenceX 條件、SemiAnalysis 見證範圍、AgentX 缺口與 NVIDIA 影響。

GLM-5.3 Fire HD Root 案例裡,一台 Fire HD、四個模型與作者自述的 266 美元,最後形成約八小時的模型接力。本文核對 CVE、Git、韌體與安全護欄,說清楚這個案例真正證明了什麼。

NVIDIA 宣布 Groq 3 LPX 機櫃系統全面量產,Artificial Analysis 量得 Gemma 4 31B 在 100K Context 達 3,431 output tokens/s。本文拆解...

Marin 535B-A23B 已在 11 套 GB200 NVL72 上啟動公開 MoE 訓練。本文核對 18T/18.75T token 差異、scaling ladder 失敗、W&B 即時紀錄與資料存取缺口,判斷這場實驗現在能證明什麼、還不能證明什麼。