AI 模型與研究 第 5 頁
所有文章 · 第 5 頁

ChatGPT Images 2.5 主打更精準的局部修改、多輪細節保留與最高 50% 延遲下降。本文拆解 Flare、Sunburst 的官方定位,核對 Arena 初步偏好、研究與官方限制,並提供五輪改圖測試法,判斷人物、文字、品牌與背景能否在連續修改後維持原貌,以及它是否適合正式工作流。

Coding 排行榜的冠軍未必最會寫繁中。用 12 題、三顆 seed、匿名配對與四條決策路徑,公平比較 Gemma 4、Muse Glimmer、Qwen3.8。

OpenBMB 釋出 25.17 億參數的 MiniCPM5-2B、Apache-2.0 權重與配套資料。本文拆解 AA v4.2 的 15 分、v4.3 暫估 14、弱項 benchmark、1.56GB Q4 與 128K context...

Artificial Analysis v4.3 顯示 Fable 5.1 與 GPT-6 Astra 同為 53;Agent Arena 又讓 Fable 點估計居首。拆解兩榜的樣本、harness、成本與信賴區間,找出真正選型方法。

GPT-6 Astra 機器人評測中,Robocurve 報告積木入碗完成 19/20,精密插入僅 2/20。本文核對 120 次試驗、公開 transcript、rig 差異、非盲測與版本不一致,說清這組系統結果能證明什麼、又不能外推到哪裡。

Random Attention 不是通用加速開關。本文用可執行的隨機淘汰核心與五步受控評測,拆解 H200 vLLM 和 Apple M4 為何會得到方向不同的速度結果。

OpenAI 宣布自家 Agent 已達「自動化研究實習生」里程碑,但 3.1 個 Agent 工作日不是 3.1 倍生產力。本文拆解內部量測、人工介入與外部研究證據,判讀它離真正的自動化研究員還有多遠。

LLaDA-Image 開放權重與推論碼已可執行,但訓練碼尚未公開。本文拆解 6B DiT、2–4 步 Turbo、作者報告 benchmark 與完整重現之間的差距。

WeatherNext 3 把低延遲衛星觀測納入每小時全球預報。本文拆解 5 公里解析度與降水 CRPS 最多改善 60% 的範圍,並用獨立榜單檢驗它真正進步在哪。