跳到主要內容
← AI

AI 模型與研究 5

所有文章 · 第 5 頁

AI 模型與研究
ChatGPT Images 2.5 深度分析:局部改圖,能保留原貌嗎?(2026)

ChatGPT Images 2.5 主打更精準的局部修改、多輪細節保留與最高 50% 延遲下降。本文拆解 Flare、Sunburst 的官方定位,核對 Arena 初步偏好、研究與官方限制,並提供五輪改圖測試法,判斷人物、文字、品牌與背景能否在連續修改後維持原貌,以及它是否適合正式工作流。

最後更新:2026年9月9日
AI 模型與研究
【2026 最新】本機 LLM 繁中創作盲測:Gemma 4 vs Muse Glimmer vs Qwen3.8 怎麼公平選?

Coding 排行榜的冠軍未必最會寫繁中。用 12 題、三顆 seed、匿名配對與四條決策路徑,公平比較 Gemma 4、Muse Glimmer、Qwen3.8。

最後更新:2026年9月8日
AI 模型與研究
MiniCPM5-2B 開放權重:2B 小模型的 Agent 成績可信嗎?(2026)

OpenBMB 釋出 25.17 億參數的 MiniCPM5-2B、Apache-2.0 權重與配套資料。本文拆解 AA v4.2 的 15 分、v4.3 暫估 14、弱項 benchmark、1.56GB Q4 與 128K context...

最後更新:2026年9月8日
AI 模型與研究
Fable 5.1 vs GPT-6 Astra:兩張 AI 榜單為何不能直接比?(2026)

Artificial Analysis v4.3 顯示 Fable 5.1 與 GPT-6 Astra 同為 53;Agent Arena 又讓 Fable 點估計居首。拆解兩榜的樣本、harness、成本與信賴區間,找出真正選型方法。

最後更新:2026年9月8日
AI 模型與研究
GPT-6 Astra 機器人評測:19/20 到 2/20 的能力斷層(2026)

GPT-6 Astra 機器人評測中,Robocurve 報告積木入碗完成 19/20,精密插入僅 2/20。本文核對 120 次試驗、公開 transcript、rig 差異、非盲測與版本不一致,說清這組系統結果能證明什麼、又不能外推到哪裡。

最後更新:2026年9月8日
AI 模型與研究
【2026 最新】Random Attention 是什麼?動手做 KV Cache 隨機淘汰評測

Random Attention 不是通用加速開關。本文用可執行的隨機淘汰核心與五步受控評測,拆解 H200 vLLM 和 Apple M4 為何會得到方向不同的速度結果。

最後更新:2026年9月7日
AI 模型與研究
OpenAI 自動化 AI 研究實習生:3.1 Agent 工作日等於研究加速?(2026)

OpenAI 宣布自家 Agent 已達「自動化研究實習生」里程碑,但 3.1 個 Agent 工作日不是 3.1 倍生產力。本文拆解內部量測、人工介入與外部研究證據,判讀它離真正的自動化研究員還有多遠。

最後更新:2026年9月7日
AI 模型與研究
LLaDA-Image 開放權重:2–4 步生圖,離完整開放還差什麼?(2026)

LLaDA-Image 開放權重與推論碼已可執行,但訓練碼尚未公開。本文拆解 6B DiT、2–4 步 Turbo、作者報告 benchmark 與完整重現之間的差距。

最後更新:2026年9月6日
AI 模型與研究
WeatherNext 3:衛星每小時進預報,5 公里與 60% 該怎麼讀?(2026)

WeatherNext 3 把低延遲衛星觀測納入每小時全球預報。本文拆解 5 公里解析度與降水 CRPS 最多改善 60% 的範圍,並用獨立榜單檢驗它真正進步在哪。

最後更新:2026年9月6日