跳到主要內容
← AI

AI 模型與研究 13

所有文章 · 第 13 頁

AI 模型與研究
h3-metal 把 MiniMax-H3 搬上 Apple Silicon:突破與代價(2026)

h3-metal 讓 MiniMax H3-Base 改走 Apple Silicon 原生 Metal。深入拆解 FL2VA/Ref2VA、SSD 串流、真實儲存與記憶體代價、外部效能訊號,以及 H3 Community License 的地區限制。

最後更新:2026年8月12日
AI 模型與研究
GPT-5.6-Cyber 是什麼?95% 回應率、V8 漏洞鏈與 Daybreak 受控存取(2026)

OpenAI 以 Daybreak Red 受控推出 GPT-5.6-Cyber,內部回應完成率達 95%,並稱協助找出 V8 零日漏洞。本文拆解 CVE-2026-15903 的獨立證據、模型反而輸給 Sol 的評測,以及受控存取真正要解的風險。

最後更新:2026年8月12日
AI 模型與研究
加密推理軌跡被讀出:作者稱原解碼方法已失效,風險仍在哪?(2026)

研究者曾在 Anthropic、OpenAI、Google API 重播並讀出加密推理軌跡;論文也明載 Figure 1 原解碼方法揭露後已失效。本文拆解機制、PII 數字與仍待確認的風險。

最後更新:2026年8月13日
AI 模型與研究
Claude 黎曼 ζ 函數研究:67.25% 的真正突破,不是解出黎曼假設(2026)

Anthropic 公布未發布研究版 Claude 的黎曼 ζ 函數手稿,主張把「單零點且位於臨界線」的無條件漸近下界推至 67.25%。本文拆解真正新意、Lean 形式化與仍待完成的外部審查。

最後更新:2026年8月13日
AI 模型與研究
Meta Muse Glimmer 30B 正式釋出:24GB 本機 Agent,82% 幻覺率怎麼看?(2026)

Meta 正式釋出 Muse Glimmer 30B 的 BF16 與兩套量化權重,讓 24GB/32GB 消費級硬體有機會跑多模態本機 Agent。本文核對 Apache 2.0、實際檔案、工具呼叫、獨立 Agent 評測與 AA-Omniscience 82% 幻覺率,說清楚它為何是有價值的本機工作模型,卻不是通用...

最後更新:2026年8月12日
AI 模型與研究
AgentOPSD 是什麼?遞迴信用分配能找出 Agent 關鍵步驟嗎?(2026)

AgentOPSD 用 teacher/student token 對數機率差遞迴重加權多步 Agent。本文拆解 89.1% ALFWorld、因果限制與程式碼尚未公開現況。

最後更新:2026年8月9日
AI 模型與研究
Grok Imagine Image 2.0 正式上線:可編輯工作流補齊,但「雙榜第二」怎麼看?(2026)

Grok Imagine Image 2.0 整合區域編輯、背景移除、Smart Resize 與最多五張參考圖。Arena 雙榜第二是真的,但還不能替正式工作流背書。

最後更新:2026年8月9日
AI 模型與研究
WeatherNext Cyclones 開源:DeepMind 把氣旋路徑、強度、風圈放進同一套 AI(2026)

DeepMind 公開 WeatherNext Cyclones 程式碼與模型權重,同一套系統預測氣旋路徑、強度與風圈。本文深讀 Nature 論文,核對「多一天」歷史回測、2025 年 NHC 即時證據、硬體與開源限制,並提出下一季該看的驗證指標。

最後更新:2026年8月9日
AI 模型與研究
Prime Intellect 多代理 RL:Self-play、Agent Judge 真正開放了什麼?(2026)

Prime Intellect 多代理 RL 讓 self-play、Agent Judge 與 User Simulation 的完整 episode 直接進入訓練。本文拆解 single-policy 架構、credit assignment 與這次發布尚未證明的模型品質。

最後更新:2026年8月9日