跳到主要內容
← AI

AI 模型與研究 6

所有文章 · 第 6 頁

AI 模型與研究
Claude 形式化費馬大定理:Lean 驗證了什麼、又沒驗證什麼?(2026)

Claude 用 11 天關閉費馬大定理的 Prove2Me 證明樹,完整重查在接下來兩天完成。本文拆解公開 Lean artifact、Comparator 與 Kevin Buzzard 的獨立成品檢查,說清楚這項成果驗證了什麼,又沒有驗證什麼。

最後更新:2026年9月5日
AI 模型與研究
K2 Horizon 深度解讀:六模型已開,完整訓練堆疊到齊了嗎?(2026)

K2 Horizon 一次公開六個尺寸,但 32B 仍是 Stage1,完整訓練程式碼與 logs 尚未到齊。本文查核 MoVA、Uno、benchmark 與 reward hacking,判斷這是完整開放,還是尚待履約的路線圖。

最後更新:2026年9月4日
AI 模型與研究
【2026 最新】K2 Horizon 本機選型:0.9B、7B、36B-A4B 怎麼選?

依第一方 BF16 GGUF 檔案與 runtime 支援,拆解 K2 Horizon 0.9B、7B、32B、36B-A4B 怎麼選,附 pinned revision 安裝、10 題 Eval 與升級判準。

最後更新:2026年9月4日
AI 模型與研究
World Labs Atlas 深度解讀:鏡頭可控,等於懂物理嗎?(2026)

World Labs Atlas 用同一模型處理鏡頭控制與 3D 重建,並協助 Real-to-Sim 工作流。本文拆解 1440p 一分鐘展示、兩三張圖重建與 benchmark,判斷它離可信物理模擬還差什麼。

最後更新:2026年9月4日
AI 模型與研究
GPT-6 Astra 是 AGI 嗎?OpenAI 自評與獨立跑分落差(2026)

GPT-6 Astra 正式發布,OpenAI 自評 OSWorld、ExploitBench 與 ARC-AGI 高分,獨立評測卻顯示綜合智力與前代接近。本文拆解 harness、成本與 AGI 宣稱。

最後更新:2026年9月4日
AI 模型與研究
Repo-To-Skill 深度解讀:模型不動,MLE 成績翻倍?(2026)

Repo-To-Skill 作者報告固定 GPT-5.5 與 Codex 後,MLE-bench 成績由 31.11% 升至 72.89%。本文拆解 DisCo、5,353 個 skills、前置建置成本與證據邊界。

最後更新:2026年9月4日
AI 模型與研究
【2026 最新】Gemini 3.8 Flash 升級:3 任務、18 格 effort 回歸工作表

升級 Gemini 3.8 Flash 前,先用三張固定 fixture 卡與 18 格 effort 回歸工作表,逐次保存模型版本、token、延遲與驗收 receipt,再為程式修補、文件抽取、工具呼叫各選一列路由。

最後更新:2026年9月3日
AI 模型與研究
DISCOVER 符號結構:神經網路向量裡真的有符號嗎?(2026)

DISCOVER 將人類指定的角色—內容結構擬合到神經表徵;在 GPT-OSS 的受控任務中,替換與介入多半保留或按預期改變行為。本文拆解七模型與單模型證據、0.903 因果結果,以及為何這不等於整個 LLM 被還原。

最後更新:2026年9月3日
AI 模型與研究
Gemini Agentic Video:Google 自測最高省 88% Token,7% 怎麼算?(2026)

Google 讓 Gemini 對長影片先搜尋再細看。本文拆解自測最高省 88% Token、降低 66% 成本與約 7% 相對準確度增幅的條件,並說明 static/agentic 的選擇與驗收。

最後更新:2026年9月3日