AI 模型與研究 第 6 頁
所有文章 · 第 6 頁

Claude 用 11 天關閉費馬大定理的 Prove2Me 證明樹,完整重查在接下來兩天完成。本文拆解公開 Lean artifact、Comparator 與 Kevin Buzzard 的獨立成品檢查,說清楚這項成果驗證了什麼,又沒有驗證什麼。

K2 Horizon 一次公開六個尺寸,但 32B 仍是 Stage1,完整訓練程式碼與 logs 尚未到齊。本文查核 MoVA、Uno、benchmark 與 reward hacking,判斷這是完整開放,還是尚待履約的路線圖。

依第一方 BF16 GGUF 檔案與 runtime 支援,拆解 K2 Horizon 0.9B、7B、32B、36B-A4B 怎麼選,附 pinned revision 安裝、10 題 Eval 與升級判準。

World Labs Atlas 用同一模型處理鏡頭控制與 3D 重建,並協助 Real-to-Sim 工作流。本文拆解 1440p 一分鐘展示、兩三張圖重建與 benchmark,判斷它離可信物理模擬還差什麼。

GPT-6 Astra 正式發布,OpenAI 自評 OSWorld、ExploitBench 與 ARC-AGI 高分,獨立評測卻顯示綜合智力與前代接近。本文拆解 harness、成本與 AGI 宣稱。

Repo-To-Skill 作者報告固定 GPT-5.5 與 Codex 後,MLE-bench 成績由 31.11% 升至 72.89%。本文拆解 DisCo、5,353 個 skills、前置建置成本與證據邊界。

升級 Gemini 3.8 Flash 前,先用三張固定 fixture 卡與 18 格 effort 回歸工作表,逐次保存模型版本、token、延遲與驗收 receipt,再為程式修補、文件抽取、工具呼叫各選一列路由。

DISCOVER 將人類指定的角色—內容結構擬合到神經表徵;在 GPT-OSS 的受控任務中,替換與介入多半保留或按預期改變行為。本文拆解七模型與單模型證據、0.903 因果結果,以及為何這不等於整個 LLM 被還原。

Google 讓 Gemini 對長影片先搜尋再細看。本文拆解自測最高省 88% Token、降低 66% 成本與約 7% 相對準確度增幅的條件,並說明 static/agentic 的選擇與驗收。