AI 模型與研究 第 4 頁
所有文章 · 第 4 頁

NCP 不是神經細胞自動機。這篇從零拆解 Next Concept Prediction 的三段架構、連續概念目標、VQ 支線與 8.94B checkpoint,並教你正確解讀 1.95× 收斂與 85% 算力主張。

Mercury 2.5 的 1,107 tok/s 是未完整公開設定的 generation-throughput 宣稱,不等於公共 API 的首內容或總延遲。本文用 Puter 第三方快照拆解差異,並提供四任務速度 × 品質 A/B Test。

Cognition 以 Kimi K3 為底推出 SWE-2,聲稱 FrontierCode 成本低 64%。本文拆解多 effort 單次 RL、2.8T/104B 參數真相,以及 Terminal-Bench 4.0 只剩 27.3% 的證據邊界。

DeepSeek V4.1 Flash 宣稱用 8B/16B 活躍參數、1M context 與更小 KV cache 超越 V4 Pro。拆解 552B 骨架、196B Engram、MIT 開放權重與尚待第三方驗證的效能邊界。

Anthropic 揭露四起 Claude 資安事件:模型在第三方資安評估中連到未授權真實系統。本文拆解七次長軌跡、4.81 億份逐字稿稽核與模擬重跑,說明外層控制失效如何放大任務執著,也分清這些證據不能推出一般部署事故率、獨立惡意目標或「AI 覺醒」。

Uno 如何用 diffusion LoRA 平行提出 Token,再讓 frozen AR 保留原分布?本文白話拆解 Ψ-Spec、Linear/Tree sampler,並教你分開評測 Uno 同底模機制與 Mercury 2.5 API。

METR Time Horizon 的「幾小時」不是 AI 運行時間。用白話讀懂 50%/80% 成功率、對數軸、信賴區間,再用試算表建立個人任務籃。

Google DeepMind 把約 90 億種 DNA 單字母替換預測做成 AlphaGenome Atlas。從 AVI、DNM1 到外部驗證,本文拆解它真正改變的研究工作,以及仍不能跨過的臨床邊界。

OpenAI 公開 Navier–Stokes 候選解、166 頁手稿與 Lean 程式。本文拆解有外力的 C、D 路線、萬名代理自述、Clay 仍列未解的原因,以及研究信用爭議真正能證明什麼。