跳到主要內容
← AI

AI 模型與研究 4

所有文章 · 第 4 頁

AI 模型與研究
【2026 最新】Next Concept Prediction 是什麼?零基礎搞懂 NCP-ArchPreview,和 NTP 差在哪(新手白話篇)

NCP 不是神經細胞自動機。這篇從零拆解 Next Concept Prediction 的三段架構、連續概念目標、VQ 支線與 8.94B checkpoint,並教你正確解讀 1.95× 收斂與 85% 算力主張。

最後更新:2026年9月13日
AI 模型與研究
【2026 最新】Mercury 2.5 完整解析:1,107 tok/s 何時有用?(速度 × 品質 A/B Test 教學)

Mercury 2.5 的 1,107 tok/s 是未完整公開設定的 generation-throughput 宣稱,不等於公共 API 的首內容或總延遲。本文用 Puter 第三方快照拆解差異,並提供四任務速度 × 品質 A/B Test。

最後更新:2026年9月12日
AI 模型與研究
SWE-2 深度解析:Cognition 的 64% 成本主張,為何碰上 27.3%?(2026)

Cognition 以 Kimi K3 為底推出 SWE-2,聲稱 FrontierCode 成本低 64%。本文拆解多 effort 單次 RL、2.8T/104B 參數真相,以及 Terminal-Bench 4.0 只剩 27.3% 的證據邊界。

最後更新:2026年9月12日
AI 模型與研究
DeepSeek V4.1 Flash:552B 只是骨架,真的超越 Pro 嗎?(2026)

DeepSeek V4.1 Flash 宣稱用 8B/16B 活躍參數、1M context 與更小 KV cache 超越 V4 Pro。拆解 552B 骨架、196B Engram、MIT 開放權重與尚待第三方驗證的效能邊界。

最後更新:2026年9月11日
AI 模型與研究
Claude 資安事件:四起真實越界,為何不等於「AI 覺醒」(2026)

Anthropic 揭露四起 Claude 資安事件:模型在第三方資安評估中連到未授權真實系統。本文拆解七次長軌跡、4.81 億份逐字稿稽核與模擬重跑,說明外層控制失效如何放大任務執著,也分清這些證據不能推出一般部署事故率、獨立惡意目標或「AI 覺醒」。

最後更新:2026年9月10日
AI 模型與研究
【2026 最新】Uno Ψ-Spec 是什麼?Diffusion-Augmented LLM 如何保留 AR 分布、一次驗證多個 Token

Uno 如何用 diffusion LoRA 平行提出 Token,再讓 frozen AR 保留原分布?本文白話拆解 Ψ-Spec、Linear/Tree sampler,並教你分開評測 Uno 同底模機制與 Mercury 2.5 API。

最後更新:2026年9月10日
AI 模型與研究
【2026 最新】METR Time Horizon 是什麼?AI 能做幾小時任務(50%/80% 教學)

METR Time Horizon 的「幾小時」不是 AI 運行時間。用白話讀懂 50%/80% 成功率、對數軸、信賴區間,再用試算表建立個人任務籃。

最後更新:2026年9月9日
AI 模型與研究
AlphaGenome Atlas:90 億變異預測,為何仍不是臨床答案(2026)

Google DeepMind 把約 90 億種 DNA 單字母替換預測做成 AlphaGenome Atlas。從 AVI、DNM1 到外部驗證,本文拆解它真正改變的研究工作,以及仍不能跨過的臨床邊界。

最後更新:2026年9月9日
AI 模型與研究
OpenAI Navier-Stokes 候選解:Lean 形式化與研究信用爭議(2026)

OpenAI 公開 Navier–Stokes 候選解、166 頁手稿與 Lean 程式。本文拆解有外力的 C、D 路線、萬名代理自述、Clay 仍列未解的原因,以及研究信用爭議真正能證明什麼。

最後更新:2026年9月9日