跳到主要內容
← AI

AI 模型與研究 7

所有文章 · 第 7 頁

AI 模型與研究
【2026 最新】Muse Spark 1.3 完整解析:值得換嗎?(Muse Code+Reasoning+成本比較)

Muse Spark 1.3 要不要換?本篇拆開模型、Muse Code harness、reasoning level 與 Standard/Contributor,教你用固定 repo 任務算出真正完成成本。

最後更新:2026年9月3日
AI 模型與研究
Gemini 3.8 Flash 深度解讀:同價為何任務成本反升 40%?(2026)

Gemini 3.8 Flash 兼具高速與更強 agentic 表現,但高推理設定的每項任務成本反而比 3.7 Flash 高約 40%。本文拆解 Google 跑分、token 經濟、Flash Cyber 存取邊界與團隊遷移方法。

最後更新:2026年9月3日
AI 模型與研究
OpenAI Astra 自評 Critical:100% ExploitBench、兩個零日漏洞解讀(2026)

OpenAI Astra 被公司依自家框架列為首個 Critical 資安模型,並自報 ExploitBench 100% 與兩個零日漏洞。本文拆解 benchmark 分母、受控存取與仍待外部驗證的證據。

最後更新:2026年9月2日
AI 模型與研究
Claude Fable 5.1/Mythos 5.1 深度解讀:特定科學跑分翻倍,能泛化嗎?(2026)

Claude Fable 5.1 在 Terminal-Bench-Science 0.1 的 Anthropic 內部測試大幅提升,Mythos 5.1 則採可信任存取。本文重讀 benchmark、成本、科研案例與系統卡,判斷結果能否泛化。

最後更新:2026年9月2日
AI 模型與研究
Runway Solaris 深度解讀:介面不寫程式碼,畫面就是軟體?(2026)

Runway Solaris 讓世界模型逐幀生成互動介面。本文拆解它的運作、內部評測矛盾,以及像素能否取代傳統 UI 程式碼。

最後更新:2026年9月2日
AI 模型與研究
DeepSeek V4 Flash Vision 開放權重:305B、168GB 與 benchmark 真相(2026)

DeepSeek V4 Flash Vision 在 API 上線十天後公開約 305B、168GB 權重。本文拆解 MIT 授權、視覺架構、83.9/27.3 benchmark 的證據邊界,以及自架部署真正面對的硬體與 runtime 門檻。

最後更新:2026年9月2日
AI 模型與研究
【2026 最新】Hy4 Preview 本機怎麼跑?先算 214 GiB:GGUF、API 與量化品質決策教學

49B active 不代表只需載入 49B。先判斷 213.66 GiB STQ 或 435.20 GiB Q4 是否值得下載,再完成 patched llama.cpp、checksum、chat template 與固定 10 題盲測。

最後更新:2026年8月31日
AI 模型與研究
Tencent Hy4 Preview 開放權重:1M Context、770B MoE 與盲測怎麼看?(2026)

Tencent Hy4 Preview 以 Apache-2.0 公開近 780B 權重,主打 1M context 與 49B active。本文拆解部署成本、內部 benchmark、自我改進主張與 Preview 限制。

最後更新:2026年8月31日
AI 模型與研究
Claude 自動對齊研究:10 種失敗改善,AI 修法真的勝過人類?(2026)

Anthropic 讓 Claude 自動搜尋 10 種對齊失敗的修法,最佳方法勝過一次性人類提案,並轉移到更大模型。本文拆解實驗設計、能力代價、Petri 限制與「AI 勝過研究員」比較真正量到的東西。

最後更新:2026年8月31日