AI 模型與研究 第 7 頁
所有文章 · 第 7 頁

Muse Spark 1.3 要不要換?本篇拆開模型、Muse Code harness、reasoning level 與 Standard/Contributor,教你用固定 repo 任務算出真正完成成本。

Gemini 3.8 Flash 兼具高速與更強 agentic 表現,但高推理設定的每項任務成本反而比 3.7 Flash 高約 40%。本文拆解 Google 跑分、token 經濟、Flash Cyber 存取邊界與團隊遷移方法。

OpenAI Astra 被公司依自家框架列為首個 Critical 資安模型,並自報 ExploitBench 100% 與兩個零日漏洞。本文拆解 benchmark 分母、受控存取與仍待外部驗證的證據。

Claude Fable 5.1 在 Terminal-Bench-Science 0.1 的 Anthropic 內部測試大幅提升,Mythos 5.1 則採可信任存取。本文重讀 benchmark、成本、科研案例與系統卡,判斷結果能否泛化。

Runway Solaris 讓世界模型逐幀生成互動介面。本文拆解它的運作、內部評測矛盾,以及像素能否取代傳統 UI 程式碼。

DeepSeek V4 Flash Vision 在 API 上線十天後公開約 305B、168GB 權重。本文拆解 MIT 授權、視覺架構、83.9/27.3 benchmark 的證據邊界,以及自架部署真正面對的硬體與 runtime 門檻。

49B active 不代表只需載入 49B。先判斷 213.66 GiB STQ 或 435.20 GiB Q4 是否值得下載,再完成 patched llama.cpp、checksum、chat template 與固定 10 題盲測。

Tencent Hy4 Preview 以 Apache-2.0 公開近 780B 權重,主打 1M context 與 49B active。本文拆解部署成本、內部 benchmark、自我改進主張與 Preview 限制。

Anthropic 讓 Claude 自動搜尋 10 種對齊失敗的修法,最佳方法勝過一次性人類提案,並轉移到更大模型。本文拆解實驗設計、能力代價、Petri 限制與「AI 勝過研究員」比較真正量到的東西。