跳到主要內容
← AI

AI 模型與研究

Start here

從這裡開始

所有文章

AI 模型與研究
【2026 最新】Self-Evolving Search Index 是什麼?20 篇文件玩具實驗

原文件不動,只修訂可檢索 Key:用 20 篇文件 BM25 玩具實驗拆解 SELF-INDEX 的三道 gate、holdout 回歸、過擬合風險與版本化回滾。

最後更新:2026年9月21日
AI 模型與研究
Step 5 Preview:1M Context、44 分與低價 API,真的推進 Pareto Frontier?(2026)

Step 5 Preview 主打 1M context、600B/27B MoE 與低價 API。本文核對 44 分獨立評測、長上下文證據、open weights 承諾與 demo 證據限制,判斷它是否真的推進價格效能邊界。

最後更新:2026年9月21日
AI 模型與研究
DeepSeek-V4.1-Flash 深度分析:百萬 Token Agent 的快取成本真降了嗎?(2026)

DeepSeek-V4.1-Flash 把 global KV cache 壓到每 token 890 bytes,並用 CED、CSA2、FP4 與 Bounded Replay 重寫百萬 token Agent 的服務成本。本文拆解官方證據、限制,以及真正該驗證的端到端指標。

最後更新:2026年9月21日
AI 模型與研究
Qwen-Image-2.1:原生透明圖、33GB 與非商用授權(2026)

Qwen-Image-2.1 把 RGBA 透明度直接納入生成與編輯,視覺核心 7B、完整權重約 33GB。本文拆解十張參考圖、Day-0 支援、廠商 benchmark,以及公開下載但僅限研究評估的授權界線。

最後更新:2026年9月21日
AI 模型與研究
NVIDIA SoL-Pi:少近半 Token,能力守得住嗎?(2026)

NVIDIA SoL-Pi 用四種 agent harness 機制減少 44.7–49.0% token,但 EdgeBench 分數下滑、Terminal-Bench 少解三題。本文完整拆解方法、數據與風險。

最後更新:2026年9月20日
AI 模型與研究
Claude 生物分子模型加速:36 套工具、4.1 倍與 7 萬殘基崩塌(2026)

Anthropic 用不到四週做出 36 套生物分子模型優化;4.1 倍加速只適用哪些測試?萬級 token 成功與 7 萬殘基崩塌又揭露什麼限制?

最後更新:2026年9月20日
AI 模型與研究
【2026 最新】Needle 3 實測:29MB 說法、4/8/20 depth 與 30 題安全驗收

Needle 3 的 29MB 說法成立嗎?本文固定模型與原生 runner,以三個 depth 設定跑完 30 條中英 Tool Calling 測例,檢查 exact match、confidence 與高風險動作,找出可上線與必須停下來確認的邊界。

最後更新:2026年9月19日
AI 模型與研究
Qwen3.8-Omni-Flash:長影音成為 Agent 輸入,真正突破在哪?(2026)

Qwen3.8-Omni-Flash 把長影音接進 Agent 工作流。本文拆解 1M context、Realtime、Plugins、Harness、benchmark 與價格主張,判斷突破來自模型還是整套工具鏈。

最後更新:2026年9月19日
AI 模型與研究
Jev 開源重製潮:SemIf、Laya 接連做出了什麼?(2026)

Jev 發布後,SemIf 做出開放介面實驗,Laya 發布 421M 專用模型。本文核對程式碼、權重、原始評測與校準圖,拆解社群重製的是介面、模型還是既有分類技巧,並判斷 TypeSafe 真正剩下的護城河。

最後更新:2026年9月19日