AI 模型與研究 第 11 頁
所有文章 · 第 11 頁

Cerebras CS-4 將三片 WSE-3 Turbo 放進新版 Nexus 機櫃。本文拆解 30× 速度、10 兆參數外推、44 GB SRAM 與量產可用性的證據邊界。

Unsloth 發布 Qwen3.8-27B Dynamic 3.0 GGUF,最小檔案 6.19GB,並宣稱同尺寸 top-1 忠實度最高提升逾 10%。本文拆解 72%/77% 落差、Div-300 與 KLD,並釐清為何權重檔能放進 8GB 不等於整機好用。

AI 影片偵測器在轉碼、縮放與改幀率後還可靠嗎?本文依 RA-Bench v2、D3 官方 repository 與 NIST/C2PA 文件,教你讀懂 AUC、低 FPR、False Positive、score 方向與成對評估流程。

Claude 蛋白質設計實驗排除一個量測無法解讀的 target 後,在 1,320 個設計中判定 354 個 binder 命中。本文拆解兩家付費外部 CRO、26.8% 命中率與藥物距離。

Google DeepMind 等研究者如何以現代最佳化與 AlphaEvolve,把矩陣乘法指數 ω 的上界推至 2.371177?本文拆解 AI 的真正角色、精確驗證與實務限制。

VibeWorlding 把 3D 世界建造成可訓練的 Agent benchmark;但作者自報的 59.3 分、評分器循環與公開程式仍有多個待對帳缺口。

Qwen3.8-27B 在 AA 的 4B–40B open-weight 分組拿到 52 分,但完整評測輸出 1.63 億 tokens、93% 用於推理。本文拆解它的真正能力、評測限制與本機部署成本。

LMArena 第一、Artificial Analysis 第一與 OpenRouter 熱門第一,可能是三個不同答案。本文用三榜交叉判讀與十題 eval,建立真正能選模型的決策框架。

DeepSeek V4 Pro、Responses API 與 Harness 同日公開,真的形成完整開源 Agent Stack 了嗎?本文拆解 MIT 權重、API 相容限制、Harness 預設路徑、官方與獨立分數差異,以及 8.59 萬 GitHub stars...