AI 模型與研究 第 12 頁
所有文章 · 第 12 頁

LMArena 第一、Artificial Analysis 第一與 OpenRouter 熱門第一,可能是三個不同答案。本文用三榜交叉判讀與十題 eval,建立真正能選模型的決策框架。

DeepSeek V4 Pro、Responses API 與 Harness 同日公開,真的形成完整開源 Agent Stack 了嗎?本文拆解 MIT 權重、API 相容限制、Harness 預設路徑、官方與獨立分數差異,以及 8.59 萬 GitHub stars...

OpenAI 與 Cerebras 預覽 GPT-5.6 Sol Ultrafast,宣稱最高 750 tokens/s、最高 14×。本文拆解輸出速度、端到端延遲、5.6× 供應商內測與限量供應,判斷它真正可能改變的 Agent 工作流。

Gemini 3.7 Flash 在 high reasoning 下獲 Intelligence Index 56、約 340 tok/s,但首答約 9.83 秒。本文拆解 Stable 發布、預設 medium、2026 年折扣價與...

GGUF 量化不能只看 Q4 標籤。本篇用同一 F16 來源實測 Q4_K_M、Q6_K、Q8_0,拆解權重、KV Cache、Context、QAT、AWQ 與 NVFP4,並提供固定 prompts、速度、記憶體與品質 gate,幫你依模型和硬體建立量化決策樹。

xAI 在 24 小時內推出 Grok Bot early beta 與 Grok 4.6。61 分模型、逾 5,700 萬次觀看與持久雲端代理背後,真正值得看的是 Arena 強弱分化、共享登入風險,以及每個成功任務的成本。

Grok 4.6 API 已可從 xAI、OpenRouter 接入 OpenCode。本文教你跑最小呼叫、抓實付帳單、避開 200K Context 成本懸崖,並用同 repo 雙賽道協議比較 Coding Agent。

LTX-2.5 釋出開放權重、Python pipelines 與 ComfyUI 工作流,主打一次生成連續多鏡頭。本文拆解 GB200 速度、16GB/32GB 硬體落差、distilled 權重、客製授權與 RTX 3060 實測。

先算實際量化檔與 KV Cache,再選 8/16/24GB 本機模型;一張決策樹分清 Dense、MoE、Context、Apple unified memory 與 CPU offload。