跳到主要內容

AI · 第 29 頁

Latest AI

最新 AI 文章 · 第 29 頁

共 74 頁

AI Agent 與開發
【2026 最新】Edit Fidelity 是什麼?10 個一行 Bug 測 Claude Code/Codex 有沒有改太多

用 10 個已知一行修補的 Bug,建立 Claude Code/Codex 的變更範圍評測;從 gold patch、excess edit distance 到 CI receipt,一次守住功能、scope 與 locality。

最後更新:2026年9月8日
AI Agent 與開發
【2026 最新】MiniCPM5-2B 本機 Agent 教學:GGUF、MLX、SGLang 的 12 題 Tool Calling 驗收

MiniCPM5-2B 適合本機 Agent 嗎?用固定 revision、12 題繁中 Tool Calling、GGUF/MLX/SGLang 三條路徑,驗收格式、多步恢復、長 context 與 fallback。

最後更新:2026年9月8日
AI Agent 與開發
【2026 最新】Ollama 遷移教學:同一 GGUF 換到 llama.cpp/LM Studio 做 A/B Test

保留同一份 GGUF,讓 Ollama、llama.cpp 與 LM Studio 跑相同 API、Tool Calling 與效能測例,用五關 scorecard 和 rollback receipt 決定該保留、並存或替換。

最後更新:2026年9月8日
AI 模型與研究
【2026 最新】本機 LLM 繁中創作盲測:Gemma 4 vs Muse Glimmer vs Qwen3.8 怎麼公平選?

Coding 排行榜的冠軍未必最會寫繁中。用 12 題、三顆 seed、匿名配對與四條決策路徑,公平比較 Gemma 4、Muse Glimmer、Qwen3.8。

最後更新:2026年9月8日
AI 模型與研究
MiniCPM5-2B 開放權重:2B 小模型的 Agent 成績可信嗎?(2026)

OpenBMB 釋出 25.17 億參數的 MiniCPM5-2B、Apache-2.0 權重與配套資料。本文拆解 AA v4.2 的 15 分、v4.3 暫估 14、弱項 benchmark、1.56GB Q4 與 128K context...

最後更新:2026年9月8日
AI 模型與研究
Fable 5.1 vs GPT-6 Astra:兩張 AI 榜單為何不能直接比?(2026)

Artificial Analysis v4.3 顯示 Fable 5.1 與 GPT-6 Astra 同為 53;Agent Arena 又讓 Fable 點估計居首。拆解兩榜的樣本、harness、成本與信賴區間,找出真正選型方法。

最後更新:2026年9月8日
AI 模型與研究
GPT-6 Astra 機器人評測:19/20 到 2/20 的能力斷層(2026)

GPT-6 Astra 機器人評測中,Robocurve 報告積木入碗完成 19/20,精密插入僅 2/20。本文核對 120 次試驗、公開 transcript、rig 差異、非盲測與版本不一致,說清這組系統結果能證明什麼、又不能外推到哪裡。

最後更新:2026年9月8日
AI 產業與治理
Hy4 OpenRouter 排名第一:14.7 兆 Token 不等於最好(2026)

OpenRouter 9 月 6 日週榜中,Hy4 preview 以 14.7 兆 Token 排名第一。拆解 379% 上線基期、99% Prompt 與 93% 快取後,這更像採用量快照,不是品質冠軍。

最後更新:2026年9月8日
AI Agent 與開發
【2026 最新】Compile by Training 是什麼?把自然語言規格編譯成本機神經函式

從自然語言規格、Teacher 合成與 LoRA 訓練,到四組 holdout、OOD、spec drift、損益平衡與隱私邊界,一篇學會如何評估、版本化並安全整合 Compile by Training 神經函式。

最後更新:2026年9月7日