AI · 第 29 頁
Latest AI
最新 AI 文章 · 第 29 頁
共 74 頁

用 10 個已知一行修補的 Bug,建立 Claude Code/Codex 的變更範圍評測;從 gold patch、excess edit distance 到 CI receipt,一次守住功能、scope 與 locality。

MiniCPM5-2B 適合本機 Agent 嗎?用固定 revision、12 題繁中 Tool Calling、GGUF/MLX/SGLang 三條路徑,驗收格式、多步恢復、長 context 與 fallback。

保留同一份 GGUF,讓 Ollama、llama.cpp 與 LM Studio 跑相同 API、Tool Calling 與效能測例,用五關 scorecard 和 rollback receipt 決定該保留、並存或替換。

Coding 排行榜的冠軍未必最會寫繁中。用 12 題、三顆 seed、匿名配對與四條決策路徑,公平比較 Gemma 4、Muse Glimmer、Qwen3.8。

OpenBMB 釋出 25.17 億參數的 MiniCPM5-2B、Apache-2.0 權重與配套資料。本文拆解 AA v4.2 的 15 分、v4.3 暫估 14、弱項 benchmark、1.56GB Q4 與 128K context...

Artificial Analysis v4.3 顯示 Fable 5.1 與 GPT-6 Astra 同為 53;Agent Arena 又讓 Fable 點估計居首。拆解兩榜的樣本、harness、成本與信賴區間,找出真正選型方法。

GPT-6 Astra 機器人評測中,Robocurve 報告積木入碗完成 19/20,精密插入僅 2/20。本文核對 120 次試驗、公開 transcript、rig 差異、非盲測與版本不一致,說清這組系統結果能證明什麼、又不能外推到哪裡。

OpenRouter 9 月 6 日週榜中,Hy4 preview 以 14.7 兆 Token 排名第一。拆解 379% 上線基期、99% Prompt 與 93% 快取後,這更像採用量快照,不是品質冠軍。

從自然語言規格、Teacher 合成與 LoRA 訓練,到四組 holdout、OOD、spec drift、損益平衡與隱私邊界,一篇學會如何評估、版本化並安全整合 Compile by Training 神經函式。