AI 模型與研究 第 8 頁
所有文章 · 第 8 頁

SKILL.state 把長任務的完整對話改成結構化執行狀態。本文核對 93.8% token 降幅的測試條件、公開 benchmark、LangGraph-style baseline 與遺失歷史的風險。

GLM-5.3 開放權重後,Z.ai 釋出 753B 推論權重。本文查核約 756GB 預設 repo、自架硬體、客製授權,以及 Terminal-Bench 與 CyberGym 分數真正代表什麼。

Gemini Co-Scientist 把假設生成接到材料、生物與醫療評測;本文核對一次生長、HealthBench、人類評估與論文幻覺,拆出真正閉環與仍由人承擔的部分。

Trail of Bits 稱 GPT-5.6-Cyber 在 Debian 12 QEMU/KVM 測試中「三度逃逸」。本文拆解一次主機鎖死、一次 libslirp 鏈與最終零時差鏈,核對模型身分、證據限制與企業隔離策略。

Google 同週推出 Gemini 3.5 Transcribe 與 Omni 1.1 Flash。本文核對 GA/Preview、function calling、2.6% WER 與獨立測試,拆解媒體 AI 專門化背後真正的產品方向。

同名模型搬到本機卻失常,先別急著換權重。用五關 parity manifest 與單變因 A/B Test,定位雲端和本機部署的第一個分叉。

Gemini Omni 1.1 Flash 新增累積 40 秒延伸、首尾影格、360p 草稿與 4K upscale。本文核對 Google 技術文件、Arena 排名與 API 限制,拆解它真正改變的是影片控制流程,而非已證明的原生 4K 或一鏡到底長片。

GigaBrain-0.7 用 future subgoal 與進度訊號訓練機器人 VLA。本文拆解 37,257 小時資料、8 月 25 日開源範圍、團隊真機 benchmark 與 OOD 限制,判斷它距離通用機器人還有多遠。

Prime Agent 在 ARC-AGI-3 Demo 回報 95.5% RHAE;本文拆解評測條件、Harness 架構、重現缺口與 Factorio reward hacking,判斷這份報告真正證明了什麼。