跳到主要內容
← AI

AI 模型與研究 8

所有文章 · 第 8 頁

AI 模型與研究
SKILL.state 深度解析:倉儲測試少 93.8% Token,代價是什麼?(2026)

SKILL.state 把長任務的完整對話改成結構化執行狀態。本文核對 93.8% token 降幅的測試條件、公開 benchmark、LangGraph-style baseline 與遺失歷史的風險。

最後更新:2026年8月31日
AI 模型與研究
GLM-5.3 開放權重:753B checkpoint、授權條件與資安能力解析(2026)

GLM-5.3 開放權重後,Z.ai 釋出 753B 推論權重。本文查核約 756GB 預設 repo、自架硬體、客製授權,以及 Terminal-Bench 與 CyberGym 分數真正代表什麼。

最後更新:2026年8月30日
AI 模型與研究
Gemini Co-Scientist 深度解析:從假設走進實驗,AI 科學家真的閉環了嗎?(2026)

Gemini Co-Scientist 把假設生成接到材料、生物與醫療評測;本文核對一次生長、HealthBench、人類評估與論文幻覺,拆出真正閉環與仍由人承擔的部分。

最後更新:2026年8月30日
AI 模型與研究
GPT-5.6-Cyber VM 逃逸:三輪測試哪些真的算成功?(2026)

Trail of Bits 稱 GPT-5.6-Cyber 在 Debian 12 QEMU/KVM 測試中「三度逃逸」。本文拆解一次主機鎖死、一次 libslirp 鏈與最終零時差鏈,核對模型身分、證據限制與企業隔離策略。

最後更新:2026年8月30日
AI 模型與研究
Gemini 3.5 Transcribe 深度解析:Google 為何讓媒體 AI 專門化?(2026)

Google 同週推出 Gemini 3.5 Transcribe 與 Omni 1.1 Flash。本文核對 GA/Preview、function calling、2.6% WER 與獨立測試,拆解媒體 AI 專門化背後真正的產品方向。

最後更新:2026年8月29日
AI 模型與研究
【2026 最新】本機 LLM 變笨?5 關 A/B Test 找出 Chat Template、量化與 Runtime 差異

同名模型搬到本機卻失常,先別急著換權重。用五關 parity manifest 與單變因 A/B Test,定位雲端和本機部署的第一個分叉。

最後更新:2026年8月28日
AI 模型與研究
Gemini Omni 1.1 Flash 深度解析:40 秒延伸、首尾影格與 4K 真相(2026)

Gemini Omni 1.1 Flash 新增累積 40 秒延伸、首尾影格、360p 草稿與 4K upscale。本文核對 Google 技術文件、Arena 排名與 API 限制,拆解它真正改變的是影片控制流程,而非已證明的原生 4K 或一鏡到底長片。

最後更新:2026年8月30日
AI 模型與研究
GigaBrain-0.7 發布:世界模型如何引導機器人動作,離通用還有多遠?(2026)

GigaBrain-0.7 用 future subgoal 與進度訊號訓練機器人 VLA。本文拆解 37,257 小時資料、8 月 25 日開源範圍、團隊真機 benchmark 與 OOD 限制,判斷它距離通用機器人還有多遠。

最後更新:2026年8月27日
AI 模型與研究
Prime Agent 95.5% 深度解析:Harness 突破,還是算力放大?(2026)

Prime Agent 在 ARC-AGI-3 Demo 回報 95.5% RHAE;本文拆解評測條件、Harness 架構、重現缺口與 Factorio reward hacking,判斷這份報告真正證明了什麼。

最後更新:2026年8月27日