2026 年 10 月 4 日,Niko1221 在 GitHub 發布了〈Strata v0.1.39〉。這份 Strata v0.1.39 更新說明把幾件事放在同一頁:更快的解碼、長提示詞調整、多請求並行,以及讓 Codex CLI 連到本機模型的 Responses API。看起來像「大模型終於能住進家用電腦」,但真正的問題是:哪些結果在什麼硬體上成立,哪些代價被一句「更快」藏了起來?本文先整理原文,再核對模型與系統文件,最後給出可操作的判斷。

這次更新真正改了什麼
先把「新模型」與「新推論器」分開。Qwen 官方模型卡顯示 Qwen3.8-Flash-Next 是 125B 參數、每次約啟用 6B 參數的模型;它的權重於 2026 年 8 月已公開。10 月 4 日的新訊息是 Strata v0.1.39 的推論、排程與介面更新,不是 Qwen 在這一天首次發布。
發布說明將更新分成三條:第一,縮短部分解碼與長提示詞的等待;第二,讓數個對話共用引擎,但必須權衡顯示等待時間與總吞吐;第三,加入 POST /v1/responses,讓使用該介面的 Coding Agent 指向本機服務。舊顯卡、Intel Arc 與多 GPU 的路徑也擴大了,但原文把其中許多寫成「實驗性」或「社群在自己的機器測得」,不能視為所有硬體的通用保證。
為什麼顯卡 12GB 還能碰 125B?
專案文件的關鍵不是把完整模型塞進顯卡,而是分工:常用專家權重放在 VRAM,更多權重留在系統 RAM,部分查表資料走 SSD。模型每個 token 只啟用部分專家,Strata 則試圖讓下一次需要的資料及早到位。原文的「家用電腦」因此有前提:文件列出至少 12GB VRAM、32GB RAM 與約 80GB 可用磁碟,並建議用 SSD;64GB RAM 才能選較多量化版本。

這也解釋了標題數字為何容易誤導:12GB 是顯卡記憶體門檻,不是整台電腦只需 12GB。每個 token 若頻繁跨 PCIe 或讀 SSD,延遲仍會上升;壓得更小的量化檔可節省容量,卻可能改變模型輸出品質。是否「能跑」與是否「足夠快、足夠準」是三個不同問題。
速度數字讀到哪裡才算公平?
作者在 RTX 5070 上以 0.1.38 為對照,做 10 組交錯測試,發布說明報告 Q2_0 的解碼中位數約快 6%,IQ3_XXS 約快 2.5% 至 6%。這是作者的特定配置結果;要知道自己的電腦是否也快 6%,還需要在自己的硬體與量化設定下測試。它至少提供了可檢查的版本、量化檔、硬體與測試對照;專案 README 的部分速度表還標示使用更早的引擎版本,不能直接當作 v0.1.39 實測。
A 12 GB card never gets there
中文:12GB 顯卡到不了這個條件。
Strata v0.1.39 發布說明
這句話限制的是一項「所有專家都留在 VRAM」才啟動的驗證圖最佳化。原文承認它沒有在大顯卡上量到該路徑的收益;讀者不該把同一份發布說明中的加速幅度照搬到 24GB 或多 GPU 系統。
長提示詞的結果更能看出條件:作者報告,在 RTX 5070、32K 提示詞、IQ3_XXS 且專家快取設為 1,500 槽時,預填充快了 18.5%;預設配置則沒有這項提升。原文也寫到 Coder 在另一個 32K 設定讀取 30K 提示詞時約慢 8%。並行文件與發布說明還顯示,在 12GB 顯卡上開四個請求可使最後一個請求更早開始,四個一起的解碼速度卻下降約 11%。這不是缺陷的修辭,而是可用 VRAM 被多個 session 分走後的容量交換。
Codex 能連上,等於私有 Agent 完成了嗎?
Strata 介面文件列出 /v1/responses 與 Codex CLI 的配置範例;發布說明說作者以 Codex 0.160.0 跑過包含工具呼叫的迴圈。這是「某個版本的代理程式能與本機端點對話」的證據,不等於所有 Responses API 功能或每個 Agent 工作流都已驗證。
It is stateless, as Codex uses it
中文:這個端點不保存對話狀態;Codex 的用法也如此。
Strata v0.1.39 發布說明
因此客戶端仍須在後續請求帶回上下文。發布說明明列 previous_response_id、託管工具與 reasoning summaries 未納入這個實作;有些依賴這些能力的客戶端不能只換 base URL 就期待功能一致。實際評估時,要用自己的工具呼叫、長對話與錯誤恢復流程跑一輪。

「本機」也要按資料流定義。專案安全文件寫明服務預設綁在 127.0.0.1,對外監聽可由使用者改成 0.0.0.0;API key、Host/Origin 限制與選配 MCP 工具各有設定。模型推論在本機,並不自動保證 Agent 使用的外部工具、擴充功能或網路請求也留在本機。若你要處理敏感程式碼,應先固定綁定地址、金鑰與工具權限,再用測試資料觀察實際連線。
我同意什麼,還存疑什麼
我同意這個專案抓對了大模型落地的瓶頸:不是只有算力,還有權重住在哪裡、資料何時跨裝置,以及多個請求是否搶同一塊快取。v0.1.39 把這些交換寫進發布說明,連變慢的案例也列出,比單貼「每秒多少 token」更有用。
我存疑的是把「能啟動 125B」直接換成「可取代遠端 Coding Agent」。量化造成的任務品質差異、長提示詞後的等待、多 session 競爭、工具失敗後的恢復,都需要同一套實際任務來驗收。發布說明把作者的單 GPU 測試與社群硬體測試分開列出;我們也沒有在本機重現作者的 GPU 測試。因此最可靠的結論是:Strata 已提供一條值得試的本機端點路徑,是否能成為你的日常後端仍取決於整機配置與任務通過率。
怎麼決定值不值得試?
先對照官方硬體需求盤點 VRAM、RAM 與 SSD 空間;再挑三個你真正在做的 Coding Agent 任務,記錄完成率、第一個 token 等待、整體耗時、工具呼叫失敗與同時跑兩個請求時的變化。若你手邊是 Mac,可先讀ds4 本機模型的記憶體與 Agent 驗收; 若你在比較桌面專用設備,DGX Spark 64GB 的本地 AI 成本分析提供另一個硬體坐標。不要只用一段展示影片或單次 tokens/s 代替這張任務成績單。
接著閱讀
左右滑動查看更多推薦






