你在 Codex 選 GPT-6 Sol 修一個 bug,隔天看到 GPT-6.1 Sol 上線,直覺想把所有工作都切過去。可是模型名稱變新,並不等於你的修正會更快過測試;把 Effort 拉高,也可能只換來更長的等待。
這篇「GPT-6.1 Sol 在 Codex」教學寫給會打開 Git 專案、但第一次認真比較模型與推理檔位的讀者。你會學到如何選入口、設計三道可驗收的小任務,並用同一張紀錄表算出哪一組值得留在日常流程。本文的任務卡是操作範本,沒有填入 AlphaLab 未執行的勝負數字。
先說結論:GPT-6.1 Sol 在 Codex 要看合格交付
一句話記住:值得換=同一驗收標準下,合格成果的總投入更低。把 token 單價想成計程車每公里的費率:要比較的還包括繞路、重叫車、到站後自己補走的時間。
- 先固定任務、提示詞、repo 起點與驗收測試,再比較模型和 Effort。
- 先看通過率與人工修正,再看耗時和用量;失敗的嘗試也要計入。
- 訂閱方案的使用量、購買 credits 與 API 美元費用分欄,避免把不同單位硬加。
GPT-6.1 Sol 在 Codex:入口與 Effort 怎麼確認?
截至 2026 年 9 月 30 日,OpenAI 的 GPT-6.1 Sol 發布說明寫明 GPT-6.1 Sol 提供給 Plus、Pro、Business、Enterprise 與 Edu 使用者的 ChatGPT Work 和 Codex,API 模型 ID 是 gpt-6.1-sol。同頁也區分 ChatGPT 聊天介面的上線狀態。先在你實際使用的 Codex 模型選單確認可選項;發布頁的方案名單不能替每個帳號的當下畫面作保。
Codex 開發者設定文件列出互動介面的 /model 選單、單次執行的 codex --model gpt-6.1-sol,以及 codex --config model_reasoning_effort='"medium"'。命令列可用 codex --version 記下客戶端版本。若清單尚未顯示 6.1,先記錄日期、方案、客戶端版本與模型選單,再依官方發布頁的 rollout 說明重查;此時不要把「清單沒看到」寫成產品永久不支援。
GPT-6.1 Sol 模型頁列出的 API 推理檔位為 low、medium、high、xhigh、max,預設 medium;none 與 minimal 不在其支援清單。Codex 介面實際顯示哪些選項,仍以你帳號的 /model 為準。若選單沒有題目指定的模型或檔位,這一格記為「未取得」,不要偷偷改用別的設定。
先弄懂三個旋鈕:模型、Effort、計費
① 模型:換一位做題者
OpenAI 的 GPT-6.1 Sol 發布說明報告,GPT-6.1 Sol 在 DeepSWE v1.1 的最佳設定,比 GPT-6 Sol 最佳分數高 6.4 個百分點,且使用較低 Effort 與成本。這是 OpenAI 在指定測試環境與任務集的結果;官方也註明研究環境或 API 的評估,可能與正式 Codex 因系統提示、工具和檔位不同而有差異。你自己的 repo 是另一道題。若想讀這種「單題成本」與綜合跑分的邊界,可對照 站內 GPT-6.1 Sol 成本分析。
② Effort:給同一位做題者多少思考空間
Effort 是推理努力程度。低檔適合把範圍清楚的工作先跑一遍;高檔可能更願意處理多步判斷,但也可能增加等待與用量。高檔是否值得,只有在同一任務的通過與總投入一起看時才有答案。別把「回答比較長」當成「程式比較對」。
③ 計費:單價、用量與訂閱額度是不同欄
截至 2026 年 9 月 30 日,GPT-6 Sol 模型頁與GPT-6.1 Sol 模型頁顯示兩代標準 API 價格均為每百萬輸入 token 2 美元、輸出 token 10 美元;快取輸入分別為 0.20 與 0.10 美元。這說明「6.1 全面降價」不精確:同樣的非快取輸入與輸出量下,標價相同。Codex 與 ChatGPT Work 定價文件另列 Codex 購買 credits 的模型費率;Plus、Pro 等方案內含使用量不能直接乘 API 美元單價,當成你每次任務的實際現金支出。

三道任務:用同一份 repo 驗收
挑一個你有權修改的小型 Git 專案,複製四份乾淨起點。每一題都用完全相同的任務描述、可見檔案、依賴版本、執行權限與驗收命令;每跑一次就從乾淨起點開始。把日期、Codex 版本、模型、Effort 和是否開啟額外工具寫在紀錄表最上方。
任務一:已知 bug 的最小修正
痛點:同一個 bug,某組模型可能很快產生看似合理的補丁,卻漏掉回歸測試。做法:先準備一個會失敗的測試,再給四組設定相同提示:「修正這個失敗測試;只改必要檔案,列出你跑過的測試。」驗收是測試通過、原有測試不退步,以及差異檔案在任務範圍內。
任務二:跨檔重構,外部行為不變
痛點:重構時,表面測試過關仍可能改了公開介面。做法:指定兩到三個檔案,把重複邏輯整理成一處,先寫下「函式輸入輸出與錯誤行為不變」。驗收除了既有測試,還加一個邊界案例並人工比較差異。它測的是維持約束,而不是改了多少行。
任務三:模糊需求,先澄清再動手
痛點:例如「讓搜尋更好用」,直接寫碼容易修錯地方。做法:把需求限制為一個小功能,但保留一處需要釐清的歧義;給四組相同上下文,觀察它是否提出關鍵問題、做出可驗收的假設,並交出最小變更。驗收清單在跑模型前寫好,避免看了結果才改分數。

如何跑 GPT-6.1 Sol 在 Codex 的四組對照?
第一輪先跑 GPT-6 Sol × medium、GPT-6 Sol × high、GPT-6.1 Sol × medium、GPT-6.1 Sol × high。用 Codex 開發者設定文件的 --model 與 model_reasoning_effort 單次覆寫設定,不必永久改動自己的預設。每次從相同的 Git commit 和測試狀態啟動;把提示詞存成文字檔,再複製到新 session。
每組至少保留:開始與結束時間、模型與 Effort、任務是否一次過關、測試輸出、人工修正分鐘數、重試次數、輸入/快取輸入/輸出用量,以及最後的 Git diff。若介面只顯示方案用量而沒有可核算的逐次 token,記「未提供逐次數值」,不要倒推出假精確的美元。
一題只跑一次只能當試跑:模型輸出有波動,網路、工具和快取也會影響時間。若條件允許,讓四組輪流跑同一題數次,並記錄中位時間與每組合格件數。需要規模化團隊評測時,可先讀 AI 模型路由評估方法;本文先讓個人用小樣本找出值得正式比較的候選組合。
把成本算到「完成」,別停在 token 單價
OpenAI 部署檢查表建議比較任務成功、延遲、輸入/輸出/推理/快取 token,以及每件成功任務成本。實作時,把四組的失敗嘗試也加總:每件合格任務成本=所有嘗試的 API 費用與人工時間成本總和 ÷ 合格件數。若分母是零,就標「尚無合格成果」,不要報成零成本。
用 API key 跑 Codex 時,可依模型頁的實際價格與逐次用量估算費用;若還有工具費、Fast 模式或其他處理選項,也要依該次紀錄加入。用訂閱登入時,先分開呈現「方案用量/credits」和「人工分鐘」;若你沒有可核對的逐次金額,決策先用合格率與人工工時,不需要硬湊一個美元數。

決策表:何時沿用 Sol,何時試 6.1 Sol?
- 先沿用 GPT-6 Sol:目前任務穩定過關,而且 6.1 Sol 在同題沒有改善合格率、修正時間或總投入。
- 優先試 GPT-6.1 Sol:跨檔、多限制任務常要重試;四組對照中 6.1 在你的驗收標準下減少補救。
- 先調 Effort:同一模型的 medium 常過簡單題、難題才失敗;只對難題試 high,觀察是否換得足夠的合格成果。
- 暫不下結論:模型入口未開、測試樣本太少、提示詞或測試變動,或逐次用量缺失卻要比較美元。先補齊條件。
決策樹可以很短:先問有沒有合格成果 → 再問人工修正是否下降 → 最後看時間與可核對的用量。想理解為什麼同一模型放在不同工具會有不同結果,可先讀 Agent Harness 的執行層原理;若你還在比較工具本身,接著看 Claude Code 與 Codex 的工作流比較。
常見錯誤:四個會讓比較失真的地方
- 題目跑到一半改了:保存提示詞與 repo commit;新條件要整組重跑。
- 只看模型自述:以測試輸出、Git diff 和人工驗收作準;「我修好了」不是通過證據。
- 快取與工具不同:固定工具權限,並把快取用量獨立記錄。
- 把官方跑分當個人結果:發布測試中的任務、環境和評分方式與你的 repo 不同;用它選候選模型,再由自己的驗收決定。
GPT-6.1 Sol 在 Codex 常見問題
Q1:6.1 Sol 一定比 6 Sol 省錢嗎?
不一定。標準 API 非快取輸入與輸出單價相同,快取輸入較低;實際用量、重試與人工修正仍會改變每件合格任務的成本。
Q2:高 Effort 一定更準嗎?
不一定。官方描述的是更高的思考空間與潛在耗時;你仍要用同一題的測試和人工審查證明收益。
Q3:我的 Codex 選單找不到 6.1,怎麼辦?
先記錄帳號方案、日期、客戶端版本和模型清單,再核對官方 rollout 與自己的工作區設定。把這組標為「未取得」,等可選時再跑;不要拿別的模型充數。
Q4:需要把 API key 貼給 Codex 嗎?
如果你用 ChatGPT 帳號登入 Codex,先用現有登入方式與方案用量完成操作評估。只有你決定另走 API 計費路徑時,才按官方帳號流程配置 API key;任務提示詞或文章紀錄不要保存密鑰。
Q5:只跑三題能選出永遠的贏家嗎?
不能。三題只代表你挑的工作類型;換專案、依賴版本、工具或測試,結論都要重新驗。
Q6:能直接拿官方 DeepSWE 分數替我的 Codex 評分嗎?
不能。官方分數屬於指定資料集與執行環境;你的驗收測試才決定這個 repo 是否合格。
Q7:比較訂閱用量時,要換算成 API 美元嗎?
不用。訂閱額度和 API 按 token 收費是不同帳本;沒有逐次可核對數據,就分欄記錄。
Q8:第一組該從哪裡開始?
先選你最常做的一道小修正,用 GPT-6 Sol medium 與 GPT-6.1 Sol medium 跑相同任務;只有差異值得追查時,再加入 high。
給新手的三個帶走重點
- 先寫過關標準,再換模型;不然你會替喜歡的答案調整標準。
- 模型與 Effort 是兩個旋鈕;同題同環境跑四格,才知道收益來自哪裡。
- 記錄合格率、補救時間與用量;成本只在數據可核對時換算。
接著閱讀
左右滑動查看更多推薦
下一步:今天先寫一張任務卡
打開你手上的小型 repo,寫下最常重複的一件工作、過關測試與允許修改的檔案。先跑 medium 的兩個模型,把「合格/修正分鐘/用量」填滿;高 Effort 只留給真的卡住的題。你會得到自己的 Codex 選型依據,而不只是別人的排行榜。若你想把這套驗收觀念延伸到完整 Agent 流程,可接著看 Agent Harness 實作,或到 AlphaLab 課程繼續練習。






