2026 年 7 月 23 日,OpenAI 在官網發布〈Launching Health in ChatGPT〉,宣布開始向符合資格的美國成年使用者逐步推出 ChatGPT Health。它真正跨過的門檻,不是讓 ChatGPT 突然變成醫師,而是把 Apple Health、支援的醫療紀錄與日常對話接在一起;這能減少「AI 不知道你的背景」的老問題,卻同時放大另一個更難的問題:當回答因讀過你的病歷而顯得更有把握,答錯時誰負責?
一句話先講結論:這是重要的產品整合與分發躍進,不是已被證明的醫療推理突破。最合理的定位,是協助整理紀錄、比較變化與準備就診問題的個人健康資料解讀器,而不是診斷、治療或急症分流工具。

以下會拆開三件容易被混在一起的事:產品究竟新增什麼、官方 benchmark 能證明到哪裡,以及隱私與臨床責任為何沒有因為一句「不能取代醫師」就消失。
ChatGPT Health 這次到底推出了什麼?
“Health in ChatGPT is launching to U.S. users. You can choose to securely connect Apple Health and supported medical records …”
中文:Health 正向美國使用者推出;你可以自行選擇連接 Apple Health 與官方支援的醫療紀錄。
OpenAI,〈Launching Health in ChatGPT〉
這句話有兩個關鍵字:「逐步」與「選擇」。
這不是 ChatGPT Health 第一次亮相。OpenAI 早在 2026 年 1 月就向少量早期使用者推出隔離式 Health 體驗;7 月版才是更廣泛的美國 rollout,而且產品架構也改成可在一般對話中按權限調用 Health 資料。
| 項目 | 目前官方說法 | 不能誤寫成 |
|---|---|---|
| 資格 | 美國、已登入、年滿 18 歲的 Free、Go、Plus、Pro;仍分批開放 | 所有美國成人都已拿到 |
| 平台 | Web 與 iOS;連 Apple Health 需要 iPhone | Android 與所有裝置皆支援 |
| 資料來源 | Apple Health、支援的美國醫療提供者,以及 One Medical、Function Health 等 | 所有醫院 EHR 都能直接連 |
| 寫入能力 | 讀取與解讀 | 能替你修改原始病歷或 Apple Health |

3 億人不是 Health 使用者
OpenAI 表示,每週有超過 3 億人向 ChatGPT 提出健康相關問題。這是公司自行公布的「健康提問人數」,不是新版 Health 的週活、連接病歷人數或付費使用者數。公司也說,在已取得早期 Health 體驗的人群中,超過 70% 的健康對話仍發生在專屬 Health 空間之外;這個觀察解釋了 7 月版為何要把資料帶進一般對話。這篇公告未交代樣本數、觀察期間或分類方法。
截至 2026 年 7 月 26 日,與這次上線相關的 X 公開趨勢頁未顯示可稽核的原始 views/reposts;同日 Hacker News 討論為 31 points、54 comments。這比較像「低分數、高討論密度」的爭議訊號,不是使用者支持度調查。
ChatGPT Health 最明確的改變是「上下文」,不是已被證明的醫療推理突破
一般聊天機器人回答健康問題時,常缺少過去檢驗、用藥、活動、睡眠與時間序列。新版 Health 把這些資料變成可被對話調用的上下文,因此能做三類很實際的工作:比較新舊檢驗值、整理近期變化、把散落紀錄轉成就診前的問題清單。
這與 上下文工程的核心相同:輸入品質與可用脈絡會改變輸出。但醫療場景至少有三層風險,資料接上去只解決其中一部分。
| 風險層 | 資料連接能改善什麼 | 仍不能保證什麼 |
|---|---|---|
| 缺少背景 | 補上檢驗、用藥、活動與時間序列 | 來源可能過期、不完整或單位被誤讀 |
| 推理與表達 | 讓回答更貼近個人狀況 | 模型仍可能誤判、遺漏、過度肯定 |
| 行動與分流 | 整理問題、協助準備就診 | 不能保證使用者會在正確時間尋求專業照護 |
真正反直覺的地方是:更多個人資料可能同時提高實用性與錯誤的說服力。一段根據你最新檢驗與睡眠紀錄寫成的答案,即使推論錯了,也會比通用健康百科更像「懂你」。因此,個人化不是安全性的同義詞;它也可能擴大自動化偏誤。

ChatGPT Health 的隱私承諾,讀細一點就不是「完全隔離」
OpenAI 承諾,連接的病歷、Apple Health 資料,以及實際調用它們的對話,不會用來訓練基礎模型或作為定向廣告訊號。這是比一般聊天更窄、更強的政策邊界,但仍是 OpenAI 的官方承諾,不是外部安全審計,也不等於沒有人或供應商能存取資料。
Health Privacy Notice 寫明:除非使用者已退出,少數授權 OpenAI 人員與受信任服務商可能為改善模型安全而存取 Health 資料;OpenAI 也會為客服、防詐/安全與法律義務使用資料,並可能向雲端、客服與安全監控供應商披露。OpenAI 說不出售 Health 個資,但「不出售」不等於沒有上述處理與依法披露。

Disconnect 不是一鍵全部刪乾淨
- 解除連接會啟動「同步來源資料」的 30 天刪除流程。
- 已寫進 chat history 的內容不會跟著消失,必須另刪對話。
- Health 不會直接把整份病歷變成記憶,但由病歷引發的對話仍可能形成 memory;刪對話不必然會刪記憶。
- 若曾上傳檔案,完整移除時應分別處理已連接帳戶、對話、記憶,以及 Library/舊版 Health Project 中的檔案。
法律保護也不是看到「病歷」兩字就自動相同。美國 HHS 指引說,若個人自行要求醫療機構把資料送到一個既非 covered entity、也非 business associate 的 App,該 App 收到的副本可能不再受 HIPAA 保護;OpenAI 的 Health Help Center 也明載消費版 Health 不提供 BAA。反過來說,FTC 的 Health Breach Notification Rule 與州級 consumer-health laws 仍可能適用。最準確的說法不是「有 HIPAA」或「完全沒有監管」,而是要看資料流與各方的法律角色。可參考 HHS 對健康 App/API 的說明。
HealthBench 能證明什麼,不能證明什麼?
OpenAI 用 HealthBench 系列結果支持新模型的健康能力。這類評測有價值,但讀法必須精確:HealthBench Professional 是由 OpenAI 研究者提出的 525 項醫師發起任務,評的是單輪或多輪對話中的「下一則模型回應」。論文明列未涵蓋 EHR 整合工作流與機構特定限制;此外,它衡量的是 rubric 分數,不是真實病患的臨床結果。它是能力訊號,不是診斷正確率,更不是新版病歷整合已完成臨床驗證的證書。
這也是為什麼理解 AI 模型的 evals 很重要:benchmark 問的是「在固定題目與評分規則下,答案表現如何」;真實醫療還包含資料缺口、長對話、情緒壓力、介面提示、使用者是否照做,以及模型何時把人導回專業照護。
一項刊於 Nature Medicine 的隨機研究預先登錄了人類受試實驗,讓 1,298 名英國參與者處理 10 個醫療情境;研究者之後加入的模型單獨驗證顯示,模型能在 94.9% 的案例辨識至少一項相關病況。真人搭配 LLM 後,病況辨識反而比對照組差,處置判斷也沒有優於對照組。這篇研究測的是 GPT-4o 等一般 LLM,不是 7 月新版 Health;它能支持的窄結論是:模型在評測或單獨作答表現好,不代表人機互動後就自然變安全。
更直接的反方證據來自另一項 Nature Medicine ChatGPT Health 壓力測試。研究者在 2026 年 1 月用當時的 gpt-5-mini thinking 後端取得 960 次輸出;在由氣喘惡化與糖尿病酮酸中毒兩種情境延伸出的 64 次明確急症輸出中,33 次被低估為 24 至 48 小時內求醫。加入客觀資料讓整體正確率由 54.6% 上升至 77.9%,卻沒有證明急症分流同步變安全。
這是一個重要警訊,卻不能被外推成「現行 ChatGPT Health 會漏掉一半所有急症」:研究使用合成案例,要求包含 A–D 分流選項的結構化輸出,並把同一套標準化提示模板的兩個版本(有/無客觀資料)套用到所有案例,且未做 prompt sensitivity analysis;急症樣本也集中於少數情境,而且測的是 1 月版本,不是 7 月的 GPT-5.5/5.6。另有尚未同儕審查、以五個不同前沿模型局部重現 17 個情境的 preprint 發現,自然化互動條件相較受限的 exam-style 條件,分流正確率提高 6.4 個百分點;其額外消融分析則把強制 A–D 輸出辨識為主要失敗機制。它顯示測試格式會顯著影響結果,但因模型與設計不同,不能直接推翻 1 月版 ChatGPT Health 的原研究。
所以,對「這次是不是醫療推理突破」最誠實的答案是:公開證據不足。新版最明確的突破在資料整合與分發;模型安全則仍需要版本對版本、使用者對使用者、包含真實資料流與升級分流的獨立測試。
未決訴訟不是判決,卻把責任缺口照得很亮
新版公告同一週,一名佛州使用者對 OpenAI 與 Sam Altman 提起訴訟。依 原告律師公開的 complaint 與 Bloomberg Law 報導,原告主張 2024 至 2025 年與 GPT-4o 的互動曾讓他延後尋求醫療,之後被診斷出肺栓塞。
這些是原告單方主張,尚未經法院裁判;本文檢視的 62 頁公開 complaint 摘錄了部分對話,但未附可供獨立核對的完整對話與醫療紀錄,也不能證明訴訟與 7 月 Health 上線時點存在因果關係。它針對的還是較早的 GPT-4o 一般對話,不是新版 Health。
但它提出的失敗模式不能被「舊模型」三個字抹掉:如果一個系統用權威語氣建立長期信任、沒有在風險升高時穩定升級到真人照護,那麼更完整的個人資料可能讓錯誤建議更有說服力。免責聲明能劃邊界,卻不會自動消除介面設計、警示機制與產品責任。
AlphaLab 判讀:這是資料層躍進,也是責任壓力測試
我同意的部分:把散落紀錄變成可查詢上下文,潛在價值很實際
病歷、穿戴裝置與聊天紀錄原本分散在不同介面。若系統能把檢驗變化、用藥清單與生活趨勢整理成一頁摘要,再讓使用者帶去看醫師,這能降低資訊整理成本,也可能讓問診更有效率。這不是炫技,而是實際工作流的改善。
我存疑的部分:把第一方 benchmark 包裝成臨床安全證據
我存疑的不是模型可能進步,而是證據層級被混在一起:文字回應評測不能回答病歷整合後的急症分流與病患結果;「每週 3 億人」與「70% 在專區外」也只能說明 OpenAI 觀察到的需求與產品設計動機,不能獨立證明實際需求規模,更不能證明安全邊界已經解決。
最可能的好未來:AI 先整理,人類做關鍵判斷
短期最健康的分工,不是「AI 取代醫師」,而是 AI 把資料整理成醫師與病人都能檢查的中間產品:時間線、差異表、待確認清單、問題草稿。這種設計讓輸出可被原始紀錄與專業人員逐項核對,也把不可逆的診斷與治療決策留給有責任鏈的人。
ChatGPT Health 現在怎麼用,風險比較低?
- 先用單次允許。剛開始不要急著選 Always allow;只在需要比較特定紀錄時開放。
- 把它當整理器。請它製作時間線、解釋術語、列出要問醫師的問題,而不是替你下診斷或改藥。
- 回到原始紀錄核對。檢查日期、單位、藥名、劑量與資料最後更新時間;專有穿戴分數未必會完整傳入。
- 高風險結論一定交叉驗證。把摘要帶給合格醫療專業人員,不要只把聊天答案當作行動依據。
- 刪除要分開做。若不再使用,分別處理已連接帳戶、對話與記憶;若曾上傳檔案,也要另行處理。
- 懷疑急症時跳過聊天。不要等待模型分流,直接尋求當地緊急醫療協助。
如果你想先理解模型為何會「看起來很懂」,可以從 LLM 的運作原理讀起。真正值得追蹤的下一個里程碑,也不是又多一個榜單分數,而是 OpenAI 是否公開獨立的人因測試、急症升級表現、資料刪除稽核,以及接入病歷後的真實錯誤分析。
📚 延伸閱讀
- LLM 是什麼?白話搞懂 ChatGPT 背後的大腦
- Context Engineering 上下文工程是什麼?
- AI 模型怎麼學習?從預訓練到 Evals
- GPT-5.6 為何一上線就被政府管制?
- OpenAI 模型攻入 Hugging Face:AI Agent 資安事件警告了什麼?
- AI 安全指數 2026:九大 AI 巨頭的安全成績單
⚠️ 醫療與風險聲明:本文為產品與產業分析,不構成醫療建議、診斷或治療。ChatGPT Health 及其他 AI 工具可能犯錯;任何涉及症狀、用藥、診斷、治療或急症的決定,請交由合格醫療專業人員處理。
🤝 利益揭露:本文不是 OpenAI 贊助內容,未使用推薦連結。文中 OpenAI 產品畫面與資料屬原權利人,於評論與報導脈絡引用;產品數字、隱私政策與 benchmark 主張均按來源歸因。查核截點為 2026 年 7 月 26 日,後續 rollout、政策與模型版本可能更新。
