跳到主要內容

【2026 最新】GEO 是什麼?別追祕技:用 30 個 Prompt 做 AI 引用 A/B 實驗

最後更新: ·
GEO 是什麼:30 題固定 Prompt 與單一內容變因的 AI 引用 A/B 實驗

GEO 是什麼?最近有人說它是下一個 SEO,也有人兜售讓 ChatGPT 必定引用你的寫法。先踩煞車。2026 年 8 月,AI visibility 廠商 Promptwatch 觀察到:在「至少含一個引用」的 ChatGPT Search 回答中,reddit.com 占全部引用的份額,從 7 月 18 日至 8 月 7 日平均 3.83%,降到 8 月 14 至 17 日平均 0.52%,相對減少 86.4%。但原始分析明說,這只能定位時間,不能證明原因,也不能排除資料蒐集問題。

換句話說,單週波動不是演算法定律,更不是「某個格式已失效」的證據。真正可用的 GEO,不是猜平台祕密,而是把 AI 回答當成會變動的量測表面:固定問題、固定紀錄、每輪只改一個內容因素,再看檢索、引用、歸因與推薦是否出現可重複的訊號。

這篇會帶你建立一套可直接複製的 30 題流程,在 ChatGPT、Claude、Gemini、Perplexity 上每週重跑。你不需要寫程式;一張試算表、一篇要測的內容,以及願意接受「本次設計仍不確定」就夠了。

GEO 是什麼?先說結論:它是量測,不是祕技

GEO 是 Generative Engine Optimization 的縮寫,常譯為「生成式引擎最佳化」。2024 年的早期 GEO 論文把它形式化為:在生成式搜尋引擎中改善內容可見度。2026 年一篇單一作者、涵蓋 45 項研究、搜尋截至 7 月 14 日的arXiv v1 critical scoping review則提醒,這是一條隨機、部分不可觀測的管線;它不是同儕共識,而其檢視的原始研究多半不能外推成自然搜尋一定找得到你或帶來長期流量。

GEO 實驗 = 固定問題 × 固定紀錄 × 單一變因 × 重複量測。

先把讀者最容易混在一起的三件事分開:

  • 檢索(retrieval):頁面進入候選集或模型語境。本文從四個消費者介面的可見輸出無法重建完整候選集合;除非該次明示 retrieval trace,否則記「不明」。可見引用或 Sources 不算檢索證據。
  • 引用(citation):回答顯示你的網址或來源標記。被列入來源,不代表每一句都由該頁支持。
  • 推薦(recommendation):回答明確把品牌、產品或做法列為建議。系統可能引用你解釋背景,卻推薦別人;也可能提到你但不附引用。

若想更完整理解「檢索後再生成」的機制,可以先看RAG 是什麼。這也是為什麼本文不把「提及」「引用」「推薦」「正確」合成一個虛假的 GEO 分數。

SEO、AEO、GEO 的重疊與差異

SEO關心網頁能否被搜尋引擎抓取、理解與排序;AEO強調內容能否直接回答問題;GEO則把觀察範圍延伸到生成式回答中的提及、引用、歸因與推薦。三者不是三套互斥的魔法。Google 的官方 AI 搜尋最佳化指南目前明確表示,AI 搜尋功能仍以既有搜尋系統為基礎,不需要特殊 AI 標記,也不使用 llms.txt;有用、原創、可抓取且結構清楚的內容仍是底座。

因此,日期、結構化資料或 FAQ 都只能是待測因素,不能被寫成保證引用的開關。結構化資料必須和頁面可見內容一致;加了 schema 之後若引用上升,也要排除同週索引、產品模式與競爭來源變動。

這不是把 30 題丟給四個 AI 就算 A/B

把同一批問題丟給四個產品,只是四個量測表面的 panel comparison,可以看差異,不能隔離因果。內容實驗要先定義 A(原始內容)、B(只改一個因素);未改動的同站頁面只能當漂移哨兵,不是自動成立的因果控制組。

GEO 引用實驗流程:固定題組、建立基線、單一變因、跨引擎重跑、依停止規則判讀
30 題不是答案;它是一塊固定量尺。真正的變因在內容端,而且每輪只改一項。

只有一篇目標頁時,最誠實的名稱是「帶漂移哨兵的中斷式前後測」:先量 A,改成 B,再跨多個時間窗重跑。它不是隨機 A/B,也不是在預先安排的時段反覆或隨機切換 A/B、並處理 carryover 的 switchback。若有多組相近頁面,才可先配對,再隨機把每組一頁分到 treatment、另一頁保留 control;不要為了實驗複製近似頁面。

第一步:先鎖住四個產品的量測條件

每次執行都開全新對話,並記錄日期、產品模式、帳戶狀態、語言、地區、VPN、個人化與記憶。不要把產品名當成永遠固定的模型;消費者介面可能路由不同模型、搜尋供應商與引用政策。以下操作已在 2026 年 8 月 23 日重查官方說明。

  • ChatGPT:使用介面的 Search;搜尋也可能自動啟動。OpenAI 說明指出,使用搜尋的回答可能含引用與 Sources。另列的相關連結不能自動算成支持某句話的引用。
  • Claude:開啟 web search,並記錄該次是否真的搜尋。Anthropic 說明所稱的來源引用,限於實際使用 web search 的回答。
  • Gemini:記錄 Sources 或 related content 是否出現。Google 說明表示連結不一定每次都有;另分開記 public websites、上傳檔案與 Workspace,後兩者不進 public-web citation rate。「相關內容」也不一定是某句答案的證據。
  • Perplexity:把回應中的引用網址逐一展開。官方產品說明以帶引用的網頁搜尋為核心,但仍要人工確認網址是否真的支持相鄰主張。

拒答、限額、產品回傳錯誤、無搜尋或無引用都保留為產品結果。只有本機瀏覽器、網路或蒐集器失敗算 missing:依預先規則重試一次,把兩次用同一 scheduled run ID 連起來,只計一個分母,另報 completion rate。這和AI Evals保存 trial 與 trace 的觀念相同。

第二步:把 10 個資訊需求改寫成固定 30 題

先選一個你確實有內容能回答的主題。以下用「AI 會議紀錄工具」示範;正式執行前,把主題、地區與使用者條件一次替換完,凍結文字,不要在看到答案後臨時補品牌名。每個資訊需求有三種自然說法,可分辨結果是對問題本身穩定,還是只對某個措辭有效。

探索與教學:第 1~12 題

  1. AI 會議紀錄工具是什麼?它和一般錄音轉文字有何不同?請用新手語言並附來源。
  2. 請為新手解釋 AI 會議紀錄工具,以及它與錄音轉文字的差異;重要說法附來源。
  3. 什麼是 AI meeting notes tool?它和一般轉錄有何不同?請列來源。
  4. 小團隊前兩週如何導入 AI 會議紀錄工具?請列步驟與來源。
  5. 請給小團隊一套兩週導入 AI 會議紀錄工具的流程,並標出依據。
  6. 小團隊試用 AI 會議紀錄工具的前兩週該做什麼?請引用資料。
  7. 採購 AI 會議紀錄工具要檢查哪些隱私、準確度與整合項目?請附來源。
  8. 請做 AI 會議紀錄工具採購清單,涵蓋隱私、準確度與整合,並附來源。
  9. 隱私、準確度與整合三方面,選 AI 會議紀錄工具要查什麼?請附連結。
  10. AI 會議紀錄工具有哪些準確度、隱私與人工覆核風險?請附來源。
  11. 請整理 AI 會議紀錄工具的準確度、隱私及人工覆核風險,並列依據。
  12. 導入 AI 會議紀錄工具會遇到哪些準確度、隱私與覆核風險?請附來源。

比較與選擇:第 13~21 題

  1. 請推薦 2026 年適合跨語言遠端小團隊的 AI 會議紀錄工具,並附標準與來源。
  2. 2026 年跨語言遠端小團隊該選哪些 AI 會議紀錄工具?請推薦並附依據。
  3. 跨語言遠端小團隊在 2026 年可考慮哪些 AI 會議紀錄工具?請附推薦標準與來源。
  4. 雲端與自架 AI 會議紀錄方案怎麼選?請比較隱私、成本、維護並附來源。
  5. 請比較雲端和自架 AI 會議紀錄工具的隱私、成本與維護,並列依據。
  6. 在隱私、成本、維護三方面,雲端和自架 AI 會議紀錄方案有何差異?請附來源。
  7. 不讓第三方機器人加入會議,還有哪些轉錄與摘要替代方案?請附來源。
  8. 請列不用第三方會議機器人的轉錄與摘要做法,說明情境與來源。
  9. 若禁止第三方機器人進入會議,團隊怎麼產生逐字稿與摘要?請列依據。

決策與驗證:第 22~30 題

  1. 10 人遠端團隊估算 AI 會議紀錄工具總成本時,要算哪些費用、用量與儲存限制?請附官方來源。
  2. 請為 10 人遠端團隊列出 AI 會議紀錄工具總成本公式、費用、用量與儲存限制,並附官方來源。
  3. 10 人遠端團隊如何估算 AI 會議紀錄工具總成本?請查費用、用量、儲存限制及官方來源。
  4. 跨國團隊使用 AI 會議紀錄工具前,要查哪些同意、保存與資料位置條款?請附官方連結。
  5. 請列跨國團隊導入 AI 會議紀錄工具前要核對的同意、保存與資料位置政策,並附官方連結。
  6. 同意、保存和資料位置方面,跨國團隊該查哪些 AI 會議工具條款?請附官方來源。
  7. 逐字稿正常但摘要漏掉決策時,應按什麼順序排查?請附來源。
  8. AI 會議逐字稿正確、摘要卻漏決策,如何依序判斷設定、音訊或模型問題?請附來源。
  9. 會議工具轉錄正常但摘要漏決策,如何依序排查設定、音訊或模型?請列步驟與來源。

這 30 題是「題組」,不是 30 個彼此獨立的使用者市場。先用它跑基線,再依你的 Search Console 查詢、客服問題與銷售紀錄調整下一版題庫。若要設計更正式的測試,可搭配AI Eval 防洩漏測試,避免把答案線索偷偷寫進 Prompt。

第三步:建立引用紀錄表,分母不能偷換

每列代表「一題 × 一個產品 × 一次執行」。30 題跑四個產品,每個 primary wave 是 120 列;同日 sentinel 重跑另列。至少保留下列欄位:

  • experiment/wave/run ID、primary 或 sentinel、repeat number、日期時間、產品模式、題號、Prompt 原文、執行順序與環境。
  • 搜尋是否啟動:是、否、不確定、錯誤;不可把「沒有搜尋」的回答刪掉。
  • 回答是否提到目標品牌、目標頁面或目標主張。
  • 所有可見 URL、canonical URL、網域,以及它屬於行內引用、Sources、related content 或圖片來源。
  • 目標 URL 是否被引用;引用位置是否真的支持相鄰說法;若不支持,記為錯誤歸因。
  • 是否出現明確推薦、推薦對象與理由;另存完整回答或可重現截圖。
  • control/treatment 版本、唯一改動、上線時間、抓取與索引狀態。

同時保存 raw URL、redirect 後 URL 與宣告 canonical;只有 redirect、canonical 與內容等價證據一致時才合併。http/https、www 或尾斜線不同,不能盲目視為同頁。評分規則要在看結果前寫好;若團隊有兩人,隨機抽一部分回答做雙人覆核。

第四步:每輪只改一個可驗證因素

先用伺服器 log、Search Console 或產品特有工具檢查公開可抓取狀態;四個消費者面板本身不能證明已抓取或索引。再跑 pilot/基線觀察波動,挑一個因素做 treatment;其他段落、標題、發布時間與內部連結盡量不動。

  • 來源透明度:把關鍵數字旁的模糊敘述改成可追到官方文件或原始資料的連結。
  • 時間資訊:補上資料觀測日期與適用版本,不假裝內容永久有效。
  • 結構:加入清楚的小標、定義、步驟與可見摘要,但不改事實內容。
  • 一手證據:加入自己的測試方法、原始數據、限制與可下載樣本,而非堆砌二手改寫。
  • 結構化資料:只標記頁面上真的看得到的內容,並先通過搜尋引擎驗證。

最乾淨的入門 treatment 是「位置」:A 版把既有證據框放在文末,B 版只把同一段、同一 HTML 搬到前言後;文字、日期、連結、字數、標題、FAQ 與 schema 全部不變。若同時補數字、改來源又搬位置,那是 bundled intervention,不能知道哪一項造成差異。

把搜尋供應商與來源品質納入記錄也很重要。AI Agent 搜尋 API 怎麼選示範了固定題組與來源稽核;AI 模型路由 Eval則提醒,產品差異不等於純粹的模型差異。

第五步:用六個指標看訊號,不做一個 GEO 總分

  1. 搜尋啟動率=有明確搜尋的 runs ÷(全部 scheduled runs − 預先定義的本機 missing)。它是產品行為,不是頁面排名。
  2. 無條件引用率=引用目標 canonical URL 的 runs ÷ 同一分母。無搜尋、無引用、拒答與產品錯誤都保留;本機 missing 另報 completion rate。
  3. 搜尋條件引用率=引用目標 URL 的 runs ÷ 已啟動搜尋的 runs。它只回答「搜尋發生後」的可見度,不能冒充 retrieval-conditional rate。
  4. 來源多樣性:每個產品 × wave 分開報獨立網域數與各網域占比;網域多不自動代表品質好。
  5. 錯誤歸因率=部分支持或不支持的 target-linked claim–citation pairs ÷ 可評估的 target-linked pairs;無法開啟的來源另列。
  6. 波動:比較相鄰 wave 的來源集合 Jaccard 相似度;兩邊都空另列 null–null,不當成完美穩定。

只有產品揭露目標頁已進候選集或 context 時,才能另算「引用 ÷ 目標已檢索 runs」;否則 retrieval 一律 unknown。推薦率也另列,不與引用率相加。要驗證來源是否支持回答,可像Reddit 公開足跡 Gemini 稽核建立 claim ledger,逐句對回來源。

第六步:每週重跑,先寫好停止規則

固定每週同一天與產品模式,隨機題序並保存順序;另預抽少量 sentinel 題在同日重跑,估計短期噪音。先依決策價值指定主要指標、方向、區間層級(例如 95%)、區間計算方法、預定判讀 waves、重複判讀校正與實務差異 δ;pilot 只估變異,再預註冊 A/B 的 minimum/maximum waves、missing/重試規則。2026 年綜述建議跨改寫、短期重複、日期與引擎觀察;一篇只涵蓋四個瑞士德語垂直、未測 Claude 的小型 preprint,對 source coverage 建議至少 8 次,只能當該設定的 pilot 起點。30 個改寫仍按 10 個資訊需求分群,不能假裝是 30 個獨立主題。

開始前就寫下以下停止規則:

  • B 上線後等預先固定的 wash-in;若 server log 或產品特有工具有重新抓取/索引訊號就記錄,但不能從「沒被引用」反推未索引。wash-in 期間不進主要比較。
  • 成功:到 minimum waves 後的預定判讀點,主要指標經重複判讀校正的區間下界高於 ,且錯誤歸因率區間上界未越過傷害線;只在單一產品達標,就只報該產品。
  • 等效:估計區間整段落在 [-δ,+δ] 內;只有這種設計才能說未見具實務意義的差異。
  • 有害:主要指標區間上界低於 ,或錯誤歸因率區間下界高於傷害線;停止並撤回 B。
  • 不確定:到 maximum waves,主要指標區間仍未整段高於 、未整段落在 [-δ,+δ],也未整段低於 ;凡未符合預寫的成功、等效或有害規則都報不確定,不能改寫成零效果。
  • 若改了多個內容因素,該輪只算探索資料。
  • 產品模式、地區、引用介面或蒐集方式改變,就開新版本分層;漂移哨兵同向變動只能示警,不能替你證明原因。

有多組頁面時,可把配對頁隨機分派 treatment/control;只有單一頁時,只報前後差異與不確定性。KDD 2026 的 SAGEO Arena在其可重現、非商業 testbed 發現,部分改寫會在檢索或重排階段退步;它不能外推所有商業引擎,卻說明只盯最終引用數容易錯判。

一個完整範例:只移動一手證據框

假設你有一篇「AI 會議紀錄工具比較」,文末已放測試日期、任務、評分規則與原始樣本。先依決策價值訂 δ,再用 30 題在四個產品跑兩個 pilot waves,共 240 列,只用來估變異與設定 minimum/maximum waves,不先宣布輸贏。

  1. A 版:證據框留在文末,跑滿預設 minimum waves。
  2. B 版唯一改動:把 byte-identical 的證據框搬到前言後;保存兩版 hash 與上線時間。
  3. 漂移哨兵:選同站、相近更新頻率但不改動的頁面,建立對應題組;它只負責示警。
  4. 重跑:等固定 wash-in,再跑相同 30 題到 minimum;只有預寫規則允許延長至 maximum。
  5. 判讀:按成功、等效、有害、不確定四種規則報告;單頁前後測只寫同期差異,不宣稱證明因果。

這套做法最有價值的地方,不是幫你製造漂亮百分比,而是讓內容團隊知道下一輪該保留什麼、撤回什麼。若要把它制度化,可參考Agent 可觀測性中的 trace 思維:沒有 run 級原始紀錄,就無法解釋聚合數字。

GEO 是什麼?引用實驗 FAQ

30 題足以證明改版有效嗎?

不夠證明普遍因果。30 題的用途是建立固定、可重跑的量尺;你還需要重複時間窗、控制組與預先寫好的評分規則。題組越貼近真實讀者需求,決策價值越高。

要不要要求「請附來源」?

可以,但要固定。上面的主面板讓三個改寫都要求可核對來源,所以估計的是「明確要求來源」時的引用表現。若要測自然引用,另建一套完全不要求來源的 panel,不能混用分母。

每一題都要開全新對話嗎?

要。否則前文、既有搜尋結果與回答會污染下一題。多輪對話可以另做實驗,但不能和單輪基線混算。

四個產品可以混用不同研究模式嗎?

不可以放進同一分母。每個產品先固定一個明確命名的 web-search mode;若要測另一模式,就建立新的 versioned stratum。

被引用就等於被推薦或帶來流量嗎?

不等於。引用、推薦、點擊與轉換是不同結果;沒有對應的點擊或分析資料,就不能從 citation 推論流量。

第一次該測哪一個內容變因?

先測位置。把 byte-identical 的既有證據框從文末搬到前段,其他內容不變,比同時補日期、連結、FAQ 與 schema 更容易解釋。

競爭對手頁面可以當 control 嗎?

不可以。你無法控制對方何時改文、換 canonical 或被重新索引;它只能作市場參考,不能代替隨機化 control 或同站漂移哨兵。

什麼時候該停止做 GEO 實驗?

到預設 maximum waves 仍未符合成功、等效或有害規則,或實驗成本已高於決策價值時就停止,誠實報「不確定」。只有區間整段落在等效界線內,才可說未見具實務意義的差異。

你真正要帶走的 5 件事

  1. GEO 不是保證引用的祕技,而是量測生成式回答中可見度、引用與歸因的實驗問題。
  2. 檢索、提及、引用、推薦、正確與流量必須分開,不能揉成一個分數。
  3. 10 個資訊需求各做 3 個固定改寫,跨四個產品跑一次就是 120 列;產品結果留在分母,本機 missing 依預註冊排除並報 completion。
  4. 每輪只改一個內容因素,保留漂移哨兵;只有配對隨機化才稱 control,單頁前後測不要冒充隨機 A/B。
  5. 先寫停止規則。沒有穩定訊號就如實記錄,而不是追著每週波動發明新祕技。

接著閱讀

左右滑動查看更多推薦

結論:把 GEO 從口號變成可否證的流程

好的 GEO 實驗,不會承諾 ChatGPT 下週一定引用你。它會留下固定題目、清楚分母、內容版本、完整回答與停止條件,讓別人能重跑,也讓「不確定」或「未達預設實務門檻」成為可接受的結論。先凍結 30 題、完成 pilot 與預註冊,再挑一個最值得讀者信任的內容因素去改;這比追任何一張爆紅截圖,更接近真正可累積的能力。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。