跳到主要內容

【2026 最新】OCR It 離線教學:6 步把 PDF 變成可核對的 Claude Context

最後更新: ·
OCR It 離線 OCR 教學首圖,以固定裁切文件與來源驗收節點呈現可核對 Claude Context

OCR It 離線教學真正要解決的,不是「怎麼從畫面抄出一段字」,而是:當 PDF 沒有可選取的文字層、網站 Viewer 鎖住複製,甚至只有一張粗糙掃描圖時,怎麼把畫面變成 Claude 能讀、你又能追回原頁核對的 Context?

風險恰好藏在最順利的時候。OCR 可能把 8.5%讀成3.5%、把雙欄段落交錯,卻仍輸出一篇語氣流暢的文字;Claude 再整理一次,錯誤就更像真的。這篇會用 OCR It 0.3.0 建立一條可重跑流程:固定版本、斷網驗證、做十頁驗收包、保留頁碼與原圖抽查,最後只把合格文字交給 Claude。你不需要寫程式,但要接受一個原則:OCR 輸出是待驗證的逐字稿,不是原文。

先說結論:可信 Claude Context 要多帶兩張「收據」

  • 固定工具版本:本文鎖定官方 v0.3.0 Release 與 Commit 3ecae307eef83890ec603b1cfd2a770721c16411,不把持續前進的 main 當成同一套程式。
  • 先證明本機 OCR:0.3.0 的辨識 Worker、核心與英/葡/西語模型都在擴充套件內;但「離線」仍要在你自己的瀏覽器中斷網重跑,不能只信說明頁。
  • 信心分數只是警報器:官方 0.3.0 的 24 張合成測試沒有雙欄樣本;其中一張模糊樣本把 carriage讀成carnage時,confidence 仍有 91%。本文不把任何單一 confidence 分數線當成原圖抽查的替代品。
  • 頁碼不是 PDF 頁碼:OCR It 匯出的 page N是擷取順序。你要另外記錄 Viewer 顯示頁、裁切區域與驗收狀態,刪頁或漏頁後才不會對錯證據。
  • 高風險欄位逐字比:金額、百分比、日期、專名、否定詞與直接引文只要有一處無法從原圖確認,整段就退回人工處理,不讓 Claude 猜。

可信 Context = OCR 文字 + 頁碼/區域定位 + 原圖抽查。

OCR It 是什麼?它讀的是畫面,不是 PDF 文字層

OCR It 是一個開源瀏覽器擴充套件。你先在目前可見的頁面畫出固定矩形,它會擷取整個可見 Viewport,再裁出矩形送給擴充套件內的 Tesseract.js 辨識。這代表它能處理「肉眼看得到、游標卻選不到」的內容,也代表它不會讀取畫面外的頁面、PDF 隱藏文字層或整份文件結構。

截至 2026 年 8 月 30 日,官方 GitHub Repository有 296 Stars;引發討論的 Hacker News 貼文有 139 Points、35 則留言(總留言數)。這些數字只說明需求存在,不等於品質背書。真正相關的證據是 0.3.0 原始碼:OCR Worker、WASM 核心與語言資料都用擴充套件本機 URL 載入,執行路徑沒有外部 OCR 端點。

OCR It 在網頁上框選固定文字區域的官方操作畫面
先框選只包含正文的固定區域;導覽列、頁碼按鈕與會移動的浮動元件都不要納入。圖片來源:OCR It 官方 Repository(MIT License)。

若你正在建立更完整的知識工作流,可以先用 RAG 是什麼理解「把資料交給模型」和「模型本來就知道」的差別;本文處理的是更前面一層:如何先把不可複製畫面變成有來源定位的文字。

第 0 步:先確認你有權擷取這份文件

離線處理不會自動取得內容授權。自己的掃描檔、公司允許處理的內部文件、已獲授權的研究資料,通常是合理起點;若網站條款禁止批次擷取、文件含客戶個資,或 Viewer 只授權線上閱覽,就先停止,向內容擁有者或組織管理員確認。不要用自動翻頁繞過存取控制,也不要把「技術上截得到」誤當成「可以複製、重製或上傳」。

同樣地,本機 OCR 只縮小文字送往外部服務的範圍;當你把結果貼進 Claude,資料便進入另一個處理環境。先刪除不需要的姓名、帳號、地址與識別碼,只送完成任務所需的最小片段。若團隊需要更完整的權限、引用與資料生命週期設計,可接著看 企業 AI 知識庫怎麼規劃

第 1 步:下載固定版本,用 Unpacked Extension 安裝

Chrome Web Store 安裝最方便,但版本可能自動更新。這次為了讓結果可重跑,使用官方 v0.3.0 Release中的 ocr-it-chrome-0.3.0.zip。下載後先算 SHA-256;本文核對到的官方壓縮檔值是:

42ec8899cb532021a83e729b155cd3061dfc653830ec957879b223f2c37d9aa3

依系統在下載資料夾選一行執行:

# macOS
shasum -a 256 ocr-it-chrome-0.3.0.zip

# Linux
sha256sum ocr-it-chrome-0.3.0.zip
  1. 比對完整 64 字元;不同就刪除檔案,回官方 Release 重新下載。
  2. 解壓縮 ZIP。Chrome 不能直接載入壓縮檔。
  3. 打開 chrome://extensions,啟用右上角 Developer mode。
  4. 按 Load unpacked,選取解壓後、內含 manifest.json的資料夾。
  5. 進入 Details,確認版本顯示 0.3.0。若要讀本機 PDF,再單獨開啟 Allow access to file URLs。

0.3.0 的 Manifest 不會在安裝時取得所有網站權限;單次手動擷取可用目前分頁的暫時授權。只有要讓 Auto-run 跨頁面重新載入後繼續執行,或要操作跨來源 Frame 時,才可能要求目前網站或所有網站的持續權限。先只給目前網站,需要時再加,不要為了省一次點擊直接永久開放所有網站。

第 2 步:斷網驗證,不把「No Cloud」當口號

先安裝擴充套件並準備不含私密資料的本機 Fixture,關閉整個測試 Profile;接著暫停 Wi-Fi、拔除網路線,或用防火牆阻擋 Chrome,冷啟動 Profile 後才第一次打開 Popup、畫區域與擷取。這個順序很重要:Popup 會送出 Warmup,若先操作再斷網,只能證明已暖機的 Worker 能續跑。若要稽核「有沒有嘗試連線」,只看網頁或 Service worker 的 Network 面板還不夠,因為 OCR 另在 Offscreen document 執行;應從乾淨 Profile 啟動 Chrome 的 Browser-wide NetLog,比較未安裝/閒置基線與冷啟動首次 OCR,再同時查看 Service worker、Offscreen document。NetLog 可能含敏感網址與封包資訊,只在本機保存。

AlphaLab 另外以 Chrome 151.0.7922.175與官方 0.3.0 Tag 的真實 E2E Fixture 重跑,將所有非本機 HTTP/HTTPS 指向不可用 Proxy,只保留 127.0.0.1測試頁。OCR、重複頁偵測、三種翻頁路徑與本機儲存檢查均通過;範例讀出 122 個字元、Tesseract confidence 為 93%。這個結果只證明該固定 Fixture 在該環境不依賴成功的非本機 HTTP/HTTPS 請求,不證明從未嘗試連線、每份掃描都準,也不涵蓋 Chrome 自身服務、網站先前載入或未來版本。

固定版程式碼顯示:成功辨識後會刪除完整裁切圖,文字、頁面資料與最寬 280px 的 JPEG 縮圖留在 chrome.storage.local;失敗工作則會保留裁切圖供重試。0.3.0 的儲存路徑把頁面與區域值直接寫入 chrome.storage.local,目前框選區還會記住來源 Origin;這與官方 Privacy 說明中「儲存資料不能識別網站」的描述不完全一致。Clear 會刪除擷取頁與工作影像,但不會清掉已存的區域/Origin 與設定;敏感工作應使用獨立 Profile,結束後再移除擴充套件或整個拋棄式 Profile,並撤銷網站權限。

離線 OCR 文字通過頁碼區域與原圖三重驗收後才交給 Claude 的流程圖
斷網成功只通過第一關;文字還要能追回擷取順序、Viewer 頁碼與原圖,才適合成為 Claude Context。

第 3 步:先做十頁驗收包,再碰真正文件

不要拿一頁乾淨英文就宣布成功。從你有權使用的資料製作十頁測試包,每頁只改一個難度,並事先保留人工校對的 Ground Truth:

  1. 清晰的單欄 Serif 正文。
  2. 清晰的 Sans-serif,含日期、金額與百分比。
  3. 低對比灰字。
  4. 輕微模糊、壓縮雜訊或紙張陰影。
  5. 傾斜或旋轉文字,驗證系統會不會安全失敗。
  6. 雙欄文章,檢查閱讀順序。
  7. 表格,特別放入小數點、負號與括號。
  8. 跨頁句子與腳註。
  9. 粗糙掃描或照片,含彎曲邊緣。
  10. 手寫或目前未隨 0.3.0 打包的語言,作為預期拒絕案例。

目前 0.3.0 內建英文、葡萄牙文與西班牙文,沒有自動語言偵測,也沒有內建繁體中文模型。新增語言需要重新 Vendor 模型並修改原始碼,不是設定頁按一下即可完成。因此,若你的主要文件是繁中,這版不應被當成即裝即用方案;可把它留給英文附錄,中文頁則人工處理或選擇明確支援中文、可保留來源圖的 OCR 工具。

每頁都記錄:測試類型、預期文字、OCR 原始文字、confidence、錯誤字數、數字/專名是否全對、段落順序、通過/人工修正/拒絕。若要量化,可計算 Character Error Rate(刪除+插入+替換字元數 ÷ Ground Truth 字元數);但決策仍要讓高風險欄位優先。99% 字元正確,若唯一錯字是金額,也應拒絕。

第 4 步:固定 Viewport,逐頁建立擷取順序

  1. 把 Chrome 縮放、視窗大小與 Viewer 顯示模式調好後就不要再改。
  2. 讓同一個矩形只包住正文;按 Alt+Shift+R重畫區域,再以 Alt+Shift+S擷取。快捷鍵衝突時到 chrome://extensions/shortcuts確認。
  3. 每擷取一頁,立刻在外部驗收紀錄寫下「OCR capture N → Viewer page X → 區域描述」。
  4. Chrome 內建 PDF Viewer 不支援 OCR It 自動翻頁;按 PageDown/方向鍵人工換頁,等畫面穩定再擷取。
  5. 若是網頁 Reader 且已通過十頁測試,才考慮選取 Next 控制並啟用 Auto-run;前五頁仍要盯著,避免固定座標因 Reflow 漂移。

Auto-run 在下一次截圖前會等 OCR 完成,因此能用辨識後文字做重複偵測;但它比對的是正規化後文字完全相同,不是影像相似度。少量 OCR 雜訊可能讓結尾不停止,合法重複段落也可能提早觸發。設定頁的 Page cap 是保險絲,不是頁數正確性的證明。

第 5 步:用三道品質閘門決定通過、修正或拒絕

OCR It 官方 Benchmark只有 24 張合成英文樣本、單一字體與書本文字,不含真實掃描、表格、照片或手寫;它最有價值的結論不是某個百分比,而是 confidence 可能和真實錯誤脫鉤。請把判分拆成三關:

第一關:畫面完整性

確認沒有截掉行首、行尾、頁首否定詞或表格欄位;縮圖順序無漏頁、無重複;雙欄沒有左右交錯。這一關失敗就重新擷取,不要先改文字。

第二關:高風險字元

逐一比對金額、百分比、日期、版本、計量單位、人名、公司名、URL、正負號、否定詞與引文。任何一項看不清楚就標記「需看原圖」;這些欄位不適合用平均 confidence 放行。

第三關:抽樣與拒絕條件

乾淨頁至少抽查開頭、中間、結尾各一段;低對比、表格、雙欄與粗掃描則整頁核對。若出現欄序錯亂、無法辨識的旋轉、縮圖不足以還原細節、頁碼映射不確定,或任一高風險欄位無法確認,直接拒絕該頁,回原始 Viewer 重截或人工抄錄。不要制定一條「confidence ≥ 90 就自動通過」的假規則。

AlphaLab 在 OCR It 0.3.0 非本機 HTTP/HTTPS Proxy 阻斷測試中取得的頁面清單與 confidence 畫面
這是 AlphaLab 固定 0.3.0 Tag、將非本機 HTTP/HTTPS 導向不可用 Proxy 的 E2E Fixture 畫面。Popup 適合巡檢與修字,但 confidence 是原始 OCR 分數;人工修改後不會重算,Re-run 按鈕也不代表成功頁的完整裁切圖仍存在。

OCR It 的 Download .txt 只輸出依序排列的文字與 --- page N ---分隔線,不會帶 confidence、時間、重複旗標、來源 Origin、區域或縮圖。請把外部驗收紀錄與必要的原始頁面截圖另外保存;已成功辨識的完整裁切圖通常已被刪除,內建 Viewer 只剩低解析縮圖,不能事後補當精密稽核證據。

第 6 步:只把合格頁送進 Claude,要求它回報頁碼

先把已通過的頁面貼成小批次,每段保留 OCR It 分隔線;若你刪過頁面,改用自己外部紀錄中的穩定 ID,例如 [DOC-A / viewer p.17 / capture 06]。接著把這段指令放在最前面:

以下是 OCR transcript,不是已驗證原文。
只依 transcript 回答,不用常識補寫缺漏。
每個可核對主張後標示 [OCR page N]。
數字、專名、否定詞與直接引文若跨頁、衝突或不清楚,
請列入「需看原圖」,不要自行修正。
找不到答案就明說找不到。
最後列出你實際使用過的頁碼,供我逐頁抽查。

Claude 回答後,挑三種內容回查原圖:結論依據、所有數字、看起來最流暢卻最難確認的一句。這和 Claude 引用稽核教學的核心相同:引用存在不等於引用支持主張;你要沿著頁碼回到原始證據。

如果你使用 Anthropic API 的 Citations 功能,可把每頁做成獨立 Custom content block,讓回傳 Citation 指向區塊索引;純文字文件則是字元範圍。Anthropic 官方文件也明確指出,沒有可抽取文字的掃描 PDF 不能直接產生 PDF Page Citation,影像 Citation 目前不受支援。因此「先 OCR、再按頁分塊、仍回原圖驗收」不是多此一舉。一般 Claude 對話介面中,本文的[OCR page N]只是你要求模型遵守的標記,不要把它誤認為 API 強制建立的 Citation。

人工抄錄、OCR It、Tesseract CLI 與 VLM 怎麼選?

  • 只有幾個高風險欄位:直接人工抄錄,再由第二人逐字比對,通常比建立 OCR 流程更省。
  • 同一 Viewer 有大量固定版面英文頁:OCR It 最方便,前提是 Viewport 不漂移、十頁驗收包通過,且你保留外部頁碼映射。
  • 需要批次檔案、語言包、旋轉偵測或字詞座標:使用可設定的 Tesseract CLI/其他文件 OCR 管線;OCR It 0.3.0 的辨識結果只保留純文字與一個整體 confidence 數值,未提供旋轉偵測或字詞座標。
  • 複雜表格、圖文混排或極差掃描:可讓具視覺能力的模型當第二讀者,但只處理你有權送出的頁面,並以原圖為最終依據。VLM 文字更像人話,不代表數字更可靠。

若你真正需要的是長文件檢索,而不是一次摘要,先做完本文的來源清理,再把通過頁送進索引;可搭配 Claude 節省 Token 教學,避免每輪對話重貼整份逐字稿。要比較一般 Claude、Claude Code 與協作介面的責任邊界,則可讀 Claude、Claude Code、Cowork 差別

常見失敗:不是 OCR 錯,而是證據鏈先斷了

  • 換頁後改了縮放:固定座標仍在原位置,文字卻移走;重畫區域並重做該批。
  • 把 capture N 當 PDF page N:漏擷取、刪頁或封面不計頁都會錯位;外部紀錄必須同時保存兩者。
  • 高 confidence 就不看原圖:版面順序錯時分數仍可能很高;先驗欄序與高風險字元。
  • 成功後才想看完整裁切:0.3.0 成功辨識後通常只留小縮圖;需要稽核的頁要在原 Viewer 另存授權範圍內的證據圖。
  • 用繁中頁測英文模型:當作預期拒絕案例,不要靠人工猜字把它「修到像對」。
  • 整份逐字稿一次丟給 Claude:頁碼與錯誤會被淹沒;按頁或小批次送入,逐批抽查。

OCR It 離線教學 FAQ

OCR It 真的完全離線嗎?

0.3.0 的 OCR 執行路徑可在本機完成,但不要把它擴張成整個瀏覽器永遠零連線。固定版原始碼使用隨附 Worker、核心與語言資料;商店下載、網站本身、Chrome 服務與未來版本是不同邊界。請用自己的斷網 Fixture 驗證。

OCR It 0.3.0 能自動讀完整 PDF 嗎?

在 Chrome 內建 PDF Viewer 中不能。0.3.0 只 OCR 目前可見的固定區域,內建 Viewer 需要人工換頁;若是有可操作 Next 控制的普通網頁 Viewer,通過測試後可能使用 Auto-run,但仍不是直接讀完整 PDF 檔案。

它支援繁體中文嗎?

官方 0.3.0 成品沒有內建繁中模型。內含英文、葡萄牙文、西班牙文;新增語言需把模型 Vendor 進 Source tree、把語碼加入 LANGUAGES,再於 chrome://extensions重新載入這份 Unpacked Extension。

Confidence 多少才算及格?

本文不設跨文件的通用門檻。先用自己的十頁測試包建立基線,再讓數字、專名、引文與段落順序採零容忍;confidence 只用來排序複核優先級。

人工修字後,Confidence 會更新嗎?

不會。畫面保留的是原始 OCR 分數;人工修改要在外部驗收紀錄標明,不要把舊分數當成修正後品質。

Download .txt 會包含原圖與區域嗎?

不會。它只輸出文字與 --- page N ---分隔線;confidence、縮圖、來源與區域都要另存。

Claude 能自動修正 OCR 錯字嗎?

它可能猜對,也可能把錯誤合理化。要求它標頁碼、列出不確定處,並用原圖驗證;不要把語句通順當成修正成功。

什麼情況應直接放棄 OCR It?

主要內容是繁中、手寫、旋轉照片、複雜表格,或你無法保存頁碼映射時。此時改用合適的文件 OCR 管線或人工雙人校對,比硬把結果送進 Claude 安全。

新手只要記住這 5 件事

  1. 下載固定 Release、核對 SHA-256,再用 Unpacked Extension 安裝。
  2. 冷啟動後硬阻擋網路並重跑固定 Fixture,確認該版本、該流程仍能 OCR。
  3. 先做十頁驗收包;confidence 不等於正確率。
  4. 外部保存 capture N、Viewer 頁碼、區域與驗收狀態。
  5. Claude 每個主張都標頁碼,數字與引文最後回原圖抽查。

接著閱讀

左右滑動查看更多推薦

最好的第一次練習,不是直接處理 300 頁報告,而是拿十頁可公開、可人工核對的英文文件完成一輪:故意放進低對比、雙欄與錯頁,確認流程會拒絕它們。當你的紀錄能讓另一個人從 Claude 的一句結論,沿著 [OCR page N]回到正確 Viewer 頁與原圖,這份 OCR 才真正成為可用的 Context。

ALPHALAB 社群

有問題?來 Telegram 聊

和 Terry、編輯、其他網友一起討論這篇文章。提問、分享觀點,回覆更即時。

加入 Telegram 討論

📩 訂閱 AlphaLab 電子報

每週最多三封:一封 Weekly 週報與最多兩封關鍵 Alpha Signal。

我們不會 spam,隨時可退訂。