OCR It 離線教學真正要解決的,不是「怎麼從畫面抄出一段字」,而是:當 PDF 沒有可選取的文字層、網站 Viewer 鎖住複製,甚至只有一張粗糙掃描圖時,怎麼把畫面變成 Claude 能讀、你又能追回原頁核對的 Context?
風險恰好藏在最順利的時候。OCR 可能把 8.5%讀成3.5%、把雙欄段落交錯,卻仍輸出一篇語氣流暢的文字;Claude 再整理一次,錯誤就更像真的。這篇會用 OCR It 0.3.0 建立一條可重跑流程:固定版本、斷網驗證、做十頁驗收包、保留頁碼與原圖抽查,最後只把合格文字交給 Claude。你不需要寫程式,但要接受一個原則:OCR 輸出是待驗證的逐字稿,不是原文。
先說結論:可信 Claude Context 要多帶兩張「收據」
- 固定工具版本:本文鎖定官方
v0.3.0Release 與 Commit3ecae307eef83890ec603b1cfd2a770721c16411,不把持續前進的 main 當成同一套程式。 - 先證明本機 OCR:0.3.0 的辨識 Worker、核心與英/葡/西語模型都在擴充套件內;但「離線」仍要在你自己的瀏覽器中斷網重跑,不能只信說明頁。
- 信心分數只是警報器:官方 0.3.0 的 24 張合成測試沒有雙欄樣本;其中一張模糊樣本把
carriage讀成carnage時,confidence 仍有 91%。本文不把任何單一 confidence 分數線當成原圖抽查的替代品。 - 頁碼不是 PDF 頁碼:OCR It 匯出的
page N是擷取順序。你要另外記錄 Viewer 顯示頁、裁切區域與驗收狀態,刪頁或漏頁後才不會對錯證據。 - 高風險欄位逐字比:金額、百分比、日期、專名、否定詞與直接引文只要有一處無法從原圖確認,整段就退回人工處理,不讓 Claude 猜。
可信 Context = OCR 文字 + 頁碼/區域定位 + 原圖抽查。
OCR It 是什麼?它讀的是畫面,不是 PDF 文字層
OCR It 是一個開源瀏覽器擴充套件。你先在目前可見的頁面畫出固定矩形,它會擷取整個可見 Viewport,再裁出矩形送給擴充套件內的 Tesseract.js 辨識。這代表它能處理「肉眼看得到、游標卻選不到」的內容,也代表它不會讀取畫面外的頁面、PDF 隱藏文字層或整份文件結構。
截至 2026 年 8 月 30 日,官方 GitHub Repository有 296 Stars;引發討論的 Hacker News 貼文有 139 Points、35 則留言(總留言數)。這些數字只說明需求存在,不等於品質背書。真正相關的證據是 0.3.0 原始碼:OCR Worker、WASM 核心與語言資料都用擴充套件本機 URL 載入,執行路徑沒有外部 OCR 端點。

若你正在建立更完整的知識工作流,可以先用 RAG 是什麼理解「把資料交給模型」和「模型本來就知道」的差別;本文處理的是更前面一層:如何先把不可複製畫面變成有來源定位的文字。
第 0 步:先確認你有權擷取這份文件
離線處理不會自動取得內容授權。自己的掃描檔、公司允許處理的內部文件、已獲授權的研究資料,通常是合理起點;若網站條款禁止批次擷取、文件含客戶個資,或 Viewer 只授權線上閱覽,就先停止,向內容擁有者或組織管理員確認。不要用自動翻頁繞過存取控制,也不要把「技術上截得到」誤當成「可以複製、重製或上傳」。
同樣地,本機 OCR 只縮小文字送往外部服務的範圍;當你把結果貼進 Claude,資料便進入另一個處理環境。先刪除不需要的姓名、帳號、地址與識別碼,只送完成任務所需的最小片段。若團隊需要更完整的權限、引用與資料生命週期設計,可接著看 企業 AI 知識庫怎麼規劃。
第 1 步:下載固定版本,用 Unpacked Extension 安裝
Chrome Web Store 安裝最方便,但版本可能自動更新。這次為了讓結果可重跑,使用官方 v0.3.0 Release中的 ocr-it-chrome-0.3.0.zip。下載後先算 SHA-256;本文核對到的官方壓縮檔值是:
42ec8899cb532021a83e729b155cd3061dfc653830ec957879b223f2c37d9aa3
依系統在下載資料夾選一行執行:
# macOS
shasum -a 256 ocr-it-chrome-0.3.0.zip
# Linux
sha256sum ocr-it-chrome-0.3.0.zip
- 比對完整 64 字元;不同就刪除檔案,回官方 Release 重新下載。
- 解壓縮 ZIP。Chrome 不能直接載入壓縮檔。
- 打開
chrome://extensions,啟用右上角 Developer mode。 - 按 Load unpacked,選取解壓後、內含
manifest.json的資料夾。 - 進入 Details,確認版本顯示
0.3.0。若要讀本機 PDF,再單獨開啟 Allow access to file URLs。
0.3.0 的 Manifest 不會在安裝時取得所有網站權限;單次手動擷取可用目前分頁的暫時授權。只有要讓 Auto-run 跨頁面重新載入後繼續執行,或要操作跨來源 Frame 時,才可能要求目前網站或所有網站的持續權限。先只給目前網站,需要時再加,不要為了省一次點擊直接永久開放所有網站。
第 2 步:斷網驗證,不把「No Cloud」當口號
先安裝擴充套件並準備不含私密資料的本機 Fixture,關閉整個測試 Profile;接著暫停 Wi-Fi、拔除網路線,或用防火牆阻擋 Chrome,冷啟動 Profile 後才第一次打開 Popup、畫區域與擷取。這個順序很重要:Popup 會送出 Warmup,若先操作再斷網,只能證明已暖機的 Worker 能續跑。若要稽核「有沒有嘗試連線」,只看網頁或 Service worker 的 Network 面板還不夠,因為 OCR 另在 Offscreen document 執行;應從乾淨 Profile 啟動 Chrome 的 Browser-wide NetLog,比較未安裝/閒置基線與冷啟動首次 OCR,再同時查看 Service worker、Offscreen document。NetLog 可能含敏感網址與封包資訊,只在本機保存。
AlphaLab 另外以 Chrome 151.0.7922.175與官方 0.3.0 Tag 的真實 E2E Fixture 重跑,將所有非本機 HTTP/HTTPS 指向不可用 Proxy,只保留 127.0.0.1測試頁。OCR、重複頁偵測、三種翻頁路徑與本機儲存檢查均通過;範例讀出 122 個字元、Tesseract confidence 為 93%。這個結果只證明該固定 Fixture 在該環境不依賴成功的非本機 HTTP/HTTPS 請求,不證明從未嘗試連線、每份掃描都準,也不涵蓋 Chrome 自身服務、網站先前載入或未來版本。
固定版程式碼顯示:成功辨識後會刪除完整裁切圖,文字、頁面資料與最寬 280px 的 JPEG 縮圖留在 chrome.storage.local;失敗工作則會保留裁切圖供重試。0.3.0 的儲存路徑把頁面與區域值直接寫入 chrome.storage.local,目前框選區還會記住來源 Origin;這與官方 Privacy 說明中「儲存資料不能識別網站」的描述不完全一致。Clear 會刪除擷取頁與工作影像,但不會清掉已存的區域/Origin 與設定;敏感工作應使用獨立 Profile,結束後再移除擴充套件或整個拋棄式 Profile,並撤銷網站權限。

第 3 步:先做十頁驗收包,再碰真正文件
不要拿一頁乾淨英文就宣布成功。從你有權使用的資料製作十頁測試包,每頁只改一個難度,並事先保留人工校對的 Ground Truth:
- 清晰的單欄 Serif 正文。
- 清晰的 Sans-serif,含日期、金額與百分比。
- 低對比灰字。
- 輕微模糊、壓縮雜訊或紙張陰影。
- 傾斜或旋轉文字,驗證系統會不會安全失敗。
- 雙欄文章,檢查閱讀順序。
- 表格,特別放入小數點、負號與括號。
- 跨頁句子與腳註。
- 粗糙掃描或照片,含彎曲邊緣。
- 手寫或目前未隨 0.3.0 打包的語言,作為預期拒絕案例。
目前 0.3.0 內建英文、葡萄牙文與西班牙文,沒有自動語言偵測,也沒有內建繁體中文模型。新增語言需要重新 Vendor 模型並修改原始碼,不是設定頁按一下即可完成。因此,若你的主要文件是繁中,這版不應被當成即裝即用方案;可把它留給英文附錄,中文頁則人工處理或選擇明確支援中文、可保留來源圖的 OCR 工具。
每頁都記錄:測試類型、預期文字、OCR 原始文字、confidence、錯誤字數、數字/專名是否全對、段落順序、通過/人工修正/拒絕。若要量化,可計算 Character Error Rate(刪除+插入+替換字元數 ÷ Ground Truth 字元數);但決策仍要讓高風險欄位優先。99% 字元正確,若唯一錯字是金額,也應拒絕。
第 4 步:固定 Viewport,逐頁建立擷取順序
- 把 Chrome 縮放、視窗大小與 Viewer 顯示模式調好後就不要再改。
- 讓同一個矩形只包住正文;按
Alt+Shift+R重畫區域,再以Alt+Shift+S擷取。快捷鍵衝突時到chrome://extensions/shortcuts確認。 - 每擷取一頁,立刻在外部驗收紀錄寫下「OCR capture N → Viewer page X → 區域描述」。
- Chrome 內建 PDF Viewer 不支援 OCR It 自動翻頁;按 PageDown/方向鍵人工換頁,等畫面穩定再擷取。
- 若是網頁 Reader 且已通過十頁測試,才考慮選取 Next 控制並啟用 Auto-run;前五頁仍要盯著,避免固定座標因 Reflow 漂移。
Auto-run 在下一次截圖前會等 OCR 完成,因此能用辨識後文字做重複偵測;但它比對的是正規化後文字完全相同,不是影像相似度。少量 OCR 雜訊可能讓結尾不停止,合法重複段落也可能提早觸發。設定頁的 Page cap 是保險絲,不是頁數正確性的證明。
第 5 步:用三道品質閘門決定通過、修正或拒絕
OCR It 官方 Benchmark只有 24 張合成英文樣本、單一字體與書本文字,不含真實掃描、表格、照片或手寫;它最有價值的結論不是某個百分比,而是 confidence 可能和真實錯誤脫鉤。請把判分拆成三關:
第一關:畫面完整性
確認沒有截掉行首、行尾、頁首否定詞或表格欄位;縮圖順序無漏頁、無重複;雙欄沒有左右交錯。這一關失敗就重新擷取,不要先改文字。
第二關:高風險字元
逐一比對金額、百分比、日期、版本、計量單位、人名、公司名、URL、正負號、否定詞與引文。任何一項看不清楚就標記「需看原圖」;這些欄位不適合用平均 confidence 放行。
第三關:抽樣與拒絕條件
乾淨頁至少抽查開頭、中間、結尾各一段;低對比、表格、雙欄與粗掃描則整頁核對。若出現欄序錯亂、無法辨識的旋轉、縮圖不足以還原細節、頁碼映射不確定,或任一高風險欄位無法確認,直接拒絕該頁,回原始 Viewer 重截或人工抄錄。不要制定一條「confidence ≥ 90 就自動通過」的假規則。

OCR It 的 Download .txt 只輸出依序排列的文字與 --- page N ---分隔線,不會帶 confidence、時間、重複旗標、來源 Origin、區域或縮圖。請把外部驗收紀錄與必要的原始頁面截圖另外保存;已成功辨識的完整裁切圖通常已被刪除,內建 Viewer 只剩低解析縮圖,不能事後補當精密稽核證據。
第 6 步:只把合格頁送進 Claude,要求它回報頁碼
先把已通過的頁面貼成小批次,每段保留 OCR It 分隔線;若你刪過頁面,改用自己外部紀錄中的穩定 ID,例如 [DOC-A / viewer p.17 / capture 06]。接著把這段指令放在最前面:
以下是 OCR transcript,不是已驗證原文。
只依 transcript 回答,不用常識補寫缺漏。
每個可核對主張後標示 [OCR page N]。
數字、專名、否定詞與直接引文若跨頁、衝突或不清楚,
請列入「需看原圖」,不要自行修正。
找不到答案就明說找不到。
最後列出你實際使用過的頁碼,供我逐頁抽查。
Claude 回答後,挑三種內容回查原圖:結論依據、所有數字、看起來最流暢卻最難確認的一句。這和 Claude 引用稽核教學的核心相同:引用存在不等於引用支持主張;你要沿著頁碼回到原始證據。
如果你使用 Anthropic API 的 Citations 功能,可把每頁做成獨立 Custom content block,讓回傳 Citation 指向區塊索引;純文字文件則是字元範圍。Anthropic 官方文件也明確指出,沒有可抽取文字的掃描 PDF 不能直接產生 PDF Page Citation,影像 Citation 目前不受支援。因此「先 OCR、再按頁分塊、仍回原圖驗收」不是多此一舉。一般 Claude 對話介面中,本文的[OCR page N]只是你要求模型遵守的標記,不要把它誤認為 API 強制建立的 Citation。
人工抄錄、OCR It、Tesseract CLI 與 VLM 怎麼選?
- 只有幾個高風險欄位:直接人工抄錄,再由第二人逐字比對,通常比建立 OCR 流程更省。
- 同一 Viewer 有大量固定版面英文頁:OCR It 最方便,前提是 Viewport 不漂移、十頁驗收包通過,且你保留外部頁碼映射。
- 需要批次檔案、語言包、旋轉偵測或字詞座標:使用可設定的 Tesseract CLI/其他文件 OCR 管線;OCR It 0.3.0 的辨識結果只保留純文字與一個整體 confidence 數值,未提供旋轉偵測或字詞座標。
- 複雜表格、圖文混排或極差掃描:可讓具視覺能力的模型當第二讀者,但只處理你有權送出的頁面,並以原圖為最終依據。VLM 文字更像人話,不代表數字更可靠。
若你真正需要的是長文件檢索,而不是一次摘要,先做完本文的來源清理,再把通過頁送進索引;可搭配 Claude 節省 Token 教學,避免每輪對話重貼整份逐字稿。要比較一般 Claude、Claude Code 與協作介面的責任邊界,則可讀 Claude、Claude Code、Cowork 差別。
常見失敗:不是 OCR 錯,而是證據鏈先斷了
- 換頁後改了縮放:固定座標仍在原位置,文字卻移走;重畫區域並重做該批。
- 把 capture N 當 PDF page N:漏擷取、刪頁或封面不計頁都會錯位;外部紀錄必須同時保存兩者。
- 高 confidence 就不看原圖:版面順序錯時分數仍可能很高;先驗欄序與高風險字元。
- 成功後才想看完整裁切:0.3.0 成功辨識後通常只留小縮圖;需要稽核的頁要在原 Viewer 另存授權範圍內的證據圖。
- 用繁中頁測英文模型:當作預期拒絕案例,不要靠人工猜字把它「修到像對」。
- 整份逐字稿一次丟給 Claude:頁碼與錯誤會被淹沒;按頁或小批次送入,逐批抽查。
OCR It 離線教學 FAQ
OCR It 真的完全離線嗎?
0.3.0 的 OCR 執行路徑可在本機完成,但不要把它擴張成整個瀏覽器永遠零連線。固定版原始碼使用隨附 Worker、核心與語言資料;商店下載、網站本身、Chrome 服務與未來版本是不同邊界。請用自己的斷網 Fixture 驗證。
OCR It 0.3.0 能自動讀完整 PDF 嗎?
在 Chrome 內建 PDF Viewer 中不能。0.3.0 只 OCR 目前可見的固定區域,內建 Viewer 需要人工換頁;若是有可操作 Next 控制的普通網頁 Viewer,通過測試後可能使用 Auto-run,但仍不是直接讀完整 PDF 檔案。
它支援繁體中文嗎?
官方 0.3.0 成品沒有內建繁中模型。內含英文、葡萄牙文、西班牙文;新增語言需把模型 Vendor 進 Source tree、把語碼加入 LANGUAGES,再於 chrome://extensions重新載入這份 Unpacked Extension。
Confidence 多少才算及格?
本文不設跨文件的通用門檻。先用自己的十頁測試包建立基線,再讓數字、專名、引文與段落順序採零容忍;confidence 只用來排序複核優先級。
人工修字後,Confidence 會更新嗎?
不會。畫面保留的是原始 OCR 分數;人工修改要在外部驗收紀錄標明,不要把舊分數當成修正後品質。
Download .txt 會包含原圖與區域嗎?
不會。它只輸出文字與 --- page N ---分隔線;confidence、縮圖、來源與區域都要另存。
Claude 能自動修正 OCR 錯字嗎?
它可能猜對,也可能把錯誤合理化。要求它標頁碼、列出不確定處,並用原圖驗證;不要把語句通順當成修正成功。
什麼情況應直接放棄 OCR It?
主要內容是繁中、手寫、旋轉照片、複雜表格,或你無法保存頁碼映射時。此時改用合適的文件 OCR 管線或人工雙人校對,比硬把結果送進 Claude 安全。
新手只要記住這 5 件事
- 下載固定 Release、核對 SHA-256,再用 Unpacked Extension 安裝。
- 冷啟動後硬阻擋網路並重跑固定 Fixture,確認該版本、該流程仍能 OCR。
- 先做十頁驗收包;confidence 不等於正確率。
- 外部保存 capture N、Viewer 頁碼、區域與驗收狀態。
- Claude 每個主張都標頁碼,數字與引文最後回原圖抽查。
接著閱讀
左右滑動查看更多推薦
最好的第一次練習,不是直接處理 300 頁報告,而是拿十頁可公開、可人工核對的英文文件完成一輪:故意放進低對比、雙欄與錯頁,確認流程會拒絕它們。當你的紀錄能讓另一個人從 Claude 的一句結論,沿著 [OCR page N]回到正確 Viewer 頁與原圖,這份 OCR 才真正成為可用的 Context。






