你把一份長報告交給 AI,卻發現光是把全文塞進對話就吃掉大量上下文。LensVLM 的想法很特別:先把文字排成縮小的「頁面照片」,讓模型掃過全貌;看到可能有答案的頁面,再展開原文細讀。真正有用的是先掃描、後回看這個動作。
這篇寫給第一次聽到視覺語言模型的讀者。你會看懂 LensVLM 如何選頁、影像 Token 與文字 Token 怎麼算,以及怎麼用同一份公開長文件設三道題,公平比較全文閱讀、關鍵字搜尋和視覺選頁。三題是可照做的評測設計;文中引用的模型表現均出自原論文,沒有把它說成本地或繁中重跑結果。
先說結論:LensVLM 把「看大綱」和「翻原頁」分開
一句話記住:LensVLM =低解析頁面總覽+按問題選頁+展開原文作答。把它想成在書店找資料:先從遠處掃過整排書架,再把疑似相關的一本拿近看。縮圖負責找方向,展開後的原文負責核對字句與數字。
截至 2026 年 9 月,Apple 的LensVLM-9B 模型卡與官方程式庫提供研究權重、文字文件示範與 5x/10x/15x 壓縮選項。模型權重採 Apple Machine Learning Research Model License,授權範圍是非商業研究;評估產品導入的人應先讀授權條款。
LensVLM 是什麼?先分清三種「變小」
一個文件有三種常被混成一談的大小:檔案大小是硬碟上的 PDF 或 PNG 位元組;文字 Token是文字模型切出的片段;影像 Token是視覺編碼器把圖片轉成的片段。把文字畫成小圖片,可能減少模型入口看到的影像 Token,卻不表示 PNG 檔案一定更小,也不保證 GPU 記憶體或總等待時間同步下降。
論文把原文 Token 數除以初始影像 Token 數,叫做「輸入壓縮率」;再把展開工具送回的內容也算進模型實際讀到的 Token,得到「有效壓縮率」。選頁越多,答案可能更完整,實際省下的 Token 也會越少。這個分母差異,是讀任何「壓縮幾倍」宣傳時要先問的事。

LensVLM 如何運作?用一個問題追完整條路
想像你問一份多頁報告:「哪個方法在最強壓縮時還保留最多答案?」模型先收到整份報告的低解析頁面。它可能辨認到某頁有實驗圖、另一頁有方法表,就呼叫 read_page 展開其中一頁;若第一頁只給了方法名稱,再打開第二頁找數字,最後才回答。官方README 的逐回合範例展示了從縮圖定位、讀原文、再作答的軌跡。
- 第一步,排成頁面:程式按字體、寬度和行距把文字渲染成多張圖片;
5x/10x/15x是官方渲染預設,不是 JPEG 品質。 - 第二步,挑證據頁:模型一邊看問題、一邊掃壓縮頁面,決定呼叫哪個頁碼。這是學出來的選擇行為;單純把字縮小,不會自動學會選頁。
- 第三步,展開閱讀:對純文字渲染頁,工具可交還來源文字;對原本就有圖表或排版訊息的文件,論文另研究放大圖片。讀完工具回應,模型仍可依新線索選下一頁。
關鍵的失敗點藏在第二步:如果答案只出現在一行極小的字裡,縮圖連「這頁值得看」的線索都不足,模型可能選不到它。LensVLM 論文把「選對頁」和「讀對答案」分開評分,正是因為兩者會以不同方式失敗。
LensVLM 與全文、搜尋:同一文件怎麼做三題對照?
拿公開的LensVLM 原論文 PDF當共用文件。它含方法、表格、附錄,適合示範不同位置的證據。這是一份教你設計對照的工作紙:我們沒有替三種方法填上勝負。若要評估自己的業務文件,請換成模型訓練期之後發布、且你有權使用的材料,減少模型記住答案的干擾。
- 題一,找機制:「模型先做哪件事,讀到可能相關的頁面後再做哪件事?」標準答案是先掃壓縮頁,再用工具展開相關來源內容;證據位於論文方法段。這題測粗略定位。
- 題二,找精確數字:「在作者的
5x設定下,LensVLM 的平均問答準確率及有效壓縮率是多少?」答案在論文主結果附近;評分要同時看數字、單位和實驗設定。 - 題三,跨段判斷:「文字排成圖時該展開原文,還是放大圖片?原生圖文文件的選擇是否相同?」答案要結合工具比較與文件任務段;這題測多處證據能否串起來。
準備同一份乾淨的文字版,固定題目、頁碼與標準答案。全文組把全文交給同一個讀者模型;關鍵字組先用 BM25 或搜尋字詞取固定數量的段落,再讓同一讀者作答;LensVLM 組用官方渲染與選頁流程。三組都記錄答對與否、引用的證據頁、送入讀者的 Token、預處理時間、檢索或選頁時間、生成時間與峰值記憶體。若讀者模型、硬體或證據預算不同,先列明差異,再解讀結果。
下圖把原論文作者的指定設定與你自己的三題記錄欄分開。原論文在多個文字問答基準測得有利結果;這不能直接推出中文小字、你的 PDF,或實際營運成本也有同樣幅度。

LensVLM 怎麼上手?先決定要「看懂」還是「跑模型」
只想理解:先讀官方 README 的逐回合輸出,找出每次 read_page 選了哪一頁、工具交回什麼文字、最後答案是否能在來源頁核對。這個步驟不需下載權重,也能學會判讀選頁軌跡。搭配BM25、向量與混合搜尋教學,就能看出視覺選頁和傳統檢索分別在哪裡付出成本。
具備足夠 GPU 與研究用途:官方模型卡的最短路徑如下。先確認 Python 環境可安裝官方 requirements.txt 裡的 PyTorch、vLLM、Transformers 與 Pillow,再執行範例。程式庫目前的 demo.py 以 bfloat16 載入模型並把最長上下文設為 32768;官方權重檔約 18.8 GB,推論還需額外快取與執行記憶體。
git clone https://github.com/apple-aiml-research/ml-lensvlm
cd ml-lensvlm
pip install -r requirements.txt
python scripts/run_demo.py
自己的純文字文件可改用 python demo.py --model apple/LensVLM-9B --text_file document.txt --question "What is the main finding?" --compression 10x。參數逐一對照官方demo.py 原始碼;輸出會包含渲染頁與模型軌跡。若文件本來是 PDF,先人工核對抽出的文字與表格順序,再餵給 --text_file。
官方評分腳本使用另一個大型模型當語意評審,因此重現「論文評分」需要額外的評審端點;新手先看選頁軌跡、手動核對三題即可。選頁命中率只表示打開過證據頁,還要再看答案是否正確。
哪些情況容易失手?先檢查四個地方
- 小字與精確數字:高壓縮會讓字形難辨;把精確數字題單獨算,檢查展開頁和答案是否同時正確。
- 中文文件:論文的主實驗是既定問答資料集和其渲染配置;繁體中文的字形密度、斷行與字體要另行驗證。不要把英文基準分數搬成繁中保證。
- 原生 PDF 與純文字:文字轉圖時,來源文字的展開通常保留最精確字句;有圖表、欄位和排版線索的原生文件,論文中的圖片放大變體可能更合適。
- 總成本:搜尋索引在多次查詢間可以攤提;LensVLM 每題仍要渲染、看圖、選頁與產生答案。記下預處理是否重複使用,以及每次展開增加多少讀者 Token。
如果關鍵字直接命中一個唯一欄位,先試簡單搜尋;若需要跨頁線索、原生排版或無法先建索引,再評估視覺選頁。這是評測優先順序,不是誰永遠贏的宣言。想理解「上下文被壓縮後找回來有多貴」,可讀上下文壓縮與重新取得成本;若只想先管理聊天成本,讀節省 Token 的實用方法。
常見問題:LensVLM 值得用在你的文件嗎?
LensVLM 是 OCR 嗎?
不完全是。它先把文字排成圖供模型總覽,再以選頁工具取回原文;處理原生文件時,論文也比較過 OCR 文字與圖片放大。OCR 是可能的工具回應,並非整個方法的名字。
把文件變圖片就一定省 Token 嗎?
不一定。初始影像 Token 可能較少,但展開頁面的文字或高解析圖片也要計入有效壓縮率。請比較同一問題下的總讀者輸入。
5x、10x、15x 是檔案壓縮倍率嗎?
不是。這些是官方渲染設定的名稱,關係到每頁文字密度和視覺 Token;它們不是 PDF 或 PNG 的檔案大小比例。
選對頁就等於答對嗎?
不等於。命中一張證據頁之後,模型仍可能漏讀另一頁、抄錯數字或推理錯誤。三題工作紙應同時計分頁碼與答案。
一般筆電可以直接跑官方權重嗎?
先檢查記憶體與推論環境。官方權重檔約 18.8 GB;官方範例使用 BF16 和 vLLM,另需模型快取。只想學原理的人可先讀範例軌跡。
LensVLM 可以放進商業產品嗎?
依目前權重授權,商業產品使用不在 Research Purposes 範圍內。Apple 的模型授權原文把研究用途限定為非商業科學研究與學術開發;程式碼另有獨立授權。
論文數字能證明繁體中文更好嗎?
不能直接證明。作者測的是指定資料集、渲染設定、讀者模型與評分方法;繁中需另建有標準答案的題庫,包含小字和精確數字。
和 BM25 搜尋只能選一個嗎?
可以組合。先用便宜的搜尋刪去明顯無關段落,再讓視覺選頁看較小的候選集,是論文提出的互補方向;是否划算要按自己的查詢量與文件型態測量。
給新手的三個重點
- 記住「低解析總覽+按需展開」,不要把縮圖誤認為能讀清每個字。
- 比較方法時,固定文件、題目與證據預算;同時記答題正確、總讀者 Token 和完整時間。
- 先讀授權與硬體需求,再決定要跑模型,或只用官方軌跡學會判讀。
接著閱讀
左右滑動查看更多推薦
下一步:拿三題工作紙讀一次真文件
先在原論文圈出三題的證據頁,再看官方示範如何選頁。手上若有合適的研究硬體,就用同一份文字檔逐題執行並填入正確率、有效壓縮率和時間;若沒有,先用搜尋與人工閱讀完成對照組,一樣能知道自己的文件最難找的是哪種證據。LensVLM 的價值,最終要由你那份文件裡「能不能找對頁、讀對字」來判斷。想把這套評測方法擴展成自己的 AI 工作流,也可以從AlphaLab 課程開始。






