PDF 文件 指南
掃描 PDF 不能搜尋、複製文字怎麼辦?OCR 與 Searchable PDF 完整指南
你看到的是字,不代表 PDF 裡真的有文字。掃描件常只是一張張圖片,必須透過 OCR 才能建立可搜尋文字層。
更新日期:
PDF 看起來明明都是文字,按 Ctrl + F 卻搜尋不到,滑鼠拖曳也選不到任何字。
這種情況通常不是 PDF 壞掉,而是:
整頁其實是一張圖片。
速答:掃描 PDF 為什麼不能搜尋?
紙本文件掃描成 PDF 時,檔案通常只保存每頁影像,不知道影像中的黑色線條是「文字」。要變成可搜尋、可選取的 PDF,需要 OCR(Optical Character Recognition,光學字元辨識)分析圖片並建立文字層。PDF 轉 JPG/PNG只是把頁面變成另一張圖片,不是 OCR。FunnyTools 目前沒有提供 OCR 功能,因此本頁會教你判斷需求與正確處理流程,而不是假裝站內工具能做到不存在的功能。
一、先測試你的 PDF 是文字型還是圖片型
測試 1:選取文字
用滑鼠拖一句話。
如果可以精準反白單字或句子:
多半有文字層。
如果完全選不到,或只能選整張頁:
可能是影像型。
測試 2:搜尋
搜尋頁面上肉眼看得到、比較特殊的詞。
完全找不到:
可能沒有可搜尋文字層。
測試 3:放大
放到 400% 或更高。
如果字邊緣像照片一樣有掃描像素、紙張紋理:
很可能是掃描圖。
二、OCR 到底是什麼?
OCR = Optical Character Recognition。
它會分析圖片中的:
- 筆畫;
- 字形;
- 排版;
- 文字區域;
再推測:
這些像素代表哪些字。
OCR 的目的不是「讓圖片更清楚」,而是:
從影像中辨識文字資料。
三、什麼是 Searchable PDF?
常見的 Searchable PDF 可以理解成兩層:
看得到的上層
原始掃描影像。
搜尋用的文字層
OCR 辨識出的文字與位置資訊。
因此畫面看起來可能幾乎沒變,但你突然可以:
- Ctrl + F;
- 選取;
- 複製;
- 全文檢索。
四、PDF → JPG → PDF 不是 OCR
這個流程:
PDF → JPG → PDF
只是:
圖片換了一次容器。
它不會突然知道圖片裡的文字是什麼。
如果原本不能搜尋:
轉一圈回來通常仍然不能搜尋。
五、FunnyTools 目前有 OCR 嗎?
目前沒有。
FunnyTools 的 PDF 工具現階段主要處理:
- 合併;
- 拆分;
- 圖片轉 PDF;
- 旋轉;
- 刪頁;
- 擷取頁;
- 重新排序;
- PDF 轉圖片;
- PDF 結構壓縮。
目前沒有:
OCR / Searchable Text Layer Generator。
由於站內目前沒有 OCR 文字層產生器,本頁不會把「FunnyTools 免費 OCR PDF」當成可用功能。這個限制很重要:你可以先用站內工具擷取、旋轉或整理頁面,再交給具備 OCR 的軟體處理,避免誤以為轉檔就會自動辨識文字。
六、真正需要 OCR 時,應找什麼工具?
選擇支援 OCR 的可信任軟體或服務,例如:
- Adobe Acrobat Scan & OCR;
- 作業系統/掃描軟體的 OCR;
- 符合組織資安規範的企業 OCR;
- 本機 OCR 軟體。
如果文件含敏感資訊,要優先確認:
- 是否上傳雲端;
- 資料保留多久;
- 服務條款;
- 組織是否允許使用。
七、Adobe OCR 的典型流程代表什麼?
Adobe 官方說明中,紙本掃描 PDF 可能只包含影像資料。
使用 OCR 後,可以:
把影像中的文字辨識並建立 searchable/selectable text。
這正是「看得到字但搜不到」的核心解法。
八、OCR 語言要選對
繁體中文、簡體中文、英文的字形模型不同。
文件可能是:
- 繁中;
- 英文;
- 中英混合;
- 日文;
- 數學符號。
如果 OCR 語言選錯,可能造成:
- 中文辨識率下降;
- 英數混淆;
- 專有名詞錯誤。
九、解析度太低會發生什麼?
低畫質常出現:
8→30→O1→l-→ 遺失- 小數點 → 消失
中文則可能:
- 偏旁誤認;
- 同形字混淆;
- 罕見字直接錯掉。
因此 OCR 結果不能不校對。
十、解析度越高一定越準嗎?
也不是。
超高解析:
- 檔案變超大;
- OCR 處理變慢;
- 不一定增加有效資訊。
更重要的是:
- 對焦;
- 對比;
- 文字尺寸;
- 無反光;
- 不要嚴重傾斜;
- 不要有手指/陰影遮住。
十一、歪斜頁面會影響 OCR
如果整頁文字斜很多,版面分析與字元切分都更困難。
好的 OCR 前處理常包含:
- deskew;
- crop;
- background cleanup;
- sharpening;
- descreen。
如果掃描軟體有這些選項,通常值得使用。
十二、手機拍文件為什麼 OCR 特別容易錯?
常見問題:
- 梯形變形;
- 桌面背景;
- 書頁彎曲;
- 手指入鏡;
- 低光噪點;
- 反光;
- 陰影。
所以「拍得好不好」往往比事後選哪個 OCR 品牌還重要。
十三、表格 OCR 要特別小心
OCR 能認出數字,不代表能理解:
- 這個數字在哪一欄;
- 表頭對應哪一列;
- 合併儲存格;
- 負號;
- 小數點。
如果你要把 OCR 表格拿去統計:
必須逐項和原圖核對。
十四、數學公式與統計符號更容易出錯
例如:
x²ση²≤≥−
OCR 可能:
- 漏掉上標;
- 把希臘字母變成英文字;
- 負號變成連字號;
- 不等號消失。
研究論文 OCR 後不能直接複製數字做分析。
十五、手寫字可以 OCR 嗎?
部分 AI/OCR 有手寫辨識,但準確度高度依賴:
- 字跡;
- 語言;
- 拍攝品質;
- 訓練模型。
正式文件不要把手寫 OCR 當成 100% 正確資料。
十六、OCR 完成後至少做 5 個檢查
1. 搜尋標題
能找到嗎?
2. 搜尋人名
姓名有沒有錯字?
3. 複製一小段
貼到純文字編輯器,看有沒有亂碼。
4. 檢查關鍵數字
日期、金額、學號、編號。
5. 檢查特殊字
罕見中文字、符號、上下標。
十七、OCR 後畫面沒變,正常嗎?
正常。
Searchable Image 類 PDF 可以保留原掃描畫面,只在底下加入文字層。
所以:
外觀幾乎一樣,但突然能搜尋。
十八、OCR 後檔案可能變大嗎?
可能。
因為多了:
- 文字層;
- OCR metadata;
- 額外結構。
不過掃描 PDF 的主要容量通常仍是圖片本身。
十九、可搜尋 PDF 等於「無障礙 PDF」嗎?
不等於。
完整 PDF accessibility 還涉及:
- Reading order;
- Tags;
- Headings;
- Alt text;
- Table structure;
- Document language;
- Form labels。
OCR 只是讓影像裡的文字被辨識,不代表所有無障礙結構都完成。
二十、如果只是要把 PDF 放進簡報,需要 OCR 嗎?
不需要。
只要畫面:
使用 PDF 轉圖片。
如果要:
- 搜尋;
- 複製;
- 建全文資料庫;
才需要 OCR。
二十一、只需要幾頁做 OCR:先擷取
例如 200 頁 PDF 只需要第 30~35 頁。
先用 擷取 PDF 頁面 做成 6 頁檔,再拿去 OCR。
好處:
- 處理更快;
- 少傳不必要資料;
- 校對範圍更小。
二十二、敏感 PDF 使用外部 OCR 要注意隱私
文件可能包含:
- 身分證號;
- 病歷;
- 成績;
- 合約;
- 地址;
- 公司資料。
第三方 OCR 服務是否上傳、保留、訓練模型,要看其政策。
FunnyTools 自己的 PDF 頁面工具採本機處理,不代表你跳轉使用的任何外部 OCR 都是本機處理。
二十三、加密 PDF 怎麼做 OCR?
若你有合法權限:
- 使用正確密碼;
- 從來源另存允許處理的版本;
- 再做 OCR。
不要使用破解、繞過權限的方式處理不屬於你的文件。
二十四、常見錯誤
錯誤 1:PDF 轉 JPG 就以為完成 OCR
完全不同。
錯誤 2:OCR 完不校對人名與數字
高風險。
錯誤 3:低畫質照片期待 100% 辨識
不合理。
錯誤 4:把 Searchable PDF 當完整 Accessible PDF
不是同一件事。
錯誤 5:敏感文件隨便上傳未知 OCR 網站
要先看資安與隱私。
錯誤 6:表格 OCR 後直接跑統計
必須人工核對。
二十五、FAQ
為什麼 PDF 看得到字卻不能複製?
因為那些字可能只是掃描圖片。
PDF 轉 PNG 可以讓文字可搜尋嗎?
不能。
OCR 會改變 PDF 外觀嗎?
Searchable Image 類輸出通常能保留原掃描外觀並加入文字層。
OCR 100% 準確嗎?
不是,低畫質、表格、特殊符號、手寫內容都更容易出錯。
FunnyTools 有 OCR 嗎?
目前沒有 OCR 工具。
OCR 後可以刪原始掃描檔嗎?
不建議。至少先保留原檔並完成校對。
搜尋得到文字就代表無障礙嗎?
不代表。
二十六、延伸閱讀
下一步
只需要把掃描 PDF 的某幾頁交給 OCR?
先在 FunnyTools 擷取真正需要的頁面,減少不必要文件內容,再使用你信任、符合隱私要求的 OCR 軟體建立 Searchable PDF。
重點速記
重點:
掃描 PDF = Image
OCR = Recognize Text
Searchable PDF = Image + Text Layer