PDF 文件 指南

掃描 PDF 不能搜尋、複製文字怎麼辦?OCR 與 Searchable PDF 完整指南

你看到的是字,不代表 PDF 裡真的有文字。掃描件常只是一張張圖片,必須透過 OCR 才能建立可搜尋文字層。

更新日期:

PDF 看起來明明都是文字,按 Ctrl + F 卻搜尋不到,滑鼠拖曳也選不到任何字。

這種情況通常不是 PDF 壞掉,而是:

整頁其實是一張圖片。

速答:掃描 PDF 為什麼不能搜尋?
紙本文件掃描成 PDF 時,檔案通常只保存每頁影像,不知道影像中的黑色線條是「文字」。要變成可搜尋、可選取的 PDF,需要 OCR(Optical Character Recognition,光學字元辨識)分析圖片並建立文字層。PDF 轉 JPG/PNG只是把頁面變成另一張圖片,不是 OCR。FunnyTools 目前沒有提供 OCR 功能,因此本頁會教你判斷需求與正確處理流程,而不是假裝站內工具能做到不存在的功能。

一、先測試你的 PDF 是文字型還是圖片型

測試 1:選取文字

用滑鼠拖一句話。

如果可以精準反白單字或句子:

多半有文字層。

如果完全選不到,或只能選整張頁:

可能是影像型。

測試 2:搜尋

搜尋頁面上肉眼看得到、比較特殊的詞。

完全找不到:

可能沒有可搜尋文字層。

測試 3:放大

放到 400% 或更高。

如果字邊緣像照片一樣有掃描像素、紙張紋理:

很可能是掃描圖。

二、OCR 到底是什麼?

OCR = Optical Character Recognition。

它會分析圖片中的:

  • 筆畫;
  • 字形;
  • 排版;
  • 文字區域;

再推測:

這些像素代表哪些字。

OCR 的目的不是「讓圖片更清楚」,而是:

從影像中辨識文字資料。

三、什麼是 Searchable PDF?

常見的 Searchable PDF 可以理解成兩層:

看得到的上層

原始掃描影像。

搜尋用的文字層

OCR 辨識出的文字與位置資訊。

因此畫面看起來可能幾乎沒變,但你突然可以:

  • Ctrl + F;
  • 選取;
  • 複製;
  • 全文檢索。

四、PDF → JPG → PDF 不是 OCR

這個流程:

PDF → JPG → PDF

只是:

圖片換了一次容器。

它不會突然知道圖片裡的文字是什麼。

如果原本不能搜尋:

轉一圈回來通常仍然不能搜尋。

五、FunnyTools 目前有 OCR 嗎?

目前沒有。

FunnyTools 的 PDF 工具現階段主要處理:

  • 合併;
  • 拆分;
  • 圖片轉 PDF;
  • 旋轉;
  • 刪頁;
  • 擷取頁;
  • 重新排序;
  • PDF 轉圖片;
  • PDF 結構壓縮。

目前沒有:

OCR / Searchable Text Layer Generator。

由於站內目前沒有 OCR 文字層產生器,本頁不會把「FunnyTools 免費 OCR PDF」當成可用功能。這個限制很重要:你可以先用站內工具擷取、旋轉或整理頁面,再交給具備 OCR 的軟體處理,避免誤以為轉檔就會自動辨識文字。

六、真正需要 OCR 時,應找什麼工具?

選擇支援 OCR 的可信任軟體或服務,例如:

  • Adobe Acrobat Scan & OCR;
  • 作業系統/掃描軟體的 OCR;
  • 符合組織資安規範的企業 OCR;
  • 本機 OCR 軟體。

如果文件含敏感資訊,要優先確認:

  • 是否上傳雲端;
  • 資料保留多久;
  • 服務條款;
  • 組織是否允許使用。

七、Adobe OCR 的典型流程代表什麼?

Adobe 官方說明中,紙本掃描 PDF 可能只包含影像資料。

使用 OCR 後,可以:

把影像中的文字辨識並建立 searchable/selectable text。

這正是「看得到字但搜不到」的核心解法。

八、OCR 語言要選對

繁體中文、簡體中文、英文的字形模型不同。

文件可能是:

  • 繁中;
  • 英文;
  • 中英混合;
  • 日文;
  • 數學符號。

如果 OCR 語言選錯,可能造成:

  • 中文辨識率下降;
  • 英數混淆;
  • 專有名詞錯誤。

九、解析度太低會發生什麼?

低畫質常出現:

  • 83
  • 0O
  • 1l
  • - → 遺失
  • 小數點 → 消失

中文則可能:

  • 偏旁誤認;
  • 同形字混淆;
  • 罕見字直接錯掉。

因此 OCR 結果不能不校對。

十、解析度越高一定越準嗎?

也不是。

超高解析:

  • 檔案變超大;
  • OCR 處理變慢;
  • 不一定增加有效資訊。

更重要的是:

  • 對焦;
  • 對比;
  • 文字尺寸;
  • 無反光;
  • 不要嚴重傾斜;
  • 不要有手指/陰影遮住。

十一、歪斜頁面會影響 OCR

如果整頁文字斜很多,版面分析與字元切分都更困難。

好的 OCR 前處理常包含:

  • deskew;
  • crop;
  • background cleanup;
  • sharpening;
  • descreen。

如果掃描軟體有這些選項,通常值得使用。

十二、手機拍文件為什麼 OCR 特別容易錯?

常見問題:

  • 梯形變形;
  • 桌面背景;
  • 書頁彎曲;
  • 手指入鏡;
  • 低光噪點;
  • 反光;
  • 陰影。

所以「拍得好不好」往往比事後選哪個 OCR 品牌還重要。

十三、表格 OCR 要特別小心

OCR 能認出數字,不代表能理解:

  • 這個數字在哪一欄;
  • 表頭對應哪一列;
  • 合併儲存格;
  • 負號;
  • 小數點。

如果你要把 OCR 表格拿去統計:

必須逐項和原圖核對。

十四、數學公式與統計符號更容易出錯

例如:

  • σ
  • η²

OCR 可能:

  • 漏掉上標;
  • 把希臘字母變成英文字;
  • 負號變成連字號;
  • 不等號消失。

研究論文 OCR 後不能直接複製數字做分析。

十五、手寫字可以 OCR 嗎?

部分 AI/OCR 有手寫辨識,但準確度高度依賴:

  • 字跡;
  • 語言;
  • 拍攝品質;
  • 訓練模型。

正式文件不要把手寫 OCR 當成 100% 正確資料。

十六、OCR 完成後至少做 5 個檢查

1. 搜尋標題

能找到嗎?

2. 搜尋人名

姓名有沒有錯字?

3. 複製一小段

貼到純文字編輯器,看有沒有亂碼。

4. 檢查關鍵數字

日期、金額、學號、編號。

5. 檢查特殊字

罕見中文字、符號、上下標。

十七、OCR 後畫面沒變,正常嗎?

正常。

Searchable Image 類 PDF 可以保留原掃描畫面,只在底下加入文字層。

所以:

外觀幾乎一樣,但突然能搜尋。

十八、OCR 後檔案可能變大嗎?

可能。

因為多了:

  • 文字層;
  • OCR metadata;
  • 額外結構。

不過掃描 PDF 的主要容量通常仍是圖片本身。

十九、可搜尋 PDF 等於「無障礙 PDF」嗎?

不等於。

完整 PDF accessibility 還涉及:

  • Reading order;
  • Tags;
  • Headings;
  • Alt text;
  • Table structure;
  • Document language;
  • Form labels。

OCR 只是讓影像裡的文字被辨識,不代表所有無障礙結構都完成。

二十、如果只是要把 PDF 放進簡報,需要 OCR 嗎?

不需要。

只要畫面:

使用 PDF 轉圖片

如果要:

  • 搜尋;
  • 複製;
  • 建全文資料庫;

才需要 OCR。

二十一、只需要幾頁做 OCR:先擷取

例如 200 頁 PDF 只需要第 30~35 頁。

先用 擷取 PDF 頁面 做成 6 頁檔,再拿去 OCR。

好處:

  • 處理更快;
  • 少傳不必要資料;
  • 校對範圍更小。

二十二、敏感 PDF 使用外部 OCR 要注意隱私

文件可能包含:

  • 身分證號;
  • 病歷;
  • 成績;
  • 合約;
  • 地址;
  • 公司資料。

第三方 OCR 服務是否上傳、保留、訓練模型,要看其政策。

FunnyTools 自己的 PDF 頁面工具採本機處理,不代表你跳轉使用的任何外部 OCR 都是本機處理。

二十三、加密 PDF 怎麼做 OCR?

若你有合法權限:

  • 使用正確密碼;
  • 從來源另存允許處理的版本;
  • 再做 OCR。

不要使用破解、繞過權限的方式處理不屬於你的文件。

二十四、常見錯誤

錯誤 1:PDF 轉 JPG 就以為完成 OCR

完全不同。

錯誤 2:OCR 完不校對人名與數字

高風險。

錯誤 3:低畫質照片期待 100% 辨識

不合理。

錯誤 4:把 Searchable PDF 當完整 Accessible PDF

不是同一件事。

錯誤 5:敏感文件隨便上傳未知 OCR 網站

要先看資安與隱私。

錯誤 6:表格 OCR 後直接跑統計

必須人工核對。

二十五、FAQ

為什麼 PDF 看得到字卻不能複製?

因為那些字可能只是掃描圖片。

PDF 轉 PNG 可以讓文字可搜尋嗎?

不能。

OCR 會改變 PDF 外觀嗎?

Searchable Image 類輸出通常能保留原掃描外觀並加入文字層。

OCR 100% 準確嗎?

不是,低畫質、表格、特殊符號、手寫內容都更容易出錯。

FunnyTools 有 OCR 嗎?

目前沒有 OCR 工具。

OCR 後可以刪原始掃描檔嗎?

不建議。至少先保留原檔並完成校對。

搜尋得到文字就代表無障礙嗎?

不代表。

二十六、延伸閱讀

下一步

只需要把掃描 PDF 的某幾頁交給 OCR?

先在 FunnyTools 擷取真正需要的頁面,減少不必要文件內容,再使用你信任、符合隱私要求的 OCR 軟體建立 Searchable PDF。

重點速記

重點: 掃描 PDF = Image OCR = Recognize Text Searchable PDF = Image + Text Layer