擷取文字

IronPDF for Python可以使用ExtractTextFromPage方法將PDF文件的文字內容提取出來——可以一次性從整個文件中提取,也可以從單個頁面中提取。

入門指南

使用PdfDocument,然後調用適當的提取方法。 這兩種方法都會返回一個包含提取文字的Python字串。

理解程式碼

  • PdfDocument.FromFile(path):從指定的文件路徑打開現有的PDF文件。 對於受密碼保護的文件,將密碼作為第二個參數傳遞。
  • ExtractAllText():返回一個包含從文件的所有頁面按頁順序提取出的文字的單一字串。
  • ExtractTextFromPage(pageIndex):返回單個頁面的文字內容。 1,依此類推。

使用案例

文字提取對以下情況有用:

  • 搜尋索引——使在資料庫或搜尋引擎中的PDF內容可以被搜尋。
  • 資料解析——從PDF報告中提取發票號碼、日期或地址等結構化資料。
  • 內容驗證——以程式化方式檢查生成的PDF是否包含預期文字。
  • 無障礙功能——將PDF內容轉換為純文字,供螢幕閱讀器或後續處理使用。

學習使用IronPDF for Python從PDF中提取內容吧!

準備開始了嗎?
版本: 2026.6 剛剛發布
Still Scrolling Icon

還在滾動嗎?

希望快速證明嗎?
運行範例 看您的HTML轉化成PDF。