IRONSOFTWAREHOME
擷取文字
from ironpdf import *

# Load existing PDF document
pdf = PdfDocument.FromFile("content.pdf")

# Extract text from PDF document
all_text = pdf.ExtractAllText()

# Extract text from specific page in the document
page_2_text = pdf.ExtractTextFromPage(1)
pip install ironpdf
擷取文字

擷取文字

IronPDF for Python可以使用ExtractTextFromPage方法將PDF文件的文字內容提取出來——可以一次性從整個文件中提取,也可以從單個頁面中提取。

入門指南

使用PdfDocument,然後調用適當的提取方法。 這兩種方法都會返回一個包含提取文字的Python字串。

理解程式碼

  • PdfDocument.FromFile(path):從指定的文件路徑打開現有的PDF文件。 對於受密碼保護的文件,將密碼作為第二個參數傳遞。
  • ExtractAllText():返回一個包含從文件的所有頁面按頁順序提取出的文字的單一字串。
  • ExtractTextFromPage(pageIndex):返回單個頁面的文字內容。 1,依此類推。

使用案例

文字提取對以下情況有用:

  • 搜尋索引——使在資料庫或搜尋引擎中的PDF內容可以被搜尋。
  • 資料解析——從PDF報告中提取發票號碼、日期或地址等結構化資料。
  • 內容驗證——以程式化方式檢查生成的PDF是否包含預期文字。
  • 無障礙功能——將PDF內容轉換為純文字,供螢幕閱讀器或後續處理使用。
學習使用IronPDF for Python從PDF中提取內容吧!

準備開始了嗎?

版本:2026.9剛剛發布

Key in blue circle

立即免費取得 30 天試用金鑰

Your trial license will be sent to your email address

無任何限制。100% 解鎖。無需信用卡。

OR
bullet_checked無需信用卡或建立帳號無任何限制。100% 解鎖。無需信用卡。
  • Logo Aetna
  • Logo NASA
  • Logo GE
  • Logo Porsche
  • Logo USDA
  • Logo Qatar
Join Millions of Engineers who’ve tried IronPDF
預約您的免費即時演示
Booking Badge

全球數百萬工程師的信賴

Iron Software的客戶標誌
獲取您的無義務諮詢
填寫以下表格或發送電子郵件至sales@ironsoftware.com
您的詳細資訊將始終保密。
全球數百萬工程師的信賴
Iron Software的客戶標誌
立即獲取您的30天試用金鑰
無需信用卡或帳戶建立
PDF的Python模塊下載
使用pip安裝

版本: 2026.9

  1. 下載並安裝Python 3.7+。
  2. 如果尚未安裝,請從 pypi.org 安裝 pip
  3. 在終端執行上述命令。
Python PDF模塊
下載模塊

版本: 2026.9

手動安裝到您的專案中

  1. 下載套件
  2. 從終端運行此命令
    pip install ironpdf-2026.9-py37-none-win_amd64.whi

$999起的授權