跳至頁尾內容
USING IRONPDF FOR PYTHON

如何從 Python 中的 PDF 提取特定文字

本文將展示如何使用IronPDF for Python程式庫從PDF文件中提取文字元素。

IronPDF

Python是一種程式語言,可以讓開發者簡單快速地建立圖形使用者介面。 與其他語言相比,Python對程式員來說更具動態性。 因此,在Python中新增IronPDF程式庫是一個簡單的過程。 可以使用大量預裝的工具,包括PyQt、wxWidgets、Kivy和許多其他套件和Python程式庫,快速且安全地構建一個完整的GUI。 IronPDF融合了Python,還允許整合來自其他框架的功能,如.NET Core。

IronPDF使網頁開發更容易。 其主要原因是Python網頁開發範式如Django、Flask和Pyramid的廣泛採用。 Reddit、Mozilla和Spotify只是使用這些框架的一些網站和線上服務。

IronPDF功能

  • 使用IronPDF,可以從各種來源建立PDF文件,包括HTML、HTML5、ASPX和Razor/MVC View。 它提供轉換HTML頁面圖像為PDF文件的功能。
  • 建立互動式PDF、填寫和提交互動表單拆分合併PDF文件、提取文字和圖像、在PDF文件中搜尋文字、將PDF光柵化為圖像、更改字體大小、使用ChatGPT進行自然語言處理、以及正確轉換PDF頁面只是IronPDF工具包可以幫助的幾項活動。
  • IronPDF提供HTML登錄表單驗證,支援使用者代理、代理伺服器、cookie、HTTP標頭和表單變數。
  • IronPDF使用使用者名和密碼提供使用者存取受保護的文件
  • 只需幾行程式碼,IronPDF即可從多種來源列印PDF文件,包括字串、流或URL。

設置Python

環境配置

確保在您的電腦上已安裝Python。 要下載並安裝與您的操作系統相容的最新Python版本,請前往Python官方網站。 安裝Python後,建立一個虛擬環境以分離您的項目需求。 使用venv模塊建立和管理虛擬環境,以便為您的轉換項目提供一個整潔、獨立的工作區。

PyCharm中的新倡議

在本次演示中,推薦使用PyCharm作為開發Python程式碼的IDE。

啟動PyCharm IDE後,選擇"新項目"。

如何在Python中從PDF提取特定文字,圖1:PyCharm PyCharm

選擇"新項目"時,會打開一個新窗口,允許您設置項目的位置和環境。 這可能會在下面的圖片中看到。

如何在Python中從PDF提取特定文字,圖2:新項目 新項目

選擇項目位置和環境路徑後,點擊Create按鈕開始新項目。 然後可以在新窗口中建立程式。 在本次教學中,使用的是Python 3.9。

如何在Python中從PDF提取特定文字,圖3:建立Python項目 建立Python項目

IronPDF程式庫需求

Python程式庫IronPDF主要使用.NET 6.0。因此,為了使用IronPDF for Python,必須在您的計算機上安裝.NET 6.0運行時。 Linux和Mac使用者可能需要在使用此Python模塊之前安裝.NET。 存取Microsoft的下載頁面以獲取所需的運行時環境。

IronPDF程式庫設置

要生成、修改和打開".pdf"擴展名的文件,必須安裝"IronPDF"包。 打開終端窗口,輸入以下命令以在PyCharm中安裝包:

pip install ironpdf

預覽ironpdf包安裝如下面的截圖所示。

如何在Python中從PDF提取特定文字,圖4:安裝IronPDF 安裝IronPDF

從PDF文件中提取特定資料

可以借助IronPDF程式庫從PDF文件中提取文字。 IronPDF提供了多種文字提取方法。 第一種方法是將整個頁面的內容作為單個字串檢索。 第二種策略是逐頁瀏覽內容,從第一頁開始。 可以使用IronPDF程式庫研究現有的PDF文件。 下面的程式碼段展示了如何使用IronPDF檢查實時PDF文件。

從PDF中提取資訊有兩個選項:

  1. 逐頁從PDF中提取
  2. 將整個PDF轉換為文字

這是本文章的範例PDF文件,如下所示。

如何在Python中從PDF提取特定文字,圖5:輸入PDF 輸入PDF

逐頁從PDF中提取

下面提供的範例程式碼顯示了如何使用頁碼從PDF文件中獲取資料。

from ironpdf import PdfDocument

# Load the PDF file
pdf = PdfDocument.FromFile('F:\\PDF\\Extract.pdf')
# Extract text from the first page of the PDF document
all_text = pdf.ExtractTextFromPage(0)
# Iterate over each line in the extracted text
for line in all_text.split('\n'):
    # Check if the line contains the keyword "Name"
    if 'Name' in line:
        # Print the line if it contains the keyword
        print(line)
from ironpdf import PdfDocument

# Load the PDF file
pdf = PdfDocument.FromFile('F:\\PDF\\Extract.pdf')
# Extract text from the first page of the PDF document
all_text = pdf.ExtractTextFromPage(0)
# Iterate over each line in the extracted text
for line in all_text.split('\n'):
    # Check if the line contains the keyword "Name"
    if 'Name' in line:
        # Print the line if it contains the keyword
        print(line)
PYTHON

程式碼片段展示了如何讀取PDF文件並使用FromFile功能構建PDF物件。 可以使用此物件存取PDF的文字和圖像。 通過將頁碼作為參數傳遞給ExtractTextFromPage功能,可以從特定頁面檢索文字。 該方法將返回一個包含所選頁面上所有單詞的字串。 然後,使用Python中的split功能將所有新行從提取的文字中分割出來。 之後,檢查提取的文字中的每一行是否包含需要的關鍵字。 如果關鍵字匹配,它將在命令提示符中顯示具體行。 否則,它將忽略該行並繼續到下一行。文字提取的輸出將如下所示。

將整個PDF轉換為文字

下面的程式碼範例演示了第一種方法,可快速和簡單地將所有PDF內容作為字串獲取。

from ironpdf import PdfDocument

# Load the PDF file
pdf = PdfDocument.FromFile('F:\\PDF\\Extract.pdf')
# Extract all text from the PDF document
all_text = pdf.ExtractAllText()
# Iterate over each line in the extracted text
for line in all_text.split('\n'):
    # Check if the line contains the keyword "Name"
    if 'Name' in line:
        # Print the line if it contains the keyword
        print(line)
from ironpdf import PdfDocument

# Load the PDF file
pdf = PdfDocument.FromFile('F:\\PDF\\Extract.pdf')
# Extract all text from the PDF document
all_text = pdf.ExtractAllText()
# Iterate over each line in the extracted text
for line in all_text.split('\n'):
    # Check if the line contains the keyword "Name"
    if 'Name' in line:
        # Print the line if it contains the keyword
        print(line)
PYTHON

上面的範例程式碼展示了如何使用FromFile功能從現有文件路徑讀取PDF並將其轉換為PDF文件物件。 因此,我們可以使用此PDF閱讀器物件查看PDF中的文字和圖像。 將使用該物件的ExtractAllText功能將資料從PDF中提取為純文字,轉換為字串,並使用與上面類似的邏輯查找具體關鍵字以顯示結果在終端中。 結果如下顯示。

如何在Python中從PDF提取特定文字,圖6:輸出 輸出

上面的程式碼/輸出顯示給定的PDF文件中包含姓名和年齡,但結果顯示PDF文件中僅包含姓名。

結論

IronPDF程式庫提供了強大的安全機制,以減少威脅並保證資料安全。 它不限於任何一個瀏覽器,並且與所有廣泛使用的瀏覽器相容。 使用IronPDF,程式員只需幾行程式碼即可快速生成和讀取PDF文件。 IronPDF程式庫提供了一系列的授權選項,包括免費開發者授權和可用於購買的額外開發授權,以滿足開發者的多樣需求。

Lite包包括永久授權、30天退款保證、一年的軟體維護和升級選項。 這些授權可用於所有環境。 此外,IronPDF提供了一些有再分發限制的免費授權。 試用授權允許使用者在沒有水印的情況下評估產品。

查看可用的IronPDF授權以了解有關商業授權的更多資訊。

常見問題

如何使用Python從PDF中提取特定文字?

您可以使用IronPDF的Python程式庫從PDF中提取文字。它提供逐頁提取文字的功能,使用ExtractTextFromPage,或使用ExtractAllText從整個文件中提取文字。

在Python項目中設置IronPDF的步驟是什麼?

首先,如果尚未安裝,則安裝.NET 6.0運行時。然後,在您的開發環境中設置Python,例如PyCharm。使用pip install ironpdf安裝IronPDF以開始將PDF功能整合到您的專案中。

IronPDF是否與如Django和Flask這類框架相容?

是的,IronPDF與Python網頁開發框架如Django和Flask整合良好,提供處理PDF的多種選擇。

有哪些IronPDF的授權選項可供使用於Python?

IronPDF提供多種授權選擇,包括個人使用的免費開發者授權,並提供附加功能和好處的各類商業授權。

如何安裝IronPDF for Python?

使用pip包管理器安裝IronPDF,通過在終端或命令提示符中運行指令pip install ironpdf

推薦使用哪種開發環境來使用IronPDF與Python?

PyCharm是一個推薦的整合開發環境(IDE),因為它具有全面的功能集和對Python的支援。

IronPDF for Python的某些關鍵功能具有哪些?

IronPDF for Python 提供例如從HTML建立PDF、將圖片轉為PDF、表單處理、文字與圖片提取和PDF合併等功能。

IronPDF程式庫處理PDF文件的安全性如何?

IronPDF設計有強大的安全功能,確保安全處理PDF文件。它支持加密和密碼保護以保護敏感資訊。

Curtis Chau
技術作家

Curtis Chau擁有Carleton大學的電腦科學學士學位,專精於前端開發,擁有Node.js、TypeScript、JavaScript和React的專業知識。Curtis熱衷於建立直觀且美觀的使用者介面,喜愛使用現代框架並建立結構良好、視覺吸引力的手冊。

除了開發,Curtis對物聯網(IoT)有濃厚的興趣,探索創新的方法來整合硬體和軟體。在空閒時間,他喜歡玩遊戲和建立Discord機器人,結合他對技術的熱愛與創造力。

Iron 支援團隊

我們線上24小時,每週5天。
聊天
電子郵件
給我打電話