如何從 Python 中的 PDF 提取特定文字
本文將展示如何使用IronPDF for Python程式庫從PDF文件中提取文字元素。
IronPDF
Python是一種程式語言,可以讓開發者簡單快速地建立圖形使用者介面。 與其他語言相比,Python對程式員來說更具動態性。 因此,在Python中新增IronPDF程式庫是一個簡單的過程。 可以使用大量預裝的工具,包括PyQt、wxWidgets、Kivy和許多其他套件和Python程式庫,快速且安全地構建一個完整的GUI。 IronPDF融合了Python,還允許整合來自其他框架的功能,如.NET Core。
IronPDF使網頁開發更容易。 其主要原因是Python網頁開發範式如Django、Flask和Pyramid的廣泛採用。 Reddit、Mozilla和Spotify只是使用這些框架的一些網站和線上服務。
IronPDF功能
- 使用IronPDF,可以從各種來源建立PDF文件,包括HTML、HTML5、ASPX和Razor/MVC View。 它提供轉換HTML頁面和圖像為PDF文件的功能。
- 建立互動式PDF、填寫和提交互動表單、拆分和合併PDF文件、提取文字和圖像、在PDF文件中搜尋文字、將PDF光柵化為圖像、更改字體大小、使用ChatGPT進行自然語言處理、以及正確轉換PDF頁面只是IronPDF工具包可以幫助的幾項活動。
- IronPDF提供HTML登錄表單驗證,支援使用者代理、代理伺服器、cookie、HTTP標頭和表單變數。
- IronPDF使用使用者名和密碼提供使用者存取受保護的文件。
- 只需幾行程式碼,IronPDF即可從多種來源列印PDF文件,包括字串、流或URL。
設置Python
環境配置
確保在您的電腦上已安裝Python。 要下載並安裝與您的操作系統相容的最新Python版本,請前往Python官方網站。 安裝Python後,建立一個虛擬環境以分離您的項目需求。 使用venv模塊建立和管理虛擬環境,以便為您的轉換項目提供一個整潔、獨立的工作區。
PyCharm中的新倡議
在本次演示中,推薦使用PyCharm作為開發Python程式碼的IDE。
啟動PyCharm IDE後,選擇"新項目"。
PyCharm
選擇"新項目"時,會打開一個新窗口,允許您設置項目的位置和環境。 這可能會在下面的圖片中看到。
新項目
選擇項目位置和環境路徑後,點擊Create按鈕開始新項目。 然後可以在新窗口中建立程式。 在本次教學中,使用的是Python 3.9。
建立Python項目
IronPDF程式庫需求
Python程式庫IronPDF主要使用.NET 6.0。因此,為了使用IronPDF for Python,必須在您的計算機上安裝.NET 6.0運行時。 Linux和Mac使用者可能需要在使用此Python模塊之前安裝.NET。 存取Microsoft的下載頁面以獲取所需的運行時環境。
IronPDF程式庫設置
要生成、修改和打開".pdf"擴展名的文件,必須安裝"IronPDF"包。 打開終端窗口,輸入以下命令以在PyCharm中安裝包:
pip install ironpdf
預覽ironpdf包安裝如下面的截圖所示。
安裝IronPDF
從PDF文件中提取特定資料
可以借助IronPDF程式庫從PDF文件中提取文字。 IronPDF提供了多種文字提取方法。 第一種方法是將整個頁面的內容作為單個字串檢索。 第二種策略是逐頁瀏覽內容,從第一頁開始。 可以使用IronPDF程式庫研究現有的PDF文件。 下面的程式碼段展示了如何使用IronPDF檢查實時PDF文件。
從PDF中提取資訊有兩個選項:
- 逐頁從PDF中提取
- 將整個PDF轉換為文字
這是本文章的範例PDF文件,如下所示。
輸入PDF
逐頁從PDF中提取
下面提供的範例程式碼顯示了如何使用頁碼從PDF文件中獲取資料。
from ironpdf import PdfDocument
# Load the PDF file
pdf = PdfDocument.FromFile('F:\\PDF\\Extract.pdf')
# Extract text from the first page of the PDF document
all_text = pdf.ExtractTextFromPage(0)
# Iterate over each line in the extracted text
for line in all_text.split('\n'):
# Check if the line contains the keyword "Name"
if 'Name' in line:
# Print the line if it contains the keyword
print(line)from ironpdf import PdfDocument
# Load the PDF file
pdf = PdfDocument.FromFile('F:\\PDF\\Extract.pdf')
# Extract text from the first page of the PDF document
all_text = pdf.ExtractTextFromPage(0)
# Iterate over each line in the extracted text
for line in all_text.split('\n'):
# Check if the line contains the keyword "Name"
if 'Name' in line:
# Print the line if it contains the keyword
print(line)程式碼片段展示了如何讀取PDF文件並使用FromFile功能構建PDF物件。 可以使用此物件存取PDF的文字和圖像。 通過將頁碼作為參數傳遞給ExtractTextFromPage功能,可以從特定頁面檢索文字。 該方法將返回一個包含所選頁面上所有單詞的字串。 然後,使用Python中的split功能將所有新行從提取的文字中分割出來。 之後,檢查提取的文字中的每一行是否包含需要的關鍵字。 如果關鍵字匹配,它將在命令提示符中顯示具體行。 否則,它將忽略該行並繼續到下一行。文字提取的輸出將如下所示。
將整個PDF轉換為文字
下面的程式碼範例演示了第一種方法,可快速和簡單地將所有PDF內容作為字串獲取。
from ironpdf import PdfDocument
# Load the PDF file
pdf = PdfDocument.FromFile('F:\\PDF\\Extract.pdf')
# Extract all text from the PDF document
all_text = pdf.ExtractAllText()
# Iterate over each line in the extracted text
for line in all_text.split('\n'):
# Check if the line contains the keyword "Name"
if 'Name' in line:
# Print the line if it contains the keyword
print(line)from ironpdf import PdfDocument
# Load the PDF file
pdf = PdfDocument.FromFile('F:\\PDF\\Extract.pdf')
# Extract all text from the PDF document
all_text = pdf.ExtractAllText()
# Iterate over each line in the extracted text
for line in all_text.split('\n'):
# Check if the line contains the keyword "Name"
if 'Name' in line:
# Print the line if it contains the keyword
print(line)上面的範例程式碼展示了如何使用FromFile功能從現有文件路徑讀取PDF並將其轉換為PDF文件物件。 因此,我們可以使用此PDF閱讀器物件查看PDF中的文字和圖像。 將使用該物件的ExtractAllText功能將資料從PDF中提取為純文字,轉換為字串,並使用與上面類似的邏輯查找具體關鍵字以顯示結果在終端中。 結果如下顯示。
輸出
上面的程式碼/輸出顯示給定的PDF文件中包含姓名和年齡,但結果顯示PDF文件中僅包含姓名。
結論
IronPDF程式庫提供了強大的安全機制,以減少威脅並保證資料安全。 它不限於任何一個瀏覽器,並且與所有廣泛使用的瀏覽器相容。 使用IronPDF,程式員只需幾行程式碼即可快速生成和讀取PDF文件。 IronPDF程式庫提供了一系列的授權選項,包括免費開發者授權和可用於購買的額外開發授權,以滿足開發者的多樣需求。
Lite包包括永久授權、30天退款保證、一年的軟體維護和升級選項。 這些授權可用於所有環境。 此外,IronPDF提供了一些有再分發限制的免費授權。 試用授權允許使用者在沒有水印的情況下評估產品。
請查看可用的IronPDF授權以了解有關商業授權的更多資訊。
常見問題
如何使用Python從PDF中提取特定文字?
您可以使用IronPDF的Python程式庫從PDF中提取文字。它提供逐頁提取文字的功能,使用ExtractTextFromPage,或使用ExtractAllText從整個文件中提取文字。
在Python項目中設置IronPDF的步驟是什麼?
首先,如果尚未安裝,則安裝.NET 6.0運行時。然後,在您的開發環境中設置Python,例如PyCharm。使用pip install ironpdf安裝IronPDF以開始將PDF功能整合到您的專案中。
IronPDF是否與如Django和Flask這類框架相容?
是的,IronPDF與Python網頁開發框架如Django和Flask整合良好,提供處理PDF的多種選擇。
有哪些IronPDF的授權選項可供使用於Python?
IronPDF提供多種授權選擇,包括個人使用的免費開發者授權,並提供附加功能和好處的各類商業授權。
如何安裝IronPDF for Python?
使用pip包管理器安裝IronPDF,通過在終端或命令提示符中運行指令pip install ironpdf。
推薦使用哪種開發環境來使用IronPDF與Python?
PyCharm是一個推薦的整合開發環境(IDE),因為它具有全面的功能集和對Python的支援。
IronPDF for Python的某些關鍵功能具有哪些?
IronPDF for Python 提供例如從HTML建立PDF、將圖片轉為PDF、表單處理、文字與圖片提取和PDF合併等功能。
IronPDF程式庫處理PDF文件的安全性如何?
IronPDF設計有強大的安全功能,確保安全處理PDF文件。它支持加密和密碼保護以保護敏感資訊。









