跳至頁尾內容
PYTHON PDF 工具

如何在 Python 中讀取 PDF 文件

PDF,或可攜式文件格式檔案,已成為分享文件的通用標準。 它們廣泛使用於保持文件的版面和格式。 然而,使用Python這樣的程式語言來處理PDF檔案可能會有點挑戰。 本文介紹IronPDF,一個Python PDF程式庫,允許我們對PDF文件進行各種操作。

IronPDF for Python PDF Library

IronPDF是一個先進的Python PDF程式庫,便於處理PDF格式檔案。 它提供了一個易於使用的API來進行各種PDF操作。 您可以讀取和寫入PDF文件,將PDF文件轉換為不同格式,合併多個PDF文件,等等。 它還能處理頁面物件,從PDF文件的所有頁面中提取文字,旋轉PDF頁面,及其他功能。

How to Read PDF Files in Python

  1. 使用Pip安裝Python PDF Library。
  2. 在Python腳本中導入Python PDF Library。
  3. 應用PDFReader Python Library的授權金鑰。
  4. 提供文件路徑以載入任何PDF文件。
  5. 在Python控制台上閱讀PDF內容。

Read a PDF File using IronPDF

使用IronPDF讀取PDF文件涉及多個步驟。 這裡有一個簡單的指南讓您開始:

Step 1 Create a virtual environment in Visual Studio

使用Python時,建立一個獨立的環境即虛擬環境至關重要。 這個環境允許您管理與您工作專案相關的依賴,不會干擾其他專案。 在整合開發環境(IDE)如Visual Studio Code中建立虛擬環境變得更加簡單。 要做到這一點,請按照以下步驟進行:

  1. 在Visual Studio Code中打開資料夾。 按Ctrl+Shift+P打開命令選擇器。 在命令選擇器中搜尋"Python: Create Environment"。

    How to Read PDF Files in Python: Figure 1

  2. 選擇第一個選項,然後選擇"Venv"作為環境型別。

    How to Read PDF Files in Python: Figure 2

  3. 之後,選擇Python解譯器並開始建立虛擬環境。

    How to Read PDF Files in Python: Figure 3

現在,您的Python腳本的獨立工作空間已經準備就緒,確保專案依賴被限制在此環境中。

How to Read PDF Files in Python: Figure 4

Step 2 Install IronPDF for Python library

設置好虛擬環境後,您就可以開始安裝IronPDF for Python library。 您可以使用Python包安裝工具'pip'進行安裝:

pip install ironpdf

Step 3 Install .NET 6.0

IronPDF for Python需要安裝.NET 6.0 SDK。

請從微軟 .NET 網站下載並安裝.NET 6.0 SDK。

Step 4 Import IronPDF

成功安裝IronPDF後,下一步是將它匯入到您的Python腳本中。 匯入程式庫將使所有功能和方法可在您的腳本中使用。 您可以使用下面這行程式碼匯入IronPDF:

from ironpdf import *
from ironpdf import *
PYTHON

這行程式碼將IronPDF程式庫中的所有模組、函式和類匯入到您的腳本中。

Step 5 Apply License Key

欲完全解鎖IronPDF程式庫的功能,您需要應用授權金鑰。 應用授權金鑰就像是將金鑰指派給License屬性一樣簡單。 以下是如何做到的:

License.LicenseKey = "License-Key-Here"
License.LicenseKey = "License-Key-Here"
PYTHON

用您實際的IronPDF授權金鑰替換"License-Key-Here"。 有了授權金鑰後,您現在可以在您的Python腳本中充分利用IronPDF程式庫的潛力。

Step 6 Set Log Path

接下來,為IronPDF操作設置日誌記錄。 透過設置自定義日誌路徑,您可以儲存程式庫生成的運行時日誌,這有助於您在執行過程中進行除錯和診斷可能發生的問題。 下面是如何設置它:

# Enable debugging mode for detailed logs
Logger.EnableDebugging = True
# Set the path for the log file
Logger.LogFilePath = "Custom.log"
# Set logging mode to capture all log types
Logger.LoggingMode = Logger.LoggingModes.All
# Enable debugging mode for detailed logs
Logger.EnableDebugging = True
# Set the path for the log file
Logger.LogFilePath = "Custom.log"
# Set logging mode to capture all log types
Logger.LoggingMode = Logger.LoggingModes.All
PYTHON

在這段程式碼片段中,Logger.LoggingMode = Logger.LoggingModes.All則確保記錄所有型別的日誌資訊。

Step 7 Load PDF document

使用IronPDF載入PDF文件就像呼叫一個方法一樣簡單。 PdfDocument.FromFile方法從給定的路徑將PDF文件載入為一個PDF文件物件。 您只需要提供PDF文件路徑作為字串:

pdf = PdfDocument.FromFile("PDF B.pdf")
pdf = PdfDocument.FromFile("PDF B.pdf")
PYTHON

在這段程式碼中,PdfDocument物件,表示指定的PDF文件。

Step 8 Read PDF File content

IronPDF提供了一個名為ExtractAllText()的方法,有助於從PDF文件中提取文字內容。 當您需要閱讀和分析PDF文件內容時,這功能尤其方便:

all_text = pdf.ExtractAllText()  # Extracts all text from the PDF document
print(all_text)  # Prints the extracted text to the console
all_text = pdf.ExtractAllText()  # Extracts all text from the PDF document
print(all_text)  # Prints the extracted text to the console
PYTHON

在這個例子中,pdf物件中的所有PDF文件文字。 您將能夠在控制台上讀取PDF內容。

How to Read PDF Files in Python: Figure 5

Step 9 Load Second PDF File

就像載入第一個PDF文件一樣,您也可以載入第二個PDF文件。 當您想操作多個PDF文件時,這特性十分有用:

pdf_2 = PdfDocument.FromFile("PDF A.pdf")
pdf_2 = PdfDocument.FromFile("PDF A.pdf")
PYTHON

在這段程式碼中,PdfDocument物件,表示第二個PDF文件。

Step 10 Merge Both files

IronPDF的一個強大功能是合併多個PDF文件為一個新的PDF文件。您可以使用PdfDocument.Merge方法輕鬆地合併兩個或多個PDF文件:

merged = PdfDocument.Merge(pdf, pdf_2)  # Merges pdf and pdf_2 documents
merged.SaveAs("Merged.pdf")  # Saves the merged document as 'Merged.pdf'
merged = PdfDocument.Merge(pdf, pdf_2)  # Merges pdf and pdf_2 documents
merged.SaveAs("Merged.pdf")  # Saves the merged document as 'Merged.pdf'
PYTHON

在這個例子中,PdfDocument物件。 SaveAs方法接著會將這個合併文件保存為名為"Merged.pdf"。

How to Read PDF Files in Python: Figure 6

Step 11 Split First PDF

IronPDF還允許您拆分PDF文件,並將特定頁面提取到新的PDF文件中。 這是使用CopyPage方法完成的:

page1doc = pdf.CopyPage(0)  # Copies the first page of the pdf document
page1doc.SaveAs("Split1.pdf")  # Saves the copied page as a new document 'Split1.pdf'
page1doc = pdf.CopyPage(0)  # Copies the first page of the pdf document
page1doc.SaveAs("Split1.pdf")  # Saves the copied page as a new document 'Split1.pdf'
PYTHON

這裡,pdf文件的第一頁。 這頁面然後被保存為名為"Split1.pdf"的輸出PDF。

How to Read PDF Files in Python: Figure 7

Step 12 Apply Watermark

加水印是IronPDF提供的另一個令人印象深刻的功能。 您可以使用您想要的文字或圖像為您的PDF文件新增水印。 pdf物件表示的PDF新增水印。

pdf.ApplyWatermark("<h2 style='color:red'>SAMPLE</h2>", 30, VerticalAlignment.Middle, HorizontalAlignment.Center)
pdf.SaveAs("Watermarked.pdf")
pdf.ApplyWatermark("<h2 style='color:red'>SAMPLE</h2>", 30, VerticalAlignment.Middle, HorizontalAlignment.Center)
pdf.SaveAs("Watermarked.pdf")
PYTHON

在這段程式碼片段中,ApplyWatermark將紅色水印貼上文字"樣本"在PDF的中間。 然後,SaveAs將加水印的文件保存為"Watermarked.pdf"。

IronPDF Compatibility

IronPDF是一個相容多種Python版本的多功能Python程式庫。 它支持Python 3.6以後的所有現代Python版本。 IronPDF不僅限於單一作業系統。 它是平台無關的,因此可以用於各種作業系統。 無論是Windows、Mac還是Linux,IronPDF都能在這些平台上無縫運行。 這種跨平台的相容性是一個巨大的優勢,使IronPDF成為開發者無論其作業系統喜好如何的首選。

結論

總之,IronPDF是一個出色的Python程式庫,簡化了處理PDF文件的操作。 不論您需要合併多個PDF,提取文字,拆分PDF文件或應用水印,IronPDF全都涵蓋。 它的多平台相容性和易用性使其對任何處理PDF文件的開發者來說都是一個有價值的工具。

IronPDF提供免費試用。 這段試用期讓您有足夠的機會來試驗其功能並評估其適合您的特定需求。 當您測試完成後,您可以從$999開始購買授權。

Curtis Chau
技術作家

Curtis Chau擁有Carleton大學的電腦科學學士學位,專精於前端開發,擁有Node.js、TypeScript、JavaScript和React的專業知識。Curtis熱衷於建立直觀且美觀的使用者介面,喜愛使用現代框架並建立結構良好、視覺吸引力的手冊。

除了開發,Curtis對物聯網(IoT)有濃厚的興趣,探索創新的方法來整合硬體和軟體。在空閒時間,他喜歡玩遊戲和建立Discord機器人,結合他對技術的熱愛與創造力。

Iron 支援團隊

我們線上24小時,每週5天。
聊天
電子郵件
給我打電話