跳至頁尾內容
USING IRONPDF FOR PYTHON

如何在 Python 中將 PDF 轉換為文字(教程)

本文將展示如何使用IronPDF for Python,一種最強大的PDF程式庫之一,從PDF文件中提取任何可用的文字。

2.0 如何使用Python從PDF中提取文字?

  1. 從Python下載頁面安裝Python的最新版本
  2. 打開任何Python IDE工具
  3. 安裝.NET Core運行時
  4. 安裝IronPDF for Python庫或從PyPI下載頁面下載
  5. 從PDF中提取文字

2.1 IronPDF for Python是什麼?

將IronPDF程式庫整合到Python中非常簡單,因為相比其它語言,Python是一種更加動態的語言,允許開發者快速且輕鬆地建立圖形使用者介面。 它擁有許多預先安裝的工具,包括PyQT、wxWidgets、kivy,還有大量其他的套件和庫,這些都可以用來快速且安全地建立完整的GUI。

IronPDF for Python是一個非常高效的程式庫,尤其適用於網頁開發。 這歸功於大量Python網頁開發的範例存在,如Django、Flask和Pyramid的廣泛使用。 這些框架已被包括Reddit、Mozilla和Spotify在內的諸多網站和線上服務使用。

2.2 IronPDF的功能

  • 可以從多種來源建立PDF文件,包括HTML、HTML5、ASP和PHP網站。 除了HTML文件之外,也可以將圖片文件轉換為PDF
  • IronPDF允許您構建互動式PDF文件,填寫和發送互動表單分割合併PDF文件,從PDF文件中提取文字和圖片,在PDF文件中搜尋特定詞語,將PDF頁面點陣化為圖片,將PDF轉換為HTML,並列印PDF文件
  • IronPDF可以打開PDF文件並從URL列印。 此外,它還允許使用者代理在HTML登錄表單、代理、Cookie、HTTP標頭、自定義網路登錄憑據、表單變數和使用者代理後登錄。
  • 圖片可以通過IronPDF從文件中提取出來。
  • 使用IronPDF,您可以非常輕鬆地在文件中新增頁眉和頁腳、文字和圖片、書籤以及水印等。
  • 可以使用新的或現有的文件結合和分離頁面。
  • 不必使用Acrobat查看器,也可以將文件轉換為PDF物件。
  • 一個CSS文件可以用來製作PDF文件。
  • 使用媒體型別CSS文件可以製作文件。

2.3 匯入IronPDF庫

在IronPDF將被使用的源文件的開始處包含以下匯入語句以匯入IronPDF:

from ironpdf import *
from ironpdf import *
PYTHON

2.4 設置授權金鑰(如果需要)

雖然IronPDF for Python可免費使用,但它會對自由使用者的PDF文件進行帶瓷磚背景的水印處理。 您必須提供該庫一個合法的授權金鑰才能使用IronPDF建立不帶水印的PDF。 以下程式碼片段顯示如何用授權金鑰設置庫:

# Set the license key for IronPDF
License.LicenseKey = "IRONPDF-LICENSE-KEY-ABCDEFGH"
# Set the license key for IronPDF
License.LicenseKey = "IRONPDF-LICENSE-KEY-ABCDEFGH"
PYTHON

在建立PDF文件或更改其內容之前,確保配置好授權金鑰。 應在其他任何程式碼行之前調用LicenseKey方法。 要獲取免費試用授權金鑰,請存取授權頁面

2.5 設置日誌文件

一個名為"Default"的文字文件可以儲存在Python腳本目錄內由Custom.log生成的日誌消息。 可以使用以下程式碼片段設置LogFilePath屬性並自定義日誌文件的名稱和位置:

# Enable debugging and set the log file path and mode
Logger.EnableDebugging = True
Logger.LogFilePath = "Custom.log"
Logger.LoggingMode = Logger.LoggingModes.All
# Enable debugging and set the log file path and mode
Logger.EnableDebugging = True
Logger.LogFilePath = "Custom.log"
Logger.LoggingMode = Logger.LoggingModes.All
PYTHON

3.0 使用IronPDF提取PDF文字

IronPDF for Python庫可以將PDF頁面轉換為PDF物件,並允許從PDF文件中提取文字,這包括掃描的PDF文件。 這裡有一個例子,展示如何使用IronPDF讀取現有的PDF。

第一個方法涉及提取PDF中的所有可用文字; 下面提供了一個程式碼樣本。

from ironpdf import *

# Load existing PDF document
pdf = PdfDocument.FromFile("content.pdf")

# Extract all the text from the entire PDF document
all_text = pdf.ExtractAllText()

# Display the extracted text
print(all_text)
from ironpdf import *

# Load existing PDF document
pdf = PdfDocument.FromFile("content.pdf")

# Extract all the text from the entire PDF document
all_text = pdf.ExtractAllText()

# Display the extracted text
print(all_text)
PYTHON

如上面的程式碼所示,FromFile方法是一個PDF閱讀器物件,用於載入現有的PDF文件並將其轉換為PDF文件物件。 此物件可用於讀取PDF頁面上的文字和圖像。 該物件提供一個名為ExtractAllText的方法,該方法從整個PDF文件中提取每一段文字,並將其保存在一個可處理的字串中。 然後使用print函式顯示文字。

如何在Python中將PDF轉換為文字(教程),圖1:顯示文字 顯示文字

第二種方法的程式碼範例提供了按頁按頁提取PDF文件中文字的功能。下面提供了該範例。

from ironpdf import *

# Load existing PDF document
pdf = PdfDocument.FromFile("content.pdf")

# Extract text from a specific page in the document
page_text = pdf.ExtractTextFromPage(1)

# Display the extracted text from the specified page
print(page_text)
from ironpdf import *

# Load existing PDF document
pdf = PdfDocument.FromFile("content.pdf")

# Extract text from a specific page in the document
page_text = pdf.ExtractTextFromPage(1)

# Display the extracted text from the specified page
print(page_text)
PYTHON

如上程式碼所示,FromFile方法用於從現有文件載入PDF文件,並將其轉換為PDF文件物件。 PDF頁面物件上的一個名為ExtractTextFromPage的方法從PDF文件中的頁面中檢索所有文字。必須將頁碼作為參數提供以提取特定頁面的文字。 然後,提取文字後,可以使用page_text來儲存可被處理的資訊。

查看更多例子以提取PDF中的文字。

4.0 結論

另一方面,IronPDF程式庫提供強大的安全措施以減少潛在風險。 它不針對任何特定的瀏覽器設置,可以與所有常用瀏覽器一起使用。 IronPDF允許程式設計師只需幾行程式碼即可輕鬆地建立和讀取PDF文件。 IronPDF程式庫提供了各種授權選項,包括免費開發者授權和可購買的額外開發授權,以滿足不同開發者的需求。

IronPDF包括永久授權、30天退款保證、一年的軟體支援和升級選項。 首次購買後不再有其他費用支出。 這些授權可以在開發、測試和生產環境中使用。 了解更多有關產品授權的資訊

下載軟體產品。

常見問題

如何在Python中將PDF轉換為文字?

您可以通過使用IronPDF的PdfDocument.FromFile方法載入您的PDF,然後使用ExtractAllTextExtractTextFromPage方法提取所需文字來在Python中將PDF轉換為文字。

在Python中使用PDF程式庫需要哪些設置?

要使用IronPDF,您需要安裝Python和IDE,以及.NET Core運行時。IronPDF可以通過PyPI下載頁面進行安裝。

我可以使用Python從PDF的特定頁面提取文字嗎?

是的,使用IronPDF,您可以使用ExtractTextFromPage方法,通過提供頁碼作為參數來從特定頁面提取文字。

是否有任何免費選擇可以在Python中使用PDF程式庫?

IronPDF for Python提供一個免費版本,該版本會在PDF上新增水印。要移除水印並解鎖全部功能,您需要一個授權金鑰。

如何將PDF程式庫整合到像Django或Flask這樣的網頁框架中?

IronPDF能夠無縫整合到網頁框架中,如Django和Flask,允許您在網頁應用程式專案中生成和操作PDF。

我應該在Python的PDF程式庫中尋找哪些功能?

像IronPDF這樣的全面PDF程式庫應該支持從HTML和圖片建立PDF,提取文字、填寫表單、合併PDF以及新增書籤和水印。

如何在Python的PDF程式庫中設置授權金鑰?

對於IronPDF,請在執行任何其他程式碼之前使用License.LicenseKey方法設置授權金鑰以註冊您的授權並移除水印。

Python的PDF程式庫是否支持從網頁建立PDF?

IronPDF能夠從HTML、HTML5以及使用ASP或PHP構建的網頁建立PDF,這使得它成為一個多用途的網頁PDF生成工具。

如何在Python的PDF程式庫中啟用除錯?

在IronPDF中通過設置Logger.EnableDebugging為true,並使用Logger.LogFilePath定義日誌文件路徑來啟用除錯。

Python的PDF程式庫有哪些安全功能?

IronPDF確保安全性和跨瀏覽器相容性,為尋求安全PDF操作解決方案的開發者提供了一個可靠的工具。

Curtis Chau
技術作家

Curtis Chau擁有Carleton大學的電腦科學學士學位,專精於前端開發,擁有Node.js、TypeScript、JavaScript和React的專業知識。Curtis熱衷於建立直觀且美觀的使用者介面,喜愛使用現代框架並建立結構良好、視覺吸引力的手冊。

除了開發,Curtis對物聯網(IoT)有濃厚的興趣,探索創新的方法來整合硬體和軟體。在空閒時間,他喜歡玩遊戲和建立Discord機器人,結合他對技術的熱愛與創造力。

Iron 支援團隊

我們線上24小時,每週5天。
聊天
電子郵件
給我打電話