如何在 Python 中將 PDF 轉換為文字(教程)
本文將展示如何使用IronPDF for Python,一種最強大的PDF程式庫之一,從PDF文件中提取任何可用的文字。
如何在Python中將PDF轉換為文字
- 安裝一個Python庫以將PDF轉換為文字
- 載入現有的PDF文件或渲染一個新的
- 利用
ExtractAllText方法從打開的文件中讀取文字 - 使用該方法的另一個重載來從特定頁面讀取文字。
- 將提取的文字列印到控制台或保存到文字文件中
2.0 如何使用Python從PDF中提取文字?
- 從Python下載頁面安裝Python的最新版本
- 打開任何Python IDE工具
- 安裝.NET Core運行時
- 安裝IronPDF for Python庫或從PyPI下載頁面下載
- 從PDF中提取文字
2.1 IronPDF for Python是什麼?
將IronPDF程式庫整合到Python中非常簡單,因為相比其它語言,Python是一種更加動態的語言,允許開發者快速且輕鬆地建立圖形使用者介面。 它擁有許多預先安裝的工具,包括PyQT、wxWidgets、kivy,還有大量其他的套件和庫,這些都可以用來快速且安全地建立完整的GUI。
IronPDF for Python是一個非常高效的程式庫,尤其適用於網頁開發。 這歸功於大量Python網頁開發的範例存在,如Django、Flask和Pyramid的廣泛使用。 這些框架已被包括Reddit、Mozilla和Spotify在內的諸多網站和線上服務使用。
2.2 IronPDF的功能
- 可以從多種來源建立PDF文件,包括HTML、HTML5、ASP和PHP網站。 除了HTML文件之外,也可以將圖片文件轉換為PDF。
- IronPDF允許您構建互動式PDF文件,填寫和發送互動表單,分割和合併PDF文件,從PDF文件中提取文字和圖片,在PDF文件中搜尋特定詞語,將PDF頁面點陣化為圖片,將PDF轉換為HTML,並列印PDF文件。
- IronPDF可以打開PDF文件並從URL列印。 此外,它還允許使用者代理在HTML登錄表單、代理、Cookie、HTTP標頭、自定義網路登錄憑據、表單變數和使用者代理後登錄。
- 圖片可以通過IronPDF從文件中提取出來。
- 使用IronPDF,您可以非常輕鬆地在文件中新增頁眉和頁腳、文字和圖片、書籤以及水印等。
- 可以使用新的或現有的文件結合和分離頁面。
- 不必使用Acrobat查看器,也可以將文件轉換為PDF物件。
- 一個CSS文件可以用來製作PDF文件。
- 使用媒體型別CSS文件可以製作文件。
2.3 匯入IronPDF庫
在IronPDF將被使用的源文件的開始處包含以下匯入語句以匯入IronPDF:
from ironpdf import *from ironpdf import *2.4 設置授權金鑰(如果需要)
雖然IronPDF for Python可免費使用,但它會對自由使用者的PDF文件進行帶瓷磚背景的水印處理。 您必須提供該庫一個合法的授權金鑰才能使用IronPDF建立不帶水印的PDF。 以下程式碼片段顯示如何用授權金鑰設置庫:
# Set the license key for IronPDF
License.LicenseKey = "IRONPDF-LICENSE-KEY-ABCDEFGH"# Set the license key for IronPDF
License.LicenseKey = "IRONPDF-LICENSE-KEY-ABCDEFGH"在建立PDF文件或更改其內容之前,確保配置好授權金鑰。 應在其他任何程式碼行之前調用LicenseKey方法。 要獲取免費試用授權金鑰,請存取授權頁面。
2.5 設置日誌文件
一個名為"Default"的文字文件可以儲存在Python腳本目錄內由Custom.log生成的日誌消息。 可以使用以下程式碼片段設置LogFilePath屬性並自定義日誌文件的名稱和位置:
# Enable debugging and set the log file path and mode
Logger.EnableDebugging = True
Logger.LogFilePath = "Custom.log"
Logger.LoggingMode = Logger.LoggingModes.All# Enable debugging and set the log file path and mode
Logger.EnableDebugging = True
Logger.LogFilePath = "Custom.log"
Logger.LoggingMode = Logger.LoggingModes.All3.0 使用IronPDF提取PDF文字
IronPDF for Python庫可以將PDF頁面轉換為PDF物件,並允許從PDF文件中提取文字,這包括掃描的PDF文件。 這裡有一個例子,展示如何使用IronPDF讀取現有的PDF。
第一個方法涉及提取PDF中的所有可用文字; 下面提供了一個程式碼樣本。
from ironpdf import *
# Load existing PDF document
pdf = PdfDocument.FromFile("content.pdf")
# Extract all the text from the entire PDF document
all_text = pdf.ExtractAllText()
# Display the extracted text
print(all_text)from ironpdf import *
# Load existing PDF document
pdf = PdfDocument.FromFile("content.pdf")
# Extract all the text from the entire PDF document
all_text = pdf.ExtractAllText()
# Display the extracted text
print(all_text)如上面的程式碼所示,FromFile方法是一個PDF閱讀器物件,用於載入現有的PDF文件並將其轉換為PDF文件物件。 此物件可用於讀取PDF頁面上的文字和圖像。 該物件提供一個名為ExtractAllText的方法,該方法從整個PDF文件中提取每一段文字,並將其保存在一個可處理的字串中。 然後使用print函式顯示文字。
顯示文字
第二種方法的程式碼範例提供了按頁按頁提取PDF文件中文字的功能。下面提供了該範例。
from ironpdf import *
# Load existing PDF document
pdf = PdfDocument.FromFile("content.pdf")
# Extract text from a specific page in the document
page_text = pdf.ExtractTextFromPage(1)
# Display the extracted text from the specified page
print(page_text)from ironpdf import *
# Load existing PDF document
pdf = PdfDocument.FromFile("content.pdf")
# Extract text from a specific page in the document
page_text = pdf.ExtractTextFromPage(1)
# Display the extracted text from the specified page
print(page_text)如上程式碼所示,FromFile方法用於從現有文件載入PDF文件,並將其轉換為PDF文件物件。 PDF頁面物件上的一個名為ExtractTextFromPage的方法從PDF文件中的頁面中檢索所有文字。必須將頁碼作為參數提供以提取特定頁面的文字。 然後,提取文字後,可以使用page_text來儲存可被處理的資訊。
查看更多例子以提取PDF中的文字。
4.0 結論
另一方面,IronPDF程式庫提供強大的安全措施以減少潛在風險。 它不針對任何特定的瀏覽器設置,可以與所有常用瀏覽器一起使用。 IronPDF允許程式設計師只需幾行程式碼即可輕鬆地建立和讀取PDF文件。 IronPDF程式庫提供了各種授權選項,包括免費開發者授權和可購買的額外開發授權,以滿足不同開發者的需求。
IronPDF包括永久授權、30天退款保證、一年的軟體支援和升級選項。 首次購買後不再有其他費用支出。 這些授權可以在開發、測試和生產環境中使用。 了解更多有關產品授權的資訊。
下載軟體產品。
常見問題
如何在Python中將PDF轉換為文字?
您可以通過使用IronPDF的PdfDocument.FromFile方法載入您的PDF,然後使用ExtractAllText或ExtractTextFromPage方法提取所需文字來在Python中將PDF轉換為文字。
在Python中使用PDF程式庫需要哪些設置?
要使用IronPDF,您需要安裝Python和IDE,以及.NET Core運行時。IronPDF可以通過PyPI下載頁面進行安裝。
我可以使用Python從PDF的特定頁面提取文字嗎?
是的,使用IronPDF,您可以使用ExtractTextFromPage方法,通過提供頁碼作為參數來從特定頁面提取文字。
是否有任何免費選擇可以在Python中使用PDF程式庫?
IronPDF for Python提供一個免費版本,該版本會在PDF上新增水印。要移除水印並解鎖全部功能,您需要一個授權金鑰。
如何將PDF程式庫整合到像Django或Flask這樣的網頁框架中?
IronPDF能夠無縫整合到網頁框架中,如Django和Flask,允許您在網頁應用程式專案中生成和操作PDF。
我應該在Python的PDF程式庫中尋找哪些功能?
像IronPDF這樣的全面PDF程式庫應該支持從HTML和圖片建立PDF,提取文字、填寫表單、合併PDF以及新增書籤和水印。
如何在Python的PDF程式庫中設置授權金鑰?
對於IronPDF,請在執行任何其他程式碼之前使用License.LicenseKey方法設置授權金鑰以註冊您的授權並移除水印。
Python的PDF程式庫是否支持從網頁建立PDF?
IronPDF能夠從HTML、HTML5以及使用ASP或PHP構建的網頁建立PDF,這使得它成為一個多用途的網頁PDF生成工具。
如何在Python的PDF程式庫中啟用除錯?
在IronPDF中通過設置Logger.EnableDebugging為true,並使用Logger.LogFilePath定義日誌文件路徑來啟用除錯。
Python的PDF程式庫有哪些安全功能?
IronPDF確保安全性和跨瀏覽器相容性,為尋求安全PDF操作解決方案的開發者提供了一個可靠的工具。









