
如何將電子郵件保存為PDF(初學者教程)
在今天的教程中,我們將探討如何使用兩個強大的PDF程式庫,IronPDF和PDFSharp從PDF文件中提取文字。 我們將學習如何在不需要擁有Adobe程式庫授權的情況下,使用這些工具進行文字提取,以及它們之間的比較。
市面上有數十種以PDF為重點的程式庫可供選擇,花時間比較它們並學習功能運作方式後,您將能選擇出最適合您專案需求的程式庫。 文字提取只是您可能需要在PDF上執行的許多任務中的一個範例,文字提取在您需要有效讀取或解析PDF文件中的資料時特別有用。
PDFSharp
PDFSharp是一個開源.NET程式庫,專為程式化建立和修改PDF文件而設計。 雖然其主要優勢在於PDF生成和操作,但結合合適的外部程式庫時,它也能提供基本的工具來閱讀現有的PDF文件並提取內容。
PDFSharp能做的不僅僅是即時建立新的PDF文件,還可以用於修改現有的PDF文件、合併和拆分文件、新增註釋等。
IronPDF
IronPDF是一個專業級.NET程式庫,旨在簡化使用C#處理PDF文件的過程。 這是一個功能豐富的工具,專為構建涉及PDF生成、操作、PDF加密、PDF文件轉換、合併PDF頁面、HTML轉PDF、內容提取等應用程式的開發人員設計。
憑藉其強大的能力,IronPDF脫穎而出成為一個多功能的解決方案,適合於小型專案和企業級應用程式的PDF建立和管理。
IronPDF設計用於相容現代.NET框架,包括.NET Core、.NET 5、.NET 6和.NET 7,以及像.NET Framework這樣的舊版。 它在Windows、macOS和Linux等作業系統上無縫運行,並完全相容Docker、Azure和AWS環境。 這確保了開發人員能將他們的PDF工作流程部署在任何平台或雲服務上。
在今天的範例中,我們將嘗試在Visual Studio中從這個PDF文件提取文字:
使用PDFSharp從PDF文件提取文字
PDFSharp在其當前版本中,並不原生支持從PDF文件中提取文字。 它主要設計用於建立和操控PDF,例如繪製圖形、新增內容和合併文件,但缺乏內建的文字提取機制,無法自行處理特殊字元、進階編碼等。 它可能會產生碎片化或不完整的文字輸出,或者是空白字串而非實際PDF內容。 例如:

如果您需要支持不同字體、編碼和佈局的進階文字提取功能,您可能需要使用更專業的程式庫,如:
-
iText:這是一個流行的PDF程式庫,對於文字提取和解析有著強大的支持。
-
Pdfium: 另一個在文字提取方面尤其是處理複雜格式的PDF時表現出色的選擇。
使用IronPDF從PDF文件提取文字
現在讓我們看看使用IronPDF如何處理文字提取。 IronPDF的文字提取功能為開發人員提供了一種簡潔且強大的方法,能有效地從PDF文件中提取文字,無需額外的程式碼將資料字串格式化為可讀文字。
using IronPdf;
public class Program
{
public static void Main(string[] args)
{
// Provide the file path to the PDF document
string pdfPath = @"invoice.pdf";
// Load the PDF document using IronPDF
var pdf = PdfDocument.FromFile(pdfPath);
// Extract all text from the PDF
var extractedText = pdf.ExtractAllText();
// Output the extracted text to the console
Console.WriteLine(extractedText);
}
}Imports IronPdf
Public Class Program
Public Shared Sub Main(args As String())
' Provide the file path to the PDF document
Dim pdfPath As String = "invoice.pdf"
' Load the PDF document using IronPDF
Dim pdf = PdfDocument.FromFile(pdfPath)
' Extract all text from the PDF
Dim extractedText = pdf.ExtractAllText()
' Output the extracted text to the console
Console.WriteLine(extractedText)
End Sub
End Class
IronPDF提供了一個簡單高效的API,用來從給定的PDF路徑中提取文字。 它確保提取的文字結構良好且準確,使其成為開發人員需要在他們的應用程式中處理PDF內容的可靠選擇。
比較
PDFSharp 是一個免費的開源程式庫,適合基本PDF建立和操作,但其功能有限,難以應對複雜的PDF。 理論上,雖然它可能被用來從PDF文件中提取文字,但這需要進階的文字解析,可能導致碎片化的結果。
IronPDF則提供了一個更為強大的解決方案,包含了準確的文字提取、HTML轉PDF轉換和支援現代PDF標準的進階功能。 它針對性能和易用性進行了優化,擁有直觀的API。 雖然供開發使用是免費的,但它也提供商業授權以供其付費授權等級使用。
結論
PDFSharp和IronPDF都是用於在C#中從PDF 提取文字的有價值工具,但它們適用於不同的用例:
- PDFSharp 是一個適合需要免費開源程式庫來進行基本PDF建立和文字提取的開發人員的優秀選擇。 然而,其文字提取能力有限,可能無法滿足更複雜的應用程式需求。
- IronPDF卻在文字提取、HTML轉PDF轉換和進階PDF編輯任務方面表現卓越。 它的易用性、跨平台相容性和廣泛的特性使它成為處理專業級PDF工作流程的開發人員的首選。
要深入了解IronPDF如何超越其他程式庫,請存取官方IronPDF Documentation。

Curtis Chau擁有Carleton大學的電腦科學學士學位,專精於前端開發,擁有Node.js、TypeScript、JavaScript和React的專業知識。Curtis熱衷於建立直觀且美觀的使用者介面,喜愛使用現代框架並建立結構良好、視覺吸引力的手冊。
相關文章


