如何將電子郵件保存為PDF(初學者教程)
在今天的教程中,我們將探討如何使用兩個強大的PDF程式庫,IronPDF和PDFSharp從PDF文件中提取文字。 我們將學習如何在不需要擁有Adobe程式庫授權的情況下,使用這些工具進行文字提取,以及它們之間的比較。
市面上有數十種以PDF為重點的程式庫可供選擇,花時間比較它們並學習功能運作方式後,您將能選擇出最適合您專案需求的程式庫。 文字提取只是您可能需要在PDF上執行的許多任務中的一個範例,文字提取在您需要有效讀取或解析PDF文件中的資料時特別有用。
PDFSharp
PDFSharp是一個開源.NET程式庫,專為程式化建立和修改PDF文件而設計。 雖然其主要優勢在於PDF生成和操作,但結合合適的外部程式庫時,它也能提供基本的工具來閱讀現有的PDF文件並提取內容。
PDFSharp能做的不僅僅是即時建立新的PDF文件,還可以用於修改現有的PDF文件、合併和拆分文件、新增註釋等。
IronPDF
IronPDF是一個專業級.NET程式庫,旨在簡化使用C#處理PDF文件的過程。 這是一個功能豐富的工具,專為構建涉及PDF生成、操作、PDF加密、PDF文件轉換、合併PDF頁面、HTML轉PDF、內容提取等應用程式的開發人員設計。
憑藉其強大的能力,IronPDF脫穎而出成為一個多功能的解決方案,適合於小型專案和企業級應用程式的PDF建立和管理。
IronPDF設計用於相容現代.NET框架,包括.NET Core、.NET 5、.NET 6和.NET 7,以及像.NET Framework這樣的舊版。 它在Windows、macOS和Linux等作業系統上無縫運行,並完全相容Docker、Azure和AWS環境。 這確保了開發人員能將他們的PDF工作流程部署在任何平台或雲服務上。
在今天的範例中,我們將嘗試在Visual Studio中從這個PDF文件提取文字:
使用PDFSharp從PDF文件提取文字
PDFSharp在其當前版本中,並不原生支持從PDF文件中提取文字。 它主要設計用於建立和操控PDF,例如繪製圖形、新增內容和合併文件,但缺乏內建的文字提取機制,無法自行處理特殊字元、進階編碼等。 它可能會產生碎片化或不完整的文字輸出,或者是空白字串而非實際PDF內容。 例如:

如果您需要支持不同字體、編碼和佈局的進階文字提取功能,您可能需要使用更專業的程式庫,如:
-
iText:這是一個流行的PDF程式庫,對於文字提取和解析有著強大的支持。
- Pdfium: 另一個在文字提取方面尤其是處理複雜格式的PDF時表現出色的選擇。
使用IronPDF從PDF文件提取文字
現在讓我們看看使用IronPDF如何處理文字提取。 IronPDF的文字提取功能為開發人員提供了一種簡潔且強大的方法,能有效地從PDF文件中提取文字,無需額外的程式碼將資料字串格式化為可讀文字。
using IronPdf;
public class Program
{
public static void Main(string[] args)
{
// Provide the file path to the PDF document
string pdfPath = @"invoice.pdf";
// Load the PDF document using IronPDF
var pdf = PdfDocument.FromFile(pdfPath);
// Extract all text from the PDF
var extractedText = pdf.ExtractAllText();
// Output the extracted text to the console
Console.WriteLine(extractedText);
}
}
using IronPdf;
public class Program
{
public static void Main(string[] args)
{
// Provide the file path to the PDF document
string pdfPath = @"invoice.pdf";
// Load the PDF document using IronPDF
var pdf = PdfDocument.FromFile(pdfPath);
// Extract all text from the PDF
var extractedText = pdf.ExtractAllText();
// Output the extracted text to the console
Console.WriteLine(extractedText);
}
}
Imports IronPdf
Public Class Program
Public Shared Sub Main(ByVal args() As String)
' Provide the file path to the PDF document
Dim pdfPath As String = "invoice.pdf"
' Load the PDF document using IronPDF
Dim pdf = PdfDocument.FromFile(pdfPath)
' Extract all text from the PDF
Dim extractedText = pdf.ExtractAllText()
' Output the extracted text to the console
Console.WriteLine(extractedText)
End Sub
End Class

IronPDF提供了一個簡單高效的API,用來從給定的PDF路徑中提取文字。 它確保提取的文字結構良好且準確,使其成為開發人員需要在他們的應用程式中處理PDF內容的可靠選擇。
比較
PDFSharp 是一個免費的開源程式庫,適合基本PDF建立和操作,但其功能有限,難以應對複雜的PDF。 理論上,雖然它可能被用來從PDF文件中提取文字,但這需要進階的文字解析,可能導致碎片化的結果。
IronPDF則提供了一個更為強大的解決方案,包含了準確的文字提取、HTML轉PDF轉換和支援現代PDF標準的進階功能。 它針對性能和易用性進行了優化,擁有直觀的API。 雖然供開發使用是免費的,但它也提供商業授權以供其付費授權等級使用。
結論
PDFSharp和IronPDF都是用於在C#中從PDF 提取文字的有價值工具,但它們適用於不同的用例:
- PDFSharp 是一個適合需要免費開源程式庫來進行基本PDF建立和文字提取的開發人員的優秀選擇。 然而,其文字提取能力有限,可能無法滿足更複雜的應用程式需求。
- IronPDF卻在文字提取、HTML轉PDF轉換和進階PDF編輯任務方面表現卓越。 它的易用性、跨平台相容性和廣泛的特性使它成為處理專業級PDF工作流程的開發人員的首選。
要深入了解IronPDF如何超越其他程式庫,請存取官方IronPDF Documentation。
常見問題
如何使用 .NET 程式庫從 PDF 文件中擷取文字?
您可以使用 IronPDF 高效地從 PDF 文件中擷取文字。IronPDF 確保擷取的文字結構良好且準確,無需額外程式碼進行文字格式化。
using PDFsharp 進行文字擷取的限制是什麼?
PDFsharp 主要設計用於建立和修改 PDFs,並且缺乏高效文字擷取的本機支援。當嘗試從複雜的 PDF 文件中擷取文字時,這可能會導致文字輸出斷裂或不完整。
為什麼選擇 IronPDF 而不是 PDFsharp 來從 PDF 中擷取文字?
IronPDF 提供強大的文字擷取能力,提供準確且結構良好的文字結果。它支援複雜的 PDF 格式和現代 .NET 構架,使其比起 PDFsharp 在全面文字擷取任務上更為多才多藝。
IronPDF 可以用於跨平台的 PDF 開發嗎?
可以,IronPDF 與現代 .NET 構架相容,支援在 Windows、macOS 和 Linux 上的跨平台開發。它也能無縫整合到 Docker、Azure 和 AWS 等雲端服務中。
有什麼替代 PDFsharp 來處理 PDF 文字擷取的方案?
PDFsharp 的替代方案包括 IronPDF,它提供了先進的文字擷取功能,以及 iTextSharp (iText 7) 和 Pdfium,這些都以其在文字擷取和解析方面的強大支援而著稱。
IronPDF 適合專業級別的 PDF 處理嗎?
是的,IronPDF 是一個專業級的 .NET 程式庫,提供廣泛的功能進行 PDF 生成、操作、加密和 HTML 到 PDF 的轉換,使其在專業環境中的先進 PDF 工作流程中成為理想選擇。
使用像 IronPDF 這樣的程式庫有哪些應用範圍?
IronPDF 適用於涉及 PDF 生成、操作、文字擷取、HTML 到 PDF 轉換和高級 PDF 編輯任務的應用,使其成為開發者需求可靠和高效 PDF 解決方案的首選。
有沒有提供免費使用和商業授權的程式庫?
IronPDF 提供用於開發目的的免費使用,同時還提供付費層級的商業授權,以滿足各種項目需求和專業要求。



