跳至頁尾內容
.NET幫助

C# Use of Unassigned Local Variable (Example)

在現代數位環境中,便攜式文件格式(PDF)已成為分享和傳播資訊的重要手段。 然而,有時需要從PDF文件中提取文字。 無論是為了研究、分析或重新利用內容,本文旨在為您提供對各種方法的全面理解,以有效從PDF文件中提取文字,同時保持準確性和格式。

方法一:複製和貼上技術

從PDF中提取文字的最直截了當的方法就是普遍使用的複製和貼上方法。 以下是逐步說明:

  1. 打開您喜歡的PDF閱讀器(例如,Adobe Acrobat Reader、Sumatra PDF,甚至是像Chrome或Firefox這樣的網頁瀏覽器)。
  2. 使用您的游標按住並拖動以選取所需的文字。 右鍵單擊所選文字,然後從上下文選單中選擇"複製"選項。
  3. 啟動文字編輯器或文字處理軟體(例如,Microsoft Word、Notepad、Google Docs)。
  4. 在文件中右鍵單擊並選擇"貼上"以傳輸複製的文字。

雖然簡單,但這種方法可能無法保持PDF的原始結構和格式。

方法二:線上PDF轉文字轉換器

有許多線上工具可讓您將PDF文件轉換為文字格式。 這些工具通常提供使用者友好的介面,可以處理單次和批量轉換。 請按照以下步驟進行:

  1. 在您喜歡的搜索引擎中搜尋"PDF轉文字轉換器"。
  2. 選擇一個可靠的線上轉換器(例如,Smallpdf、Online2PDF、或PDF2Go)。 在此範例中將使用PDF2Go。
  3. 將您的PDF文件上傳至轉換器的網站。如有可用轉換選項,請選擇(例如,OCR - 光學字元識別)。
  4. 啟動轉換過程並等待工具處理PDF。 下載提取出的文字文件。

請記住,文字提取的準確性在很大程度上取決於轉換器所使用的OCR技術的質量。

Method 3: Programming with C

對於那些熟悉編程的人來說,C#提供了一種強大的方式,使用IronPDF這類程式庫來從PDF文件中提取文字。 IronPDF提供了一系列處理PDF文件的工具,使其成為文字提取工作的絕佳選擇。 在進一步操作之前,先來簡單介紹一下IronPDF。

IronPDF

IronPDF是一個強大的.NET程式庫,讓開發者能在他們的應用程式內擁有強大的PDF操作和建立能力。 具有從零生成PDF、無縫HTML到PDF轉換、文字和圖像提取、數位簽名、互動表單以及條碼生成等功能,IronPDF提供了一個全面的工具包,以高效處理PDF。 通過與.NET框架的無縫整合及提供的使用者友好API,IronPDF簡化了複雜的PDF任務,使開發者能利用高級PDF功能增強其應用程式並簡化文件工作流程。

Extract text from PDF file in C

在Visual Studio中開啟或建立一個新專案。 執行以下命令以安裝IronPDF NuGet套件。

Install-Package IronPdf

此命令將在專案中安裝IronPDF。

撰寫以下C#程式碼以方便地從PDF文件中提取文字。

using IronPdf;

class Program
{
    static void Main()
    {
        // Load the PDF document
        PdfDocument pdfDocument = new PdfDocument(@"D:/Sample PDF File.pdf");

        // Extract all text from the PDF
        string text = pdfDocument.ExtractAllText();

        // Output the extracted text
        Console.WriteLine(text);
    }
}
using IronPdf;

class Program
{
    static void Main()
    {
        // Load the PDF document
        PdfDocument pdfDocument = new PdfDocument(@"D:/Sample PDF File.pdf");

        // Extract all text from the PDF
        string text = pdfDocument.ExtractAllText();

        // Output the extracted text
        Console.WriteLine(text);
    }
}
Imports IronPdf

Friend Class Program
	Shared Sub Main()
		' Load the PDF document
		Dim pdfDocument As New PdfDocument("D:/Sample PDF File.pdf")

		' Extract all text from the PDF
		Dim text As String = pdfDocument.ExtractAllText()

		' Output the extracted text
		Console.WriteLine(text)
	End Sub
End Class
$vbLabelText   $csharpLabel

此程式碼使用IronPDF從指定的PDF文件中提取文字。 然後我們可以從提取的文字中建立一個文字文件或根據需要利用它。 通過這樣,IronPDF使資料提取過程變得非常簡單和容易。 它還可以用於導出PDF至文字文件。 我們還可以使用IronPDF建立可編輯文件並從掃描的PDF中提取PDF圖像。

如需有關如何從PDF文件中提取文字的更多資訊,請造訪IronPDF的C#文字提取部落格

結論

使用不同的方法從PDF文件中提取文字,包括C#和IronPDF程式庫,為您提供了有效處理PDF文件的靈活性和能力。 無論您選擇一個使用者友好的線上轉換器還是C#的編程能力,IronPDF,這個強大的.NET程式庫,通過提供豐富的PDF操作和建立能力進一步豐富了您的工具箱,例如從零生成PDF,轉換HTML內容,資料提取,應用數位簽名,甚至生成條碼。 無論您是一個為企業解決方案而努力的開發者還是尋求簡化文件工作流程,IronPDF簡化了複雜的PDF任務,讓您能專注於提供高品質的應用程式,同時充分利用PDF格式的全部功能。

IronPDF的商業授權可從Iron Software獲得免費試用。 這份全面的指南已為您提供了知識,使您能自信而精確地處理來自PDF文件的文字提取任務,並以IronPDF的強大功能為後盾。

Curtis Chau
技術作家

Curtis Chau擁有Carleton大學的電腦科學學士學位,專精於前端開發,擁有Node.js、TypeScript、JavaScript和React的專業知識。Curtis熱衷於建立直觀且美觀的使用者介面,喜愛使用現代框架並建立結構良好、視覺吸引力的手冊。

除了開發,Curtis對物聯網(IoT)有濃厚的興趣,探索創新的方法來整合硬體和軟體。在空閒時間,他喜歡玩遊戲和建立Discord機器人,結合他對技術的熱愛與創造力。

Iron 支援團隊

我們線上24小時,每週5天。
聊天
電子郵件
給我打電話