跳至頁尾內容
使用IRONPDF
如何使用IronPDF從PDF中提取文字

如何移除PDF文件上的密碼

從 PDF 提取資料對於節省手動輸入時間至關重要。 本文說明開發者如何使用 IronPDF 程式庫從 PDF 文件中提取文字和圖像

IronPDF: C# PDF程式庫

IronPDF 是一個 .NET 程式庫,可以用來建立、編輯和轉換 PDF 文件。 它為開發者在應用程式中使用 API 提供了易於使用的解決方案。 它是全球最受歡迎的建立、編輯和轉換 PDF 文件的程式庫之一。 使用 IronPDF,您可以快速建立針對 PDF 的簡易解決方案。 您將自定義文字以適應每個文件,您的佈局將被設置以便於閱讀,而圖形將在 .NET 程式協助下設計。

IronPDF 程式庫提供了一個出色的特性來從 PDF 文件中提取資料。 本文將探討如何使用 IronPDF 提取資料。 首先,您需要建立或開啟一個 C# 專案。 讓我們繼續到下一節。

在 Visual Studio 中建立或開啟一個 C# 專案

本教學建議使用 Visual Studio 的最新版本。

Visual Studio 開啟後,請按照下列步驟建立一個新的 C# 專案。 如果您想使用現有的專案,則可以跳過這些步驟,直接進入下一節。

  • 開啟 Visual Studio
  • 點擊"建立新專案"按鈕。

如何在 C# 中從 PDF 提取資料,圖1:Visual Studio 開啟介面 Visual Studio 開啟介面

  • 從範本中選擇"C# Console Application"。

如何在 C# 中從 PDF 提取資料,圖2:建立新專案 建立新專案

  • 給專案命名,然後點擊下一步按鈕。
  • 根據專案要求選擇 .NET Framework,然後點擊建立按鈕。

如何在 C# 中從 PDF 提取資料,圖3:選擇 .NET Framework .NET Framework 選擇

Visual Studio 現在將生成新的 C# .NET 專案。

安裝IronPDF程式庫

IronPDF程式庫可以通過多種方式安裝。

使用套件管理器控制台

  • 通過進入工具 > NuGet 套件管理員 > 套件管理員控制台打開套件管理控制台。
  • 運行以下命令以安裝 IronPDF 程式庫:
Install-Package IronPdf

如何在 C# 中從 PDF 提取資料,圖4:套件管理控制台標籤中的安裝進度 套件管理控制台標籤中的安裝進度

安裝後,您將在下方的 dependencies 區段中看到 IronPDF 依賴項。

如何在 C# 中從 PDF 提取資料,圖5:在解決方案資源管理器中引用 IronPDF 套件 在解決方案資源管理器中引用 IronPDF 套件

使用 NuGet 套件管理器

另一種安裝 IronPDF 程式庫的方法是使用 Visual Studio 的整合 NuGet 套件管理器介面。

  • 前往主選單中的工具。 將滑鼠停留在下拉選單中的"NuGet 套件管理器"上,然後選擇"管理解決方案的 NuGet 套件..."。

如何在 C# 中從 PDF 提取資料,圖6:導航到 NuGet 套件管理器 導航至NuGet套件管理器

  • 這將打開NuGet套件管理器窗口。 轉到瀏覽標籤,搜尋 IronPdf,然後按下 Enter。
  • 從搜尋結果中選擇 IronPDF,然後點擊"安裝"按鈕開始安裝。

如何在 C# 中從 PDF 提取資料,圖7:從 NuGet 套件管理器中安裝 IronPDF 套件 從NuGet套件管理器安裝IronPDF套件

從 PDF 檔案中提取資料

讓我們來看看以下使用 IronPDF 提取資料的程式碼:

// Import necessary namespaces
using IronPdf;
using System.Collections.Generic;
using System.Drawing;

public class PDFExtractor
{
    public void ExtractDataFromPDF()
    {
        // Open a 128-bit encrypted PDF file by providing the filename and password
        using PdfDocument pdf = PdfDocument.FromFile("encrypted.pdf", "password");

        // Extract all text from the PDF document
        string allText = pdf.ExtractAllText();

        // Extract all images from the PDF document
        IEnumerable<Image> allImages = pdf.ExtractAllImages();

        // Iterate over each page in the PDF document
        for (var index = 0; index < pdf.PageCount; index++)
        {
            int pageNumber = index + 1;

            // Extract text from the specific page
            string text = pdf.ExtractTextFromPage(index);

            // Extract images from the specific page
            IEnumerable<Image> images = pdf.ExtractImagesFromPage(index);

            // Code to process the extracted text and images
            //...
        }
    }
}
// Import necessary namespaces
using IronPdf;
using System.Collections.Generic;
using System.Drawing;

public class PDFExtractor
{
    public void ExtractDataFromPDF()
    {
        // Open a 128-bit encrypted PDF file by providing the filename and password
        using PdfDocument pdf = PdfDocument.FromFile("encrypted.pdf", "password");

        // Extract all text from the PDF document
        string allText = pdf.ExtractAllText();

        // Extract all images from the PDF document
        IEnumerable<Image> allImages = pdf.ExtractAllImages();

        // Iterate over each page in the PDF document
        for (var index = 0; index < pdf.PageCount; index++)
        {
            int pageNumber = index + 1;

            // Extract text from the specific page
            string text = pdf.ExtractTextFromPage(index);

            // Extract images from the specific page
            IEnumerable<Image> images = pdf.ExtractImagesFromPage(index);

            // Code to process the extracted text and images
            //...
        }
    }
}
' Import necessary namespaces
Imports IronPdf
Imports System.Collections.Generic
Imports System.Drawing

Public Class PDFExtractor
	Public Sub ExtractDataFromPDF()
		' Open a 128-bit encrypted PDF file by providing the filename and password
		Using pdf As PdfDocument = PdfDocument.FromFile("encrypted.pdf", "password")
	
			' Extract all text from the PDF document
			Dim allText As String = pdf.ExtractAllText()
	
			' Extract all images from the PDF document
			Dim allImages As IEnumerable(Of Image) = pdf.ExtractAllImages()
	
			' Iterate over each page in the PDF document
			For index = 0 To pdf.PageCount - 1
				Dim pageNumber As Integer = index + 1
	
				' Extract text from the specific page
				Dim text As String = pdf.ExtractTextFromPage(index)
	
				' Extract images from the specific page
				Dim images As IEnumerable(Of Image) = pdf.ExtractImagesFromPage(index)
	
				' Code to process the extracted text and images
				'...
			Next index
		End Using
	End Sub
End Class
$vbLabelText   $csharpLabel

在此程式碼範例中:

  1. 使用 FromFile 方法載入輸入的 PDF 文件,此文件已加密並需要密碼。
  2. 使用 ExtractAllText 方法從 PDF 中提取所有文字內容。
  3. 使用 ExtractAllImages 方法獲取所有嵌入的圖片。
  4. 一個迴圈遍歷文件的每一頁,使用 ExtractTextFromPageExtractImagesFromPage 從那特定頁提取文字和圖片。

總結

IronPDF 使開發者能輕鬆地從 PDF 文件中提取文字和圖片。 利用 ExtractAllTextExtractAllImages,可以立即提取 PDF 文件的整個內容。 或者,這些方法可以用來從特定頁面提取內容。 前面的程式碼展示如何使用這兩種方法從多頁讀取文字和圖片。

此外,IronPDF 提供的功能還有渲染圖表新增條形碼使用密碼增強安全性水印功能以及以程式化方式處理 PDF 表單。

IronPDF 在開發期間可免費使用,用於商業用途則需付費。 提供IronPDF 的免費試用可在生產環境中無需付費即用。

以兩個IronPDF Lite 授權的價格購買Iron Software 的全部文件程式庫套裝

立即下載 IronPDF 開始從 PDF 中提取資料!

常見問題

如何在C#中從PDF中提取文字?

您可以使用IronPDF的ExtractAllText方法從PDF文件中提取所有文字。此方法簡化了過程,允許輕鬆存取PDF的文字內容。

使用C#從PDF中提取圖片的過程是什麼?

使用IronPDF,您可以利用ExtractAllImages方法從PDF中提取圖片。此方法高效地檢索PDF文件中所有嵌入的圖片。

如何在C#項目中安裝PDF處理程式庫?

要在C#項目中安裝IronPDF,您可以使用套件管理器控制台,通過命令Install-Package IronPdf或在Visual Studio中的NuGet套件管理器UI中導航以安裝該套件。

是否可以在C#中處理加密的PDF?

是的,IronPDF允許您通過使用FromFile方法打開並處理加密的PDF文件,您可以提供文件名和密碼來存取內容。

我可以從C#中PDF的特定頁面中提取資料嗎?

IronPDF允許您遍歷PDF文件的每一頁,並使用如ExtractTextFromPageExtractImagesFromPage等方法,從特定頁面中提取資料。

C#的PDF程式庫提供哪些附加功能?

除了資料提取,IronPDF還提供渲染圖表、新增條碼、使用密碼增強文件安全、水印處理和程式化處理PDF表單等功能。

如何在C#中將HTML轉換為PDF?

您可以使用IronPDF的RenderHtmlAsPdf方法將HTML字串轉換為PDF,這對於從網頁內容建立PDF文件特別有用。

C#的PDF程式庫有試用版嗎?

IronPDF在開發過程中免費使用,允許您測試其功能。生產使用需商業授權,但也提供免費試用。

如何開始使用C#程式庫從PDF中提取資料?

要開始使用IronPDF進行資料提取,下載此程式庫,在Visual Studio中建立或打開C#項目,安裝IronPDF,並遵循程式碼範例以高效地從PDF中提取文字和圖片。

.NET 10相容性:我可以在.NET 10上使用IronPDF的資料提取功能嗎?

是的—IronPDF在.NET 10上完全支持,包括其資料提取功能,如提取文字和圖片。您可以在.NET 10項目中使用IronPDF而無需特殊配置。它支持.NET 10、.NET 9、.NET 8以及早期版本和.NET Standard與.NET Framework。(ironpdf.com)

Curtis Chau
技術作家

Curtis Chau擁有Carleton大學的電腦科學學士學位,專精於前端開發,擁有Node.js、TypeScript、JavaScript和React的專業知識。Curtis熱衷於建立直觀且美觀的使用者介面,喜愛使用現代框架並建立結構良好、視覺吸引力的手冊。

除了開發,Curtis對物聯網(IoT)有濃厚的興趣,探索創新的方法來整合硬體和軟體。在空閒時間,他喜歡玩遊戲和建立Discord機器人,結合他對技術的熱愛與創造力。

Iron 支援團隊

我們線上24小時,每週5天。
聊天
電子郵件
給我打電話