跳至頁尾內容
使用IRONPDF
C# 從PDF中提取文字

如何給PDF文件設置密碼

PDF(可攜式文件格式)文件在無數行業中扮演著重要角色,使企業能夠安全地共享、儲存和管理文件。 對於開發者來說,處理PDF通常包括建立、閱讀、轉換和提取內容以支持客戶需求。 從PDF中提取文字對於資料分析、文件索引、內容遷移或啟用可存取功能等任務至關重要。 現代的程式庫如IronPDF使這些任務比以往更容易,提供強大的工具來操作PDF文件,所需工作量極少。

本指南著重於最常見的要求之一:在C#中從PDF提取文字。 我們將引導您在Visual Studio中設置專案,安裝IronPDF,並使用它進行文字提取,附帶精簡的程式碼範例。 在此過程中,我們將強調IronPDF強大的功能,包括其使用.NET建立、操作和轉換PDF文件的能力。 無論您是在構建文件密集型應用程式還是僅需高效處理PDF,這篇教程都會幫助您入門。

1. IronPDF功能

IronPDF是一個強大的PDF轉換器,能夠完成幾乎瀏覽器能執行的所有操作。 使用.NET程式庫開發者能夠簡單地建立、閱讀和操作PDF文件。 IronPDF使用Chrome引擎將HTML轉換為PDF文件。IronPDF支援HTML、ASPX、Razor HTML和MVC View,以及其他Web組件。 IronPDF支援Microsoft .NET應用程式(包括ASP.NET Web應用程式和傳統Windows應用程式)。 IronPDF也可以用來建立視覺上吸引人的PDF文件。

我們可以使用IronPDF從HTML5、JavaScript、CSS和圖像建立PDF文件。 此外,文件可以新增頁眉和頁腳。 感謝IronPDF,我們可以輕鬆閱讀PDF文件。 IronPDF還具有全面的PDF轉換引擎和功能強大的HTML到PDF轉換器,能夠處理PDF文件。

  • PDF建立:從HTML、JavaScript、CSS、圖像或URL生成PDF。 新增頁眉、頁腳、書籤、水印和其他自定義元素以增強設計。
  • HTML到PDF轉換:將HTML、Razor/MVC Views和媒體型別CSS文件直接轉換為PDF格式。
  • 互動式PDF功能:構建、填寫和提交互動式PDF表格
  • 文字和圖像提取:從現有PDF文件中提取文字或圖像以進行資料處理或重用。
  • 文件操作:合併、拆分及重新排列新或現有PDF文件中的頁面。
  • 圖像和頁面處理:將PDF頁面光柵化為圖像並將圖像轉換為PDF格式
  • 使用自定義登錄憑據:IronPDF能夠從URL建立文件。 它同時支援自定義網路登錄憑據、使用者代理、代理、Cookie、HTTP標頭和表單變數以登入HTML登錄表單
  • 搜尋和可存取性:在PDF文件中搜尋文字並確保其符合可存取標準。
  • 轉換多樣性:將PDF轉換為其他格式如HTML並配合CSS文件來生成PDF。
  • 獨立功能:獨立運行,不需Adobe Acrobat或其他第三方工具。

2. 在Visual Studio中建立新專案

打開Visual Studio軟體並進入文件選單。 選擇"新專案",然後選擇"控制台應用程式"。 在本文中,我們將使用控制台應用程式來生成PDF文件。

C#從PDF提取文字(程式碼範例教程),圖1:在Visual Studio中建立新專案 在Visual Studio中建立新專案

在適當的文字框中輸入專案名稱並選擇文件路徑。 然後,點擊建立按鈕並選擇所需的.NET Framework,如下圖所示。

C#從PDF提取文字(程式碼範例教程),圖2:在Visual Studio中配置新專案 在Visual Studio中配置新專案

Visual Studio專案現在將為所選應用程式生成結構,如果您選擇了控制台、Windows和Web應用程式,它將打開program.cs文件以輸入程式碼並構建/運行應用程式。

C#從PDF提取文字(程式碼範例教程),圖3:選擇.NET Core 選擇.NET Core

接下來,我們可以新增程式庫來測試程式碼。

3. 安裝IronPDF程式庫

IronPDF程式庫可以通過四種方式下載和安裝。

這些是:

  • 使用Visual Studio。
  • 使用Visual Studio命令行。
  • 從NuGet網站直接下載。
  • 從IronPDF網站直接下載。

3.1 使用Visual Studio

Visual Studio軟體提供NuGet包管理選項,可以直接將包安裝到解決方案中。 下面的截圖顯示了如何打開NuGet包管理器。

C#從PDF提取文字(程式碼範例教程),圖4:Visual Studio program.cs文件 Visual Studio program.cs文件

它提供了搜索框顯示來自NuGet網站的包列表。在包管理器中,我們需要按下圖搜索關鍵字"IronPDF"。

C#從PDF提取文字(程式碼範例教程),圖5:NuGet包管理器 NuGet包管理器

在上圖中,我們可以看到相關搜索項的列表。 我們需要選擇所需的選項將包安裝到解決方案中。

3.2 使用Visual Studio命令行

在Visual Studio中,進入工具> NuGet包管理器> 包管理器控制台

在包管理器控制台標籤中輸入以下行:

Install-Package IronPdf

現在包將下載/安裝到當前專案並準備使用。

C#從PDF提取文字(程式碼範例教程),圖6:NuGet包管理器中的IronPDF程式庫 NuGet包管理器中的IronPDF程式庫

3.3 從NuGet網站直接下載

第三種方式是直接從他們的網站下載IronPDF NuGet包

  • 導航到NuGet上的IronPDF包。
  • 從右側選單中選擇下載套件選項。
  • 雙擊下載的包。 它將會自動安裝。
  • 然後,重新載入解決方案並開始在專案中使用。

3.4 從IronPDF網站直接下載

存取IronPDF官方網站,直接從網站下載最新包。下載完成後,按照以下步驟將包新增到專案中。

  • 從解決方案窗口右擊專案。
  • 然後,選擇選項引用並瀏覽下載的參考位置。
  • 接下來,單擊確定以新增引用。

4. 使用IronPDF提取文字

IronPDF程式允許我們從PDF文件中提取文字,並將PDF頁面轉換為PDF物件。 以下是使用IronPDF閱讀現有PDF的範例。

第一種方法是從PDF提取文字,下面是範例程式碼片段。

using IronPdf;

// Load an existing PDF document from a file
var pdfDocument = PdfDocument.FromFile("result.pdf");

// Extract all text from the entire PDF document
string allText = pdfDocument.ExtractAllText();
using IronPdf;

// Load an existing PDF document from a file
var pdfDocument = PdfDocument.FromFile("result.pdf");

// Extract all text from the entire PDF document
string allText = pdfDocument.ExtractAllText();
Imports IronPdf

' Load an existing PDF document from a file
Private pdfDocument = PdfDocument.FromFile("result.pdf")

' Extract all text from the entire PDF document
Private allText As String = pdfDocument.ExtractAllText()
$vbLabelText   $csharpLabel

PDFDocument物件,如上程式碼所示。 我們可以使用此物件閱讀PDF頁面上的文字和圖像。 該物件具有一個稱為ExtractAllText的方法,該方法提取整個PDF文件中的所有文字,然後將提取的文字保存到我們可以用於處理的字串中。

以下是我們可以逐頁從PDF文件中提取文字的第二種方法的程式碼範例。

using IronPdf;

// Load an existing PDF document from a file
using PdfDocument pdf = PdfDocument.FromFile("result.pdf");

// Loop through each page of the PDF document
for (var index = 0; index < pdf.PageCount; index++)
{
    // Extract text from the current page
    string text = pdf.ExtractTextFromPage(index);
}
using IronPdf;

// Load an existing PDF document from a file
using PdfDocument pdf = PdfDocument.FromFile("result.pdf");

// Loop through each page of the PDF document
for (var index = 0; index < pdf.PageCount; index++)
{
    // Extract text from the current page
    string text = pdf.ExtractTextFromPage(index);
}
Imports IronPdf

' Load an existing PDF document from a file
Private PdfDocument As using

' Loop through each page of the PDF document
For index = 0 To pdf.PageCount - 1
	' Extract text from the current page
	Dim text As String = pdf.ExtractTextFromPage(index)
Next index
$vbLabelText   $csharpLabel

在上面的程式碼中,我們看到它將首先載入整個PDF文件並將其轉換為PDF物件。 然後,我們使用名為PageCount的內建屬性獲取整個PDF文件的頁面數,該屬性檢索可用於已載入PDF文件的頁面總數。 使用"for迴圈"和ExtractTextFromPage功能允許我們將頁碼作為參數傳遞從已載入文件中提取文字。 然後它將準確文字保存在字串變數中。 同樣,借助"for"或"for each"迴圈,它將逐頁從PDF提取文字。

5. 結論

IronPDF是一個多功能且強大的PDF程式庫,旨在使在.NET應用程式中處理PDF無縫流暢。 其強大的功能使開發者能夠建立、操作和提取PDF中的內容,而無需依賴於Adobe Reader等第三方依賴。 IronPDF的一個突出能力是其從PDF文件中提取文字的功能。 此功能對於自動化資料分析、文件索引、內容遷移和啟用可存取功能等任務非常有價值。 通過允許開發者以程式化方式檢索和處理文字,IronPDF簡化了工作流程並為處理PDF內容開創了新的可能性。

IronPDF具有簡單的整合和跨平台支持,是尋求高效處理PDF文件的開發者的理想選擇。 此外,IronPDF提供免費試用,讓您在承諾之前無風險地探索其全功能範圍。 有關定價詳情及了解更多授權選項,請存取定價頁面

常見問題

如何使用 C# 從 PDF 文件中提取文字?

您可以使用 IronPDF 在 C# 中從 PDF 文件中提取文字。首先,使用 PdfDocument.FromFile 方法載入 PDF,然後應用 ExtractAllText 方法以從文件中檢索文字。

在 Visual Studio 專案中設置 IronPDF 的步驟是什麼?

要在 Visual Studio 專案中設置 IronPDF,可以通過 NuGet Package Manager 安裝它。或者,您可以使用 Visual Studio 命令行或直接從 NuGet 或 IronPDF 網站下載。

IronPDF 是一個全面的 PDF 程式庫的特點是什麼?

IronPDF 提供了包括 PDF 建立、HTML 到 PDF 轉換、文字和圖像提取、文件操作以及支援互動式 PDF 表單的廣泛功能範圍。

IronPDF 可以用於在 C# 中將 HTML 轉換為 PDF 嗎?

是的,IronPDF 可以直接使用其整合的 Chrome 引擎將 HTML,包括 Razor/MVC 視圖和多媒體型別的 CSS 文件,轉換為 PDF 格式。

IronPDF 與所有型別的 .NET 應用程式相容嗎?

是的,IronPDF 與 ASP.NET 網頁應用程式和傳統的 Windows 應用程式都相容,為 .NET 開發人員提供了多樣性。

IronPDF 如何促進 PDF 文件的可存取性?

IronPDF 通過允許使用者在 PDF 文件中搜索文字並確保它們遵循可存取性標準來增強可存取性。

using IronPDF 是否需要任何第三方依賴?

IronPDF 獨立運行,不需要像 Adobe Acrobat 這樣的第三方工具,實現無縫的 PDF 操作於您的 .NET 應用程式中。

using IronPDF 從 PDF 中提取文字的優勢是什麼?

IronPDF 使工作流程更加順暢,通過程式化文字提取功能,對於資料分析、文件索引和內容遷移非常有用。

IronPDF 有試用版本嗎?

是的,IronPDF 提供免費試用版,允許開發者在購買決策前探索其功能和能力。

在 .NET 應用程式中使用 IronPDF 進行 PDF 管理的重要性是什麼?

IronPDF 在 .NET 應用程式中進行 PDF 管理至關重要,因為它的功能強大,包含 PDF 建立、文字提取和 HTML 到 PDF 轉換,且無需像 Adobe Acrobat 這樣的外部軟體。

本文中的 C# PDF 文字提取程式碼是否與 .NET 10 相容?

是的。本教程中的 PdfDocument.FromFile 和 ExtractText 例子在 .NET 10 中與早期 .NET 版本的工作方式相同。在建立 .NET 10 專案後,從 NuGet 安裝最新的 IronPDF 套件,您就可以在現代 .NET 10 應用程式中運行相同的程式碼來讀取 PDF 和提取文字。

Kye Stuart
技術作家

Kye Stuart在Iron Software結合了編碼熱情與寫作技能。就讀於Yoobee學院,專攻軟體部署,現在將複雜的技術概念轉化為清晰的教育內容。Kye重視終身學習,樂於迎接新的技術挑戰。

在工作之外,他喜歡PC遊戲、在Twitch上直播,以及戶外活動如園藝和帶他的狗Jaiya散步。Kye的直率方法使他成為Iron Software全球開發者解謎技術使命的關鍵。

Iron 支援團隊

我們線上24小時,每週5天。
聊天
電子郵件
給我打電話