跳至頁尾內容
使用IRONPDF
How to Parse a PDF File in VB .NET

如何在.NET MAUI中查看PDF(逐步教程)

本教程介紹如何使用IronPDF從PDF檔案中程式化提取文字和圖像的第一流支持。

IronPDF

特性

高效的PDF轉換。 幾乎任何一台機器能做的事情,IronPDF也可以做到。 由於這個PDF庫,開發人員可以快速建立、讀取文字內容、寫入、載入和操作PDF。

IronPDF利用Chrome引擎將HTML轉換為PDF記錄。結合Windows Forms, HTML, ASPX, Razor HTML, .NET Core, ASP.NET, Windows Forms 和 WPF。 IronPDF還支持Xamarin, Blazor, Unity 和 HoloLens 應用程式。 IronPDF支持Microsoft .NET和.NET Core應用程式(包括ASP.NET Web包和傳統的Windows包)。 IronPDF可以用於製作美觀的PDF。

IronPDF可以使用HTML5, JavaScript, CSS 和圖像建立PDF。 IronPDF還擁有一個強大的HTML轉PDF轉換器,與PDF整合。 IronPDF中存在一個強大的PDF轉換機制,使用Chromium渲染引擎。它也不與任何外部來源相連。

  • 可以從多種來源建立PDF圖像,包括HTML, HTML5, ASPX 和 Razor/MVC View。 HTML和圖像資源都可以轉換成PDF。
  • 可用於處理互動式PDF的工具包括填寫和提交互動式表單
  • 合併和拆分PDF,從PDF文件中提取文字和圖片,在PDF文件中搜尋文字,將PDF光柵化為圖像,改變字體大小並轉換PDF文件。
  • 它允許通過使用者代理、代理、Cookie、HTTP標頭和表單變數對HTML登錄表單進行驗證。
  • IronPDF通過提供使用者名稱和密碼使存取安全文件成為可能。
  • IronPDF是一個讀取PDF中文字並填補空白的程式。
  • 允許新增文字、圖像、書籤浮水印等。
  • 您可以從CSS文件中建立PDF檔。

欲了解更多詳情,請存取這個IronPDF授權資訊頁面,獲取免費的限量金鑰和專業版。

如何在VB.NET中解析PDF檔案,圖1:IronPDF-字體格式化 IronPDF- 字體格式化

從PDF文件中提取文字

借助IronPDF程式庫,IronPDF還可以讀取和提取PDF文件中的文字。 以下是可用於檢查當前PDF文件的IronPDF程式碼範例。

從所有頁面中提取文字

下面的程式碼範例顯示了如何通過幾行程式碼獲取所有PDF內容為字串的第一種方法。

Imports IronPdf

Module Program
    Sub Main(args As String())
        ' Create a PDF Document object from an existing PDF file
        Dim pdfdoc = PdfDocument.FromFile("result.pdf")

        ' Extract all the text from the PDF
        Dim AllText As String = pdfdoc.ExtractAllText()

        ' Output the extracted text to the console
        Console.WriteLine(AllText)
    End Sub
End Module
Imports IronPdf

Module Program
    Sub Main(args As String())
        ' Create a PDF Document object from an existing PDF file
        Dim pdfdoc = PdfDocument.FromFile("result.pdf")

        ' Extract all the text from the PDF
        Dim AllText As String = pdfdoc.ExtractAllText()

        ' Output the extracted text to the console
        Console.WriteLine(AllText)
    End Sub
End Module
VB .NET

上面的範例程式碼演示了如何使用FromFile方法從現有文件中讀取PDF並將其轉換為PDF文件物件。 該物件提供了一個方法ExtractAllText,可以從PDF中提取純文字並將其轉換為字串。

按頁碼提取文字

下面的範例程式碼顯示了如何使用頁碼從PDF文件中提取資料。

Imports IronPdf

Module Program
    Sub Main(args As String())
        ' Create a PDF Document object from an existing PDF file
        Dim pdfdoc = PdfDocument.FromFile("result.pdf")

        ' Extract text from the first page (page numbers are zero-based)
        Dim AllText As String = pdfdoc.ExtractTextFromPage(0)

        ' Output the extracted text to the console
        Console.WriteLine(AllText)
    End Sub
End Module

上面的程式碼顯示了如何從現有文件中讀取PDF並使用FromFile函式將其轉換為PDF文件物件。 文字和圖像可以通過此物件在PDF中存取。 該物件提供了一個方法ExtractTextFromPage,可以將頁碼作為參數發送,以獲取包含PDF該頁上的每個字的字串。

在頁面之間提取文字

以下程式碼顯示了如何在多個頁面之間提取資料。

Imports IronPdf

Module Program
    Sub Main(args As String())
        ' Define a list of page numbers from which to extract text
        Dim Pages As List(Of Integer) = New List(Of Integer) From {3, 5, 7}

        ' Create a PDF Document object from an existing PDF file
        Dim pdfdoc = PdfDocument.FromFile("result.pdf")

        ' Extract text from the specified pages
        Dim AllText As String = pdfdoc.ExtractTextFromPages(Pages)

        ' Output the extracted text to the console
        Console.WriteLine(AllText)
    End Sub
End Module
Imports IronPdf

Module Program
    Sub Main(args As String())
        ' Define a list of page numbers from which to extract text
        Dim Pages As List(Of Integer) = New List(Of Integer) From {3, 5, 7}

        ' Create a PDF Document object from an existing PDF file
        Dim pdfdoc = PdfDocument.FromFile("result.pdf")

        ' Extract text from the specified pages
        Dim AllText As String = pdfdoc.ExtractTextFromPages(Pages)

        ' Output the extracted text to the console
        Console.WriteLine(AllText)
    End Sub
End Module
VB .NET

上面的程式碼演示了如何使用FromFile方法從現有文件中讀取PDF並將其轉換為PDF文件物件。 此物件允許檢查PDF中的文字和圖像。 該物件具有一個名為ExtractTextFromPages的方法,可以通過傳遞頁碼列表作為參數來獲取包含文件給定頁面上所有文字內容的字串。 下方左側是來源PDF,右側是提取出的資料。

如何在VB.NET中解析PDF檔案,圖2:在頁面之間提取文字輸出 在頁面之間提取文字輸出

從 PDF 文件中提取圖像

IronPDF提供了一系列方法來提取圖像,例如:

每種方法都允許從文件的頁面或多個頁面中提取圖像。

Imports IronPdf
Imports System.Drawing

Module Program
    Sub Main(args As String())
        ' Create a PDF Document object from an existing PDF file
        Dim pdfdoc = PdfDocument.FromFile("result.pdf")

        ' Extract raw images from the first page
        Dim images = pdfdoc.ExtractRawImagesFromPage(1)

        ' Iterate over extracted images
        For Each imgData As Byte() In images
            ' Create a memory stream from byte data
            Using ms As New IO.MemoryStream(imgData)
                ' Create a Bitmap object from the memory stream
                Dim image = New Bitmap(ms)

                ' Save the image to the specified output directory
                image.Save("output/test.jpg")
            End Using
        Next
    End Sub
End Module
Imports IronPdf
Imports System.Drawing

Module Program
    Sub Main(args As String())
        ' Create a PDF Document object from an existing PDF file
        Dim pdfdoc = PdfDocument.FromFile("result.pdf")

        ' Extract raw images from the first page
        Dim images = pdfdoc.ExtractRawImagesFromPage(1)

        ' Iterate over extracted images
        For Each imgData As Byte() In images
            ' Create a memory stream from byte data
            Using ms As New IO.MemoryStream(imgData)
                ' Create a Bitmap object from the memory stream
                Dim image = New Bitmap(ms)

                ' Save the image to the specified output directory
                image.Save("output/test.jpg")
            End Using
        Next
    End Sub
End Module
VB .NET

上面的程式碼顯示了如何從現有文件中讀取文件並使用FromFile函式將其轉換為PDF文件物件。 通過將頁碼傳遞給物件的ExtractRawImagesFromPage方法,可以獲得包含文件該頁上存在每張圖片的位元串列。 使用Bitmap,這有助於圖片保存。 下方圖片顯示了上面程式碼的輸出。

如何在VB.NET中解析PDF檔案,圖3:從PDF輸出提取圖像 從 PDF 輸出提取圖像

欲了解更多有關IronPDF API程式碼教程的資訊,請參閱IronPDF 文件。 您還可以存取其他教程以瞭解如何使用C#解析PDF文字

結論

IronPDF程式庫的開發授權是免費的。 如果在生產環境中使用IronPDF,可以根據開發者的需求購買不同的授權。 Lite方案起價$999,無持續費用。 還提供SaaS和OEM再分發替代方案。 所有授權均包括更新、一年的產品支援和永久使用權。 它們對製造、上線和開發也有用。 這是一筆一次性的購買。 還有其他免費的限時授權可用。 存取全面的IronPDF授權資訊,以閱讀IronPDF的完整定價和授權詳細資訊。 IronPDF還提供用於版權保護的免費授權。

常見問題

如何在VB.NET中從PDF中提取文字?

使用IronPDF程式庫,您可以通過利用ExtractAllText方法從PDF中提取文字。這使您能夠在VB.NET專案中從PDF文件的所有頁面中檢索文字。

能否使用VB.NET從PDF的特定頁面提取圖片?

是的,IronPDF允許您使用其ExtractRawImagesFromPage方法從特定頁面提取圖片。此方法返回影像資料作為位元組陣列,您可以將其轉換為影像文件。

如何在VB.NET中將HTML內容轉換為PDF文件?

IronPDF使用Chromium渲染引擎提供強大的HTML-to-PDF轉換。您可以使用例如RenderHtmlAsPdf的方法將HTML字串或文件高效地轉換為PDF文件。

在VB.NET應用中使用IronPDF進行PDF解析有什麼好處?

IronPDF提供多功能的API用於提取文字和圖片,支持HTML-to-PDF轉換,並且與包括ASP.NET、Windows Forms、Blazor等在內的各種.NET平台相容。它還提供不同的授權選項以滿足開發和生產需求。

如何將IronPDF整合到我的VB.NET專案中?

要整合IronPDF,從NuGet下載該程式庫並新增到您的VB.NET專案中。這將允許您程式設計上地使用其方法來解析和操作PDF檔案。

IronPDF能否處理PDF解析和轉換任務?

是的,IronPDF專門設計來有效地處理解析(文字和圖像提取)和轉換任務(例如HTML-to-PDF),使其成為VB.NET中PDF操作的綜合解決方案。

IronPDF提供哪些授權選項?

IronPDF提供免費開發授權和各種生產授權,包括Lite、SaaS和OEM再分發。這些授權包括一年的更新和支援,以滿足不同的專案需求。

IronPDF的功能是否依賴於外部資源?

不,IronPDF是自包含的,並在內部使用Chromium渲染引擎,保證強大的功能,無需依賴外部資源進行PDF轉換和解析。

IronPDF是否支持.NET 10,對VB.NET開發人員有哪些益處?

是的,IronPDF全面支持.NET 10,同時還支持早期版本如.NET 9、8、7、6、Core、Standard和Framework。這意味著針對.NET 10的VB.NET專案可以使用IronPDF而不需要額外配置。開發人員可以從.NET 10的新運行時性能提升中受益,如減少堆積配置、更好的運行時和JIT優化,這些優化增強了PDF生成、文字/圖像提取和HTML-to-PDF渲染。

Curtis Chau
技術作家

Curtis Chau擁有Carleton大學的電腦科學學士學位,專精於前端開發,擁有Node.js、TypeScript、JavaScript和React的專業知識。Curtis熱衷於建立直觀且美觀的使用者介面,喜愛使用現代框架並建立結構良好、視覺吸引力的手冊。

除了開發,Curtis對物聯網(IoT)有濃厚的興趣,探索創新的方法來整合硬體和軟體。在空閒時間,他喜歡玩遊戲和建立Discord機器人,結合他對技術的熱愛與創造力。

Iron 支援團隊

我們線上24小時,每週5天。
聊天
電子郵件
給我打電話