
.NET MAUIでPDFを表示する方法(ステップバイステップ)チュートリアル
このチュートリアルでは、IronPDFの一流のサポートを受けて、PDFファイルからテキストや画像をプログラムで抽出する方法を紹介します。
VB.NETでPDFファイルを解析する方法
- PDFファイルを解析するIronPDF C#ライブラリをダウンロードする.
- VB.NETで
FromFileメソッドを利用してPDFファイルを解析する - 開いたPDFから
ExtractAllTextメソッドでテキストを抽出する - 特定のページからテキストを抽出するには、
ExtractTextFromPagesメソッドを使用します。 - 開いたPDFから
ExtractRawImagesFromPageメソッドで画像を抽出する
IronPDF
特徴
効率的なPDF変換。 機械でできるほとんどのことを、IronPDFでもできます。 このPDFライブラリのおかげで、開発者は迅速にPDFを作成、テキストコンテンツを読み取り、書き込み、読み込み、操作することができます。
IronPDFは、Chromeエンジンを使用してHTMLをPDFレコードに変換します。Windows Forms、HTML、ASPX、Razor HTML、.NET Core、ASP.NET、Windows Forms、WPFと組み合わせて。 IronPDFはまた、Xamarin、Blazor、Unity、HoloLensアプリケーションをサポートします。 IronPDFは、Microsoft .NETと.NET Coreアプリケーション(ASP.NET Webパッケージと従来のWindowsパッケージの両方)をサポートします。 IronPDFは、美的に魅力的なPDFを作成するために使用できます。
IronPDFは、HTML5、JavaScript、CSS、画像を使用してPDFを作成できます。 IronPDFには、PDFと統合される強力なHTML-to-PDFコンバータもあります。 IronPDFには、Chromiumレンダリングエンジンを使用した強力なPDF変換メカニズムがあります。また、外部ソースには依存していません。
- PDF画像は、HTML、HTML5、ASPX、Razor/MVC Viewなど、さまざまなソースから作成できます。 HTMLと画像のアセットの両方をPDFに変換できます。
- インタラクティブなPDFを操作するためのツールには、インタラクティブフォームの記入と送信があります。
- PDFをマージおよび分割、PDFファイルからテキストと画像を抽出、PDFファイル内のテキストを検索し、PDFを画像にラスタライズ、フォントサイズを変更してPDFファイルを変換します。
- ユーザーエージェント、プロキシ、クッキー、HTTPヘッダー、およびフォーム変数を使用して、HTMLログインフォームの確認ができます。
- IronPDFは、ユーザー名とパスワードを提供することで、保護されたドキュメントへのアクセスを可能にします。
- IronPDFはPDF内のテキストを読み取り、空白を埋めるプログラムです。
- テキスト、画像、ブックマーク、ウォーターマークなどを追加できます。
- CSSファイルからPDFを作成することができます。
詳細については、このIronPDFライセンス情報ページを訪れて、無料の制限付きキーとプロフェッショナルバージョンをご覧ください。
IronPDF - フォントフォーマット
PDFファイルからテキストを抽出する
IronPDFは、IronPDFライブラリを使用してPDFファイルからテキストを読み取って抽出することもできます。 以下に示すのは、現在のPDFファイルを確認するために使用できるIronPDFコードのパターンです。
すべてのページからテキストを抽出
以下のコード例は、わずか数行でPDFのすべてのコンテンツを文字列として取得する方法を示しています。
Imports IronPdf
Module Program
Sub Main(args As String())
' Create a PDF Document object from an existing PDF file
Dim pdfdoc = PdfDocument.FromFile("result.pdf")
' Extract all the text from the PDF
Dim AllText As String = pdfdoc.ExtractAllText()
' Output the extracted text to the console
Console.WriteLine(AllText)
End Sub
End Module
上記のサンプルコードは、FromFileメソッドを使用して既存のファイルからPDFを読み取り、PDFドキュメントオブジェクトに変換する方法を示しています。 オブジェクトは、PDFからプレーンテキストを抽出し、文字列に変換するExtractAllTextというメソッドを提供します。
ページ番号でテキストを抽出
以下のサンプルコードは、ページ番号を使用してPDFファイルからデータを抽出する方法を示しています。
Imports IronPdf
Module Program
Sub Main(args As String())
' Create a PDF Document object from an existing PDF file
Dim pdfdoc = PdfDocument.FromFile("result.pdf")
' Extract text from the first page (page numbers are zero-based)
Dim AllText As String = pdfdoc.ExtractTextFromPage(0)
' Output the extracted text to the console
Console.WriteLine(AllText)
End Sub
End Module
上記のコードは、FromFile関数を使用して既存ファイルからPDFを読み取り、PDFドキュメントオブジェクトに変換する方法を示しています。 テキストと画像は、このオブジェクトを使用してPDF上でアクセスできます。 オブジェクトは、ページ番号をパラメータとして送信して、そのPDFページ上にあったすべての単語を含む文字列を得るためのExtractTextFromPageというメソッドを提供します。
ページ間でテキストを抽出
以下のコードは、複数ページ間のデータを抽出する方法を示しています。
Imports IronPdf
Module Program
Sub Main(args As String())
' Define a list of page numbers from which to extract text
Dim Pages As List(Of Integer) = New List(Of Integer) From {3, 5, 7}
' Create a PDF Document object from an existing PDF file
Dim pdfdoc = PdfDocument.FromFile("result.pdf")
' Extract text from the specified pages
Dim AllText As String = pdfdoc.ExtractTextFromPages(Pages)
' Output the extracted text to the console
Console.WriteLine(AllText)
End Sub
End Module
上記のコードは、FromFileメソッドを使用して既存のファイルからPDFを読み取り、PDFドキュメントオブジェクトに変換する方法を示しています。 このオブジェクトにより、PDF上のテキストと画像を調べることができます。 オブジェクトには特定のページ番号リストをパラメータとして渡すことにより、ドキュメントの指定されたページ上のテキストコンテンツすべてを含む文字列を取得するためのExtractTextFromPagesというメソッドがあります。 下記の左側はソースPDFで、右側は抽出されたデータです。
ページ間でのテキスト抽出結果
PDFファイルから画像を抽出する
IronPDFは、画像を抽出するためのメソッドリストを提供します:
ExtractBitmapsFromPageExtractBitmapsFromPagesExtractImagesFromPageExtractImagesFromPagesExtractRawImagesFromPageExtractRawImagesFromPages
各メソッドは、文書の1ページまたは複数ページから画像を抽出することを可能にします。
Imports IronPdf
Imports System.Drawing
Module Program
Sub Main(args As String())
' Create a PDF Document object from an existing PDF file
Dim pdfdoc = PdfDocument.FromFile("result.pdf")
' Extract raw images from the first page
Dim images = pdfdoc.ExtractRawImagesFromPage(1)
' Iterate over extracted images
For Each imgData As Byte() In images
' Create a memory stream from byte data
Using ms As New IO.MemoryStream(imgData)
' Create a Bitmap object from the memory stream
Dim image = New Bitmap(ms)
' Save the image to the specified output directory
image.Save("output/test.jpg")
End Using
Next
End Sub
End Module
上記のコードは、FromFile関数を使用して既存のファイルからドキュメントを読み取り、PDFドキュメントオブジェクトに変換する方法を示しています。 オブジェクトのExtractRawImagesFromPageメソッドにページ番号を渡すことで、そのドキュメントのページに存在していたすべての画像を含むバイトリストを取得することができます。 Bitmapに変換され、画像の保存を支援します。 下記の画像は、上記のコードからの出力を示しています。
PDFからの画像抽出結果
IronPDF APIコードチュートリアルについてもっと知りたい方は、IronPDFドキュメントを参照してください。 また、PDFテキストをC#で解析する方法を学ぶ他のチュートリアルも訪問できます。
結論
IronPDFライブラリの開発ライセンスは無料です。 IronPDFをプロダクション環境で使用する場合、開発者のニーズに応じて異なるライセンスを購入できます。 Liteプランは$999から始まり、継続的なコストはありません。 SaaSおよびOEM再配布のオプションも提供されています。 すべてのライセンスには、更新、1年間の製品サポート、および永続ライセンスが含まれています。 これらはまた製造、ステージング、開発においても有用です。 一度の購入です。 追加の無料で時間制限のあるライセンスも利用可能です。 IronPDFの詳細な価格とライセンス情報を読むためには、包括的なIronPDFライセンス情報を訪れてください。 IronPDFはコピー保護用の無料ライセンスも提供しています。

Curtis Chauは、カールトン大学でコンピュータサイエンスの学士号を取得し、Node.js、TypeScript、JavaScript、およびReactに精通したフロントエンド開発を専門としています。直感的で美しいユーザーインターフェースを作成することに情熱を持ち、Curtisは現代のフレームワークを用いた開発や、構造の良い視覚的に魅力的なマニュアルの作成を楽しんでいます。
関連する記事


