
PDF文書にパスワードを設定する方法
あなたのビジネスはPDFのセキュリティとコンプライアンスの年間サブスクリプションに多額を費やしています。デジタル署名、赤枠加工、暗号化、保護などのSaaSサービスを管理するためのソリューションを、一度の支払いで提供するIron SoftwareのIronSecureDocをご検討ください。今すぐIronSecureDocを体験しましょう
PDF(ポータブル・ドキュメント・フォーマット)ファイルは、無数の業界で重要な役割を果たしており、企業が安全にドキュメントを共有、保存、管理することを可能にします。 開発者にとって、PDFを扱うことは、クライアントのニーズをサポートするために、内容の作成、読み取り、変換、抽出を伴うことがよくあります。 PDFからのテキストの抽出は、データ分析、ドキュメントのインデックス化、コンテンツの移行、またはアクセシビリティ機能の有効化などのタスクに必要不可欠です。 近代的なライブラリのIronPDFのようなものがこれらのタスクをこれまで以上に簡単にし、PDFファイルの操作のための強力なツールを最小限の労力で提供します。
このガイドは、最も一般的な要求の1つである、C#でのPDFからのテキストの抽出に焦点を当てます。 Visual Studioでのプロジェクトのセットアップ、IronPDFのインストール、および簡潔なコード例を使用したテキスト抽出の実行方法について手順を紹介します。 途中で、.NETを使用してPDFファイルを作成、操作、変換する、IronPDFの強力な機能を強調します。 ドキュメントに重心を置いたアプリケーションを構築する場合でも、効率的なPDFの取り扱いが必要な場合でも、このチュートリアルが役立ちます。
C#でPDFからテキストを抽出する方法
- PDFからテキストを抽出するC#ライブラリをダウンロードする。
- Visual Studioで新しいプロジェクトを作成する
- プロジェクトにライブラリをインストールする
- PDFファイルからのテキスト抽出を実行
- PDFドキュメントからのテキスト出力を表示
1. IronPDFの機能
IronPDFは、ブラウザが行うほぼすべての操作を実行できる頑健なPDFコンバーターです。 開発者向けに、.NETライブラリを使用すると、PDFドキュメントを簡単に作成、読み取り、および操作できます。 IronPDFは、Chromeエンジンを使用してHTML-to-PDFドキュメントを変換します。IronPDFはHTML、ASPX、Razor HTML、およびその他のWebコンポーネントなどをサポートしています。 Microsoft .NETアプリケーションは、IronPDF(ASP.NET Webアプリケーションと従来のWindowsアプリケーションの両方)によりサポートされています。 IronPDFは、視覚的に魅力的なPDFドキュメントを作成するためにも使用できます。
IronPDFを使用してHTML5、JavaScript、CSS、および画像からPDFドキュメントを作成できます。 ファイルにはヘッダーとフッターを追加することもできます。 IronPDFのおかげで、PDFドキュメントを簡単に読むことができます。 IronPDFには、包括的なPDF変換エンジンと、PDFドキュメントを処理できる強力なHTML-to-PDFコンバーターもあります。
- PDFの作成: HTML、JavaScript、CSS、画像、またはURLからPDFを生成します。 ヘッダー、フッター、ブックマーク、透かしなどのカスタム要素を追加して、デザインを向上させます。
- HTML-to-PDF変換: HTML、Razor/MVCビュー、およびメディアタイプのCSSファイルを直接PDF形式に変換します。
- インタラクティブなPDFの機能: インタラクティブなPDFフォームを作成、記入、および送信します。
- テキストと画像の抽出: データ処理や再利用のために、既存のPDFドキュメントからテキストや画像を抽出します。
- ドキュメント操作: マージ、スプリット、および新規または既存のPDFファイルのページを再配置します。
- 画像とページのハンドリング: PDFページを画像にラスタライズし、画像をPDF形式に変換します。
- カスタムログインクレデンシャルの使用: IronPDFはURLからドキュメントを作成できます。 カスタムネットワークログインクレデンシャル、ユーザーエージェント、プロキシ、クッキー、HTTPヘッダー、およびHTMLログインフォームの背後でのログイン用のフォーム変数もサポートしています。
- 検索とアクセシビリティ: PDFドキュメント内のテキストを検索し、アクセシビリティ基準を満たしていることを確認します。
- 変換の柔軟性: PDFをHTMLなどの他の形式に変換し、CSSファイルを使用してPDFを生成します。
- スタンドアロン機能: Adobe Acrobatや追加のサードパーティツールを必要とせずに独立して操作します。
2. Visual Studioでプロジェクトを作成する
Visual Studioソフトウェアを開き、ファイルメニューに移動します。 "新しいプロジェクト"を選択し、"コンソールアプリケーション"を選択します。 この記事では、コンソールアプリケーションを使用してPDFドキュメントを生成します。
Visual Studioで新しいプロジェクトを作成
次に、作成ボタンをクリックし、以下のスクリーンショットのように必要な.NET Frameworkを選択します。
Visual Studioで新しいプロジェクトを構成
Visual Studioプロジェクトは、選択したアプリケーションの構造を生成し、コンソール、Windows、およびWebアプリケーションを選択した場合、program.cs ファイルが開かれ、そこにコードを入力してアプリケーションをビルド/実行できます。
.NET Coreの選択
次に、コードをテストするためにライブラリを追加できます。
3. IronPDFライブラリのインストール
IronPDFライブラリは4つの方法でダウンロードとインストールが可能です。
以下のような方法です:
- Visual Studioを使用する。
- Visual Studioコマンドラインを使用して。
- NuGetウェブサイトから直接ダウンロードして。
- IronPDFウェブサイトから直接ダウンロード。
3.1 Visual Studioを使用する
Visual Studioソフトウェアは、ソリューションにパッケージを直接インストールするためのNuGetパッケージマネージャーオプションを提供します。 以下のスクリーンショットは、NuGetパッケージマネージャーを開く方法を示しています。
Visual Studioのprogram.csファイル
NuGetウェブサイトからパッケージのリストを表示する検索ボックスを提供します。下のスクリーンショットのように、パッケージマネージャーで "IronPDF "というキーワードを検索する必要があります。
NuGetパッケージマネージャー
上記の画像では、関連する検索項目のリストを見ることができます。 解決策にパッケージをインストールするために必要なオプションを選択する必要があります。
3.2 Visual Studioのコマンドラインを使用する
2.2.2 Visual Studioコマンドラインの使用
パッケージマネージャーコンソールタブに次の行を入力します:
今、パッケージは現在のプロジェクトにダウンロード/インストールされ、使用可能になります。
NuGetパッケージマネージャーの中のIronPDFライブラリ
3.3 NuGetウェブサイトからの直接ダウンロード
3番目の方法は、IronPDF NuGetパッケージをそのウェブサイトから直接ダウンロードすることです。
- NuGetでIronPDFパッケージに移動します。
- NuGetリンクに移動します
- ダウンロードしたパッケージをダブルクリックします。 自動的にインストールされます。
- 次に、ソリューションを再読み込みし、プロジェクトで使用を開始します。
3.4 Direct download from the IronPDF website
IronPDF公式サイトを訪れて、最新のパッケージを直接ダウンロードしてください。ダウンロード後、以下の手順に従ってプロジェクトにパッケージを追加してください。
- ソリューションウィンドウからプロジェクトを右クリックします。
- 次に、選択オプションの参照とダウンロードした参照の場所を参照します。
- 次に、参照を追加するにはOKをクリックします。
4. Extract Text Using IronPDF
IronPDFプログラムを使ってPDFファイルからテキストを抽出し、PDFページをPDFオブジェクトに変換できるようになります。 以下は、IronPDFを使用して既存のPDFを読み取る方法の例です。
最初のアプローチではPDFからテキストを抽出し、以下のサンプルコードスニペットがそれを示しています。
using IronPdf;
// Load an existing PDF document from a file
var pdfDocument = PdfDocument.FromFile("result.pdf");
// Extract all text from the entire PDF document
string allText = pdfDocument.ExtractAllText();Imports IronPdf
' Load an existing PDF document from a file
Private pdfDocument = PdfDocument.FromFile("result.pdf")
' Extract all text from the entire PDF document
Private allText As String = pdfDocument.ExtractAllText()FromFile 静的メソッドは、既存のファイルからPDFドキュメントを読み込み、それをPDFDocument オブジェクトに変換するために使用されます。これは上記のコードで示されています。 このオブジェクトを使用して、PDFページにアクセス可能なテキストと画像を読み取ることができます。 オブジェクトにはExtractAllTextというメソッドがあり、PDFドキュメント全体から全てのテキストを抽出します。その後、抽出したテキストを処理に使える文字列として保持します。
以下は、PDFファイルからページ単位でテキストを抽出するために使用できる2番目の方法のコード例です。
using IronPdf;
// Load an existing PDF document from a file
using PdfDocument pdf = PdfDocument.FromFile("result.pdf");
// Loop through each page of the PDF document
for (var index = 0; index < pdf.PageCount; index++)
{
// Extract text from the current page
string text = pdf.ExtractTextFromPage(index);
}Imports IronPdf
' Load an existing PDF document from a file
Private PdfDocument As using
' Loop through each page of the PDF document
For index = 0 To pdf.PageCount - 1
' Extract text from the current page
Dim text As String = pdf.ExtractTextFromPage(index)
Next index上記のコードで、最初にPDFドキュメント全体がロードされ、PDFオブジェクトに変換されます。 次に、PageCountという組み込みプロパティを使用して、読み込まれたPDFドキュメント内の利用可能なページの総数を取得することで、PDFドキュメント全体のページカウントを取得します。 "forループ"とExtractTextFromPage 関数を使用することで、ページ番号をパラメーターとして渡し、読み込まれたドキュメントからテキストを抽出することができます。 それから正確なテキストを文字列変数に保持します。 同様に、"for"または"for each"ループを使用してページごとにPDFからテキストを抽出します。
5. 結論
IronPDFは、多用途で強力なPDFライブラリで、.NETアプリケーションでのPDFの取り扱いをシームレスにします。 その強力な機能は、開発者がPDFからコンテンツを作成、操作、抽出することを可能にし、Adobe Readerなどのサードパーティの依存性を必要としません。 IronPDFの注目すべき機能の1つは、PDFドキュメントからテキストを抽出する能力です。 この機能は、データ分析、ドキュメントのインデックス化、コンテンツの移行、アクセシビリティ機能の提供など、自動化タスクにとって非常に貴重です。 開発者がテキストをプログラム的に取得して処理できることにより、IronPDFはワークフローを簡略化し、PDFコンテンツの扱いに新たな可能性を開きます。
簡単な統合とクロスプラットフォームのサポートにより、IronPDFはPDFドキュメントを効率的に扱う開発者にとって優れた選択肢です。 さらに、IronPDFは無料トライアルを提供しており、購入する前にその完全な機能をリスクなく探索できます。 価格の詳細やライセンスオプションについては、価格ページを訪れてください。

Kye Stuartは、Iron Softwareでコーディングへの情熱と執筆スキルを融合させています。ソフトウェアデプロイメントを学んでいるYoobeeカレッジで教育を受け、今では複雑な技術的概念を明瞭な教育コンテンツに変換しています。Kyeは生涯学習を重視し、新しい技術的課題を受け入れています。
関連する記事


