IRONSOFTWAREHOME
PYTHON用IRONPDFを使用する

PythonでPDFをテキストに変換する方法(チュートリアル)

Curtis Chau
Curtis Chau
Updated: 2026年4月21日

この記事では、最も強力な PDF ライブラリの 1 つである IronPDF for Python を使用して、PDF ドキュメント内の任意のテキストを抽出する方法を説明します。

2.0 Python を使用して PDF からテキストを抽出するにはどうすればいいですか?

  1. Pythonダウンロードページから最新バージョン for Pythonをインストールします。
  2. Python用のIDEツールを開きます
  3. .NET Coreランタイムをインストールする
  4. IronPDF for Pythonライブラリをインストールするか、 PyPIダウンロードページからダウンロードします。
  5. PDFからテキストを抽出する

2.1 IronPDF for Python とは何ですか?

IronPDF ライブラリは他の言語に比べてはるかに動的な言語であり、開発者がグラフィカル ユーザー インターフェイスを迅速かつ簡単に作成できるため、Python に統合するのは簡単です。 PyQT、wxWidgets、kivy、および多数の追加パッケージとライブラリを含む多数のプリインストールされたツールがあり、それらすべてを使用して、完全に完成した GUI を迅速かつ安全に作成できます。

IronPDF for Python は非常に効率的なライブラリであり、特に Web 開発に役立ちます。 Django、Flask、Pyramid など、多数の Python Web 開発パラダイムが利用可能であることが、この一因となっています。 これらのフレームワークは、Reddit、Mozilla、Spotify など、多数の Web サイトやオンライン サービスで使用されています。

2.2 IronPDFの機能

  • PDF ファイルは、HTML、HTML5、ASP、PHP の Web サイトなど、さまざまなソースから作成できます。 HTML ファイルだけでなく、画像ファイルを PDF に変換することも可能です。
  • IronPDF を使用すると、インタラクティブな PDF ドキュメントの作成、インタラクティブなフォームへの入力と送信、PDF ファイルの分割と結合、PDF ファイルからのテキストと画像の抽出、PDF ファイル内の特定の単語の検索、 PDF ページの画像へのラスタライズ、PDF から HTML への変換、 PDF ファイルの印刷を行うことができます。
  • IronPDF は URL から PDF ファイルを開いて印刷できます。 さらに、ユーザー エージェントが HTML ログイン フォーム、プロキシ、Cookie、HTTP ヘッダー、カスタム ネットワーク ログイン資格情報、フォーム変数、およびユーザー エージェントの背後でログインできるようになります。
  • IronPDF を使用してドキュメントから画像を抽出できます。
  • IronPDF を使用すると、ヘッダーやフッター、テキストや画像、ブックマークや透かしなどをドキュメントに簡単に追加できます。
  • IronPDF を使用すると、新規または既存のドキュメントを使用してページを結合したり分離したりすることができます。
  • Acrobat ビューアを使用せずに、ドキュメントを PDF オブジェクトに変換できます。
  • CSS ファイルを使用して PDF ドキュメントを作成できます。
  • メディアタイプのCSSファイルを使用してドキュメントの作成が可能です。

2.3 IronPDFライブラリのインポート

IronPDF をインポートするには、IronPDF が使用されるソース ファイルの先頭に次のインポート ステートメントを含めます。

from ironpdf import *
Python

2.4 ライセンスキーの設定(必要な場合)

IronPDF for Python は無料で使用できますが、無料ユーザーの場合、PDF ファイルにタイル状の背景に透かしが入ります。 IronPDF を使用して透かしのない PDF を作成するには、ライブラリに正規のライセンス キーを付与する必要があります。 ライセンス キーを使用してライブラリを設定する方法は、次のコード スニペットに示されています。

# Set the license key for IronPDF
License.LicenseKey = "IRONPDF-LICENSE-KEY-ABCDEFGH"
Python

PDF ファイルを作成したり、そのコンテンツを変更したりする前に、ライセンス キーが設定されていることを確認してください。 他のコード行の前にLicenseKeyメソッドを呼び出す必要があります。 無料試用ライセンス キーを取得するには、ライセンス ページにアクセスしてください。

2.5 ログファイルの設定

"Default"というテキスト ファイルには、Python スクリプトのディレクトリ内の Custom.log によって生成されたログ メッセージを保存できます。 以下のコードスニペットを使用して、LogFilePathプロパティを設定し、ログファイルの名前と場所をカスタマイズできます。

# Enable debugging and set the log file path and mode
Logger.EnableDebugging = True
Logger.LogFilePath = "Custom.log"
Logger.LoggingMode = Logger.LoggingModes.All
Python

3.0 IronPDFでPDFテキストを抽出する

IronPDF for Python ライブラリは、PDF ページを PDF オブジェクトに変換し、スキャンされた PDF ファイルを含む PDF ファイルからテキストを抽出できるようにします。 以下は、IronPDF を使用して既存の PDF を読み取る方法を示す例です。

最初の方法では、PDF 内のすべてのテキストを抽出します。 コードのサンプルを以下に示します。

from ironpdf import *

# Load existing PDF document
pdf = PdfDocument.FromFile("content.pdf")

# Extract all the text from the entire PDF document
all_text = pdf.ExtractAllText()

# Display the extracted text
print(all_text)
Python

上記のコードで示されているように、FromFileメソッドは既存のPDFファイルを読み込み、それをPDF文書オブジェクトに変換するPDFリーダーオブジェクトです。 このオブジェクトは、PDF ページにあるテキストと画像を読み取るために使用できます。 オブジェクトはExtractAllTextというメソッドを提供しており、PDFファイル全体からすべてのテキストを取得し、文字列として保持して処理することができます。 その後、print関数を使用してテキストを表示します。

PythonでPDFをテキストに変換する方法(チュートリアル)、図1: テキストの表示 テキストを表示する

PDFファイルからページごとにテキストを抽出する2番目の方法のコード例を以下に示します。

from ironpdf import *

# Load existing PDF document
pdf = PdfDocument.FromFile("content.pdf")

# Extract text from a specific page in the document
page_text = pdf.ExtractTextFromPage(1)

# Display the extracted text from the specified page
print(page_text)
Python

FromFileメソッドは、既存のファイルからPDFファイルを読み込み、PDFファイルオブジェクトに変換するために使用されます。上記のコードで示されています。 PDFページオブジェクトのメソッドExtractTextFromPageは、PDFファイル内のページからすべてのテキストを取得します。特定のページからテキストを抽出するにはページ番号をパラメータとして提供する必要があります。 そして、テキストを抽出した後、処理できる情報を保持するためにpage_textを使用することができます。

PDF からテキストを抽出するためのその他の例を確認してください。

4.0 結論

対照的に、IronPDFライブラリは潜在的なリスクを軽減するために強力なセキュリティ対策を提供します。 特定のブラウザ向けにカスタマイズされておらず、一般的に使用されているすべてのブラウザで動作します。 IronPDF を使用すると、プログラマーはわずか数行のコードで簡単に PDF ファイルを作成および読み取ることができます。 IronPDF ライブラリは、さまざまな開発者のニーズを満たすために、無料の開発者ライセンスや購入可能な追加の開発ライセンスなど、さまざまなライセンス オプションを提供します。

IronPDF には、永久ライセンス、30 日間の返金保証、1 年間のソフトウェア サポート、アップグレード オプションが含まれています。 初回購入後、追加費用は発生しません。 これらのライセンスは、開発、ステージング、プロダクション環境で使用することができます。 製品ライセンスの詳細については、こちらをご覧ください。

ソフトウェア製品をダウンロードします。

Curtis Chau
テクニカルライター

Curtis Chauは、カールトン大学でコンピュータサイエンスの学士号を取得し、Node.js、TypeScript、JavaScript、およびReactに精通したフロントエンド開発を専門としています。直感的で美しいユーザーインターフェースを作成することに情熱を持ち、Curtisは現代のフレームワークを用いた開発や、構造の良い視覚的に魅力的なマニュアルの作成を楽しんでいます。

...
詳しく読む

関連する記事

Key in blue circle

無料の30日間トライアルキーをすぐに入手してください。

Your trial license will be sent to your email address

制限なし。100% ロック解除済み。クレジットカード不要。

OR
bullet_checkedクレジットカードやアカウントの作成は不要です。制限なし。100% ロック解除済み。クレジットカード不要。
  • Logo Aetna
  • Logo NASA
  • Logo GE
  • Logo Porsche
  • Logo USDA
  • Logo Qatar
Join Millions of Engineers who’ve tried Iron Suite
無料のライブデモを予約する
Booking Badge

世界中の数百万人のエンジニアから信頼されています。

ライセンスはより安く
義務のない相談を受ける
下記のフォームを記入するか、sales@ironsoftware.comにメールしてください。
あなたの詳細は常に守秘されます。
世界中の数百万人のエンジニアから信頼されています。
ライセンスはより安く
あなたの無料30日間の試用キーをすぐに入手。
クレジットカードやアカウントの作成は不要です。
PDF用C# NuGetライブラリ
NuGetでインストール

バージョン: 2026.9

PM > Install-Package IronPdf
nuget.org/packages/IronPdf/
  1. ソリューションエクスプローラーで参照を右クリックし、NuGetパッケージを管理を選択
  2. ブラウズを選択し、"IronPDF"を検索
  3. パッケージを選択してインストール
C# PDF DLL
DLLをダウンロード

バージョン: 2026.9

またはここからWindowsインストーラーをダウンロードする。

  1. IronPDFを~/Libsなどの場所に解凍し、ソリューションディレクトリ内に配置する
  2. Visual Studioソリューションエクスプローラーで参照を右クリックし、"IronPDF.dll"をブラウズして選択

ライセンスは$999から