
PythonでPDFから画像を抽出する方法
この記事では、IronPDF for Pythonを使用して、Pythonコードを使いPDFファイルから画像を抽出します。
IronPDF Python 向け
IronPDF for Pythonは最先端で強力なライブラリであり、PythonにおけるPDFドキュメントの取り扱いに新たな次元をもたらします。 PDFタスクの包括的なソリューションとして、IronPDFはアプリケーションへの高度なPDF機能のシームレスな統合を可能にします。
IronPDFは、ゼロからPDFを作成したり、HTMLを高品質のPDFに変換したり、PDFページを結合、分割、編集するなどのアクションを通じて管理するための幅広いツールとAPIを提供します。 これらのツールはユーザーフレンドリーで効率的です。 ユーザーフレンドリーなインターフェイスと幅広いドキュメントを備えたIronPDFは、開発者に可能性を開きます。
プロフェッショナルなレポートや請求書の作成、ワークフローの自動化、ドキュメント管理のために、IronPDFはドキュメント管理と自動化の分野で貴重な資産を提供し、PythonアプリケーションでPDFの力を活用しようとする開発者にとって必須のツールです。
IronPDF Python 向けを使用してPDFから画像を抽出する方法
- PythonでPDFから画像を抽出するためにIronPDFライブラリをインストールします。
- ローカルディスクからファイルパスを使用してPDFファイルを読み込むには、
PdfDocument.FromFileメソッドを使用します。 - PDFファイルから画像を抽出するには、
ExtractAllImagesメソッドを適用します。 - ループを使用して、PDFに含まれるすべての抽出された画像を反復処理します。
- 必要な画像拡張子でPDFファイルから抽出された画像を保存します。
前提条件
Pythonを使用してPDFから画像を取得する世界に入る前に、必要な前提条件をインストールしましょう。
-
**Python のインストール:**システムにPythonインタープリターがインストールされていることを確認します。 PDFから画像を取得するプロセスにはPython 3.0以上のバージョンが必要です。 互換性のあるPythonのインストールを確認してください。
-
IronPDFライブラリ: IronPDF の強力な機能を活用するには、Pythonパッケージマネージャー
pipを使用してインストールする必要があります。 コマンドラインインターフェイスを開き、次のコマンドを実行します: -
統合開発環境 (IDE): 必須ではありませんが、IDEを使用すると開発体験が大幅に向上します。 IDEはコード補完、デバッグ、よりスムーズなワークフローなどの機能を提供します。 Python開発用として非常に人気のあるIDEの一つがPyCharmです。 JetBrainsのウェブサイトからPyCharmをダウンロードしてインストールできます。
これらの前提条件が整ったら、PythonとIronPDFを使用してPDFから画像を取得するエキサイティングな世界を、ステップバイステップでガイドします。
ステップ1 新しいPythonプロジェクトの作成
以下にPyCharmで新しいPythonプロジェクトを作成する手順を示します。
-
PyCharmで新しいPythonプロジェクトを開始するには、PyCharmアプリケーションを開き、トップメニューに移動します。
-
ファイルをクリックし、ドロップダウンメニューから新しいプロジェクトを選択します。
PyCharm IDE -
新しいプロジェクトをクリックすると、プロジェクト作成というタイトルの新しいウィンドウが表示されます。
-
このウィンドウで、上部の場所フィールドにプロジェクト名を入力します。環境を選択し、 仮想環境を使用している場合は、提供されたオプションから選択します。
PyCharmで新しいPythonプロジェクトを作成 -
環境を選択したら、作成ボタンをクリックしてPythonプロジェクトを作成します。
これでPythonプロジェクトが作成され、画像の抽出など、さまざまなタスクに使用する準備が整いました。
ステップ2 IronPDFのインストール
IronPDFをインストールするには、端末または別のコマンドプロンプトを開き、コマンドpip install ironpdfを入力し、Enterキーを押します。 ターミナルには以下の出力が表示されます。
IronPDFパッケージをインストールする
ステップ3 IronPDFを使用してPDFファイルから画像を抽出
IronPDFは開発者に対してPDFを操作し、埋め込まれた画像をシームレスに識別および抽出するためのツールとAPIを提供します。 分析や統合のため、IronPDFはPythonの柔軟性を活用して抽出を簡略化します。 これにより、PDFや画像ベースのアプリで作業するために不可欠です。わずか数行のコードでPDFファイルからすべての画像を抽出でき、非常にシンプルです。
次のコードでPythonプログラミング言語を使用してPDFから画像を抽出します。
from ironpdf import PdfDocument
# Open PDF file
pdf = PdfDocument.FromFile("FYP Thesis.pdf")
# Get all images found in the PDF Document
all_images = pdf.ExtractAllImages()
# Save each image to the local disk with a dynamic name
for i, image in enumerate(all_images):
image.SaveAs(f"output_image_{i}.png")
このコードはまずIronPDFライブラリをインポートし、次にファイルパスとPdfDocument.FromFile メソッドを使用してローカルスペースからPDFファイルを読み込みます。 PDFの各ページにアクセスし、Imageオブジェクトとして画像バイトを抽出します。 PDFページからのこれらの画像オブジェクトは、その後SaveAs メソッドを使用して保存されます。 コードは、画像インデックスと必要な画像ファイル拡張子(この例ではPNG)に基づいて動的に画像名を割り当てます。
このアプローチは、PyMuPDFやPillowなどの他 for Pythonライブラリを使用するよりも簡単で、同じタスクである画像ファイルの抽出と保存にはより多くのコードが必要です。
ステップ4 PDFファイルから画像を保存
画像はPDFファイルのすべてのページから抽出され、PNG形式で保存されます。 出力形式は、ファイル拡張子を調整することで、希望する画像ファイル形式に変更する柔軟性があります。
サンプルPDFファイルから抽出された画像
結論
Pythonと強力なIronPDFを組み合わせることで、PDFファイルから画像を取得するための多用途で効率的な解決策を提供します。 Pythonの柔軟性とIronPDFの機能を活用し、開発者はPDFドキュメントをシームレスに操作し、その中の画像バイトを見つけ、希望の画像拡張子でこれらの画像を保存できます。 プロセスは、PDFから画像を取得することを含み、生成された画像リストは、必要に応じてさらに処理および操作できます。 Pythonを使用してPDFから画像を取得する技術をマスターすることで、開発者はワークフローを強化し、ドキュメント管理を自動化し、画像ベースのアプリケーションの幅広いエクスプロレーションを行うことができ、デジタル時代において価値のあるスキルとなります。
PDFファイルから画像を抽出するためのその他の機能については、次の例をご覧ください。 PDFファイルのコンテンツを画像に変換するなどの他の操作を探ることができます。 完全なチュートリアルはこのhow-to Python記事にあります。

Curtis Chauは、カールトン大学でコンピュータサイエンスの学士号を取得し、Node.js、TypeScript、JavaScript、およびReactに精通したフロントエンド開発を専門としています。直感的で美しいユーザーインターフェースを作成することに情熱を持ち、Curtisは現代のフレームワークを用いた開発や、構造の良い視覚的に魅力的なマニュアルの作成を楽しんでいます。
関連する記事


