IronPDF for Pythonは、ExtractTextFromPageメソッドを使用して、PDFドキュメントのテキストコンテンツをドキュメント全体または個々のページから抽出できます。
開始方法
PdfDocument.FromFileを使ってロードし、適切な抽出メソッドを呼び出します。 どちらのメソッドも、抽出されたテキストを含むPythonの文字列を返します。
コードの理解
PdfDocument.FromFile(path):指定されたファイルパスから既存のPDFドキュメントを開きます。 パスワード保護されたファイルの場合、2つ目の引数としてパスワードを渡します。ExtractAllText():ドキュメントのすべてのページから抽出されたテキストをページ順に単一の文字列として返します。ExtractTextFromPage(pageIndex):単一ページのテキストコンテンツを返します。1を渡して使用します。
使用例
テキスト抽出は次の用途に役立ちます。
- 検索インデックス化 - PDFコンテンツをデータベースまたは検索エンジンで検索できるようにします。
- データ解析 - PDFレポートから請求番号、日付、住所などの構造化データを抽出します。
- コンテンツの検証 - 生成されたPDFに期待するテキストが含まれているかをプログラムでチェックします。
- アクセシビリティ - スクリーンリーダーや後処理用にPDFコンテンツをプレーンテキストに変換します。