IRONSOFTWAREHOME
提取文本
from ironpdf import *

# Load existing PDF document
pdf = PdfDocument.FromFile("content.pdf")

# Extract text from PDF document
all_text = pdf.ExtractAllText()

# Extract text from specific page in the document
page_2_text = pdf.ExtractTextFromPage(1)
pip install ironpdf
提取文本

提取文本

IronPDF for Python可以使用ExtractTextFromPage方法提取PDF文档的文本内容——既可以一次从整个文档中提取,也可以从单个页面中提取。

开始

使用PdfDocument,然后调用适当的提取方法。 两种方法都返回一个包含提取文本的Python字符串。

理解代码

  • PdfDocument.FromFile(path):从指定的文件路径打开现有的PDF文档。 对于受密码保护的文件,请将密码作为第二个参数传递。
  • ExtractAllText():返回文档所有页面中提取的文本按页顺序组成的单一字符串。
  • ExtractTextFromPage(pageIndex):返回单一页面的文本内容。 1以获得第二页,依此类推。

用例

文本提取对于以下情况很有用:

  • 搜索索引——使PDF内容在数据库或搜索引擎中可被搜索。
  • 数据解析——从PDF报告中提取结构化数据,如发票号码、日期或地址。
  • 内容验证——程序化检查生成的PDF中是否包含预期文本。
  • 无障碍访问——将PDF内容转换为纯文本,以便屏幕阅读器或后续处理使用。
学习使用IronPDF for Python从PDF中提取内容!

准备开始了吗?

版本:2026.9刚刚发布

Key in blue circle

立即获取免费的 30 天试用版密钥。

Your trial license will be sent to your email address

无任何限制。100% 解锁。无需信用卡。

OR
bullet_checked无需信用卡或创建账户无任何限制。100% 解锁。无需信用卡。
  • Logo Aetna
  • Logo NASA
  • Logo GE
  • Logo Porsche
  • Logo USDA
  • Logo Qatar
Join Millions of Engineers who’ve tried Iron Suite
预约您的免费现场演示
Booking Badge

深受全球数百万工程师信赖

Iron Software 的客户徽标
获取您的无义务咨询
填写下面的表格或通过sales@ironsoftware.com
您的资料将始终保密。
深受全球数百万工程师信赖
Iron Software 的客户徽标
立即获取您的免费30 天试用密钥。
无需信用卡或创建账户
Python 模块下载 PDF
using pip 安装

版本: 2026.9

  1. 下载 并安装 Python 3.7+。
  2. 如果尚未安装,请从 pypi.org 安装 pip。
  3. 在终端中执行上述命令。
Python PDF 模块
下载 模块

版本: 2026.9

手动安装到您的项目中

  1. 下载软件包
  2. 在终端中运行此命令
    pip install ironpdf-2026.9-py37-none-win_amd64.whi

$999 起