提取文本

IronPDF for Python可以使用ExtractTextFromPage方法提取PDF文档的文本内容——既可以一次从整个文档中提取,也可以从单个页面中提取。

开始

使用PdfDocument,然后调用适当的提取方法。 两种方法都返回一个包含提取文本的Python字符串。

理解代码

  • PdfDocument.FromFile(path):从指定的文件路径打开现有的PDF文档。 对于受密码保护的文件,请将密码作为第二个参数传递。
  • ExtractAllText():返回文档所有页面中提取的文本按页顺序组成的单一字符串。
  • ExtractTextFromPage(pageIndex):返回单一页面的文本内容。 1以获得第二页,依此类推。

用例

文本提取对于以下情况很有用:

  • 搜索索引——使PDF内容在数据库或搜索引擎中可被搜索。
  • 数据解析——从PDF报告中提取结构化数据,如发票号码、日期或地址。
  • 内容验证——程序化检查生成的PDF中是否包含预期文本。
  • 无障碍访问——将PDF内容转换为纯文本,以便屏幕阅读器或后续处理使用。

学习使用IronPDF for Python从PDF中提取内容!

准备开始了吗?
版本: 2026.6 刚刚发布
Still Scrolling Icon

还在滚动吗?

想快速获得证据?
运行示例看着你的HTML代码变成PDF文件。