提取文本
IronPDF for Python可以使用ExtractTextFromPage方法提取PDF文档的文本内容——既可以一次从整个文档中提取,也可以从单个页面中提取。
开始
使用PdfDocument,然后调用适当的提取方法。 两种方法都返回一个包含提取文本的Python字符串。
理解代码
PdfDocument.FromFile(path):从指定的文件路径打开现有的PDF文档。 对于受密码保护的文件,请将密码作为第二个参数传递。ExtractAllText():返回文档所有页面中提取的文本按页顺序组成的单一字符串。ExtractTextFromPage(pageIndex):返回单一页面的文本内容。1以获得第二页,依此类推。
用例
文本提取对于以下情况很有用:
- 搜索索引——使PDF内容在数据库或搜索引擎中可被搜索。
- 数据解析——从PDF报告中提取结构化数据,如发票号码、日期或地址。
- 内容验证——程序化检查生成的PDF中是否包含预期文本。
- 无障碍访问——将PDF内容转换为纯文本,以便屏幕阅读器或后续处理使用。






