Extraer Texto
IronPDF for Python puede extraer el contenido de texto de un documento PDF, ya sea de todo el documento a la vez o de páginas individuales, utilizando los métodos ExtractAllText y ExtractTextFromPage.
Empezando
Carga un PdfDocument desde un archivo usando PdfDocument.FromFile, y luego llama al método de extracción adecuado. Ambos métodos devuelven una cadena de Python que contiene el texto extraído.
Entender el código
PdfDocument.FromFile(path): Abre un documento PDF existente desde la ruta de archivo especificada. Para archivos protegidos con contraseña, pasa la contraseña como segundo argumento.ExtractAllText(): Devuelve una sola cadena que contiene el texto extraído de todas las páginas del documento, en el orden de las páginas.ExtractTextFromPage(pageIndex): Devuelve el contenido de texto de una sola página. El argumentopageIndexse basa en cero; pasa0para la primera página,1para la segunda, y así sucesivamente.
Casos de uso
La extracción de texto es útil para:
- Indexación de búsqueda — hacer que el contenido PDF sea buscable en una base de datos o motor de búsqueda.
- Análisis de datos — extraer datos estructurados como números de facturas, fechas o direcciones de informes PDF.
- Verificación de contenido — verificar automáticamente que los PDFs generados contengan el texto esperado.
- Accesibilidad — convertir el contenido PDF a texto plano para lectores de pantalla o procesamiento posterior.
¡Aprende a extraer contenido de PDFs con IronPDF for Python!






