Extraer Texto

IronPDF for Python puede extraer el contenido de texto de un documento PDF, ya sea de todo el documento a la vez o de páginas individuales, utilizando los métodos ExtractAllText y ExtractTextFromPage.

Empezando

Carga un PdfDocument desde un archivo usando PdfDocument.FromFile, y luego llama al método de extracción adecuado. Ambos métodos devuelven una cadena de Python que contiene el texto extraído.

Entender el código

  • PdfDocument.FromFile(path): Abre un documento PDF existente desde la ruta de archivo especificada. Para archivos protegidos con contraseña, pasa la contraseña como segundo argumento.
  • ExtractAllText(): Devuelve una sola cadena que contiene el texto extraído de todas las páginas del documento, en el orden de las páginas.
  • ExtractTextFromPage(pageIndex): Devuelve el contenido de texto de una sola página. El argumento pageIndex se basa en cero; pasa 0 para la primera página, 1 para la segunda, y así sucesivamente.

Casos de uso

La extracción de texto es útil para:

  • Indexación de búsqueda — hacer que el contenido PDF sea buscable en una base de datos o motor de búsqueda.
  • Análisis de datos — extraer datos estructurados como números de facturas, fechas o direcciones de informes PDF.
  • Verificación de contenido — verificar automáticamente que los PDFs generados contengan el texto esperado.
  • Accesibilidad — convertir el contenido PDF a texto plano para lectores de pantalla o procesamiento posterior.

¡Aprende a extraer contenido de PDFs con IronPDF for Python!

¿Listo para empezar?
Versión: 2026.6 recién publicada
Still Scrolling Icon

¿Aún desplazándote?

¿Quieres una prueba rápida?
ejecutar una muestra Mira cómo tu HTML se convierte en PDF.