IronPDF for Python peut extraire le contenu textuel d'un document PDF - soit de l'ensemble du document d'un seul coup, soit de pages individuelles - en utilisant les méthodes ExtractAllText et ExtractTextFromPage.
Commencer
Chargez un PdfDocument à partir d'un fichier en utilisant PdfDocument.FromFile, puis appelez la méthode d'extraction appropriée. Les deux méthodes renvoient une chaîne Python contenant le texte extrait.
Comprendre le code
PdfDocument.FromFile(path): Ouvre un document PDF existant à partir du chemin de fichier spécifié. Pour les fichiers protégés par mot de passe, passez le mot de passe en tant que second argument.ExtractAllText(): Retourne une seule chaîne contenant le texte extrait de toutes les pages du document, selon l'ordre des pages.ExtractTextFromPage(pageIndex): Retourne le contenu textuel d'une seule page. L'argumentpageIndexest basé sur zéro - passez0pour la première page,1pour la seconde, et ainsi de suite.
Cas d'utilisation
L'extraction de texte est utile pour :
- Indexation de recherche - rendre le contenu PDF consultable dans une base de données ou un moteur de recherche.
- Analyse des données - extraire des données structurées telles que des numéros de facture, des dates ou des adresses à partir de rapports PDF.
- Vérification de contenu - vérifier de manière programmatique que les PDF générés contiennent le texte attendu.
- Accessibilité - convertir le contenu PDF en texte brut pour les lecteurs d'écran ou le traitement en aval.