Extraire le texte
IronPDF for Python peut extraire le contenu textuel d'un document PDF — soit de l'ensemble du document d'un seul coup, soit de pages individuelles — en utilisant les méthodes ExtractAllText et ExtractTextFromPage.
Commencer
Chargez un PdfDocument à partir d'un fichier en utilisant PdfDocument.FromFile, puis appelez la méthode d'extraction appropriée. Les deux méthodes renvoient une chaîne Python contenant le texte extrait.
Comprendre le code
PdfDocument.FromFile(path): Ouvre un document PDF existant à partir du chemin de fichier spécifié. Pour les fichiers protégés par mot de passe, passez le mot de passe en tant que second argument.ExtractAllText(): Retourne une seule chaîne contenant le texte extrait de toutes les pages du document, selon l'ordre des pages.ExtractTextFromPage(pageIndex): Retourne le contenu textuel d'une seule page. L'argumentpageIndexest basé sur zéro — passez0pour la première page,1pour la seconde, et ainsi de suite.
Cas d'utilisation
L'extraction de texte est utile pour :
- Indexation de recherche — rendre le contenu PDF consultable dans une base de données ou un moteur de recherche.
- Analyse des données — extraire des données structurées telles que des numéros de facture, des dates ou des adresses à partir de rapports PDF.
- Vérification de contenu — vérifier de manière programmatique que les PDF générés contiennent le texte attendu.
- Accessibilité — convertir le contenu PDF en texte brut pour les lecteurs d'écran ou le traitement en aval.
Apprenez à extraire du contenu de PDFs avec IronPDF for Python !

