Extraire le texte

IronPDF for Python peut extraire le contenu textuel d'un document PDF — soit de l'ensemble du document d'un seul coup, soit de pages individuelles — en utilisant les méthodes ExtractAllText et ExtractTextFromPage.

Commencer

Chargez un PdfDocument à partir d'un fichier en utilisant PdfDocument.FromFile, puis appelez la méthode d'extraction appropriée. Les deux méthodes renvoient une chaîne Python contenant le texte extrait.

Comprendre le code

  • PdfDocument.FromFile(path) : Ouvre un document PDF existant à partir du chemin de fichier spécifié. Pour les fichiers protégés par mot de passe, passez le mot de passe en tant que second argument.
  • ExtractAllText() : Retourne une seule chaîne contenant le texte extrait de toutes les pages du document, selon l'ordre des pages.
  • ExtractTextFromPage(pageIndex) : Retourne le contenu textuel d'une seule page. L'argument pageIndex est basé sur zéro — passez 0 pour la première page, 1 pour la seconde, et ainsi de suite.

Cas d'utilisation

L'extraction de texte est utile pour :

  • Indexation de recherche — rendre le contenu PDF consultable dans une base de données ou un moteur de recherche.
  • Analyse des données — extraire des données structurées telles que des numéros de facture, des dates ou des adresses à partir de rapports PDF.
  • Vérification de contenu — vérifier de manière programmatique que les PDF générés contiennent le texte attendu.
  • Accessibilité — convertir le contenu PDF en texte brut pour les lecteurs d'écran ou le traitement en aval.

Apprenez à extraire du contenu de PDFs avec IronPDF for Python !

Prêt à commencer?
Version : 2026.6 vient de sortir
Still Scrolling Icon

Vous faites encore défiler ?

Vous voulez une preuve rapidement ?
exécuter un échantillon Regardez votre code HTML se transformer en PDF.