Metoda PdfDocument.ExtractAllText z biblioteki PDF IronPDF C# jest idealna do prostych zadań związanych z odczytem tekstu PDF. Metoda ta bez problemu radzi sobie z rozbieżnościami w zakresie spacji i kodowania w źródłowych dokumentach PDF.
PdfDocument.ExtractTextFromPage odczytuje tekst z określonych stron PDF. W poniższym przykładzie widzimy, jak jest on używany iteracyjnie do pobierania treści tekstowych z określonego zakresu stron.
IronPDF może również wyodrębniać surowe obrazy z plików PDF. Do tego użyj dowolnej metody z klasy PdfDocument poniżej:
ExtractAllImages: zwraca wszystkie osadzone obrazy PDF jako obiektyIronSoftware.Drawing.AnyBitmap.ExtractAllRawImages: odzyskuje wszystkie osadzone obrazy jako listę surowych bajtów (byte[]).ExtractImagesFromPage: wyciąga obrazy zawarte na indeksowanej stronie.ExtractImagesFromPages: to samo coExtractImagesFromPage, ale z określonego zakresu stron lub listy poszczególnych stron.ExtractRawImagesFromPageiExtractRawImagesFromPages: działa tak samo jak poprzednie dwie metody, ale zwraca wyodrębnione obrazy jako tablice bajtów zamiast obiektówIronSoftware.Drawing.AnyBitmap.
Jak odczytywać pliki PDF w języku C#
- Pobierz bibliotekę IronPDF dla języka C#
- Wyodrębnianie obrazów lub tekstu z plików PDF
- Czytanie i wyszukiwanie słów w określonych dokumentach
- Wyświetl plik PDF wygenerowany na podstawie oryginalnego dokumentu
ExtractTextFromPage Method