
Como ler um arquivo PDF em Java
Este artigo irá explorar como criar um leitor de PDF para abrir um arquivo PDF em seu aplicativo de software de forma programática. Para realizar essa tarefa de forma eficaz, o IronPDF for Java é uma biblioteca de sistema que ajuda a abrir e ler arquivos PDF usando o nome do arquivo em programas Java.
Como ler arquivos PDF em Java
- Baixe a biblioteca Java do IronPDF
- Utilize o método
fromFilepara carregar documentos PDF existentes. - Chame o método
extractAllTextpara extrair o texto incorporado em PDFs. - Extrair texto de uma página específica com o método
extractTextFromPage - Recuperar texto de PDFs gerados a partir de URLs
IronPDF
A biblioteca IronPDF - Java é construída sobre a já consagrada .NET Framework. Isso torna o IronPDF uma ferramenta versátil para trabalhar com documentos PDF em comparação com outras bibliotecas de classes, como o Apache PDFBox. Ele oferece a funcionalidade de extrair e analisar conteúdo , carregar texto e carregar imagens. Ele também oferece opções para personalizar as páginas do PDF, como layout da página , margens, cabeçalho e rodapé , orientação da página e muito mais.
Além disso, o IronPDF também oferece suporte à conversão de outros formatos de arquivo, proteção de PDFs com senha, assinatura digital, mesclagem e divisão de documentos PDF.
Como ler arquivos PDF em Java
Pré-requisitos
Para usar o IronPDF para criar um leitor de PDF em Java, é necessário garantir que os seguintes componentes estejam instalados no computador:
- O JDK (Java Development Kit) é necessário para criar e executar programas Java. Caso não esteja instalado, faça o download no site da Oracle .
- IDE - Ambiente de Desenvolvimento Integrado é um software que auxilia na escrita, edição e depuração de um programa. Baixe qualquer IDE for Java, por exemplo, Eclipse, NetBeans ou IntelliJ.
- Maven - O Maven é uma ferramenta de automação que auxilia no download de bibliotecas do Repositório Central. Faça o download no site do Apache Maven .
- IronPDF - Por fim, o IronPDF é necessário para ler o arquivo PDF em Java. Isso precisa ser adicionado como uma dependência em seu projeto Java Maven. Inclua o artefato IronPDF junto com a dependência slf4j no arquivo
pom.xmlconforme mostrado no exemplo abaixo:
<!-- Add Maven dependencies for IronPDF -->
<dependencies>
<!-- IronPDF Dependency -->
<dependency>
<groupId>com.ironsoftware</groupId>
<artifactId>ironpdf</artifactId>
<version>your-version-here</version>
</dependency>
<!-- SLF4J Dependency necessary for logging -->
<dependency>
<groupId>org.slf4j</groupId>
<artifactId>slf4j-api</artifactId>
<version>1.7.32</version>
</dependency>
</dependencies>
Adicionando as importações necessárias
Primeiramente, adicione o seguinte código no início do arquivo fonte Java para referenciar todos os métodos necessários do IronPDF:
import com.ironsoftware.ironpdf.*;
// Necessary imports from IronPDF library
Em seguida, configure o IronPDF com uma chave de licença válida para usar seus métodos. Invoque o método setLicenseKey no método principal.
License.setLicenseKey("Your license key");
// Set your IronPDF license key - required for full version
Observação: você pode obter uma chave de licença de avaliação gratuita para criar, ler e imprimir PDFs.
Ler um arquivo PDF existente em Java
Para ler arquivos PDF , é necessário que existam arquivos PDF, ou que um seja criado. Este artigo utilizará um arquivo PDF já criado. O código é simples e consiste em um processo de duas etapas para extrair o texto do documento:
// Load the PDF document from file
PdfDocument pdf = PdfDocument.fromFile(Paths.get("assets/sample.pdf"));
// Extract all text from the PDF
String text = pdf.extractAllText();
// Print the extracted text
System.out.println(text);
In the above code, fromFile opens a PDF document. O método Paths.get obtém o diretório do arquivo e está pronto para extrair conteúdo do arquivo. Em seguida, [extractAllText](/java/object-reference/api/com/ironsoftware/ironpdf/PdfDocument.html#extractAllText() lê todo o texto no documento.
O resultado é o seguinte:
Leitura de saída de texto em PDF
Ler texto de uma página específica
O IronPDF também consegue ler o conteúdo de uma página específica em um PDF. O método extractTextFromPage usa um objeto PageSelection para aceitar um intervalo de página(s) das quais o texto será lido.
No exemplo a seguir, o texto foi extraído da segunda página do documento PDF. PageSelection.singlePage pega o índice da página que precisa ser extraída (índice começando de 0).
// Load the PDF document from file
PdfDocument pdf = PdfDocument.fromFile(Paths.get("assets/sample.pdf"));
// Extract text from the second page (page index based, starts at 0, so 1 means second page)
String text = pdf.extractTextFromPage(PageSelection.singlePage(1));
// Print the extracted text from the specified page
System.out.println(text);
Leitura de saída de texto em PDF
Other methods available in the PageSelection class which can be used to extract text from various pages include: firstPage, [lastPage](/java/object-reference/api/com/ironsoftware/ironpdf/edit/PageSelection.html#firstPage(), [pageRange](/java/object-reference/api/com/ironsoftware/ironpdf/edit/PageSelection.html#pageRange(int,int), and [allPages](/java/object-reference/api/com/ironsoftware/ironpdf/edit/PageSelection.html#allPages().
Ler texto de um arquivo PDF recém-gerado
A busca de texto também pode ser realizada a partir de um arquivo PDF recém-gerado, seja a partir de um arquivo HTML ou de uma URL. O código de exemplo a seguir gera PDFs a partir de URLs e extrai todo o texto do site.
// Generate PDF from a URL
PdfDocument pdf = PdfDocument.renderUrlAsPdf("https://unsplash.com/");
// Extract all text from the generated PDF
String text = pdf.extractAllText();
// Print the extracted text from the URL
System.out.println("Text extracted from the website: " + text);
Ler de um novo arquivo
O IronPDF também pode ser usado para extrair imagens de arquivos PDF.
O código completo é o seguinte:
import com.ironsoftware.ironpdf.License;
import com.ironsoftware.ironpdf.PdfDocument;
import com.ironsoftware.ironpdf.edit.PageSelection;
import java.io.IOException;
import java.nio.file.Paths;
public class Main {
public static void main(String[] args) throws IOException {
// Set the IronPDF license key for commercial use
License.setLicenseKey("YOUR LICENSE KEY HERE");
// Read text from a specific page in an existing PDF
PdfDocument pdf = PdfDocument.fromFile(Paths.get("assets/sample.pdf"));
String text = pdf.extractTextFromPage(PageSelection.singlePage(1));
System.out.println(text);
// Read all text from a PDF generated from a URL
pdf = PdfDocument.renderUrlAsPdf("https://unsplash.com/");
text = pdf.extractAllText();
System.out.println("Text extracted from the website: " + text);
}
}
Resumo
Este artigo explicou como abrir e ler PDFs em Java usando o IronPDF.
O IronPDF ajuda a criar PDFs facilmente a partir de HTML ou URL e a converter entre diferentes formatos de arquivo. Também ajuda a realizar tarefas com PDFs de forma rápida e fácil.
Experimente o IronPDF gratuitamente por 30 dias e descubra como ele funciona para você em produção. Explore as opções de licenciamento comercial para IronPDF que começam a partir de apenas $999.

Curtis Chau é bacharel em Ciência da Computação (Universidade Carleton) e se especializa em desenvolvimento front-end, com experiência em Node.js, TypeScript, JavaScript e React. Apaixonado por criar interfaces de usuário intuitivas e esteticamente agradáveis, Curtis gosta de trabalhar com frameworks modernos e criar manuais bem estruturados e visualmente atraentes.
Artigos relacionados


