IRONSOFTWAREHOME
USANDO O IRONPDF FOR JAVA

Como extrair dados de um PDF em Java

Curtis Chau
Curtis Chau
Updated: 21 de abril de 2026

Este tutorial mostrará como usar o IronPDF for Java para extrair dados de um arquivo PDF. A configuração do ambiente, a importação da biblioteca, a leitura do arquivo de entrada e a extração dos dados necessários são explicadas com exemplos de código.

2. Biblioteca IronPDF for Java

IronPDF é uma biblioteca de software que oferece aos desenvolvedores a capacidade de gerar, editar e extrair dados de arquivos PDF usando o IronPDF for Java em seus aplicativos Java. Ele permite criar PDFs a partir de documentos HTML , imagens e muito mais, além de mesclar vários PDFs , dividir arquivos PDF e manipular PDFs existentes. O IronPDF também oferece a possibilidade de proteger PDFs com recursos de proteção por senha e adicionar assinaturas digitais a PDFs , entre outros recursos.

O IronPDF for Java é desenvolvido e mantido pela Iron Software. Uma de suas funcionalidades mais bem avaliadas é a extração de texto e dados de arquivos PDF, bem como de HTML e URLs.

3. Pré-requisitos

Para usar o IronPDF para extrair dados de arquivos PDF, você deve atender aos seguintes pré-requisitos:

  1. Instalação do Java: Certifique-se de que o Java esteja instalado em seu sistema e que seu caminho esteja configurado nas variáveis ​​de ambiente. Se você ainda não instalou o Java, consulte esta página de download no site do Java para obter instruções.
  2. IDE Java: Tenha uma IDE Java como o Eclipse ou o IntelliJ instalada. Você pode baixar o Eclipse nesta página de downloads do Eclipse e o IntelliJ nesta página de downloads do IntelliJ .
  3. Biblioteca IronPDF : Baixe e adicione a biblioteca IronPDF como uma dependência em seu projeto. Visite a página de instruções de configuração do IronPDF para obter instruções de configuração.
  4. Instalação do Maven: O Maven deve ser instalado e integrado ao seu IDE antes de iniciar o processo de conversão para PDF. Consulte este tutorial de instalação do Maven da JetBrains sobre como instalar e integrar o Maven.

4. Instalação do IronPDF for Java

Instalar o IronPDF for Java é fácil e descomplicado, desde que todos os requisitos sejam atendidos. Este guia utilizará o IntelliJ IDEA da JetBrains para demonstrar a instalação e executar um código de exemplo.

Eis o que fazer:

  • Abra o IntelliJ IDEA: Inicie o JetBrains IntelliJ IDEA em seu sistema.
  • Criar um projeto Maven: No IntelliJ IDEA, crie um novo projeto Maven. Isso proporcionará um ambiente adequado para a instalação do IronPDF for Java.

Como Extrair Dados de PDF em Java, Figura 1: Novo Projeto Maven no IntelliJ Novo projeto Maven no IntelliJ

  • Uma nova janela será aberta. Digite o nome do projeto e clique em Concluir.

Como Extrair Dados de PDF em Java, Figura 2: Nomeie o Projeto Maven e clique em Concluir Dê um nome ao projeto Maven e clique em Concluir.

  • Um novo projeto com um arquivo pom.xml será aberto assim que você clicar em Concluir. Isso será usado para adicionar as dependências do IronPDF Java Maven.

Como Extrair Dados de PDF em Java, Figura 3: O arquivo pom.xml O arquivo pom.xml

Adicione as seguintes dependências no arquivo pom.xml ou você pode baixar o arquivo JAR da página da biblioteca IronPDF no Sonatype Central.

<dependency>
    <groupId>com.ironsoftware</groupId>
    <artifactId>ironpdf</artifactId>
    <version>1.0.0</version> <!-- replace with the latest version -->
</dependency>
XML

Depois de colocar as dependências no arquivo pom.xml, um pequeno ícone aparecerá no canto superior direito do arquivo.

Como Extrair Dados de PDF em Java, Figura 4: Clique no ícone flutuante para instalar as dependências do Maven automaticamente Clique no ícone flutuante para instalar as dependências do Maven automaticamente.

Instale as dependências Maven do IronPDF for Java clicando neste botão. Dependendo da velocidade da sua conexão com a internet, isso deve levar apenas alguns minutos.

5. Extrair dados

IronPDF é uma biblioteca Java para criar, editar e extrair dados de documentos PDF. Ela fornece uma API simples para extrair texto de arquivos PDF, URLs e tabelas.

5.1. Extrair dados de documentos PDF

Utilizando o IronPDF for Java, você pode extrair facilmente dados de texto de documentos PDF. Abaixo está um exemplo de código para extrair dados de um arquivo PDF.

Como Extrair Dados de PDF em Java, Figura 5: Entrada de PDF Entrada de PDF

// Import the necessary IronPDF package for working with PDF documents
import com.ironsoftware.ironpdf.PdfDocument;

import java.io.IOException;
import java.nio.file.Paths;

public class Main {
    public static void main(String[] args) throws IOException {
        // Load the PDF document from the specified file
        PdfDocument pdf = PdfDocument.fromFile(Paths.get("business plan.pdf"));
        
        // Extract all text from the PDF document
        String text = pdf.extractAllText();
        
        // Print the extracted text to the console
        System.out.println("Text extracted from the PDF: " + text);
    }
}
Java

O código-fonte produz a saída apresentada abaixo:

> Text extracted from the PDF:
> 
> CRAFT-ARENA
> 
> Muhammad Waleed Butt
> 
> Hassan Khan
> 
> ABOUT US
> 
> Craft-Arena is a partnership based business that will help local crafters of Pakistan to sell their handicrafts at good prices and helps them earn a good living.
Text

5.2. Extrair dados de URLs

O IronPDF for Java converte a URL em PDF em tempo de execução e extrai o texto dela. Este exemplo mostrará o código-fonte para extrair texto de URLs.

// Import the necessary IronPDF package for working with PDF documents
import com.ironsoftware.ironpdf.PdfDocument;

import java.io.IOException;

public class Main {
    public static void main(String[] args) throws IOException {
        // Convert a URL to a PDF and load it into a PdfDocument
        PdfDocument pdf = PdfDocument.renderUrlAsPdf("https://ironpdf.com/java/");
        
        // Extract all text from the PDF document
        String text = pdf.extractAllText();
        
        // Print the extracted text to the console
        System.out.println("Text extracted from the URLs: " + text);
    }
}
Java

Como Extrair Dados de PDF em Java, Figura 6: Dados de Página da Web Extraídos Dados extraídos da página da Web

5.3. Extrair dados de dados de tabela

Extrair dados de tabelas de um PDF usando o IronPDF for Java é muito simples; Você só precisa de um PDF contendo uma tabela e executar o código abaixo.

Como Extrair Dados de PDF em Java, Figura 7: Entrada de Tabela PDF de Exemplo Exemplo de entrada de tabela em PDF

// Import the necessary IronPDF package for working with PDF documents
import com.ironsoftware.ironpdf.PdfDocument;

import java.io.IOException;
import java.nio.file.Paths;

public class Main {
    public static void main(String[] args) throws IOException {
        // Load the PDF document from the specified file
        PdfDocument pdf = PdfDocument.fromFile(Paths.get("table.pdf"));
        
        // Extract all text from the PDF document, including table data
        String text = pdf.extractAllText();
        
        // Print the extracted table data to the console
        System.out.print("Text extracted from the Marked tables: " + text);
    }
}
Java
> Test Case Description Expected Result Actual Result Status
> 
> 1 Test login functionality User should be able to log in with valid credentials
> 
> User log in successfully Pass
> 
> 2 Test search functionality Search results should be relevant and accurate
> 
> Search is accurate and provide relevant products Pass
> 
> 3 Test checkout process User should be able to complete a purchase successfully
> 
> User can purchase successfully Pass
Text

6. Conclusão

Em conclusão, este tutorial demonstrou como extrair dados, especificamente dados tabulares, de um arquivo PDF usando o IronPDF for Java.

Para obter mais informações, consulte o exemplo de extração de texto de um PDF no site da IronPDF .

IronPDF é uma biblioteca com detalhes de licença comercial, começando em $999. No entanto, você pode avaliá-lo em produção com um teste gratuito usando a licença de avaliação do IronPDF .

Curtis Chau
Redator Técnico

Curtis Chau é bacharel em Ciência da Computação (Universidade Carleton) e se especializa em desenvolvimento front-end, com experiência em Node.js, TypeScript, JavaScript e React. Apaixonado por criar interfaces de usuário intuitivas e esteticamente agradáveis, Curtis gosta de trabalhar com frameworks modernos e criar manuais bem estruturados e visualmente atraentes.

...
Leia mais

Artigos relacionados

Key in blue circle

Obtenha sua chave de avaliação gratuita de 30 dias instantaneamente.

Your trial license will be sent to your email address

Sem limitações. 100% desbloqueado. Sem cartão de crédito.

bullet_checkedNão é necessário cartão de crédito nem criação de conta.Sem limitações. 100% desbloqueado. Sem cartão de crédito.
  • Logo Aetna
  • Logo NASA
  • Logo GE
  • Logo Porsche
  • Logo USDA
  • Logo Qatar
Join Millions of Engineers who’ve tried IronPDF
Agende sua demonstração ao vivo gratuita.
Booking Badge

Aprovado por milhões de engenheiros em todo o mundo.

Logotipos dos clientes da Iron Software
Agende sua consulta sem compromisso.
Preencha o formulário abaixo ou envie um e-mail para sales@ironsoftware.com
Os seus dados serão sempre mantidos em sigilo.
Aprovado por milhões de engenheiros em todo o mundo.
Logotipos dos clientes da Iron Software
Obtenha sua chave de avaliação gratuita de 30 dias instantaneamente.
Não é necessário cartão de crédito nem criação de conta.