IRONSOFTWAREHOME
텍스트 추출
from ironpdf import *

# Load existing PDF document
pdf = PdfDocument.FromFile("content.pdf")

# Extract text from PDF document
all_text = pdf.ExtractAllText()

# Extract text from specific page in the document
page_2_text = pdf.ExtractTextFromPage(1)
pip install ironpdf
텍스트 추출

텍스트 추출

IronPDF for Python은 ExtractAllTextExtractTextFromPage 메서드를 사용하여 PDF 문서의 텍스트 내용을 한 번에 전체 문서에서 또는 개별 페이지에서 추출할 수 있습니다.

시작하기

파일에서 PdfDocument을(를) PdfDocument.FromFile을(를) 사용하여 로드한 후, 적절한 추출 메서드를 호출합니다. 두 방법 모두 추출된 텍스트를 포함하는 Python 문자열을 반환합니다.

코드 이해하기

PdfDocument.FromFile(path): 지정된 파일 경로에서 기존 PDF 문서를 엽니다. 암호로 보호된 파일의 경우 두 번째 인수로 암호를 전달합니다. ExtractAllText(): 문서의 모든 페이지에서 추출된 텍스트를 페이지 순서에 따라 하나의 문자열로 반환합니다.

  • ExtractTextFromPage(pageIndex): 단일 페이지의 텍스트 콘텐츠를 반환합니다. pageIndex 인수는 0부터 시작합니다. 첫 번째 페이지에는 0를, 두 번째 페이지에는 1를 전달합니다.

사용 사례

텍스트 추출은 다음에 유용합니다:

  • 검색 색인화 — 데이터베이스 또는 검색 엔진에서 PDF 콘텐츠를 검색 가능하게 만듭니다.
  • 데이터 구문 분석 — PDF 보고서에서 송장 번호, 날짜 또는 주소와 같은 구조화된 데이터를 추출합니다.
  • 콘텐츠 검증 — 생성된 PDF가 예상되는 텍스트를 포함하는지 프로그래밍 방식으로 확인합니다.
  • 접근성 — 화면 읽기 프로그램 또는 다운스트림 처리용으로 PDF 콘텐츠를 일반 텍스트로 변환합니다.
IronPDF for Python으로 PDF에서 콘텐츠를 추출하는 방법을 배워보세요!

시작할 준비 되셨나요?

버전:2026.6방금 출시

Key in blue circle

무료 30일 체험 키를 즉시 받으세요.

Your trial license will be sent to your email address

제한 없음. 100% 무제한 이용. 신용카드 불필요.

bullet_checked신용카드나 계정 생성은 필요하지 않습니다.제한 없음. 100% 무제한 이용. 신용카드 불필요.
  • Logo Aetna
  • Logo NASA
  • Logo GE
  • Logo Porsche
  • Logo USDA
  • Logo Qatar
Join Millions of Engineers who’ve tried IronPDF
무료 라이브 데모를 예약하세요
Booking Badge

전 세계 수백만 엔지니어들이 신뢰하는 제품입니다.

Iron Software의 고객 로고
부담 없는 무료 상담을 받아보세요
아래 양식을 작성하시거나 sales@ironsoftware.com으로 이메일을 보내주세요.
고객님의 정보는 항상 비밀로 유지됩니다.
전 세계 수백만 엔지니어들이 신뢰하는 제품입니다.
Iron Software의 고객 로고
지금 바로 30일 무료 체험판 키를 받으세요.
신용카드나 계정 생성은 필요하지 않습니다.