밀집된 테이블에서 순서가 뒤바뀐 텍스트 추출

This article was translated from English: Does it need improvement?
Translated
View the article in English

밀집된 테이블 또는 양식 레이아웃에서 추출된 텍스트는 스크램블된 것처럼 보입니다. 인접한 행의 문자가 섞여, 예를 들어, "고유 번호 123456789"가 "U123456789nique Number"로 추출됩니다.

이것은 밀집된 레이아웃에 대한 page.Lines 추출의 알려진 제한 사항입니다. page.Lines은 구성할 수 없는 내장된 수직 공차를 사용하여 문자를 그룹화합니다. 테이블 셀의 두 개의 가시적인 행이 포인트 또는 두 포인트밖에 떨어져 있지 않을 때, 그룹화 기는 두 행을 하나의 논리적 행으로 병합하고 문자를 좌에서 우로 정렬하며, 서로 섞이게 합니다. ExtractTextFromPage(i) 메서드는 기본적으로 콘텐츠 스트림 순서를 사용하며, 이는 양식 PDF에서 시각적 읽기 순서와 일치하지 않을 수 있습니다.

해결책

추천: 조정 가능한 관용을 가진 TextChunks로 추출

TextChunkBoundingBox을 노출하여 수직 위치로 그룹화하고 각 행 내에서 수평 위치로 정렬할 수 있게 합니다:

using IronPdf.Pages;
using System.Text;

static string ExtractTextUsingTextChunks(IPdfPage page, double rowTolerance = 2.0)
{
    var rows = page.TextChunks
        .Where(c => !string.IsNullOrWhiteSpace(c.Contents))
        .GroupBy(c => Math.Round(c.BoundingBox.Top / rowTolerance) * rowTolerance)
        .OrderByDescending(g => g.Key);

    var extractedText = new StringBuilder();
    foreach (var row in rows)
    {
        var line = string.Join(" ",
            row.OrderBy(c => c.BoundingBox.Left)
               .Select(c => c.Contents.Trim())
               .Where(text => !string.IsNullOrWhiteSpace(text)));
        extractedText.AppendLine(line);
    }
    return extractedText.ToString();
}
using IronPdf.Pages;
using System.Text;

static string ExtractTextUsingTextChunks(IPdfPage page, double rowTolerance = 2.0)
{
    var rows = page.TextChunks
        .Where(c => !string.IsNullOrWhiteSpace(c.Contents))
        .GroupBy(c => Math.Round(c.BoundingBox.Top / rowTolerance) * rowTolerance)
        .OrderByDescending(g => g.Key);

    var extractedText = new StringBuilder();
    foreach (var row in rows)
    {
        var line = string.Join(" ",
            row.OrderBy(c => c.BoundingBox.Left)
               .Select(c => c.Contents.Trim())
               .Where(text => !string.IsNullOrWhiteSpace(text)));
        extractedText.AppendLine(line);
    }
    return extractedText.ToString();
}
Imports IronPdf.Pages
Imports System.Text

Private Shared Function ExtractTextUsingTextChunks(page As IPdfPage, Optional rowTolerance As Double = 2.0) As String
    Dim rows = page.TextChunks _
        .Where(Function(c) Not String.IsNullOrWhiteSpace(c.Contents)) _
        .GroupBy(Function(c) Math.Round(c.BoundingBox.Top / rowTolerance) * rowTolerance) _
        .OrderByDescending(Function(g) g.Key)

    Dim extractedText As New StringBuilder()
    For Each row In rows
        Dim line = String.Join(" ", row.OrderBy(Function(c) c.BoundingBox.Left) _
                                   .Select(Function(c) c.Contents.Trim()) _
                                   .Where(Function(text) Not String.IsNullOrWhiteSpace(text)))
        extractedText.AppendLine(line)
    Next
    Return extractedText.ToString()
End Function
$vbLabelText   $csharpLabel

rowTolerance = 2.0부터 시작하십시오. 행이 아직도 병합되면 이를 1.0이나 0.5으로 낮추십시오. 더 세밀한 제어를 위해 page.Characterspage.TextChunks로 대체하십시오.

대안: 시각적 순서 추출

오직 콘텐츠 스트림 순서만 잘못된 PDF를 위해:

pdf.ExtractTextFromPage(i, TextExtractionOrder.VisualOrder);
pdf.ExtractTextFromPage(i, TextExtractionOrder.VisualOrder);
pdf.ExtractTextFromPage(i, TextExtractionOrder.VisualOrder)
$vbLabelText   $csharpLabel

행이 시각적으로 매우 가까운 PDF의 경우, TextChunks 접근 방식이 보다 엄격한 공차를 더 잘 처리합니다.

Curtis Chau
기술 문서 작성자

커티스 차우는 칼턴 대학교에서 컴퓨터 과학 학사 학위를 취득했으며, Node.js, TypeScript, JavaScript, React를 전문으로 하는 프론트엔드 개발자입니다. 직관적이고 미적으로 뛰어난 사용자 인터페이스를 만드는 데 열정을 가진 그는 최신 프레임워크를 활용하고, 잘 구성되고 시각적으로 매력적인 매뉴얼을 제작하는 것을 즐깁니다.

커티스는 개발 분야 외에도 사물 인터넷(IoT)에 깊은 관심을 가지고 있으며, 하드웨어와 소프트웨어를 통합하는 혁신적인 방법을 연구합니다. 여가 시간에는 게임을 즐기거나 디스코드 봇을 만들면서 기술에 대한 애정과 창의성을 결합합니다.

시작할 준비 되셨나요?
Nuget 다운로드 20,088,359 | 버전: 2026.7 방금 출시
Still Scrolling Icon

아직도 스크롤하고 계신가요?

빠른 증거를 원하시나요? PM > Install-Package IronPdf
샘플을 실행하세요 HTML이 PDF로 변환되는 것을 지켜보세요.