밀집된 테이블에서 순서가 뒤바뀐 텍스트 추출
밀집된 테이블 또는 양식 레이아웃에서 추출된 텍스트는 스크램블된 것처럼 보입니다. 인접한 행의 문자가 섞여, 예를 들어, "고유 번호 123456789"가 "U123456789nique Number"로 추출됩니다.
이것은 밀집된 레이아웃에 대한 page.Lines 추출의 알려진 제한 사항입니다. page.Lines은 구성할 수 없는 내장된 수직 공차를 사용하여 문자를 그룹화합니다. 테이블 셀의 두 개의 가시적인 행이 포인트 또는 두 포인트밖에 떨어져 있지 않을 때, 그룹화 기는 두 행을 하나의 논리적 행으로 병합하고 문자를 좌에서 우로 정렬하며, 서로 섞이게 합니다. ExtractTextFromPage(i) 메서드는 기본적으로 콘텐츠 스트림 순서를 사용하며, 이는 양식 PDF에서 시각적 읽기 순서와 일치하지 않을 수 있습니다.
해결책
추천: 조정 가능한 관용을 가진 TextChunks로 추출
각 TextChunk은 BoundingBox을 노출하여 수직 위치로 그룹화하고 각 행 내에서 수평 위치로 정렬할 수 있게 합니다:
using IronPdf.Pages;
using System.Text;
static string ExtractTextUsingTextChunks(IPdfPage page, double rowTolerance = 2.0)
{
var rows = page.TextChunks
.Where(c => !string.IsNullOrWhiteSpace(c.Contents))
.GroupBy(c => Math.Round(c.BoundingBox.Top / rowTolerance) * rowTolerance)
.OrderByDescending(g => g.Key);
var extractedText = new StringBuilder();
foreach (var row in rows)
{
var line = string.Join(" ",
row.OrderBy(c => c.BoundingBox.Left)
.Select(c => c.Contents.Trim())
.Where(text => !string.IsNullOrWhiteSpace(text)));
extractedText.AppendLine(line);
}
return extractedText.ToString();
}
using IronPdf.Pages;
using System.Text;
static string ExtractTextUsingTextChunks(IPdfPage page, double rowTolerance = 2.0)
{
var rows = page.TextChunks
.Where(c => !string.IsNullOrWhiteSpace(c.Contents))
.GroupBy(c => Math.Round(c.BoundingBox.Top / rowTolerance) * rowTolerance)
.OrderByDescending(g => g.Key);
var extractedText = new StringBuilder();
foreach (var row in rows)
{
var line = string.Join(" ",
row.OrderBy(c => c.BoundingBox.Left)
.Select(c => c.Contents.Trim())
.Where(text => !string.IsNullOrWhiteSpace(text)));
extractedText.AppendLine(line);
}
return extractedText.ToString();
}
Imports IronPdf.Pages
Imports System.Text
Private Shared Function ExtractTextUsingTextChunks(page As IPdfPage, Optional rowTolerance As Double = 2.0) As String
Dim rows = page.TextChunks _
.Where(Function(c) Not String.IsNullOrWhiteSpace(c.Contents)) _
.GroupBy(Function(c) Math.Round(c.BoundingBox.Top / rowTolerance) * rowTolerance) _
.OrderByDescending(Function(g) g.Key)
Dim extractedText As New StringBuilder()
For Each row In rows
Dim line = String.Join(" ", row.OrderBy(Function(c) c.BoundingBox.Left) _
.Select(Function(c) c.Contents.Trim()) _
.Where(Function(text) Not String.IsNullOrWhiteSpace(text)))
extractedText.AppendLine(line)
Next
Return extractedText.ToString()
End Function
rowTolerance = 2.0부터 시작하십시오. 행이 아직도 병합되면 이를 1.0이나 0.5으로 낮추십시오. 더 세밀한 제어를 위해 page.Characters을 page.TextChunks로 대체하십시오.
대안: 시각적 순서 추출
오직 콘텐츠 스트림 순서만 잘못된 PDF를 위해:
pdf.ExtractTextFromPage(i, TextExtractionOrder.VisualOrder);
pdf.ExtractTextFromPage(i, TextExtractionOrder.VisualOrder);
pdf.ExtractTextFromPage(i, TextExtractionOrder.VisualOrder)
행이 시각적으로 매우 가까운 PDF의 경우, TextChunks 접근 방식이 보다 엄격한 공차를 더 잘 처리합니다.

