목록으로

한국어 혼합 레이아웃 문서에서 표 구조를 복원하는 그래프 기반 방법

한서윤, 오지훈, 문태경

기술 리포트 · GR-2026-082026.08.12

문서 이해#가늠 PAGE

요약

금융·공공 서류의 표는 선이 끊기거나 칸이 병합되고, 본문과 표가 한 페이지에 섞여 있습니다. 본 리포트는 셀 후보를 노드로, 셀 사이의 정렬 관계를 간선으로 표현한 그래프에서 행과 열을 복원하는 방법을 제안하고, 사내 구축 문서 1,200쪽에서 기존 규칙 기반 방식보다 병합 셀 복원 정확도가 개선됨을 보입니다(예시 데이터).

그림 1. 셀 후보를 노드로, 인접 관계를 간선으로 두고 행과 열을 복원하는 과정
그림 1. 셀 후보를 노드로, 인접 관계를 간선으로 두고 행과 열을 복원하는 과정

배경

은행 신청서, 보험 청구서, 민원 서식에는 대부분 표가 들어 있습니다. 사람에게는 줄과 칸이 분명해 보이지만, 스캔 과정에서 선이 끊기거나 칸이 병합된 표는 글자 인식이 완벽해도 어떤 값이 어떤 항목에 속하는지 알기 어렵습니다. 실제 도입 현장에서 발생한 추출 오류를 분류해 보면 글자를 잘못 읽은 경우보다 값을 엉뚱한 칸에 연결한 경우가 더 많았습니다.

문제 정의

우리는 표 인식을 '글자 읽기'가 아니라 '관계 복원' 문제로 다시 정의했습니다. 입력은 페이지 이미지와 글자 인식 결과이고, 출력은 각 셀의 행·열 범위와 셀 사이의 소속 관계입니다. 특히 줄 없는 표와 여러 칸에 걸친 병합 셀, 표 바깥 본문과 표 안 텍스트가 가깝게 붙은 경우를 핵심 난제로 삼았습니다.

방법

먼저 페이지에서 셀 후보 영역을 검출하고 각 후보를 그래프의 노드로 둡니다. 두 후보가 같은 행이나 열에 정렬되어 있을 가능성을 위치, 글자 크기, 주변 선의 흔적으로 계산해 간선의 가중치로 사용합니다. 이렇게 만든 그래프에서 강하게 연결된 노드 묶음을 행과 열로 모으고, 한 노드가 여러 묶음에 걸치면 병합 셀로 판단합니다. 표 바깥 본문은 그래프에서 연결이 약한 노드로 남기 때문에 자연스럽게 분리됩니다.

실험 설정

평가는 사내에서 구축한 한국어 혼합 레이아웃 문서 1,200쪽으로 진행했습니다. 대출 신청서, 보험금 청구서, 주민 민원 서식 등 12종이며 개인정보는 모두 가상 값으로 바꿨습니다. 비교 대상은 선 검출에 기반한 규칙 방식과 이미지 분할 방식입니다.

결과

병합 셀이 포함된 표에서 셀 소속 정확도는 규칙 방식 대비 크게 올랐고, 줄 없는 표에서도 안정적인 결과를 보였습니다(예시 수치는 본문 표 참고). 반면 한 셀 안에 여러 줄의 손글씨가 겹쳐 쓰인 경우에는 여전히 행을 잘못 나누는 사례가 남았습니다.

한계와 다음 단계

현재 방법은 페이지를 넘어 이어지는 표를 하나로 합치지 못합니다. 다음 리포트에서는 페이지 경계를 가로지르는 표 연결과 손글씨가 섞인 셀의 분리를 다룰 예정입니다. 이 방법은 가늠 PAGE 3의 표 인식 단계에 적용되었습니다.

이 연구가 적용된 솔루션가늠 PAGE