본문 바로가기

인공지능

Unlimited-OCR로 살펴보는 장문 문서 파싱 OCR 기술과 활용 방법

728x90
반응형
728x170

이 글에서는 최신 OCR 기술인 Unlimited-OCR를 중심으로, 기존 OCR이 가지던 한계를 어떻게 확장했는지, 어떤 배경에서 등장했는지, 그리고 실제로 어떻게 사용할 수 있는지를 정리합니다. 특히 긴 문서와 다중 페이지를 한 번의 추론으로 처리하는 ‘One-shot Long-horizon Parsing’ 개념을 기반으로, 기술적 특징과 활용 방법을 이해하기 쉽게 설명합니다.

반응형

Unlimited-OCR 개요와 등장 배경

Unlimited-OCR은 기존 OCR 모델들이 상대적으로 취약했던 장문 문서, 복잡한 레이아웃, 다중 페이지 PDF 처리 문제를 해결하기 위해 제안된 모델입니다.
기존 OCR은 페이지 단위로 나누어 처리하거나, 문맥 길이에 제한이 있어 전체 문서의 구조를 이해하는 데 한계가 있었습니다.

Unlimited-OCR은 이러한 문제를 해결하기 위해 최대 32,768 토큰의 긴 컨텍스트를 지원하며, 문서를 한 번의 추론 과정에서 파싱할 수 있도록 설계되었습니다. 이를 통해 문서 전체 흐름과 구조를 유지한 OCR 결과를 얻는 것이 핵심 목표입니다.

이 모델은 Baidu에서 공개한 모델로, Deepseek-OCR 계열의 접근 방식을 한 단계 확장하는 방향으로 개발되었습니다.


One-shot Long-horizon Parsing이란 무엇인가

Unlimited-OCR의 핵심 개념은 One-shot Long-horizon Parsing입니다.
이는 문서를 여러 조각으로 나누지 않고, 한 번의 추론으로 긴 문서를 끝까지 이해하고 파싱하는 방식입니다.

이 접근 방식의 장점은 다음과 같습니다.

  • 페이지 간 문맥 단절이 줄어듦
  • 표, 문단, 헤더 등 문서 구조 인식 정확도 향상
  • 긴 PDF나 보고서 처리 시 후처리 부담 감소

특히 계약서, 연구 보고서, 기술 문서처럼 페이지 간 연결성이 중요한 문서에서 강점을 보입니다.


Unlimited-OCR의 주요 기술적 특징

Unlimited-OCR은 다음과 같은 기술적 특징을 갖습니다.

1. 초장문 컨텍스트 지원

최대 32,768 토큰 길이를 지원해 다중 페이지 문서를 하나의 흐름으로 처리할 수 있습니다.

2. 이미지 처리 모드 제공

단일 이미지에 대해 두 가지 설정을 지원합니다.

  • gundam 모드
    이미지 크기를 줄이고 크롭을 활용해 복잡한 문서에 최적화
  • base 모드
    원본 해상도를 유지하며 안정적인 파싱 제공

다중 페이지 및 PDF는 base 모드만 사용합니다.

3. 반복 억제 로직

No-repeat ngram 설정과 윈도우 기반 반복 억제 로직을 통해 OCR 결과에서 중복 텍스트가 발생하는 문제를 줄입니다.


Transformers 기반 추론 방식

Unlimited-OCR은 Hugging Face Transformers 환경에서 바로 사용할 수 있도록 설계되었습니다.
NVIDIA GPU 환경에서 Python과 CUDA를 기반으로 추론이 가능하며, 단일 이미지, 다중 이미지, PDF까지 동일한 흐름으로 처리할 수 있습니다.

단일 이미지 OCR 예시 개념

  • 모델과 토크나이저 로드
  • 이미지 파일 입력
  • 출력 디렉터리 지정
  • gundam 또는 base 설정 선택

이 방식은 스캔 문서나 이미지 기반 리포트를 빠르게 처리할 때 적합합니다.


다중 페이지 및 PDF 문서 처리 방식

Unlimited-OCR은 PDF를 직접 입력받기보다는, PDF를 이미지로 변환한 뒤 다중 페이지 추론을 수행합니다.

처리 흐름은 다음과 같습니다.

  1. PDF를 페이지 단위 이미지로 변환
  2. 변환된 이미지 리스트를 모델에 입력
  3. 하나의 OCR 결과로 통합 출력

이 방식 덕분에 페이지 수가 많은 문서도 구조를 유지한 상태로 파싱할 수 있습니다.


SGLang 서버 기반 활용 시나리오

Unlimited-OCR은 SGLang 서버로 실행해 OpenAI 호환 API 형태로도 사용할 수 있습니다.
이를 통해 다음과 같은 활용이 가능합니다.

  • 스트리밍 방식 OCR 결과 수신
  • 서버 기반 대규모 문서 처리
  • OCR 파이프라인을 서비스 형태로 운영

특히 사내 문서 자동화나 OCR 기반 데이터 파이프라인을 구축할 때 유용한 구조입니다.


기존 OCR 모델과의 관계

Unlimited-OCR은 다음과 같은 기존 OCR 모델에서 아이디어와 구조적 영감을 받았습니다.

  • Deepseek-OCR
  • Deepseek-OCR-2
  • PaddleOCR

이 모델들의 강점을 기반으로, 긴 문서 처리와 문맥 확장이라는 방향으로 진화한 결과물이 Unlimited-OCR입니다.


728x90

Unlimited-OCR은 단순히 텍스트를 인식하는 OCR을 넘어, 문서를 이해하는 OCR에 가까운 접근을 보여줍니다.
장문 문서와 다중 페이지 처리에 강점을 가지며, 후처리 부담을 줄이고 구조화된 결과를 제공하는 점이 핵심 가치입니다.

앞으로 보고서 자동화, 계약서 분석, 기술 문서 파싱과 같은 영역에서 Unlimited-OCR은 기존 OCR 대비 더 높은 생산성과 정확도를 기대할 수 있는 솔루션으로 활용될 가능성이 큽니다.

300x250

https://huggingface.co/baidu/Unlimited-OCR

 

baidu/Unlimited-OCR · Hugging Face

We’re on a journey to advance and democratize artificial intelligence through open source and open science.

huggingface.co

728x90
반응형
그리드형