StarDoc-AI/TeleOCR
TeleOCR — 디지털 문서와 촬영 문서를 함께 파싱하는 12억 파라미터 모델
TeleOCR은 디지털 문서와 카메라로 촬영한 문서를 함께 처리하도록 설계한 오픈소스 문서 파싱 모델입니다. 12억 파라미터 규모로 텍스트·표·수식·레이아웃을 분석하며, 공개 벤치마크와 Dr.DocBench Challenge 결과를 제시합니다.
- 주제
AI 요약
TeleOCR은 문서 이미지에서 텍스트만 읽는 데 그치지 않고, 표와 수식, 읽기 순서, 레이아웃까지 파싱하는 12억 파라미터 규모의 오픈소스 Vision-Language Model(VLM)입니다. 개발팀은 디지털 문서와 카메라 촬영 문서를 따로 다루던 기존 접근과 달리 두 입력 유형을 하나의 프레임워크로 처리하도록 설계했습니다. 2026년 8월 17일 NaviDC-OCR 이름으로 가중치와 기술 보고서를 공개했고, 이후 TeleOCR로 이름을 바꿔 후속 모델을 개발한다고 밝혔습니다.
학습과 문서 표현
모델에는 여러 기법을 결합했습니다. Multi-node Consensus Voting(MCV)으로 의사 라벨을 자동 생성하고, 촬영 문서의 기하학적 왜곡을 반영하는 모델링을 적용합니다. 곡선 형태 문서의 경계 정보를 다루기 위해 Curvature-Guided Douglas-Peucker Sampling(CGDP)을 도입했으며, 이미지 간 자기 검증으로 학습 데이터를 정제합니다. 학습은 네 단계로 진행하고, 표와 수식에서는 내용과 구조를 분리해 학습하는 Content-Structure Decoupled Learning을 사용합니다.
개발팀은 DocUNet과 DIR300 같은 문서 왜곡 보정 데이터셋에서 시각 평가도 진행했다고 설명합니다. 별도의 왜곡 보정 전처리나 전용 교정 모델 없이, 기울거나 휘어진 문서 이미지에서 레이아웃과 내용을 바로 파싱하는 방식입니다. 제공된 비교표의 clean·디지털 열화·실제 열화 조건에서 TeleOCR의 overall 점수는 각각 86.90, 77.47, 70.85입니다. 같은 표에 실린 비교 모델 중 이 세 조건 모두에서 가장 높은 overall 값입니다. 실제 열화 조건의 표 점수는 77.66이며, 텍스트 오류 지표는 0.302입니다. 해당 표에서 overall·표 점수는 높을수록 좋고 텍스트 오류는 낮을수록 좋습니다.
공개 벤치마크 결과
제공된 전문 문서 파싱 비교표에서 TeleOCR은 1.2B 파라미터로 overall 96.87을 기록했습니다. 비교 대상인 OvisOCR2(0.8B)는 96.58, PaddleOCR-VL-1.6(0.9B)은 96.33, MinerU2.5-Pro(1.2B)는 95.75입니다. TeleOCR의 표 TEDS는 97.05, TEDS-S는 98.52, 읽기 순서 편집 오류는 0.122입니다. 수식 CDM은 96.36으로 표에 나온 모델 가운데 가장 높지는 않습니다. OvisOCR2가 97.53, PaddleOCR-VL-1.6과 HunyuanOCR-1.5가 각각 97.49를 기록했습니다. 지표마다 강점이 다르므로 overall 순위와 세부 항목을 나눠 볼 필요가 있습니다.
디지털 문서와 촬영 문서를 함께 평가한 비교에서는 TeleOCR의 overall이 67.96입니다. MinerU 2.5 Pro는 62.26, OvisOCR2는 59.25, PaddleOCR-VL 1.6은 55.11입니다. 다만 이 표에서 TeleOCR의 표 TEDS는 64.97로 MinerU 2.5 Pro의 67.75보다 낮고, 수식 CDM도 0.02로 PaddleOCR-VL 1.6의 0.21보다 낮습니다. 서로 다른 표의 평가 설정과 지표는 구분해야 합니다.
개발팀은 EMNLP 2026 Dr.DocBench Challenge 결과도 공개했습니다. 표에서 TeleOCR 팀은 RMS 17.23, TEDS 66.39, 가중 점수 41.81로 1위이며, VLMinators 팀은 가중 점수 40.80으로 뒤를 이었습니다. 개발팀은 NaviDC-OCR의 기본 가중치로 MinerU 2.5 Pro와 PaddleOCR-VL 1.6보다 좋은 결과를 얻었다고 소개했습니다.
실행과 배포
모델 페이지의 예제는 Transformers, PyTorch, Pillow를 설치하고 AutoProcessor와 AutoModel로 모델을 불러옵니다. 예제에서는 bfloat16 가중치를 사용해 CUDA 장치에서 추론하며, 프롬프트에 따라 이미지의 텍스트·표·수식·레이아웃을 각각 출력합니다. 표 결과는 OTSL 형식으로 생성한 뒤 HTML로 변환하고, 수식은 LaTeX로 정리합니다. 전체 문서 파싱은 연결된 GitHub 저장소를 참고하도록 안내합니다. 커뮤니티 기여로 GGUF 변환과 llama.cpp 지원도 언급하며, Ascend 910B 배포 경험이 공유됐다고 밝혔습니다.
원문: Hugging Face / 번역·요약: Trawling