나라지식정보
Ancient Document Cube · 고문헌 AI OCR

A DOC CUBE기록을 읽고, 지식으로 잇다

초서·행서·해서, 국한문 혼용과 복잡한 세로쓰기까지. 문자 영역과 순서를 인식하고 사람이 검수·보완하는 고문헌 전문 AI OCR 작업 환경입니다.

A DOC CUBE가 강한집 고문헌의 한자 영역을 인식하고 표점·번역 정보를 제공하는 화면
고문헌 원문, 문자 인식 결과, 표점·번역과 문자 정보를 함께 확인
KOLAS 공인 시험시험성적서 2024-212-VSW-K
DHEAC 2025 우수연구근대 시기 문서 다국어 OCR 개발
2022년부터 연구·개발고문헌 인식과 어노테이션 기술 고도화

Specialized recognition

고문헌을 위한 세 가지 핵심 경쟁력

현대 인쇄문서와 다른 서체·배치·손상 문제를 고려해 문자 인식과 데이터 제작 도구를 함께 설계했습니다.

01

국한문 혼용 인식

한자와 한글이 함께 쓰인 근대문서에서 문자를 구분하고 순서에 맞춰 추출합니다.

02

다양한 서체·작은 한자

초서·행서·해서와 작은 글자, 불균형한 간격 등 고문헌 특유의 난도를 다룹니다.

03

복잡한 지면 구조

세로쓰기, 다단, 주석과 본문이 섞인 판면에서 문자 영역과 읽기 순서를 분석합니다.

04

자동 어노테이션

초기 바운딩 박스와 라벨을 자동 생성해 학습데이터 구축의 반복 작업을 줄입니다.

05

전문가 검수 도구

오인식과 영역을 바로잡고 번호·순서를 조정하며 결과를 단계별로 검수합니다.

06

지식 활용 연결

텍스트와 JSON으로 저장해 검색, 아카이브, 번역·표점과 디지털 인문학 연구에 연결합니다.

KOLAS-accredited test

공인 시험으로 확인한 인식 성능

KS X ISO/IEC 25023:2016 기능 적합성·정확성 항목에 따라 해당 시험대상과 시험환경에서 측정한 결과입니다.

89%초서 인식
97%해서 인식
98%행서 인식
96%문자 바운딩 박스

수치는 시험성적서 2024-212-VSW-K의 해당 시험 결과이며, 문서 상태·서체·촬영 품질과 구축 환경에 따라 실제 결과가 달라질 수 있습니다.

국한문 혼용과 복합 구조 문서의 A DOC CUBE 인식 정확도 분석 화면
혼용문자와 복잡한 판면을 함께 처리하는 고문헌 특화 기술

AI annotation workbench

사람과 AI가 함께 완성하는 데이터 제작 흐름

고문헌은 완전 자동화보다 전문가의 판단을 빠르게 반영하는 검수 환경이 중요합니다.

  1. 프로젝트·업로드원본 이미지와 담당자·검수자를 프로젝트 단위로 관리
  2. 정리·전처리해상도와 문헌별 이미지를 구분하고 정제
  3. 자동 인식문자 영역·라벨과 1차 OCR 결과를 생성
  4. 전문가 검수오인식·영역·읽기 순서를 보정하고 오류 점검
  5. 저장·관리고품질 결과를 저장하고 목록·이력 관리
  6. 모델 고도화검수 데이터를 성능 검증과 모델 개선에 활용
  7. 검색·번역 연계표점·번역·검색 서비스와 후속 연구에 연결
  8. 기관 환경 배포웹 기반 또는 보안 요구에 맞춘 구축 방식 협의

Research & recognition

국제 연구 현장에서 검증한 기술

고문헌 OCR 연구와 실제 도구 개발을 병행하며 국제 경진·학술대회에서 성과를 축적했습니다.

2023 · ICDAR

국제 문서분석·인식 학회 참가

고전문자 인식 기술을 국제 연구 현장에서 시연하고 교류했습니다.

2023 · HTR-Greek

그리스 문자 인식 국제대회 3위

FAU 주최 역사문자 인식 경진에서 인식 기술의 확장성을 확인했습니다.

2025.07.22 · DHEAC

근대문서 다국어 OCR 우수연구

제4회 동아시아 고전학 디지털 인문학 국제학술대회에서 우수연구로 선정됐습니다.

보유 문헌으로 적용 가능성을 확인하세요.

문헌 유형·서체·분량에 맞춰 샘플 인식과 데이터 구축 방식을 검토합니다.