AI 기술2026년 8월 11일 08:25

오래된 OCR 오인식이 AI 학습 데이터를 오염시킨다

Hugging Face와 EleutherAI가 공동 프로젝트 「FineBooks」로서 오픈소스 OCR 모델 14종류를 2,000페이지 이상의 역사 서적으로 테스트했다. 최고 정확도 모델 「dots.mocr」은 문자 정확도 97.6%를 달성했으며, 비용은 1,000페이지당 2달러 미만이다. AI 학습 데이터로는 충분한 수준이지만 학술적 전사로는 부족하다고 평가하고 있다.

오래된 OCR 오인식이 AI 학습 데이터를 오염시킨다

Hugging Face와 EleutherAI가 공동으로 진행하는 「FineBooks」 프로젝트는 역사적 서적을 디지털화할 때 사용되는 OCR(문자 인식) 기술의 정확도를 대규모로 평가했다. 오픈소스 OCR 모델 14종류를 대상으로 2,000페이지 이상의 역사 서적 스캔 이미지에서 테스트를 실시하여 각 모델의 성능과 실용성을 비교했다.

원래 OCR이란 종이 책이나 문서를 스캔한 이미지에서 문자를 읽어 텍스트 데이터로 변환하는 기술이다. 오래된 서체나 인쇄 흐릿함·왜곡이 많은 역사적 서적에서는 현대 문서보다 정확한 읽기가 어렵고 오류가 발생하기 쉽다. 이러한 오류를 포함한 텍스트가 AI의 학습 데이터로 사용되면 모델이 잘못된 언어 패턴을 학습할 가능성이 있으며, 데이터 품질 확보가 과제가 된다.

테스트 결과, 가장 정확도가 높았던 모델은 「dots.mocr」이며, 문자 단위의 정확성(문자 정확도)은 97.6%에 달했다. 비용 측면에서도 1,000페이지당 2달러 미만으로 낮게 유지되어 대량의 서적을 디지털화하는 용도에서 현실적인 운영이 예상되는 수준이다. 한편 프로젝트 팀은 이 정확도를 「AI의 학습 데이터로는 충분하지만 학술적 전사로는 부족하다」고 평가하고 있다. 역사 연구 등에서 한 글자 한 글자의 정확성이 요구되는 상황에서는 아직 추가적인 개선이 필요하다는 것이다.

이 프로젝트가 주목받는 배경에는 최근 AI 개발에서 데이터 품질에 대한 인식이 높아지고 있다는 점이 있다. 대규모 언어 모델(LLM)의 성능은 학습에 사용되는 데이터의 양뿐만 아니라 질에도 영향을 받으므로, 오타나 문자 깨짐이 섞인 텍스트는 학습 효과를 저하시키는 요인이 될 수 있다. 인터넷의 현대적 텍스트는 이미 대량으로 활용되고 있으며, 서적 및 문서 아카이브는 다음의 유력한 데이터 소스로 위치 지워지고 있다.

역사적 서적의 디지털화는 도서관이나 연구 기관이 그동안 오랫동안 취해온 분야이지만, 품질 기준이 학술 용도에 설정되어 있었기 때문에 비용 측면의 제약도 컸다. FineBooks의 접근 방식은 AI 학습 용도에 한정함으로써 비용과 정확도의 균형을 현실적인 수준으로 다시 조정하는 것으로 볼 수 있다. 이 「학술 용도 미만이지만 AI 용도로는 충분하다」는 생각은 대규모 데이터 정비를 진행하는 데 있어 하나의 실용적인 지침이 될 수 있다.

향후 초점은 97.6%라는 문자 정확도가 AI 학습 현장에서 어느 정도 통용될 수 있는지에 있다. 남은 약 2.4%의 오류가 장문 텍스트 전체에 누적된 경우의 영향은 문맥에 따라 다르므로, 실제 학습에 미치는 영향을 지속적으로 검증해야 한다. 또한 역사적 서적의 문체와 어휘가 AI 모델의 언어 능력 다양화에 어떻게 기여하는지도 계속 주목할 점이라고 할 수 있다.

#OCR#학습데이터#LLM#데이터품질#HuggingFace#오픈소스#디지털아카이브
AI issue 편집부

본 기사는 AI issue 편집부가 사실(fact)을 바탕으로 독자적으로 작성·편집한 저작물입니다. 저작권은 AI issue에 있으며, 무단 전재·재배포 및 AI 학습·활용을 금합니다.

댓글

댓글을 작성하려면 로그인하세요