언어 바꾸기English
이전 목록

"학습 데이터 오염 막아라"...AI 기업들, 오프라인 '인쇄 서적' 대량 확보 총력전

"Prevent training data contamination"...AI companies go all out to secure large quantities of offline printed books

TL;DR AI

핵심 요약

1분
  1. 인터넷의 합성 콘텐츠가 늘며 학습 데이터 품질이 떨어지자, AI 기업들이 더 나은 데이터를 확보하려고 중고 인쇄 서적을 대량 매입하고 있다.

  2. 2022년 이전 출간 도서를 중심으로 ISBNdb, Alibris, Biblio 같은 유통망을 통해 책을 확보한 뒤 스캔·디지털화해 학습에 활용한다.

  3. 일부 사례에서는 고속 스캔을 위해 책을 분해하고, 실물은 폐기하는 방식도 쓰이는 것으로 전해졌다.

  4. 이 과정은 저작권 분쟁을 키우는 동시에, 책의 폐기와 디지털화 통제로 문화유산 접근성이 훼손될 수 있다는 우려를 낳고 있다.

원문 보기