본문으로 건너뛰기
AZ Tools

EPUB 뷰어 · 메타데이터 · 텍스트 추출

.epub은 구조가 엄격하게 정해진 ZIP 파일입니다. 그래서 겉보기에 멀쩡한 책도 아무 설명 없이 뷰어에서 열리지 않는 일이 생깁니다. 이 도구는 파일을 열어 무엇이 들어 있는지 알려줍니다. 제목, 저자, 언어, 출판사, 발행일, 식별자, 주제어와 함께 읽는 순서, 챕터별 단어 수, 그리고 원하는 챕터나 책 전체의 본문 텍스트를 보여줍니다. 또한 뷰어가 파일을 열지 말지 결정하는 구조 검사도 수행합니다. mimetype 항목은 아카이브의 첫 번째여야 하고 압축하지 않은 상태로 저장되어야 합니다. 뷰어는 아무것도 풀지 않은 채 그 바이트를 그대로 읽어 책인지 판별하기 때문에, mimetype이 압축되었거나 마지막에 기록된 책은 ZIP으로는 완벽히 유효해도 첫 단계에서 실패합니다. 그 밖에 컨테이너가 실제로 존재하는 패키지 파일을 가리키는지, 읽는 순서의 각 항목이 매니페스트에서 찾아지는지, 매니페스트에 적힌 파일이 실제로 들어 있는지, 목차가 있는지를 확인합니다. 단어 수는 그 자체로 유용합니다. 이 책이 실제로 얼마나 긴지, 어디가 늘어지는지 알 수 있으니까요. 추출한 텍스트는 검색·비교·붙여넣기에 바로 쓸 수 있습니다. 모든 처리는 브라우저에서 이뤄지고 책은 업로드되지 않습니다.

.epub 파일을 끌어다 놓으면 내용이 표시됩니다.

사용법

  1. .epub 파일을 끌어다 놓거나 클릭해서 선택하세요.
  2. 메타데이터 영역에서 제목, 저자, 언어, 출판사, 식별자, 주제어를 확인하세요.
  3. 구조 검사 목록을 보세요. 빨간 표시가 뷰어가 책을 거부하는 이유입니다.
  4. 목차 표에서 읽는 순서와 챕터별 단어 수를 확인하세요.
  5. 챕터나 책 전체를 선택해 본문 텍스트를 복사하거나 내려받으세요.

자주 묻는 질문

mimetype 파일이 왜 맨 앞에, 압축 없이 있어야 하나요?
뷰어가 아무것도 풀지 않은 채, 정해진 위치의 정해진 바이트 수만 읽고 파일 종류를 판별할 수 있어야 하기 때문입니다. OCF 컨테이너 규격에 정의된 규칙입니다. 이를 어긴 책도 ZIP으로는 유효하기 때문에, 뷰어가 그냥 거부하는 모습이 더 이해하기 어려워 보입니다.
어떤 앱에서는 열리는데 다른 앱에서는 안 열립니다.
뷰어마다 관대함이 다릅니다. 여기서 하는 검사는 엄격한 뷰어가 적용하는 항목이라, 빨간 표시가 대개 그 차이를 설명해 줍니다. 매니페스트에 적혔지만 없는 파일, 아무것도 가리키지 않는 읽기 순서 항목, 잘못 기록된 mimetype 같은 것들입니다.
단어 수는 어떻게 계산하나요?
각 챕터에서 마크업, 스크립트, 스타일을 걷어낸 뒤 남은 텍스트를 공백으로 나눕니다. 글자 수도 함께 보여주는데, 단어를 공백으로 구분하지 않는 한국어·중국어·일본어에서는 글자 수가 더 의미 있는 값입니다.
이미지와 서식도 보여주나요?
아니요. 이 도구는 파일에 무엇이 들어 있는지 보는 뷰어이지 독서 앱이 아닙니다. 검색·집계·비교·붙여넣기를 할 수 있도록 텍스트를 추출합니다. 이미지와 레이아웃은 파일 안에 그대로 남습니다.
DRM이 걸린 책도 되나요?
아니요. 서점에서 받은 DRM 적용 책은 본문이 암호화되어 있어 브라우저에서 읽을 수 없습니다. DRM 없이 내보낸 파일은 정상적으로 열립니다.
책이 어디론가 업로드되나요?
아니요. 파일은 브라우저에서 압축을 풀고 분석하며, 서버로 전송되는 것은 없습니다.

관련 도구