본문으로 건너뛰기
AZ Tools

PDF 텍스트 추출

PDF 뷰어에서 그냥 복사하면 결과가 지저분합니다. 페이지마다 머리글과 바닥글이 섞여 들어오고, 단이 뒤엉키고, 문장 한가운데에 줄바꿈이 들어갑니다. 이 도구는 문서의 텍스트 레이어를 직접 읽어 전체를 편집 가능한 상자 하나에 담아줍니다. 메모·번역기·스프레드시트에 그대로 붙여 넣으면 됩니다. '문단 다시 잇기'를 켜면 편집 과정에서 박힌 줄바꿈을 되돌립니다 — 잘린 줄을 다시 잇고, 붙임표로 쪼개진 단어를 붙이며, 글머리 기호와 번호 항목은 그대로 둡니다. 페이지 표시를 남겨 어디서 페이지가 바뀌었는지 알 수도 있고, 지워서 깔끔한 문장만 얻을 수도 있습니다. 스캔본이라면 뽑을 글자가 아예 없는데, 이때는 빈 상자를 내미는 대신 그 사실을 알려줍니다. 모든 처리는 브라우저 안에서 이뤄지므로 계약서나 급여명세서가 기기를 벗어나지 않습니다.

사용법

  1. PDF를 상자에 끌어다 놓거나, 상자를 눌러 파일을 고르세요.
  2. '전체 페이지'를 그대로 두거나, '페이지 범위'로 바꿔 `1-3, 5`처럼 입력하세요.
  3. `--- 페이지 n ---` 표시를 남길지, 문단을 다시 이을지 정하세요.
  4. 추출을 누른 뒤 텍스트를 복사하거나 .txt로 내려받으세요.

자주 묻는 질문

제 PDF가 어딘가로 업로드되나요?
아니요. 문서는 브라우저 탭 안에서만 열리고 읽힙니다. 서버로 전송되는 것이 없고, 탭을 닫으면 사본도 남지 않습니다.
아무것도 안 나옵니다. 분명 글자가 보이는데요.
그렇다면 거의 확실히 스캔본입니다. 페이지를 찍은 그림이라 선택할 수 있는 텍스트 레이어가 없습니다. 여기서 글자를 뽑으려면 OCR이 필요한데, 이 도구는 OCR을 하지 않습니다. 페이지를 이미지로 변환해 OCR 도구에 넣는 방법은 있습니다.
'문단 다시 잇기'는 정확히 뭘 바꾸나요?
PDF는 화면에 보이는 줄을 하나씩 따로 저장합니다. 그래서 문단이 80자쯤마다 끊긴 채로 나옵니다. 다시 잇기는 문장 끝이 아닌 곳에서 끊긴 줄을 붙이고, 붙임표로 나뉜 단어를 복구하며, 빈 줄·글머리 기호·번호 항목은 건드리지 않습니다.
2단 문서인데 글이 뒤섞여 나옵니다.
텍스트는 문서가 저장해둔 순서대로 나옵니다. 다단 레이아웃은 대개 단 단위로 저장되지만 항상 그런 것은 아닙니다. 한 페이지씩 범위를 지정해 뽑으면 무슨 일이 일어났는지 보기 쉽고 고치기도 쉽습니다.
표·간격·굵게 같은 서식은 유지되나요?
아니요. 결과는 순수 텍스트입니다. 읽는 순서대로의 단어와 줄·페이지 구분만 남습니다. 표의 칸은 평범한 글자 덩어리로 나오고, 글꼴 서식은 모두 사라집니다.

이 주제의 가이드

관련 도구