PDF 텍스트 추출
PDF 뷰어에서 그냥 복사하면 결과가 지저분합니다. 페이지마다 머리글과 바닥글이 섞여 들어오고, 단이 뒤엉키고, 문장 한가운데에 줄바꿈이 들어갑니다. 이 도구는 문서의 텍스트 레이어를 직접 읽어 전체를 편집 가능한 상자 하나에 담아줍니다. 메모·번역기·스프레드시트에 그대로 붙여 넣으면 됩니다. '문단 다시 잇기'를 켜면 편집 과정에서 박힌 줄바꿈을 되돌립니다 — 잘린 줄을 다시 잇고, 붙임표로 쪼개진 단어를 붙이며, 글머리 기호와 번호 항목은 그대로 둡니다. 페이지 표시를 남겨 어디서 페이지가 바뀌었는지 알 수도 있고, 지워서 깔끔한 문장만 얻을 수도 있습니다. 스캔본이라면 뽑을 글자가 아예 없는데, 이때는 빈 상자를 내미는 대신 그 사실을 알려줍니다. 모든 처리는 브라우저 안에서 이뤄지므로 계약서나 급여명세서가 기기를 벗어나지 않습니다.
사용법
- PDF를 상자에 끌어다 놓거나, 상자를 눌러 파일을 고르세요.
- '전체 페이지'를 그대로 두거나, '페이지 범위'로 바꿔 `1-3, 5`처럼 입력하세요.
- `--- 페이지 n ---` 표시를 남길지, 문단을 다시 이을지 정하세요.
- 추출을 누른 뒤 텍스트를 복사하거나 .txt로 내려받으세요.
자주 묻는 질문
- 제 PDF가 어딘가로 업로드되나요?
- 아니요. 문서는 브라우저 탭 안에서만 열리고 읽힙니다. 서버로 전송되는 것이 없고, 탭을 닫으면 사본도 남지 않습니다.
- 아무것도 안 나옵니다. 분명 글자가 보이는데요.
- 그렇다면 거의 확실히 스캔본입니다. 페이지를 찍은 그림이라 선택할 수 있는 텍스트 레이어가 없습니다. 여기서 글자를 뽑으려면 OCR이 필요한데, 이 도구는 OCR을 하지 않습니다. 페이지를 이미지로 변환해 OCR 도구에 넣는 방법은 있습니다.
- '문단 다시 잇기'는 정확히 뭘 바꾸나요?
- PDF는 화면에 보이는 줄을 하나씩 따로 저장합니다. 그래서 문단이 80자쯤마다 끊긴 채로 나옵니다. 다시 잇기는 문장 끝이 아닌 곳에서 끊긴 줄을 붙이고, 붙임표로 나뉜 단어를 복구하며, 빈 줄·글머리 기호·번호 항목은 건드리지 않습니다.
- 2단 문서인데 글이 뒤섞여 나옵니다.
- 텍스트는 문서가 저장해둔 순서대로 나옵니다. 다단 레이아웃은 대개 단 단위로 저장되지만 항상 그런 것은 아닙니다. 한 페이지씩 범위를 지정해 뽑으면 무슨 일이 일어났는지 보기 쉽고 고치기도 쉽습니다.
- 표·간격·굵게 같은 서식은 유지되나요?
- 아니요. 결과는 순수 텍스트입니다. 읽는 순서대로의 단어와 줄·페이지 구분만 남습니다. 표의 칸은 평범한 글자 덩어리로 나오고, 글꼴 서식은 모두 사라집니다.
이 주제의 가이드
관련 도구
PDF를 이미지로 변환
PDF의 각 페이지를 원하는 해상도의 PNG·JPEG·WebP 이미지로 변환해 개별 또는 ZIP으로 내려받으세요. 업로드하지 않습니다.
숫자 → 단어 변환
어떤 숫자든 영어·한국어·일본어 단어로 — 수표, 계약서, 명확한 표현 등에.
CSS 텍스트 그림자 생성기 (멀티 레이어)
여러 text-shadow 레이어를 쌓아 네온 글로우·3D·아웃라인·롱섀도 효과 — 라이브 프리뷰 + 복사 가능 CSS.
PDF 압축
PDF 안의 이미지를 다시 인코딩해 용량을 줄입니다. 텍스트는 그대로 선택·검색됩니다. 업로드하지 않습니다.
PDF 페이지 추출
PDF 드롭 → 원하는 페이지만(`1-3, 5, 7-10`) 새 PDF로 추출. 모두 브라우저 내·업로드 없음.
Markdown → 일반 텍스트
마크다운 서식 모두 제거하고 읽을 수 있는 평문만 유지 — 미리보기·요약·이메일·정확한 글자 수 등에 유용.