CalcTimer

PDF 텍스트 추출

PDF에서 글자만 뽑아냅니다. 파일은 서버에 업로드되지 않고 브라우저 안에서만 처리됩니다.

글자가 하나도 안 나온다면

스캔한 PDF일 가능성이 큽니다. 종이를 스캔하면 겉보기에는 문서지만 내용물은 사진 한 장입니다. 파일 안에 글자 정보가 아예 없으니 뽑아낼 것도 없습니다.

구분하는 방법은 간단합니다. PDF 뷰어에서 글자를 드래그해 선택할 수 있으면 텍스트 PDF, 드래그가 안 되고 영역만 잡히면 이미지 PDF입니다. 후자는 OCR(문자 인식)이 필요하며 이 도구로는 처리할 수 없습니다.

줄바꿈 정리 옵션

PDF는 문단을 저장하지 않고 글자 위치만 기록합니다. 그래서 그대로 뽑으면 화면 폭 때문에 접혔던 줄이 전부 실제 줄바꿈으로 남습니다.

이 옵션을 켜면 마침표나 물음표로 끝나지 않은 줄만 이어 붙여 원래 문단에 가깝게 복원합니다. 표나 목록이 많은 문서라면 꺼두는 편이 낫습니다.

이럴 때 씁니다

  • 논문이나 보고서 내용을 인용할 때
  • 번역기에 넣기 전 본문만 뽑아낼 때
  • PDF 안의 내용을 검색하거나 워드로 옮길 때
  • 회의록·계약서에서 특정 조항만 복사할 때

자주 묻는 질문

스캔한 PDF에서도 글자가 나오나요?

아니요. 스캔본은 내용물이 사진이라 글자 정보가 없습니다. 뷰어에서 글자를 드래그해 선택할 수 있으면 추출되고, 영역만 잡히면 이미지 PDF라 OCR이 필요합니다.

표는 어떻게 나오나요?

표의 칸 구조는 유지되지 않고 텍스트만 순서대로 나옵니다. 표가 중요하다면 줄바꿈 정리 옵션을 꺼서 원래 줄 구조를 살리는 편이 낫습니다.

추출한 글자가 서버에 저장되나요?

아니요. 브라우저 안에서 읽어 화면에만 표시합니다. 계약서나 개인정보가 담긴 문서도 안전합니다.

한글도 잘 추출되나요?

네. 다만 PDF를 만든 프로그램이 글꼴을 특수하게 심어 둔 경우 드물게 글자가 깨질 수 있습니다.