PDF 텍스트 추출
PDF의 글자를 줄바꿈·문단 그대로 뽑아내고, 한글·영문 스캔본은 글자 인식으로 읽어냅니다. 복사하거나 .txt로 저장 — 무료, 업로드 없음, 브라우저 처리.
PDF를 드롭하거나 클릭해 선택
🔒 브라우저에서 처리되며 업로드되지 않습니다. 글자 인식도 기기 안에서 실행됩니다.
PDF에서 텍스트 뽑아내기
PDF를 넣으면 페이지별로 선택 가능한 텍스트를 모두 추출해 복사하거나 .txt 파일로 내려받을 수
있습니다. 브라우저에서 실행되어 파일이 업로드되지 않습니다.
스캔한 PDF도 됩니다
글자 데이터 없이 스캔 이미지로만 된 PDF라면, 그 사실을 먼저 알려 주고 이미지에서 글자 읽어내기를 제안합니다. 문서의 언어(한국어 / 한국어 + English / English)를 고르고 버튼만 누르면 됩니다. 한글은 한글에 맞춰 만들어진 PaddleOCR PP-OCRv5 모델이, 영어는 Tesseract가 읽습니다. 둘 다 처음 한 번만 내려받아 브라우저가 보관하고, 인식은 전부 내 기기에서 이뤄지므로 대외비 스캔본도 일반 PDF와 똑같이 기기 밖으로 나가지 않습니다.
읽는 대상은 글자가 하나도 없는 쪽뿐입니다. 보고서 중간에 스캔한 쪽이 세 장 섞여 있어도 나머지 쪽의 글자는 원본 그대로 남습니다 — PDF에 들어 있는 글자는 실제로 입력된 것이고, 인식은 그것에 대한 추측이기 때문입니다. 반대로 그 글자를 믿을 수 없다면 — 텍스트 층이 망가진 PDF는 실제로 있습니다 — 글자가 이미 있는 쪽까지 전부 이미지에서 읽기를 켜면 추측 쪽을 씁니다.
검색되는 스캔본으로 내려받기
그 버튼 옆에 검색되는 PDF로 내려받기가 있습니다. 보이는 모습은 지금과 똑같은 문서를 그대로 돌려주되, 읽어낸 글자를 그림 속 글자가 있는 자리 밑에 깔아 둡니다. 그래서 Ctrl+F로 찾을 수 있고 드래그해 복사하면 진짜 글자가 복사됩니다. 보이는 것은 아무것도 바뀌지 않고 업로드도 없습니다 — 인식은 내 기기에서 돌아가며, 다른 사이트들이 업로드를 요구하는 부분이 바로 이 부분입니다.
암호가 걸린 PDF
파일이 잠겨 있으면 "읽을 수 없다"고 하지 않고 암호를 묻습니다. 암호는 이 페이지의 다른 작업과 마찬가지로 브라우저 안에서만 쓰이고 어디로도 가지 않습니다. 다만 잠긴 파일은 검색되는 사본으로 저장할 수 없으니 — PDF 암호 도구로 먼저 암호를 푸세요 — 글자를 읽어 내는 것은 평소처럼 됩니다.
자주 묻는 질문
텍스트를 파일로 저장할 수 있나요?
네. 복사 외에 추출한 텍스트를 .txt 파일로 내려받을 수 있어 긴 문서에 편리합니다.
왜 텍스트가 안 나오나요?
해당 PDF가 글자 데이터 없는 스캔본일 가능성이 큽니다. 그럴 때는 화면에서 그 사실을 알려 주고, 페이지 그림에서 글자를 읽어내겠다고 제안하므로 결국 텍스트는 얻을 수 있습니다. 원래 들어 있던 글자를 뽑아내는 것보다 시간이 더 걸릴 뿐입니다.
한글 스캔본도 읽나요?
네. 한국어(영문이 섞였으면 한국어 + English)를 고르면 한글에 맞춰 만들어진 PaddleOCR PP-OCRv5 모델로 읽습니다. 모델은 처음 한 번 약 32MB를 내려받고 그다음부터는 브라우저에 보관된 것을 쓰며, 이후에는 A4 한 쪽에 몇 초 정도 걸립니다. 업로드는 없고 인식은 전부 내 기기에서 실행됩니다.
텍스트 말고 검색되는 PDF로도 받을 수 있나요?
네. 스캔본일 때 "검색되는 PDF로 내려받기"를 누르면 보이는 모습이 지금과 똑같은 파일을 돌려주면서, 읽어낸 글자를 그림 밑에 보이지 않게 깔아 둡니다. 그래서 검색으로 찾히고 드래그하면 진짜 글자가 복사됩니다. 이때는 페이지를 자체 해상도로 다시 읽으므로, 화면에 나온 글자를 재활용하는 것이 아니라 한 번 더 인식하는 것입니다.
이미 글자가 있는 쪽도 인식하나요?
켜야만 합니다. 기본은 글자가 하나도 없는 쪽만 인식하므로, 스캔한 쪽이 몇 장 섞인 보고서도 나머지 쪽의 글자는 원본 그대로 남습니다. 텍스트 층 자체를 믿을 수 없을 때만 "글자가 이미 있는 쪽까지 전부 이미지에서 읽기"를 켜세요.
암호가 걸린 PDF는요?
암호를 물어보고 그 암호로 파일을 엽니다. 암호는 브라우저 안에서만 쓰이고 어디로도 보내지 않습니다. 잠긴 파일로 할 수 없는 한 가지는 검색되는 사본 저장이니, PDF 암호 도구로 먼저 암호를 푸세요.
인식할 수 있는 언어는 무엇인가요?
한국어와 영어입니다. 언어 하나가 곧 브라우저가 내려받아야 할 인식 모델 하나라서, 서버에서 돌리는 서비스처럼 목록을 길게 늘일 수 없습니다. 여기 있는 둘은 각각 약 32MB와 10MB이고 이 사이트에서 직접 제공하므로 다른 곳으로 나가는 요청이 없습니다. 한국어 모델은 한글 페이지에 섞인 알파벳과 숫자도 함께 읽기 때문에 한국어와 한국어 + English는 같은 모델을 씁니다.