PDF에는 글자가 보이는데 검색과 복사가 되지 않을 수 있다. 스캔 이미지인지, 텍스트가 있지만 읽기 순서가 다른지부터 살펴야 한다. 인식 결과를 얻은 뒤에도 숫자·기호·표의 연결을 원문과 대조해야 후속 분석에 쓸 수 있다.

이미지 PDF와 텍스트 PDF를 구분한다

종이 문서를 스캔한 PDF에는 각 페이지의 사진만 들어 있을 수 있다. 이 경우 OCR은 이미지 속 글자를 인식해 검색하거나 선택할 수 있는 텍스트로 바꾸는 역할을 한다. Adobe의 OCR 안내는 언어와 페이지 범위 설정, 처리 후 정확성 확인을 설명한다.

문서의 글자 몇 개를 선택해 복사하고 검색해 보면 상태를 좁히는 데 도움이 된다. 다만 일부 페이지에만 텍스트가 있거나 스캔과 디지털 페이지가 섞여 있을 수 있다. 첫 페이지에서 검색이 된다는 이유로 전체 PDF를 같은 상태로 판단하지 않는다.

화면에서 보이는 현상 먼저 확인할 것 바로 확정할 수 없는 결론
글자를 선택할 수 없음 페이지가 이미지인지 파일 전체가 손상됐다는 판단
선택되지만 복사 내용이 이상함 문자 인식·문자 매핑·읽기 순서 화면의 글자도 모두 틀렸다는 판단
일부 페이지만 검색됨 페이지별 구성과 처리 범위 문서 전체 OCR 완료
문장은 읽히지만 표가 섞임 행·열과 셀 연결 텍스트 인식 정확도만의 문제

OCR 전에 원본과 처리 범위를 정한다

원본 PDF는 유지하고 OCR용 사본을 만든다. 문서 언어와 필요한 페이지를 확인하고, 기울어진 페이지나 흐린 스캔처럼 인식에 영향을 줄 조건을 살핀다. 파일이 암호화되거나 편집 권한에 제한이 있다면 공식적으로 허용된 범위에서 처리한다.

기밀 문서를 외부 온라인 OCR 서비스에 올려 해결하기 전에 자료를 전달할 수 있는 환경인지 확인한다. 기기 안에서 처리하는 기능과 외부 서버에 업로드하는 기능은 정보 취급 조건이 다를 수 있다. 문서 입력 사본 준비에서 필요한 정보만 남기는 점검을 함께 할 수 있다.

처리 범위에는 본문뿐 아니라 표, 각주, 페이지 머리말과 부록도 포함되는지 적는다. 특정 절만 처리했다면 결과도 그 범위의 텍스트로 표시한다. 전체 문서처럼 파일 이름만 붙여 놓으면 다음 사람이 누락을 알아차리기 어렵다.

검색 한 번으로 PDF 전체의 텍스트 상태를 판단하지 않는다

표지의 제목이 검색된다고 본문까지 텍스트라는 뜻은 아니다. 한 파일에 직접 만든 텍스트 페이지와 스캔 이미지 페이지가 섞일 수 있다. 반대로 검색 실패가 곧 OCR 필요를 뜻하지는 않는다. 찾는 문구의 공백이나 줄바꿈, 문서에 실제 사용된 표현이 다른지도 먼저 살핀다.

필요한 페이지 몇 곳에서 짧고 특징적인 문장을 검색하고 선택해 복사한다. 복사한 문장에서 글자 순서, 공백, 숫자가 화면과 맞는지 본다. 페이지의 글자는 선택되지만 복사 결과가 다른 순서라면 텍스트 존재 여부보다 읽기 순서가 문제일 수 있다. 도구의 처리가 끝났다는 표시와 사용할 수 있는 텍스트 상태를 구분해야 한다.

원문에서 1,250으로 보이는 숫자가 복사 결과에서는 1.250으로 나오거나, 영문 O가 숫자 0으로 바뀌는 상황을 생각해 보자. 이는 오류 유형을 설명한 예시다. 겉으로 비슷한 문자라도 금액이나 식별 코드에서는 의미가 달라진다. 중요한 숫자는 주변 행 제목과 단위까지 함께 대조한다.

기울어진 페이지는 인식 후 수정보다 원본 상태부터 살핀다

흐릿하거나 그림자가 낀 스캔에서는 단어를 하나씩 고치는 것보다 더 선명한 원본을 확보하는 편이 나을 수 있다. 다시 촬영하거나 스캔할 수 있다면 페이지가 평평하고 글자와 배경이 충분히 구분되는지 살핀다. 방향을 바로잡을 때는 원본을 보존하고 처리용 사본을 만든다.

인식 언어도 자료와 맞춘다. 한국어 본문에 영문 제품 코드와 숫자 표가 섞여 있다면 본문만 자연스럽게 읽히는지 보지 않는다. 코드, 날짜, 소수점, 음수 표시, 각주처럼 결론에 영향을 주는 요소를 따로 확인한다. 자동 인식이 잘되는 문장과 어려운 요소를 한 묶음의 정확도로 표현할 필요는 없다.

2단 문서에서 왼쪽 첫 줄과 오른쪽 첫 줄이 이어지면 단어는 맞지만 문장의 순서가 틀릴 수 있다. 표에서도 값이 다음 행으로 이동하면 글자 정확성만으로 발견하기 어렵다. 인식한 텍스트를 원문의 문단과 셀에 다시 연결하는 점검이 필요하다.

점검 결과는 ‘PDF 30쪽 중 표가 있는 12~15쪽의 숫자와 단위 대조’처럼 범위를 남긴다. 앞부분 세 장만 확인했다면 전체 문서의 검토가 끝났다고 쓰지 않는다. 문제가 반복되는 구조를 발견하면 같은 구조의 다른 페이지까지 확인 범위를 넓힌다. OCR의 목적은 검색 버튼이 작동하게 만드는 데 그치지 않고 후속 분석에 쓸 텍스트를 확보하는 것이다.

인식 결과는 중요한 요소부터 원본과 대조한다

본문을 모두 같은 속도로 읽기보다 이름·날짜·수치·부정 표현처럼 의미를 크게 바꾸는 요소를 먼저 확인한다. 0과 O, 1과 l, 소수점과 쉼표처럼 비슷해 보이는 문자를 대조한다. 어떤 문자가 자주 잘못되는지 찾았더라도 모든 오류가 같은 유형일 것이라 단정하지 않는다.

설명용 예로 원본에 1.5가 있는데 추출 결과가 15라면 글자 하나의 누락이 수치의 의미를 바꾼다. ‘지원하지 않음’에서 부정 표현이 빠지면 문장 전체의 결론이 달라진다. 이 예제는 실제 OCR 도구의 출력이나 오류율 측정이 아니라 검토할 요소를 보여주는 것이다.

수정할 때는 원본 페이지와 위치를 기록한다. 인식 결과만 자연스럽게 다듬으면 잘못된 숫자도 매끄러운 문장 안에 그대로 남을 수 있다. 원본이 흐려 값을 확인할 수 없다면 임의로 채우지 않고 읽기 어려운 상태로 남긴다.

읽기 순서와 표 구조는 따로 확인한다

2단 편집 문서는 왼쪽 열을 끝까지 읽은 뒤 오른쪽 열을 읽어야 할 수 있다. 추출 텍스트가 두 열의 줄을 번갈아 합쳤다면 개별 글자가 맞아도 문장 관계는 달라진다. 제목, 본문, 각주가 어떤 순서로 나왔는지 원본과 비교한다.

표에서는 행 제목과 열 제목, 단위, 병합된 셀, 합계가 연결돼야 한다. 숫자가 모두 나왔다고 표의 의미까지 유지된 것은 아니다. 텍스트를 추출한 다음 표를 다시 구성하는 작업에는 별도 대조가 필요하다. PDF 표의 행·열 확인에서 작은 예제로 관계를 설명한다.

이미지 안 그래프는 OCR 텍스트에 범례와 수치가 일부 나타나더라도 전체 관계를 복원했다고 판단하기 어렵다. 축과 단위, 범례와 색의 연결을 원래 그림에서 확인하고, 텍스트에서 확인하지 못한 정보는 추측으로 채우지 않는다.

AI에 업로드한 뒤에도 입력 범위를 확인한다

Gemini 파일 업로드 안내는 지원 파일과 분석 범위의 조건을 설명한다. 업로드가 완료됐다는 표시와 문서 모든 부분을 정확히 읽었다는 판단은 구분해야 한다. OCR이 된 PDF라도 실제 처리 범위와 자료 구조에 대한 점검은 남는다.

먼저 어떤 페이지와 절을 다룰지 지정하고, 답변이 참조한 원문 위치를 확인한다. 모델에게 오류를 찾게 할 수 있지만 원본 숫자와 중요한 조건의 독립 대조를 대신할 수는 없다. 출처가 달린 AI 답변 검토와 함께 입력과 결과를 연결해 본다.

작업을 마치면 원본, OCR 사본, 수정한 추출 결과를 구분해 보관한다. 처리한 페이지, 언어, 수동 확인 범위, 읽을 수 없던 항목을 기록하면 다시 사용할 때 한계가 보인다. OCR 완료의 좋은 기준은 버튼의 성공 표시보다 필요한 자료를 정확한 구조로 다시 사용할 수 있는 상태다.

자료 확인일 2026.09.12작성·자료 확인 원칙
내용에 오류가 있나요?정정 요청