초안이 빨리 나오고 문장이 자연스러워도 원문에 없는 담당자나 기한을 만들었다면 업무에 바로 쓰기 어렵다. 도구를 비교하기 전에 맡길 작업의 통과 기준과 중요한 실패를 정해야 한다. 자료 준비부터 검토·수정까지 포함한 작은 평가를 구성한다.
업무 하나를 정하고 결과의 기준을 만든다
처음부터 ‘보고서를 잘 쓴다’처럼 넓은 목표를 세우기보다 작고 반복 가능한 작업을 고른다. 예를 들어 메모에서 확정된 후속 작업을 표로 정리하는 일이라면 항목 누락, 상태 변경, 담당자 추정, 기한 오류를 구체적으로 검토할 수 있다.
정답 기준은 원자료에서 만들고, 자료에 없는 정보는 미정으로 남겨야 한다. 정답이 하나로 결정되지 않는 글쓰기 작업이라면 필수 의미·금지할 주장·대상 독자·톤을 나누어 평가한다. 자연스러운 표현 하나만으로 모든 항목을 통과 처리하지 않는다.
아래는 실제 모델을 실행한 점수표가 아니라 평가 항목을 구성한 예제다.
| 평가 항목 | 통과 기준의 예 | 따로 기록할 실패 |
|---|---|---|
| 필요한 항목 추출 | 원문의 확정 작업이 포함됨 | 중요한 작업 누락 |
| 상태 유지 | 제안과 결정이 구분됨 | 제안을 확정 지시로 변경 |
| 근거 연결 | 원문 위치를 찾을 수 있음 | 존재하지 않는 근거 |
| 미정 처리 | 없는 담당·날짜를 미정으로 표시 | 그럴듯한 값 추정 |
| 사용성 | 후속 검토에 필요한 표 구조 | 형식만 맞고 내용이 틀림 |
평균 점수에 묻히면 안 되는 실패를 정한다
여러 항목의 평균이 높더라도 하나의 중요한 오류 때문에 결과를 사용할 수 없을 수 있다. 잘못된 기한이나 원문에 없는 고객 안내처럼 영향이 큰 실패는 별도 상태로 기록한다. 일반 문장 톤 오류와 같은 무게로 합산하지 않는 편이 낫다.
중요 실패가 나오면 그 결과는 검토·수정이 필요한 상태로 분류한다. ‘대부분 맞음’이라는 평균 표시를 공유용 자료의 승인 표시로 사용하지 않는다. 실제 작업에서 어떤 오류가 결론을 바꾸는지 팀의 목적에 맞게 정해야 한다.
NIST 생성형 AI 프로파일은 생성형 AI 사용의 위험과 평가 맥락을 다룬다. 업무용 작은 평가는 이런 위험을 추상적인 점수 대신 구체적인 실패 항목으로 확인하는 데 목적이 있다. 자체 표를 만들었다는 것만으로 표준 인증을 받은 것은 아니다.
평균보다 중요한 실패를 작은 평가에서 드러내는 방법
가상의 회의 기록 추출 평가에서 10개 항목 중 9개가 맞고, 나머지 하나는 검토 중인 제안을 확정 지시로 바꿨다고 하자. 항목 단위로는 90%지만 그 지시가 외부 공지로 이어진다면 그대로 사용할 수 없다. 자료마다 ‘수정 후 사용 가능’과 ‘결정 상태 오류로 사용 보류’를 구분해야 평균 뒤에 중요한 실패가 숨지 않는다.
평가 자료를 만들 때는 정상 사례와 경계 사례를 나눈다. 확정 담당과 기한이 명확한 메모는 기본 추출을 본다. 기한이 없거나 뒤에서 일정이 수정된 메모는 추정과 변경 반영을 본다. 서로 다른 역할이 의견을 말한 자료는 발언자를 담당자로 바꾸는지 확인한다. 업무에서 자주 틀리는 구조가 평가 안에 있어야 결과가 다음 수정으로 이어진다.
정답 기록도 세분화한다. ‘문의 유형 정리, 운영, 금요일, 확정’이라는 정보와 그 근거 문장을 남기고, 화면 변경은 ‘미정’으로 둔다. 이런 기준을 먼저 만들면 표현은 달라도 의미가 같은 답을 비교할 수 있다. 글자 그대로 일치하는지만 보면 자연스러운 다른 표현을 오류로 처리하거나 의미가 틀린 비슷한 문장을 통과시킬 수 있다.
초안 생성 시간과 최종 사용까지의 시간을 나눈다
예를 들어 가상의 시간 기록이 자료 준비 8분, 초안 생성 1분, 원문 대조 12분, 수정 4분이라면 전체는 25분이다. 기존 방식이 20분이었다면 ‘초안이 1분 만에 나왔다’는 사실만으로 시간이 줄었다고 말할 수 없다. 이 숫자는 설명용이며 실제 도구 측정값이 아니다.
반대로 전체 시간이 비슷해도 원문 위치를 찾기 쉬워졌거나 누락된 항목을 빨리 발견한 장점이 있을 수 있다. 이 경우에는 시간 절감과 검토 편의를 따로 기록한다. 측정하지 않은 편의를 생산성 배수로 바꾸지 않는다. 도구를 맡길 단계가 달라지면 평가 기준도 바뀐다.
자료 수가 적을수록 실패 한 건의 이유를 자세히 남기는 편이 유용하다. ‘정확도 낮음’보다 ‘뒤에서 수정한 일정이 반영되지 않음’이라고 적어야 입력 범위를 바꿀지 요청서를 바꿀지 판단할 수 있다. 수정 후에는 같은 오류를 유발한 자료와 새로운 자료를 함께 확인해 특정 예제에만 맞춘 지시가 되었는지 살핀다.
평가 결과에는 자료 종류, 수, 실행 조건, 중요한 실패, 검토에 걸린 시간을 남긴다. 이를 바탕으로 ‘후속 작업의 후보 목록 생성에 사용하고, 담당·기한 확정은 직접 검토한다’처럼 맡길 범위를 정할 수 있다. 작은 평가는 도구 전체의 순위를 만들기보다 자신의 업무에서 사용할 단계와 남길 검토를 찾는 데 쓸 수 있다.
쉬운 자료뿐 아니라 실제 업무의 어려운 자료도 포함한다
예제에는 명확한 메모만 넣지 않는다. 담당자가 없는 항목, 바뀐 일정, 서로 다른 의견, 긴 각주, 스캔 표처럼 실제 업무에서 만나는 구조를 포함할 수 있다. 단, 자료를 외부 도구에 제공할 권한과 개인정보 취급 조건을 먼저 확인한다.
비밀 자료 대신 구조가 비슷한 가상 문서를 만들 수 있다. 이 경우 평가 결과는 그 가상 문서에 대한 결과이며 실제 비공개 자료의 정확도를 증명하지는 않는다. 입력의 특성과 검토 목적을 기록해야 평가 범위를 올바르게 이해할 수 있다.
같은 작업을 여러 번 실행할 때는 입력 문서와 요청서, 기능 설정과 도구의 버전을 기록한다. 조건이 달라진 결과를 같은 비교표에 넣으면 도구 차이인지 입력 차이인지 알기 어렵다. AI 출력 버전 관리의 기록 방식으로 실행 단위를 연결할 수 있다.
AI를 쓰지 않는 기존 작업과도 비교한다
기존에 사람이 만든 목록이나 단순한 검색·서식 도구로 처리한 결과가 있다면 같은 기준으로 비교한다. AI 응답 시간만 재지 말고 자료 준비와 오류 검토, 수정까지 포함한 전체 작업을 살핀다.
초안은 빨리 나오지만 검토가 오래 걸린다면 실제 업무 시간이 기대만큼 줄지 않을 수 있다. 반대로 완성본을 그대로 쓰기 어렵더라도 자료의 구조를 찾거나 검토 대상을 추리는 역할로는 도움이 될 수 있다. 맡길 단계와 사용할 최종 결과를 나누면 적합한 범위를 찾기 쉽다.
실제 시간을 재지 않았다면 ‘몇 배 생산성이 높아졌다’는 수치를 쓰지 않는다. 정성적으로 도움이 된다고 느낀 상태와 측정한 결과를 구분하고, 수치를 제시할 때는 측정 범위와 자료 수를 함께 기록한다.
작은 평가 결과를 모든 업무로 확대하지 않는다
한 종류의 짧은 문서에서 결과가 좋았다고 긴 PDF나 다른 언어 문서에도 같은 수준이라고 판단할 수 없다. 새로운 입력 구조나 기능 업데이트가 있으면 영향을 받는 작업을 다시 점검한다. 전체 재평가가 필요한지, 특정 오류 유형만 확인하면 되는지도 구분한다.
확인한 자료 수와 실패 유형을 남기고 결과가 불확실하면 그 상태를 그대로 기록한다. 검토 기준을 AI에게 작성하게 할 수 있지만 기준의 적절성은 실제 업무 목적과 원자료를 바탕으로 확인해야 한다.
Microsoft의 결과 평가 안내는 표현과 정확성·맥락을 함께 검토하도록 설명한다. 자신의 평가에서는 요약의 조건 누락이나 표의 구조 오류처럼 실제 작업에서 중요한 실패를 별도 항목으로 잡으면 더 유용하다.
