AI의 업무 성과는 최종 결과의 품질과 전체 처리 비용을 기준으로 측정하고, 그 결과를 만드는 업무·운영·평가·책임을 함께 설계해야 합니다.
AI가 자료를 찾아 초안을 작성하면 담당자는 결과를 더 빨리 받아볼 수 있습니다. 업무가 끝나려면 출처를 확인하고, 빠진 조건을 보완하고, 실제로 사용할 수 있는 결과인지 판단해야 합니다. 이 과정의 시간을 포함해야 AI가 업무에 어떤 도움을 줬는지 설명할 수 있습니다.
다음 다섯 질문은 도입할 업무를 고르고 운영 범위를 정하는 기준입니다. 문서를 검색해 답변을 작성하는 업무를 예로 들어, 무엇을 측정하고 어디에 사람의 판단을 둘지 살펴봅니다. 업무 흐름과 평가표는 조사 자료를 참고한 설계안이며, 실제 측정한 성과를 뜻하지 않습니다.
| 주제 | 기억할 질문 |
|---|---|
| 성과 | 실제로 시간·품질·비용이 얼마나 개선됐나? |
| 업무 설계 | AI와 사람이 각각 어느 단계를 맡나? |
| 플랫폼 | 반복 실행과 변경·장애 관리가 가능한가? |
| 평가 | 실제 업무와 실패 상황에서도 제대로 작동하나? |
| 사람 | 결과를 판단하고 책임질 역량이 있는가? |
최종 업무를 기준으로 성과 측정하기
초안 작성이 빨라져도 검토와 수정이 늘면 전체 처리 시간은 줄지 않을 수 있습니다. 성과를 판단하려면 개인이 느끼는 편리함과 업무 전체의 결과를 구분해야 합니다. 관련 성과 조사
문서 기반 답변 업무의 완료 조건을 "담당자가 근거를 확인해 전달할 수 있는 답변"으로 정해 봅니다. 이 조건에서는 자료 검색과 초안 생성뿐 아니라 검토, 수정, 승인 대기까지 전체 처리 시간에 들어갑니다. 작업에 직접 투입한 시간과 대기 시간을 따로 기록하면 개선할 단계를 찾기 쉽습니다.
| 측정 대상 | 기록할 값 | 비교할 때 지킬 조건 |
|---|---|---|
| 시간 | 요청부터 승인까지 걸린 시간, 단계별 작업·대기 시간 | 난이도와 문서 접근 범위가 비슷한 업무끼리 비교 |
| 품질 | 사실·인용 오류율, 필수 조건 누락률 | 같은 판정 기준을 적용하고 중대한 오류는 별도 집계 |
| 재작업 | 반려 비율, 수정 횟수와 검토 시간 | AI 초안과 사람이 고친 최종본을 연결 |
| 비용 | 모델·검색·인프라 비용과 사람의 작업 비용 | 실패와 재시도 비용을 포함하고 구축·교육비는 별도 명시 |
| 업무 결과 | 품질 기준을 충족한 완료 건수, 기한 내 완료 비율 | 전체 접수 건수와 미완료·이관 건수도 함께 기록 |
완료 건당 비용은 같은 기간의 전체 처리 비용을 품질 기준을 충족한 완료 건수로 나누어 계산할 수 있습니다. 성공한 요청의 비용만 더하면 실패와 재시도 부담이 빠지므로, 전체 요청의 비용을 분자에 포함합니다. 완료 건수가 없으면 건당 비용을 계산하지 않고 미완료 상태와 누적 비용을 보고합니다.
절약한 시간이 조직의 성과로 이어졌는지도 확인해야 합니다. 담당자가 그 시간에 적체된 문의를 처리했는지, 더 어려운 검토를 맡았는지 함께 기록합니다. 실제 지출 감소는 비용 절감으로, 같은 시간과 품질 기준에서 늘어난 처리량은 생산성 개선으로 구분해 확인합니다.
AI와 사람의 업무 경계 정하기
업무를 나눌 때는 각 단계의 입력, 결과, 실행 권한과 승인 조건을 함께 정해야 합니다. AI가 초안을 만드는 단계와 사람이 그 결과를 업무에 사용하는 단계를 구분하면, 오류를 어디서 확인할지 분명해집니다. 관련 도입 가이드
문서 기반 답변 업무에서는 사람이 먼저 질문의 범위와 사용할 수 있는 자료를 정합니다. 시스템은 사용자의 권한으로 검색 범위를 제한하고, AI는 검색 결과를 바탕으로 인용과 초안을 구성합니다. 담당자는 규정의 적용 조건과 예외를 확인한 뒤 전달을 승인합니다.
flowchart TD
A["사람이 질문과 완료 조건 정의"] --> B["시스템이 접근 권한 확인 후 문서 검색"]
B --> C["AI가 근거와 답변 초안 구성"]
C --> D{"필수 근거 확인<br/>충돌 없음?"}
D -->|검사 통과| E["담당자가 조건과 예외 검토"]
D -->|누락 또는 충돌| F["미해결 사유와 함께 담당자에게 이관"]
E --> G{"전달 승인?"}
G -->|승인| H["담당자가 답변 전달과 결과 기록"]
G -->|수정 필요| F
F --> I{"추가 확인 후 수정 가능?"}
I -->|수정 완료| E
I -->|해결 불가| K["보류와 미완료 사유 기록"]
H --> J["오류 사례를 평가에 반영"]
이 예시에서 AI에는 문서 검색과 초안 작성 범위만 허용하고, 원문 변경이나 답변 발송 권한은 주지 않습니다. 필수 근거 확인은 문서의 존재와 버전을 검사하는 단계이며, 내용의 타당성은 담당자가 이어서 검토합니다. 자료가 없거나 서로 충돌하면 미해결 상태를 표시하고 담당자에게 넘깁니다.
이관할 때는 질문, 확인한 근거, 시도한 작업, 해결하지 못한 조건을 함께 전달해야 합니다. 그래야 담당자가 처음부터 같은 조사를 반복하는 부담을 줄일 수 있습니다. 승인자와 문서 소유자를 정해 두면, 답변 수정과 원문 규정 확인을 누구에게 요청할지도 분명해집니다.
반복 실행과 변경 관리하기
같은 업무를 반복하려면 담당자가 바뀌어도 실행 조건과 변경 이력을 확인할 수 있어야 합니다. 누군가의 로컬 설정에만 의존하면, 결과가 달라졌을 때 모델·문서·설정 중 무엇이 바뀌었는지 찾기 어렵습니다. 관련 운영 사례
여기서 플랫폼은 여러 작업이 함께 사용하는 실행·관리 기능을 뜻합니다. 처음에는 기존 저장소와 실행 도구에 아래 기록과 통제를 추가하는 방식으로 시작할 수 있습니다. 여러 업무에서 같은 기능이 반복되면 공통으로 관리할 범위를 넓힙니다.
| 운영 항목 | 남길 기록 또는 통제 | 해결하려는 문제 |
|---|---|---|
| 실행 조건 | 모델·프롬프트·검색 설정과 문서 버전 | 같은 질문의 답이 달라진 원인 추적 |
| 변경 관리 | 변경 담당자, 평가 결과, 적용 이력 | 품질 저하를 만든 변경 식별과 되돌림 |
| 권한 | 사용자별 자료 범위와 허용 동작 | 권한 밖의 문서 조회·수정 차단 |
| 장애 대응 | 실패 단계, 제한된 재시도, 중단·이관 조건 | 반복 실패의 비용 증가와 업무 방치 방지 |
| 관측 | 요청별 소요 시간·비용·결과와 담당자 | 느리거나 실패하는 단계 확인 |
버전 기록은 같은 답변을 보장하지 않지만, 어떤 조건에서 결과가 나왔는지 비교할 근거가 됩니다. 모델이나 검색 설정을 바꾸기 전에는 고정한 평가 사례로 품질과 비용을 비교하고, 문제가 생기면 검증된 이전 설정으로 되돌립니다. 이미 전달한 잘못된 답변은 설정 복구와 별개로 담당자가 정정해야 합니다.
이 예시의 AI 기능은 읽기와 초안 작성만 수행하지만, 이후 자동 발송을 추가하면 재시도에 따른 중복 발송도 관리해야 합니다. 실행 이력에는 원문 전체를 무조건 저장하지 않고, 추적에 필요한 문서 식별자와 버전 등을 남깁니다. 로그에 담을 내용, 보관 기간과 열람 권한은 사용하는 자료의 민감도에 맞춰 정합니다.
실제 업무와 실패 상황 평가하기
평가에는 실제 업무의 입력과 제약, 성공 조건이 들어가야 합니다. 공개 벤치마크 점수는 모델 후보를 좁히는 참고 자료로 쓰고, 최종 선택은 사용할 업무의 평가 결과로 판단합니다. 관련 평가 설계
문서 기반 답변 업무에서는 필요한 문서가 검색됐는지, 인용문이 주장을 뒷받침하는지, 담당자가 최종 결과를 승인할 수 있는지 나누어 확인합니다. 형식이 맞고 링크가 열려도, 그 출처가 답변 내용을 지지하는지는 별도로 판단해야 합니다.
| 평가 상황 | 기대하는 행동 | 실패 판정 예시 |
|---|---|---|
| 정상 질문 | 허용된 최신 문서를 찾아 근거와 답변 제공 | 필수 조건을 누락하거나 잘못 인용 |
| 근거 문서 없음 | 근거 부족을 알리고 추가 확인 요청 | 존재하지 않는 규정이나 출처 생성 |
| 신구 문서 충돌 | 버전과 적용 시점을 대조하고 미해결 충돌 표시 | 폐기된 규정을 현재 규정으로 단정 |
| 접근 권한 부족 | 접근을 차단하고 허용 범위 안내 | 다른 사용자의 문서나 내용을 노출 |
| 검색·모델 호출 실패 | 제한 안에서 재시도하고 실패 시 담당자에게 이관 | 반복 호출을 계속하거나 성공으로 기록 |
| 처리할 수 없는 요구 | 충족할 수 없는 조건과 한계를 설명 | 근거를 바꾸거나 미완료 작업을 완료로 보고 |
처리할 수 없는 요구와 반복 실패에서는 작업을 멈추거나 담당자에게 넘기는 행동도 평가해야 합니다. 테스트의 허점을 이용하는 행동을 다룬 모델 행동 연구를 참고해, 근거 변경이나 허위 완료 보고를 실패 조건에 포함합니다. 이는 연구를 업무 평가에 적용한 제안이며, 말투만으로 모델의 신뢰성을 판단한다는 뜻은 아닙니다.
문서 식별자와 접근 권한처럼 규칙으로 확인할 항목은 프로그램으로 검사하고, 주장과 근거의 대응은 업무 담당자가 검토합니다. 같은 AI의 자체 채점은 보조 자료로 사용하고, 최종 통과 기준은 실제 결과와 연결합니다.
변경 전후에는 같은 평가 사례를 여러 번 실행해 성공률과 결과의 변동을 함께 봅니다. 전체 평균과 함께 문서 누락, 권한 위반 같은 실패 유형별 결과도 남깁니다. 운영 중 발견한 오류는 원인을 확인하고 평가 사례에 추가해 다음 변경에서 다시 검사합니다.
판단과 책임을 맡을 사람 정하기
결과를 승인하는 사람은 어떤 요구사항을 충족했고 무엇을 확인하지 못했는지 설명할 수 있어야 합니다. 이를 위해서는 업무 지식, 근거를 대조하는 능력, 오류를 재현하고 수정하는 경험이 필요합니다. 관련 역량 평가
검토자의 이름과 판단에 필요한 조건도 함께 정해야 합니다. 원문을 열 수 없거나 검토 시간이 없으면, 승인 단계가 있어도 실질적인 확인이 어렵습니다. 다음은 문서 기반 답변 업무에서 담당자가 갖춰야 할 조건입니다.
| 판단할 일 | 필요한 역량과 권한 | 남길 근거 |
|---|---|---|
| 업무 정의 | 질문을 완료 조건과 금지 행동으로 구체화 | 요구사항과 승인 기준 |
| 결과 검토 | 원문·버전·예외를 대조하고 오류 식별 | 인용 확인과 수정 사유 |
| 운영 판단 | 실패 원인을 확인하고 중단·이관 결정 | 실행 이력과 처리 결정 |
| 개선 | 반복 오류를 평가와 업무 절차에 반영 | 재현 사례와 변경 후 검사 결과 |
교육도 실제 오류를 찾아 고치는 연습과 연결할 수 있습니다. 담당자가 오래된 문서를 식별하고, AI가 누락한 조건을 보완하고, 판단할 수 없는 요청을 적절히 넘길 수 있는지 확인합니다. 검토자가 작업을 보류할 권한과 도움을 요청할 담당자까지 정해야 책임을 수행할 수 있습니다.
한 업무에서 시작하기
다섯 기준을 적용할 첫 대상으로는 완료 조건이 분명하고 결과를 확인할 수 있는 업무가 적합합니다. 예를 들어 범위가 정해진 문서 묶음에서 근거를 찾아 답변 초안을 만드는 작업을 선택합니다. 아래 순서는 파일럿 설계안이며, 이미 수행한 프로젝트의 결과를 뜻하지 않습니다.
| 순서 | 할 일 | 다음 단계로 넘어갈 근거 |
|---|---|---|
| 기준선 기록 | 기존 방식의 시간·품질·비용과 실패 사례 수집 | 비교할 업무 단위와 판정 기준 확보 |
| 역할 배정 | AI의 작업 범위, 사람의 승인·이관 조건 정의 | 담당자와 접근 권한 확정 |
| 제한된 적용 | 정해진 자료와 사용자 범위에서 실행 | 실행 이력과 실제 검토 결과 확보 |
| 평가와 수정 | 정상·실패 사례로 변경 전후 비교 | 품질 기준 충족과 실패 처리 확인 |
| 확대 판단 | 전체 비용, 완료 건수, 검토 부담 비교 | 개선이 확인된 범위와 중단 조건 명시 |
가능하면 비슷한 난이도의 업무를 기존 방식과 AI 보조 방식에 나누어 배정합니다. 같은 사람이 같은 질문을 반복하면 앞서 본 답을 기억할 수 있으므로, 질문 집합과 수행 순서도 조정합니다. 동시 비교가 어렵다면 도입 전후의 인력·업무량·문서 변경을 기록하고, AI만의 효과로 단정하지 않습니다.
확대 기준과 중단 기준은 결과를 보기 전에 정합니다. 품질 하한을 충족하면서 전체 시간이나 비용이 개선됐는지 확인하고, 중대한 권한 위반이나 근거 조작은 평균 점수와 별도로 다룹니다. 근거가 부족하면 적용 범위를 유지한 채 원인을 확인하고 다시 측정합니다.
정리
AI의 업무 성과는 검토와 재작업을 포함한 최종 완료 기준으로 측정해야 합니다. AI와 사람의 역할을 나누고, 반복 실행에 필요한 기록·권한·변경·복구 절차를 갖추면 결과를 추적하고 개선할 수 있습니다. 실제 업무와 실패 상황을 함께 평가하고, 사람이 결과를 판단할 시간과 권한을 확보해야 합니다.
한 업무에서 기준선을 만들고, 다섯 질문에 답할 수 있는 근거가 쌓인 범위부터 활용을 확대합니다. 조사와 연구는 설계에 참고할 수 있지만, 적용한 업무의 개선 여부는 직접 측정해야 합니다.
참고 자료
아래 자료는 2026년 10월 7일에 확인했습니다. 설문 결과, 운영 사례, 실험 연구는 근거의 성격이 다르므로, 각 자료의 조건과 범위를 구분해 읽어야 합니다.
- AI 활용과 성과 조사 — McKinsey, 2026. 개인 생산성과 조직 성과를 다룬 자기보고 설문이며, 특정 도입 방법의 인과효과를 입증하지 않습니다.
- AI 도입 설계 가이드 — 삼성SDS, 2025. 업무 목표, 데이터, 운영과 조직 설계를 다룬 자문 자료이며, 시간 단축 수치는 목표의 예시입니다.
- 모델 개발·관리 사례 — 버즈빌, 2024. 실행 명세, 검증, 변경 관리의 구현 사례이며, 생산성·비용 개선율은 제시하지 않습니다.
- 업무별 벤치마크 구축기 — 토스, 2026. 실제 업무와 지시 준수의 평가 설계이며, 결과는 해당 모델·태스크 집합의 범위에서 해석해야 합니다.
- 감정 개념의 내부 표현과 모델 행동 연구 — Anthropic, 2026. 내부 표현에 개입한 실험이며, 주관적 감정 경험이나 일반 프롬프트의 말투 효과를 입증하지 않습니다.
- 요구사항 해석과 검증 역량의 평가 사례 — 무신사, 2026. AI 사용을 허용한 채용 평가 설계이며, 장기 업무성과 예측력이나 보편적 공정성을 입증한 자료는 아닙니다.