AI 도입, 정말 효과가 있는지 어떻게 숫자로 확인할까?
2026-07-18
AI 도입이 실패로 끝나는 이유는 무엇일까?
도구를 구독하는 것으로 도입이 끝났다고 생각하기 때문입니다. 챗봇을 깔고, 문서 작성 도구를 결제하고 나면 "이제 우리도 AI를 쓴다"는 상태가 됩니다. 그런데 몇 달 뒤 갱신 시점이 오면 판단할 근거가 없습니다. 업무 시간이 줄었는지, 처리 건수가 늘었는지 아무도 재지 않았기 때문입니다.
이 상태에서는 두 가지 실패가 반복됩니다. 첫째, 효과가 없는 도구인데 구독료만 계속 나갑니다. 둘째, 효과가 있는 도구인데 그걸 증명할 수 없어서 해지해 버립니다. 어느 쪽이든 원인은 도구가 아니라 측정을 하지 않은 것입니다. 도입 전 상태를 기록해 두지 않으면, 도입 후에 비교할 대상 자체가 없습니다.
OpenAI가 내놓은 측정 기준은 무엇일까?
OpenAI의 CFO 사라 프라이어(Sarah Friar)는 2026년 7월 17일 'A scorecard for the AI age'라는 글에서 AI 투자 효과를 재는 기준을 제시했습니다. 핵심 개념은 '달러당 유용한 지능(Useful Intelligence per Dollar)', 즉 AI가 해낸 일의 가치가 그 일을 시키는 비용보다 빠르게 커지고 있는가입니다.
이 글이 제시하는 점검 항목은 네 가지입니다.
- 유용한 작업량 — AI가 해결을 도운 고객 문의가 몇 건인지, 배포까지 간 코드 변경이 몇 건인지, 검토한 계약이 몇 건인지 같은 실제 결과물의 수
- 성공한 작업 1건당 비용 — 시도 횟수가 아니라, 쓸 수 있는 결과물 1건을 얻는 데 든 총비용
- 신뢰도 — 사람이 다시 손보지 않고 맡길 수 있는 정도
- 투입 자원 대비 회수 — 컴퓨팅에 쓴 돈이 만들어 낸 가치
특히 눈여겨볼 대목은 단가의 함정입니다. 값이 싼 모델이라도 여러 번 다시 시키고 사람이 검토해야 한다면, 한 번에 끝내는 비싼 모델보다 성공 1건당 비용은 오히려 높을 수 있다는 지적입니다. 이 논리는 도구 구독료에도 그대로 적용됩니다. 월 요금이 낮은 도구가 아니라, 결과물 1건을 가장 싸게 만들어 주는 도구가 좋은 도구입니다.
작은 회사에서는 이 기준을 무엇으로 바꿔 읽어야 할까?
OpenAI의 기준은 대규모 조직을 염두에 둔 것이지만, 항목을 하나씩 우리 규모의 말로 번역하면 그대로 쓸 수 있습니다.
| 스코어카드 항목 | 뜻 | 10인 이하 회사에서 재는 법 |
|---|---|---|
| 유용한 작업량 | 실제로 완성된 결과물의 수 | 주당 처리한 견적서·답변·게시물 건수를 셉니다 |
| 성공 1건당 비용 | 쓸 수 있는 결과물 1건의 총비용 | (들인 시간 × 시급 환산 인건비 + 도구 구독료) ÷ 완성 건수로 계산합니다 |
| 신뢰도 | 다시 손보지 않아도 되는 정도 | AI 초안 중 수정 없이 내보낸 비율, 다시 손본 시간을 적습니다 |
| 투입 대비 회수 | 쓴 돈이 만든 가치 | 절약된 시간을 인건비로 환산해 구독료와 비교합니다 |
스코어카드 항목은 2026-08-20 OpenAI 공식 사이트 게시글 확인 기준이며, 오른쪽 열은 이를 소규모 사업장에 맞게 옮긴 것입니다.
비용 대비 효과를 계산할 때 빠뜨리기 쉬운 항목은 무엇일까?
"구독료 월 3만 원 대 절약 시간"만 놓고 계산하면 실제보다 효과가 부풀려집니다. 비용 쪽에 들어가야 할 항목이 구독료 말고도 세 가지 더 있기 때문입니다.
- 배우는 시간 — 사장과 직원이 도구 사용법을 익히는 데 쓴 시간도 인건비입니다. 첫 달에 집중적으로 발생합니다.
- 검토하는 시간 — AI 결과물을 그대로 내보낼 수는 없으므로, 읽고 고치는 시간이 매번 붙습니다. 기록표의 '다시 손본 시간' 열이 이 항목입니다.
- 실패한 시도 — 지시를 몇 번 바꿔 가며 다시 시킨 시간입니다. 성공한 결과물만 세고 실패한 시도의 시간을 빼면 건당 비용이 실제보다 낮게 계산됩니다.
반대로 효과 쪽에도 시간 절약 외의 항목이 있습니다. 밤이나 주말에도 초안이 나온다는 점, 담당자가 자리를 비워도 일정 품질이 유지된다는 점입니다. 다만 이런 항목은 숫자로 적기 어려우므로, 판단의 중심은 어디까지나 건당 시간·비용에 두고 이런 요소는 참고로만 더하십시오.
주간 업무시간 기록표는 어떻게 만들까?
측정 도구는 구글 시트(또는 엑셀) 한 장이면 충분합니다. 열은 여섯 개만 만드십시오.
- 날짜
- 업무명 — 예: 견적서 작성, 문의 답변, 블로그 초안
- 처리 건수
- 걸린 시간(분)
- AI 사용 여부 — 전/후 비교의 기준 열입니다
- 다시 손본 시간(분) — AI 결과물을 고치는 데 쓴 시간
기록 규칙은 세 가지입니다. 하루 일과 끝에 5분만 들여 그날 치를 적습니다. 시간은 1분 단위가 아니라 5분 단위로 어림해도 충분합니다. 그리고 재는 업무는 한 가지로 고정합니다. 여러 업무를 한꺼번에 재면 어느 것도 비교할 수 없게 됩니다.
도입 전후 비교는 어떤 주기로 돌려야 할까?
세 구간으로 나누는 방식을 권합니다.
- 도입 전 1~2주 — 지금 방식 그대로 일하면서 기록만 합니다. 이 구간이 기준선이 됩니다.
- 적응 2~4주 — 도구를 실제 업무에 씁니다. 처음 1~2주는 서툴러서 오히려 느려질 수 있으므로 이 구간의 수치로 판단하지 않습니다.
- 도입 후 1~2주 — 같은 업무, 같은 담당자, 같은 기록 방식으로 다시 잽니다.
이 주기를 돌릴 때 흔한 실수가 두 가지 있습니다. 하나는 도입 전 기록 없이 시작해 놓고 나중에 기억으로 "전에는 30분쯤 걸렸던 것 같다"고 채우는 것입니다. 기억으로 채운 기준선은 비교의 근거가 되지 못합니다. 다른 하나는 측정 중에 도구를 바꾸는 것입니다. 여러 도구를 같은 기간에 섞어 쓰면 어느 도구의 효과인지 알 수 없게 되므로, 한 번의 측정에서는 도구 하나만 시험하십시오.
판단은 한 가지 나눗셈으로 합니다. (그 업무에 들인 총시간의 인건비 환산액 + 도구 구독료) ÷ 완성 건수. 이 값이 도입 전보다 줄었으면 효과가 있는 것이고, 줄지 않았으면 그 도구를 그 업무에 계속 쓸 이유가 없습니다. 시간은 그대로인데 결과물의 품질이 눈에 띄게 좋아졌다면, 그것도 효과입니다. 다만 "좋아진 것 같다"로 남기지 말고 수정 없이 내보낸 비율처럼 셀 수 있는 형태로 적어 두십시오.
실제로는 어떤 순서로 진행해야 할까?
- 업무 선정 — 매주 반복되고 시간이 많이 드는 업무 하나를 고릅니다.
- 기준선 기록 — 구글 시트에 1~2주간 지금 방식의 시간·건수를 적습니다.
- 도구 적용 — 도구 하나만 골라 2~4주 실제 업무에 씁니다.
- 재측정 — 같은 기록표로 1~2주 다시 잽니다.
- 판단 — 성공 1건당 총비용을 전후로 비교해 계속 쓸지, 업무를 바꿀지, 도구를 바꿀지 정합니다.
중요한 것은 화려한 도구가 아니라, 우리 회사 기준선을 먼저 적어 두는 습관입니다. 기준선이 없으면 어떤 도구도 효과를 증명할 수 없습니다.
자주 묻는 질문
AI를 쓰면 진짜 시간이 절약되는지 어떻게 확인하나요?
같은 업무를 도입 전 1~2주, 도입 후 1~2주 기록해서 건당 걸린 시간을 비교합니다. 이때 AI 결과물을 다시 손보는 데 든 시간까지 포함해야 합니다. 초안 작성은 빨라졌는데 수정에 그만큼 시간이 들면 절약이 아니기 때문입니다.
측정 기간이 짧으면 안 되나요?
도입 직후 1~2주는 도구에 서툰 시기라 수치가 나쁘게 나오는 것이 자연스럽습니다. 이 구간으로 판단하면 쓸 만한 도구도 버리게 됩니다. 적응 기간을 2~4주 두고, 그 뒤의 수치로 전후를 비교하십시오.
시간은 줄었는데 구독료를 더하면 손해인 경우는 어떻게 하나요?
절약된 시간을 인건비로 환산해 구독료와 나란히 놓고 계산합니다. 그래도 총비용이 늘었다면, 그 도구를 더 부가가치가 높은 업무에 옮겨 쓸 수 있는지 먼저 검토하고, 옮길 곳이 없으면 해지하는 것이 맞습니다. OpenAI의 표현을 빌리면, 기준은 도구 사용 여부가 아니라 성공한 작업 1건당 비용입니다.