AI 맡겼던 사장님들, 왜 돌아섰나

AI 에이전트 자율 배포 앞의 사람 승인 관문을 표현한 네이비와 골드 일러스트
AI 에이전트 자율 배포 앞의 사람 승인 관문을 표현한 네이비와 골드 일러스트
TL;DR
  • VentureBeat 8월 조사에서 AI 에이전트의 프로덕션 변경 자율 허용(또는 1년 내 추진) 응답이 7월 75%에서 56%로 하락했습니다.
  • 최종 구매 결정권자만 보면 88%에서 61%로 더 크게 떨어졌고, 사람 검토를 계속 유지하겠다는 응답은 20%에서 42%로 늘었습니다.
  • 사전 평가를 통과한 AI 기능이 고객 앞에서 실패한 적 있다는 응답이 61%에 달했습니다.
  • 표본은 자발적 응답 140명이라 시장 전체로 일반화는 어렵지만, 승인 체계를 점검할 신호로는 충분합니다.

AI 에이전트가 알아서 일하는 시대라는 말이 한창인데, 정작 현장의 온도는 조금 다릅니다. 테스트를 통과한 에이전트에게 실서비스 변경 권한까지 맡기겠다는 기업이 한 달 사이에 눈에 띄게 줄었습니다. 같은 주에 구글이 이메일 계정까지 가진 기업용 Gemini 에이전트를 내놓았다는 점을 생각하면, 도입 속도와 신뢰 속도 사이에 간극이 벌어지고 있다고 볼 수 있습니다.

신뢰는 한 달 만에 얼마나 꺾였나

75%에서 56%, 구매 결정권자는 더 가파르게

VentureBeat Intelligence가 10월 8일 공개한 8월 조사(응답자 140명)에 따르면, 에이전트를 실제로 운영 중인 조직 가운데 자동화된 평가만으로 특정 프로덕션 변경을 허용하거나 1년 안에 그렇게 하겠다고 답한 비율이 56%였습니다. 7월 조사의 75%에서 19%포인트 내려간 수치입니다. AI 구매에 최종 결정권을 가진 응답자만 따로 보면 88%에서 61%로 하락 폭이 더 컸습니다.

반대로 앞으로도 사람의 검토를 유지하겠다는 응답은 20%에서 42%로 두 배 넘게 늘었습니다. 에이전트를 도입한 기업 가운데 32%는 위험이 낮은 일부 사례에 한해 이미 사람 검토 없이 변경을 허용하고 있고, 24%는 그 방향으로 준비 중이라고 답했습니다. 즉 자율 운영 자체를 포기한 것이 아니라 속도를 늦추고 선을 긋는 쪽으로 움직이는 모습입니다.

AI Biz Insider 분석 — 이번 수치는 자발적으로 응답한 독자 패널이라는 한계가 있고, 7월과 8월의 응답자 구성도 달랐습니다. 다만 구매 결정권자 집단에서도 같은 방향의 하락이 나타났다는 점은 표본 구성만으로 설명하기 어렵습니다. 숫자 자체보다 방향을 읽는 편이 안전합니다.


평가는 통과했는데 고객 앞에서 무너졌다

사전 평가의 한계와 모니터링 공백

사전 평가 체계를 갖춘 응답자의 61%는 지난 12개월 동안 내부 테스트를 통과한 AI 기능이 고객 접점에서 최소 한 번 실패했다고 답했습니다. 두 번 이상 겪었다는 응답도 22%였습니다. 자동 평가를 가장 큰 제약으로 꼽은 이유로는 평가 결과가 실제 성과와 맞지 않는다는 지적이 27%, 설명 가능성 부족이 24%로 가장 많았습니다.

운영 단계의 감시 방식도 허술한 편입니다. 에이전트 운영 조직의 주된 모니터링 수단은 거래 추적 로그(36%)와 실시간 품질 검증(29%)이었습니다. VentureBeat는 빠르고 자신 있게 틀린 답이 깨끗한 로그와 정상 응답 코드로 남을 수 있다고 지적했습니다. 서버가 멀쩡해 보여도 결과물이 틀렸을 수 있다는 뜻입니다.

그래도 평가 도구 투자는 늘어납니다

신뢰가 낮아졌다고 투자가 멈춘 것은 아닙니다. 응답자의 62%가 12개월 안에 새로운 평가 플랫폼을 추가하거나 교체할 계획이며, 35%는 3개월 안에 하겠다고 답했습니다. 평가 도구로는 OpenAI 개발자 플랫폼이 스택에 포함된 비율이 31%에서 59%로 뛰었습니다. 불신이 커질수록 검증 도구에 돈을 쓰는 구조입니다.

AI Biz Insider 분석 — 평가를 자동화하는 것과 배포 승인을 자동화하는 것은 별개의 결정입니다. 평가 점수가 높다는 이유로 승인 권한까지 넘기는 순간, 평가가 놓친 오류가 그대로 고객에게 도달합니다.


에이전트를 들이기 전 사장님이 점검할 3가지

권한, 감시, 되돌리기

구글은 같은 주에 자체 이메일과 캘린더를 가진 Gemini 에이전트를 기업용으로 먼저 공개했습니다. 모든 작업은 에이전트 이름으로 감사 기록에 남고, 실시간 지출 한도 같은 비용 통제 장치도 내세웠습니다. 다만 TechCrunch 보도에는 명시적인 사람 승인 단계에 대한 설명이 없었습니다. 도구가 기본으로 주는 통제만 믿기보다 우리 회사의 기준을 먼저 세워야 하는 이유입니다.

첫째, 변경 유형별로 자율 허용 범위를 나누세요. 문구 수정처럼 위험이 낮은 작업과 결제, 고객 데이터, 가격 변경처럼 되돌리기 어려운 작업을 같은 승인선에 두면 안 됩니다. 둘째, 서버 상태가 아니라 결과물의 정확성을 감시하세요. 응답 코드가 정상이어도 내용이 틀릴 수 있으니 샘플 검수나 실시간 품질 점검을 따로 두는 편이 안전합니다. 셋째, 평가 통과를 승인 근거 전부로 삼지 말고, 문제가 생겼을 때 즉시 되돌릴 방법과 책임자를 미리 정해 두세요.

AI Biz Insider 분석 — 에이전트 도입의 병목은 모델 성능이 아니라 승인 구조로 옮겨가고 있습니다. 사람 검토를 남기는 것은 속도를 포기하는 선택이 아니라, 자율 범위를 단계적으로 넓히기 위한 안전 장치로 보는 편이 현실적입니다.


관련 글

출처

  1. VentureBeat, The share of enterprises trusting AI agents to make production changes on their own has fallen from 75% to 56% (2026-10-08)
  2. TechCrunch, Google brings agentic AI to Gemini, starting with businesses (2026-10-08)

AI Biz Insider · AI 비즈니스 · aibizinsider.com


AI Biz Insider에서 더 알아보기

구독을 신청하면 최신 게시물을 이메일로 받아볼 수 있습니다.

코멘트

답글 남기기

AI Biz Insider에서 더 알아보기

지금 구독하여 계속 읽고 전체 아카이브에 액세스하세요.

계속 읽기

AI Biz Insider에서 더 알아보기

지금 구독하여 계속 읽고 전체 아카이브에 액세스하세요.

계속 읽기