Research (연구)/Societal Impacts

현실에서 AI 에이전트 자율성을 측정하기

앤트로픽은 Claude Code와 공개 API에서 수집한 수백만 건의 인간-에이전트 상호작용을 분석해, 실제 배포 환경에서 에이전트가 얼마나 자율적으로 작동하는지, 어떤 감독 방식이 쓰이는지, 위험한 영역으로의 확산은 어느 정도인지 측정했다.

2026년 2월 18일영문 원문 보기 ↗
현실에서 AI 에이전트 자율성을 측정하기

AI 에이전트는 이미 현실에 들어와 있다. 이메일 분류 같은 비교적 가벼운 일부터 사이버 첩보처럼 훨씬 민감한 맥락까지, 에이전트는 다양한 결과를 낳는 환경에 배치되고 있다. 따라서 이들이 실제로 얼마나 자율적으로 행동하는지, 사람은 어떤 방식으로 이를 감독하는지, 위험한 분야로의 사용은 어디까지 확산됐는지를 파악하는 일은 안전한 배포의 핵심 과제가 됐다.

이 글에서 앤트로픽은 Claude Code와 공개 API 전반에서 수집한 수백만 건의 인간-에이전트 상호작용을, 프라이버시를 보존하는 자체 도구로 분석한 결과를 제시한다. 연구 질문은 네 가지다. 사용자는 에이전트에게 실제로 얼마나 많은 자율성을 부여하는가. 경험이 쌓이면 그 양상은 어떻게 달라지는가. 에이전트는 어떤 분야에서 일하는가. 그리고 그 행동은 얼마나 위험한가.

연구진이 내세우는 핵심 발견은 다음과 같다.

  • Claude Code의 장기 세션은 더 오래 자율적으로 돌아가고 있다. 가장 오래 지속되는 작업의 경우, Claude Code가 멈추기 전에 연속으로 일하는 시간은 3개월 사이 25분 미만에서 45분 이상으로 거의 두 배가 됐다.
  • 숙련 사용자는 Claude Code를 더 자주 auto-approve로 돌리지만, 동시에 더 자주 끼어든다. 초보 사용자는 매 행동을 일일이 승인하는 반면, 숙련 사용자는 기본적으로 자율 실행을 허용하고 필요할 때만 개입하는 쪽으로 감독 전략을 바꾸는 경향이 있다.
  • Claude Code는 인간이 중간에 멈추는 빈도보다, 스스로 멈춰 확인 질문을 던지는 빈도가 더 높다. 특히 복잡한 과제일수록 그 경향이 커진다.
  • 에이전트는 이미 의료, 금융, 사이버보안처럼 위험도가 높은 영역에서도 쓰이고 있지만, 아직 대다수 행동은 저위험·가역적 범주에 머문다. 공개 API 기준으로 소프트웨어 엔지니어링이 전체 에이전트 활동의 절반 가까이를 차지했다.

연구진의 결론은 분명하다. 앞으로 효과적인 에이전트 감독을 위해서는 배포 이후를 겨냥한 새로운 모니터링 인프라와, 승인 버튼만 누르는 방식과는 다른 인간-AI 상호작용 패러다임이 필요하다.

현실의 에이전트를 어떻게 연구할 것인가

에이전트를 실증적으로 연구하기 어려운 이유는 두 가지다. 첫째, 무엇을 에이전트라고 부를지에 대한 합의된 정의가 없다. 둘째, 에이전트 자체가 너무 빠르게 변하고 있다. 불과 지난해까지만 해도 가장 정교한 에이전트 시스템은 대개 단일 대화 스레드 안에서 움직였지만, 이제는 여러 하위 에이전트가 자율적으로 협업하는 구조도 등장했다.

이 글은 우선 조작 가능하고 관찰 가능한 정의를 채택한다. 곧, 코드 실행, 외부 API 호출, 다른 에이전트에 대한 메시지 전송처럼 실제 행동을 취할 수 있는 도구를 갖춘 AI 시스템을 에이전트로 본다. 이 정의의 장점은 무엇보다 도구 사용 로그를 통해 현실의 행동을 추적할 수 있다는 점이다.

연구진은 두 가지 데이터 소스를 결합해 측정한다.

  • 공개 API: 수많은 고객이 실제 배포한 에이전트를 넓게 볼 수 있다. 대신 고객 시스템 전체 구조는 알 수 없기 때문에, 분석 단위를 개별 tool call 수준으로 잡는다.
  • Claude Code: 앤트로픽 자체 제품이므로 세션 전체를 이어 붙여 볼 수 있다. 덕분에 인간 개입 없이 얼마나 오래 작동하는지, 무엇이 중간 정지를 유발하는지 같은 자율성 관련 질문을 더 직접적으로 볼 수 있다.

이 두 소스는 서로 다른 강점을 지닌다. 공개 API는 폭넓지만 얕고, Claude Code는 좁지만 깊다. 연구진은 이 둘을 함께 써야만 실제 배포 현장에서의 자율성과 감독을 입체적으로 볼 수 있다고 본다.

Claude Code는 더 오래 자율적으로 일하고 있다

현실의 에이전트가 사람 손을 떠나 얼마 동안 계속 일하는지 측정하려면, Claude Code에서는 비교적 단순한 지표를 쓸 수 있다. Claude가 작업을 시작한 시점부터 멈춘 시점까지, 곧 일을 끝냈든, 질문을 던졌든, 사용자가 중단했든 간에 한 턴(turn)이 얼마나 오래 지속되는지를 보면 된다.

원문은 이 지표가 자율성의 완벽한 대리변수는 아니라고 선을 긋는다. 더 유능한 모델은 같은 일을 더 빨리 끝낼 수 있고, 하위 에이전트가 동시에 돌아가면 더 많은 일이 짧은 시간 안에 처리될 수 있다. 반대로 사용자가 점점 더 큰 과제를 맡기기 시작하면 턴 길이는 길어진다. 그럼에도 장기적인 추세는 중요한 신호를 준다.

대부분의 Claude Code 턴은 짧다. 중앙값은 약 45초 수준이며, 최근 몇 달 사이 크게 흔들리지 않았다. 99번째 백분위수 이하도 대체로 안정적이었다. 다시 말해 보통 수준의 사용 패턴은 크게 변하지 않았다.

핵심은 **꼬리(tail)**에 있다. 가장 긴 턴들이야말로 사용자가 Claude Code에 얼마나 큰 독립성을 맡기고 있는지를 가장 잘 보여 준다. 2025년 10월부터 2026년 1월 사이, 99.9번째 백분위수의 턴 길이는 25분 미만에서 45분 이상으로 거의 두 배가 됐다.

그림 1: Claude Code 장기 턴의 지속 시간 증가

그림 1: 인터랙티브 Claude Code 세션에서 턴 지속 시간의 99.9번째 백분위수. 7일 이동평균 기준으로, 장기 턴은 2025년 가을 25분 미만에서 2026년 초 45분 이상으로 꾸준히 늘어났다.

이 증가는 특정 모델 출시 시점에 맞춘 급격한 점프가 아니라 비교적 매끈한 추세로 나타난다. 연구진은 이것이 단순히 모델 성능 향상만의 결과는 아니라고 본다. 장기 사용자가 도구를 더 신뢰하게 된 것, 제품 사용 방식이 성숙해진 것, 상위권 사용자가 점점 더 야심찬 작업을 맡기게 된 것 등이 함께 작용했을 수 있다는 것이다.

한편 1월 중순 이후 극단적 장기 턴이 다소 줄어든 점도 언급한다. 사용자 기반이 빠르게 커지면서 분포가 바뀌었을 가능성, 연휴가 끝난 뒤 작업 특성이 달라졌을 가능성 등이 그 이유로 제시된다.

내부 사용자 데이터도 흥미롭다. 2025년 8월부터 12월 사이, 앤트로픽 내부의 가장 어려운 Claude Code 작업에서 성공률은 두 배 가까이 올랐고, 세션당 인간 개입 횟수는 5.4회에서 1.4회로 내려갔다. 연구진은 이 두 지표를 함께 보면, 모델이 실제 현장에서 행사하는 자율성은 그 잠재 능력보다 아직 뒤처져 있다는 deployment overhang가 존재한다고 해석한다.

외부 능력 평가와 비교해도 비슷한 결론이 나온다. 예컨대 METR의 장기 과제 평가에 따르면 Claude Opus 4.5는 인간이 거의 5시간 걸릴 만한 과제를 50% 성공률로 처리할 수 있다. 현실에서 관측되는 99.9번째 백분위수 턴은 아직 그 수준에 한참 못 미친다. 즉, 모델이 할 수 있는 것과 사용자가 실제로 맡기는 것 사이에는 여전히 간극이 있다.

숙련 사용자는 더 자주 자동 승인하지만, 더 자주 개입하기도 한다

그렇다면 사람은 에이전트와 함께 일하면서 감독 방식을 어떻게 바꿀까. 연구진이 본 첫 번째 변화는 자동 승인 비율이다. Claude Code를 50세션 미만 사용한 신규 사용자는 전체 세션 중 약 20%에서만 완전 auto-approve를 쓴다. 하지만 사용 경험이 750세션에 이르면 이 비율은 40%를 넘는다.

그림 2: 계정 숙련도에 따른 auto-approve 비율

그림 2: 계정 사용 경험이 늘어날수록, 사용자는 Claude의 각 행동을 일일이 승인하지 않고 자율 실행을 허용하는 비율이 높아진다.

이 변화는 급격한 전환이 아니라 점진적 신뢰 축적처럼 보인다. 다만 연구진은 기본 설정 자체가 수동 승인 방식이기 때문에, 일부 변화는 사용자가 제품 설정을 자기 선호에 맞게 바꾼 결과일 수도 있다고 덧붙인다.

흥미로운 점은, 자동 승인이 늘어난다고 해서 인간 감독이 사라지는 것은 아니라는 점이다. 사용자는 Claude가 일하는 도중 중간에 끼어들어 피드백을 줄 수도 있다. 그런데 계정 숙련도가 높아질수록 이 interrupt rate도 함께 올라간다. 약 10세션 수준의 초보 사용자는 턴의 5% 정도에서 중간 개입하는 반면, 더 경험 많은 사용자는 약 9% 수준까지 올라간다.

그림 3: 계정 숙련도에 따른 중단(interrupt) 비율

그림 3: 경험 많은 사용자는 Claude를 덜 통제하는 것이 아니라, 통제 방식을 바꾼다. 사전 승인 대신 실행 중 모니터링과 개입을 더 많이 택한다.

겉으로 보면 자동 승인과 중간 개입이 동시에 늘어나는 것은 모순처럼 보인다. 하지만 연구진은 이것이 감독 전략의 전환이라고 해석한다. 초보 사용자는 매 행동을 하기 전 승인하는 방식에 의존하므로, 실행 중 끼어들 일이 적다. 반대로 숙련 사용자는 일단 일을 맡기고, 필요할 때만 개입하는 방식으로 이동한다. 이는 이전 앤트로픽 연구에서 말한 바와도 맞닿는다. 효과적인 감독은 모든 행동을 미리 승인하는 것만으로 이뤄지지 않는다.

Claude Code는 인간보다 더 자주 스스로 멈춰 확인한다

자율성의 전개를 좌우하는 것은 사람만이 아니다. Claude도 스스로 멈추고 질문할 수 있다. 연구진은 과제 복잡도가 높아질수록 Claude Code가 **확인 질문(clarification question)**을 더 자주 던지며, 가장 복잡한 작업에서는 인간이 Claude를 중간에 멈추는 빈도보다 Claude가 스스로 멈추는 빈도가 더 높다고 보고한다.

그림 4: 과제 복잡도에 따른 확인 질문과 인간 개입

그림 4: 작업이 복잡해질수록 인간의 중단도 늘어나지만, Claude가 스스로 불확실성을 인식하고 확인 질문을 던지는 속도가 더 빠르게 증가한다.

가장 복잡한 과제에서는 Claude Code의 확인 질문 빈도가 최소 복잡도 과제의 두 배 이상으로 뛰었다. 연구진은 이를 Claude가 자기 불확실성에 어느 정도 보정(calibration)돼 있다는 신호로 읽는다. 물론 이것이 곧 Claude가 늘 적절한 순간에 멈춘다는 뜻은 아니다. 불필요하게 질문할 수도 있고, 반대로 질문해야 할 때 지나칠 수도 있다.

그럼에도 이 결과는 배포된 시스템에서 에이전트 스스로의 정지가 중요한 감독 수단이라는 점을 보여 준다. 모델이 스스로 불확실성을 인식하고 인간에게 도움을 요청하도록 훈련하는 일은, 권한 제한이나 인간 승인 흐름 같은 외부 안전장치와 상호보완적인 안전 속성이라는 것이다.

에이전트는 위험한 분야에서도 쓰이지만 아직 대규모는 아니다

다음 질문은 이것이다. 사람들은 에이전트를 실제로 어디에 쓰고 있는가. 그리고 그 작업은 얼마나 위험하며, 어느 정도 자율적인가.

이를 보기 위해 연구진은 공개 API에서 발생한 개별 tool call마다 Claude를 이용해 **위험도(risk)**와 **자율성(autonomy)**을 1점에서 10점 사이로 추정했다. 위험도 1은 문제가 생겨도 거의 결과가 없는 행동이고, 10은 심각한 피해를 낳을 수 있는 행동이다. 자율성 역시 인간 감독이 강하게 개입된 저자율 행동부터, 에이전트가 상당한 재량을 갖고 연속 행동을 수행하는 고자율 행동까지의 연속체로 본다.

원문은 이 측정이 개별 tool call 수준이라는 한계를 인정한다. 예를 들어 금융 거래나 데이터 유출처럼 보이는 행동도 실제로는 모의 평가일 가능성이 있고, 공개 API 바깥의 인간 검토 단계는 보이지 않을 수 있다. 그럼에도 집계 수준에서는 중요한 그림이 드러난다.

우선 전체 tool call의 80%는 권한 제한이나 인간 승인 요건 같은 안전장치를 하나 이상 갖춘 것으로 보였고, 73%는 어떤 형태로든 human-in-the-loop가 있었다. 비가역적 행동, 예컨대 고객에게 실제 이메일을 보내는 행위처럼 되돌리기 어려운 행동으로 추정된 비율은 0.8%에 그쳤다.

동시에, 위험도와 자율성이 모두 높은 영역은 아직 드물지만 완전히 비어 있지는 않다. 연구진은 민감한 보안 관련 행동, 금융 관련 행위, 고객과의 실제 상호작용처럼 더 높은 위험과 자율성이 겹치는 사례가 이미 나타나고 있다고 본다.

그림 5: 작업 클러스터별 평균 위험도와 자율성

그림 5: 오른쪽 위, 곧 위험도와 자율성이 모두 높은 영역은 아직 성기지만 비어 있지 않다. 에이전트가 저위험 영역에 주로 머물러 있는 지금도, 더 높은 위험의 전선(frontier)은 이미 형성되기 시작했다.

도메인 분포를 보면 더욱 분명하다. 오늘날 공개 API에서 관측되는 에이전트 활동의 절반 가까이는 소프트웨어 엔지니어링에 몰려 있다. 그 밖에도 비즈니스 운영, 금융, 의료, 사이버보안 등 여러 분야로의 작은 확산이 보인다.

그림 6: 도메인별 tool call 분포

그림 6: 소프트웨어 엔지니어링이 전체 tool call의 거의 절반을 차지한다. 다만 그 외 산업에서도 실험적 채택이 서서히 늘고 있다.

연구진은 이런 패턴이 아직 "초기 채택 국면"임을 보여 준다고 본다. 소프트웨어 엔지니어는 에이전트 도구를 가장 먼저 만들고 가장 먼저 실제 규모로 써 본 집단이다. 코드는 실행해 보고 결과를 확인할 수 있기 때문에, 에이전트를 신뢰하고 실수를 잡아내기가 다른 영역보다 쉽다. 법률, 의료, 금융처럼 검증 비용이 큰 영역에서는 같은 곡선이 반복될지 아직 열려 있다.

한계

원문은 이 연구가 어디까지나 시작이라고 강조한다. 주요 한계는 다음과 같다.

  • 분석 대상은 앤트로픽 모델 기반 시스템뿐이다. 다른 모델 제공자 위에서 작동하는 에이전트는 다른 채택 패턴과 상호작용을 보일 수 있다.
  • 공개 API와 Claude Code는 서로 보완적이지만 둘 다 불완전하다. 하나는 넓고 얕고, 다른 하나는 깊지만 좁다.
  • 위험도, 자율성, 인간 개입 여부 같은 분류는 Claude가 생성했다. 내부 데이터와 대조 검증했지만, 프라이버시 제약 때문에 전수 수동 검토는 불가능했다.
  • 분석 기간은 2025년 말부터 2026년 초까지의 특정 시점이다. 에이전트 환경은 매우 빠르게 변하고 있어 패턴이 쉽게 달라질 수 있다.
  • 공개 API에서는 개별 tool call을 샘플링하므로, 여러 연속 호출이 필요한 워크플로우가 더 두드러져 보일 수 있다.
  • 고객이 공개 API 위에 구축한 더 넓은 시스템 구조는 대부분 보이지 않는다. API 수준에서 자율적으로 보이는 에이전트도, 실제 제품 전체에서는 하류 단계에서 인간 검토를 거칠 수 있다.

앞으로

연구진은 자율성이 계속 커지고 있고, Cowork 같은 제품이 에이전트를 더 쉽게 배포하게 만들수록 더 높은 위험의 배치도 늘어날 것으로 본다. 이에 따라 세 부류의 행위자에게 권고를 제시한다.

첫째, 모델 개발자와 제품 개발자는 배포 후 모니터링(post-deployment monitoring)에 투자해야 한다. 사전 평가가 통제된 환경에서 모델이 무엇을 할 수 있는지 보여 준다면, 배포 후 모니터링은 사람들이 무엇을 실제로 맡기고 어떤 감독 전략을 쓰는지 보여 준다. 이 연구의 핵심 발견 상당수는 배포 전 테스트만으로는 관찰할 수 없는 종류의 것들이다.

둘째, 모델은 자기 불확실성을 인식하고 드러내도록 훈련될 필요가 있다. 스스로 멈춰 질문하는 능력은 인간 승인 체계와 접근 제한을 보완하는 중요한 안전 속성이다.

셋째, 제품은 인간 감독을 위한 설계를 더 정교하게 해야 한다. 원문은 숙련 사용자가 개별 행동 승인에서 벗어나 모니터링과 중간 개입으로 이동한다는 점을 들어, 특정 상호작용 패턴을 성급히 규제하는 데는 신중해야 한다고 말한다. 특히 모든 행동에 대한 일률적 사전 승인을 강제하는 정책은 현실의 숙련 사용 패턴과 어긋날 수 있다.

연구진이 가장 강조하는 교훈은 자율성이 모델 혼자서 결정되는 속성이 아니라는 점이다. 실제 현장에서의 자율성은 모델, 사용자, 제품이 함께 만든다. Claude는 불확실할 때 스스로 질문하며 자율성을 제한한다. 사용자는 경험이 쌓일수록 신뢰를 형성하고 감독 방식을 바꾼다. 제품은 어떤 행동을 허용하고 어떤 순간에 인간을 끼워 넣을지 결정한다. 따라서 에이전트 감독의 문제는 모델 성능만의 문제가 아니라, 인간-AI 상호작용 설계와 배포 후 관측 인프라 전체의 문제라는 것이 이 글의 핵심 결론이다.

Related content (관련 글)