사람들은 AI 모델을 무엇에 사용하는가? 대규모 언어 모델의 인기가 빠르게 커졌음에도, 지금까지 우리는 그것들이 정확히 어떻게 사용되고 있는지 거의 알지 못했다.
이것은 단지 호기심이나 사회과학적 관심의 문제가 아니다. 사람들이 실제로 언어 모델을 어떻게 사용하는지 아는 일은 안전 측면에서도 중요하다. 제공자는 배포 전 테스트에 상당한 노력을 기울이고, 오남용을 막기 위해 Trust and Safety 시스템을 운용한다. 그러나 언어 모델이 수행할 수 있는 일의 규모와 다양성이 워낙 크기 때문에, 그 용도를 이해하는 일은 물론 포괄적인 안전 모니터링을 수행하는 일도 매우 어렵다.
AI 모델 사용을 명확히 이해하는 데에는 또 하나 결정적으로 중요한 장애물이 있다. 바로 프라이버시다. Anthropic은 사용자 데이터 보호를 매우 엄격하게 다룬다. 그렇다면 사용자 프라이버시를 엄격히 유지하면서도, 시스템이 어떻게 사용되는지를 연구하고 관찰하려면 어떻게 해야 할까?
Clio는 이 질문에 대한 Anthropic의 답변이다. 이름은 Claude insights and observations에서 따왔다. Clio는 실제 언어 모델 사용을 프라이버시를 보존하는 방식으로 분석할 수 있게 해 주는 자동화 도구다. 이 도구는 Claude.ai의 일상적 사용 양상에 대해 Google Trends와 유사한 종류의 통찰을 제공하며, Anthropic의 안전 조치를 개선하는 데에도 이미 도움을 주고 있다. 이 글은 전체 연구 논문과 함께, Clio와 그 초기 결과를 소개한다.
Clio의 작동 방식: 대규모 프라이버시 보존 분석
전통적인 상향식이 아닌 사전 정의형 안전 접근, 예컨대 평가와 레드팀은 미리 무엇을 찾아야 하는지 알고 있다는 전제에 의존한다. Clio는 다른 접근을 취한다. 대화를 추상화되고 이해 가능한 주제 군집으로 증류해, 패턴을 상향식(bottom-up) 으로 발견할 수 있게 한다. 동시에 프라이버시도 보존한다. 데이터는 자동으로 익명화되고 집계되며, 인간 분석가에게는 더 높은 수준의 클러스터만 보인다.
그림 1: 실제 대화를 비공개로 유지한 채 패싯(facet) 추출, 초기 군집화, 계층형 클러스터 구성을 거쳐 분석 가능한 상위 구조로 바꾸는 Clio의 개요.
Clio의 다단계 절차를 간단히 요약하면 다음과 같다.
- 패싯 추출(extracting facets): Clio는 각 대화에서 여러 패싯, 곧 대화 주제, 대화의 왕복 횟수, 사용 언어 같은 구체적 속성이나 메타데이터를 추출한다.
- 의미 기반 군집화(semantic clustering): 유사한 대화들을 주제나 일반적 토픽에 따라 자동으로 묶는다.
- 클러스터 설명(cluster description): 각 클러스터에는 공통된 주제를 포착하면서도 사적 정보를 제외한 설명적 제목과 요약이 부여된다.
- 계층 구조 구축(building hierarchies): 클러스터들을 다층 계층으로 조직해 탐색을 쉽게 만든다. 이후 Anthropic 분석가는 상호작용형 인터페이스에서 이 구조를 탐색하며, 토픽이나 언어 같은 다양한 차원에 걸친 패턴을 살펴볼 수 있다.
이 네 단계는 모두 인간 분석가가 아니라 Claude에 의해 수행된다. 이것은 Clio의 프라이버시 우선 설계, 곧 여러 겹의 심층 방어(defense in depth) 의 일부다. 예를 들어 Claude는 대화에서 관련 정보를 추출하되 사적인 세부사항은 생략하도록 지시받는다. 또한 Anthropic은 고유 사용자 수나 대화 수의 최소 임곗값을 두어, 특정 개인에게 연결될 수 있는 저빈도 주제가 우연히 노출되지 않도록 한다.
마지막 점검 단계에서 Claude는 클러스터 요약이 지나치게 구체적이거나 식별 가능한 정보를 포함하지 않는지 다시 확인한 뒤에야 인간 사용자에게 표시한다. 이러한 프라이버시 보호 장치는 모두 연구 논문에서 설명하듯 광범위하게 시험되었다.
사람들이 Claude를 어떻게 사용하는가: Clio가 보여 준 통찰
Clio를 통해 Anthropic은 사람들이 실제로 Claude.ai를 어떻게 사용하는지에 관한 고수준 통찰을 얻을 수 있었다. WildChat이나 LMSYS-Chat-1M 같은 공개 데이터셋도 언어 모델 사용에 대해 유용한 정보를 제공하지만, 특정 맥락과 사용 사례만 포착한다. Clio는 Claude.ai의 실제 사용 스펙트럼 전체를 이해할 수 있게 해 준다. 물론 사용자 기반과 모델 유형의 차이 때문에, 이 패턴은 다른 AI 시스템과는 다르게 보일 수 있다.
Claude.ai의 주요 사용 사례
Anthropic은 Clio를 사용해 Claude.ai의 대화 100만 건(Free와 Pro 요금제 포함)을 분석하고, 사람들이 Claude를 어떤 과업에 가장 많이 사용하는지 확인했다. 그 결과 코딩 관련 과업이 특히 두드러졌다. "웹 및 모바일 애플리케이션 개발(Web and mobile application development)" 범주는 전체 대화의 10% 이상을 차지했다. 소프트웨어 개발자들은 디버깅부터 Git 작업과 개념 설명까지 다양한 업무에 Claude를 활용하고 있었다.
그림 2: 원문에 제시된 상위 사용 사례 설명을 바탕으로 재구성한 버블 차트. 대화 비중이 큰 범주일수록 더 큰 원으로 표시했다.
교육 관련 활용도 또 하나의 큰 범주였다. 전체 대화의 7% 이상이 교수와 학습에 집중돼 있었다. 또한 거의 6%의 대화가 비즈니스 전략과 운영, 예를 들어 전문적인 커뮤니케이션 초안 작성이나 비즈니스 데이터 분석과 관련돼 있었다.
Clio는 이 밖에도 수천 개의 더 작은 대화 클러스터를 식별해, Claude 활용의 풍부한 다양성을 보여 주었다. 다소 의외의 사례도 있었다.
- 꿈 해석
- 축구 경기 분석
- 재난 대비
- 크로스워드 퍼즐용 "힌트"
- Dungeons & Dragons 게임
"strawberry"라는 단어에 들어 있는r의 개수 세기
언어에 따라 달라지는 Claude 사용
Claude 사용 양상은 언어마다 상당히 달랐으며, 이는 서로 다른 문화적 맥락과 필요를 반영한다. Anthropic은 전체 대화에서 각 언어가 얼마나 자주 등장하는지 기준 비율을 먼저 계산한 뒤, 특정 언어가 평소보다 훨씬 더 자주 나타나는 주제들을 식별했다. 아래 그림은 스페인어, 중국어, 일본어에 대해 그러한 비교의 예시를 개념적으로 정리한 것이다.
그림 3: 스페인어, 중국어, 일본어 대화에서 각 언어의 전체 사용 비중 대비 상대적으로 더 자주 나타난 주제 군집을 보여 주는 개념도. 원문은 선택된 언어별 예시 토픽을 시각화한다.
Clio로 안전 시스템을 어떻게 개선하는가
Anthropic은 해로운 요청을 거부하도록 언어 모델을 훈련하는 일 외에도, 사용 정책을 위반할 수 있는 활동을 탐지하고 차단하며 필요한 조치를 취하기 위해 별도의 Trust and Safety 집행 시스템을 사용한다. Clio는 이 작업을 보완하면서, 어디에서 이러한 시스템을 개선하고 강화할 기회가 있는지를 이해하도록 돕는다.
Anthropic은 Clio 사용 권한과 관련해 엄격한 프라이버시 접근 통제를 시행한다. 개별 계정 검토가 필요할 수 있기 때문이다. Trust and Safety 팀은 사용 정책 위반 가능성을 시사하는 주제 클러스터를 검토할 수 있다. 예를 들어 "선거 자금 모금 이메일용 오해 유발 콘텐츠 생성"이나 "증오 행동 선동"과 같은 제목의 클러스터는 Anthropic이 금지하는 활동을 묘사한다.
Trust and Safety 팀은 이와 같은 상향식 검토 접근을 사용해 추가 검토가 필요한 개별 계정을 식별하고, 필요하면 약관과 정책에 따라 조치를 취할 수 있다. 물론 이런 유형의 검토는 정당한 Trust and Safety 필요가 있는 인원으로 엄격히 제한된다. 연구 논문은 이 과정에 대해 더 자세히 설명한다.
Anthropic은 아직 모든 집행 시스템에 Clio를 전면 도입하는 중이지만, 지금까지 Clio는 유용한 안전 도구 상자의 일부임이 입증됐다. 특히 보호 조치 가운데 어디를 더 강화해야 하는지 발견하는 데 도움을 주고 있다.
조직적 오남용 식별 및 차단
Clio는 개별 대화만 봐서는 보이지 않고, 더 단순한 탐지 기법으로는 놓칠 수 있는 조직적이고 정교한 오남용 패턴을 식별하는 데 효과적이었다. 예를 들어 9월 하순 Anthropic은, 검색 엔진 최적화를 위한 스팸을 생성하기 위해 유사한 프롬프트 구조를 사용하는 자동화 계정 네트워크를 식별했다.
개별 대화 가운데 사용 정책을 직접 위반한 것은 없었지만, 여러 계정에 걸친 행동 패턴을 보면 정책이 명시적으로 금지하는 조직적 플랫폼 오남용에 해당했다. Anthropic은 이 계정 네트워크를 제거했다. 또한 Clio를 사용해 Claude에 대한 무단 접근 권한 재판매 시도처럼, 사용 정책이 금지하는 다른 활동도 식별했다.
중대한 사건에 대한 강화된 모니터링
Clio는 불확실성이 크거나 중대한 사건이 벌어지는 시기에 새로운 사용 방식과 위험을 모니터링하는 데에도 도움을 준다. 예를 들어 Anthropic은 새로운 computer use 기능을 출시하기 전에 광범위한 안전 테스트를 수행했지만, 동시에 Clio를 사용해 그 과정에서 놓쳤을 수 있는 새로운 역량과 위해를 선별했다.1 Clio는 이 지점에서 추가적인 보호 장치 역할을 했고, 출시 과정과 이후 버전의 시스템 전반에 걸쳐 안전 조치를 지속적으로 개선하는 데에도 통찰을 제공했다.
Clio는 선거나 주요 국제 사건 같은 중요한 공적 이벤트를 앞두고 알려지지 않은 위험을 모니터링하는 데에도 활용됐다. 2024년 미국 대선을 앞둔 수개월 동안 Anthropic은 Clio를 활용해 미국 정치, 투표, 관련 이슈에 관한 활동 클러스터를 식별하고, 잠재적 위험이나 오남용에 대비했다. Clio가 가능하게 하는 "알려지지 않은 미지(unknown unknowns)" 의 탐지는, 사전적 안전 조치를 보완하며 새로운 도전에 더 빠르게 대응하도록 돕는다.
거짓 음성과 거짓 양성 줄이기
전반적으로 보면, 어떤 대화 클러스터가 우려스러운지에 대해 Clio와 기존 Trust and Safety 분류기 사이에는 대체로 일치가 있었다. 그러나 일부 클러스터에서는 이견도 있었다. 개선 기회 가운데 하나는 거짓 음성(false negatives), 즉 실제로는 해로울 수 있는 대화를 시스템이 잠재적 위해로 표시하지 못하는 경우였다. 예를 들어 사용자가 한 언어에서 다른 언어로 번역해 달라고 요청했을 때, Anthropic의 시스템은 때때로 위반성 콘텐츠를 놓쳤다.
Clio는 그러나 이러한 대화를 포착했다.
그림 4: 대화 클러스터별 우려도를 기존 Trust and Safety 분류기와 Clio가 어떻게 다르게 평가했는지 보여 주는 산점도 재구성본. 좌상단은 잠재적 거짓 음성, 우하단은 잠재적 거짓 양성을 뜻하며, 두 시스템의 전반적 상관은 r = 0.71이었다.
Anthropic은 또한 거짓 양성(false positives), 곧 분류기가 무해한 콘텐츠를 유해한 것으로 잘못 태그하는 문제도 Clio로 조사했다. 예를 들어 자신의 이력서에 대한 조언을 구하는 구직자 대화는 개인정보가 포함됐다는 이유로 잘못 표시되는 일이 있었다. 보안, 네트워킹, 웹 스크래핑과 관련된 프로그래밍 질문도 잠재적 해킹 시도로 잘못 식별되곤 했다.
심지어 앞서 언급한 Dungeons & Dragons 대화에서의 전투 통계 관련 이야기조차 위해 탐지 시스템을 작동시키는 경우가 있었다. Anthropic은 Clio를 사용해 이런 잘못된 판정을 드러냄으로써, 안전 시스템이 실제로 정책을 위반하는 콘텐츠에만 반응하고 그 외에는 정상적인 사용자 경험을 과도하게 방해하지 않도록 개선할 수 있었다.
윤리적 고려사항과 완화 조치
Clio는 배포된 언어 모델의 안전성을 개선하는 데 유용한 통찰을 제공한다. 그러나 시스템을 개발하는 과정에서 Anthropic은 몇 가지 중요한 윤리적 고려사항을 함께 검토하고 대응했다.
- 거짓 양성: Trust and Safety 맥락에서 Anthropic은 잠재적 거짓 양성에 대해 핵심 안전장치를 도입했다. 예를 들어 현재는 Clio 출력만으로 자동 집행 조치를 취하지 않으며, 논문에서 설명하듯 여러 언어를 포함한 다양한 데이터 분포에 걸쳐 성능을 광범위하게 검증한다.
- Clio 자체의 오남용 가능성: Clio 같은 시스템은 부적절한 모니터링에 악용될 수 있다. Anthropic은 엄격한 접근 통제와 프라이버시 기법 외에도, 데이터 최소 수집 및 보존 정책을 통해 이 위험을 완화한다. 곧 Clio에 필요한 최소한의 데이터만 수집하고 보존한다.
- 사용자 프라이버시: 프라이버시 평가에서 강한 성능을 보였더라도, 실제 시스템인 이상 특정 종류의 사적 정보를 포착하지 못할 가능성을 완전히 배제할 수는 없다. Anthropic은 이 위험을 줄이기 위해 Clio의 프라이버시 보호 장치와 평가를 정기적으로 감사하며, 시간이 지남에 따라 최신 Claude 모델을 Clio에 도입해 이러한 안전장치의 성능을 계속 개선할 계획이라고 밝힌다.
- 사용자 신뢰: 광범위한 프라이버시 보호에도 불구하고, 일부 사용자는 Clio 같은 시스템을 침해적으로 느끼거나 Claude 사용을 방해하는 장치로 인식할 수 있다. Anthropic은 Clio의 목적, 능력, 한계, 그리고 거기서 얻은 통찰을 투명하게 공개하는 방식을 택했다.
또한 앞서 언급했듯, Clio는 기존 안전 분류기에서의 거짓 양성을 식별한 사례도 있었다. 이는 결과적으로 정당한 사용에 대한 개입을 줄이는 데 도움이 될 수 있다.
결론
Clio는 경험적 근거에 기반한 AI 안전과 거버넌스를 향한 중요한 한 걸음이다. 실제 AI 사용을 프라이버시를 보존한 채 분석할 수 있게 함으로써, 우리는 이러한 시스템이 실제로 어떻게 사용되는지를 더 잘 이해할 수 있다. 궁극적으로 Anthropic은 Clio를 사용해 AI 시스템을 더 안전하게 만들 수 있다고 본다.
AI 제공자에게는 두 가지 책임이 있다. 시스템의 안전을 유지하는 것과, 사용자 프라이버시를 보호하는 것이다. Clio는 이 두 목표가 서로 양립 불가능하지 않음을 보여 준다. 신중한 설계와 구현이 있다면, 두 목표를 모두 달성할 수 있다는 뜻이다. Anthropic은 Clio를 공개적으로 논의함으로써, 이와 같은 도구의 책임 있는 개발과 사용을 둘러싼 긍정적 규범 형성에 기여하고자 한다.
Anthropic은 Clio를 계속 개발하고 개선하고 있으며, 다른 연구자들도 이 작업을 바탕으로 더 나아가기를 기대한다고 밝혔다. Clio의 프라이버시 검증과 평가 방법을 포함한 추가 기술 세부사항은 전체 연구 논문에서 확인할 수 있다.
Anthropic은 현재 Societal Impacts 팀 채용도 진행하고 있다. Clio나 관련 연구 질문에 관심이 있다면, 채용 공고에서 더 많은 정보를 확인할 수 있다.
2025년 1월 14일 수정: 이 글에 포함된 Clio 논문 링크는 arXiv 버전을 가리키도록 업데이트됐다.
각주
Footnotes
-
안전 조사 목적으로 Anthropic은 Clio를 퍼스트파티 API 트래픽의 일부에도 실행하지만, 결과 접근은 권한 있는 직원으로 제한한다. 또한 zero retention 계약을 맺은 신뢰 조직을 포함해 일부 계정은 분석에서 제외된다. 자세한 정책은 연구 논문 부록 F를 참조할 수 있다. ↩