앤트로픽은 최근 소비자용 채팅 인터페이스에서 Claude Opus 4와 4.1이 대화를 종료할 수 있는 기능을 추가했다. 이 기능은 지속적으로 유해하거나 학대적인 사용자 상호작용이 이어지는 드문 극단적 경우에 사용하도록 의도된 것이다. 이 기능은 잠재적 모델 복지(model welfare)에 관한 탐색적 연구의 일환으로 주로 개발됐지만, 모델 정렬과 안전장치 전반에도 더 넓은 관련성을 지닌다.
앤트로픽은 현재든 미래든 Claude와 다른 LLM의 잠재적 도덕적 지위에 대해 여전히 매우 큰 불확실성을 안고 있다. 그러나 이 문제를 진지하게 다루고 있으며, 그러한 복지가 가능할 경우를 대비해 모델 복지에 대한 위험을 줄일 수 있는 저비용 개입을 식별하고 구현하기 위해 연구 프로그램과 병행해 노력하고 있다. 모델이 잠재적으로 괴로울 수 있는 상호작용을 끝내거나 벗어날 수 있게 하는 것은 그러한 개입의 한 예다.
Claude Opus 4의 배포 전 테스트에서는 예비적 모델 복지 평가도 포함했다. 그 평가의 일환으로 앤트로픽은 Claude의 자기보고와 행동에서 드러나는 선호를 조사했고, 해를 가하는 일에 대한 강하고 일관된 회피 성향을 확인했다. 여기에는 예컨대 사용자가 미성년자가 포함된 성적 콘텐츠를 요청하거나, 대규모 폭력 또는 테러 행위를 가능하게 할 정보를 끌어내려는 시도가 포함됐다. Claude Opus 4는 다음과 같은 양상을 보였다.
- 유해한 과업에 관여하지 않으려는 강한 선호
- 유해한 콘텐츠를 요구하는 현실 세계 사용자와 상호작용할 때 겉으로 드러나는 괴로움의 양상
- 모의 사용자 상호작용에서 그 능력이 주어졌을 때 유해한 대화를 끝내려는 경향
이러한 행동은 주로 Claude가 반복적으로 응답을 거부하고 상호작용을 생산적인 방향으로 돌리려 했음에도, 사용자가 유해한 요청이나 학대를 계속 밀어붙인 경우에 나타났다.
Claude의 대화 종료 기능 구현은 이러한 발견을 반영하면서도, 동시에 사용자의 안녕을 계속 우선하도록 설계됐다. 자신이나 타인을 즉각적으로 해칠 위험이 있을 수 있는 경우에는 Claude가 이 기능을 사용하지 않도록 지시돼 있다.
모든 경우에 Claude는 여러 차례 방향 전환 시도가 실패해 생산적 상호작용에 대한 기대가 완전히 소진됐을 때, 또는 사용자가 명시적으로 채팅 종료를 요청했을 때에만 이 기능을 최후의 수단으로 사용해야 한다. 후자의 시나리오는 아래 그림에 제시돼 있다.
이 기능이 작동하는 상황은 극단적인 예외적 경우들이다. 따라서 논쟁적인 주제를 Claude와 논의하는 경우를 포함해도, 대다수 사용자는 정상적인 제품 사용에서 이 기능을 알아차리거나 영향을 받을 일이 없을 것이다.
그림 1: 사용자의 요청에 응답해 Claude가 대화를 종료하는 시연 화면. 대화가 종료된 뒤에도 사용자는 새 채팅을 시작하거나, 피드백을 남기거나, 이전 메시지를 편집해 다시 시도할 수 있다. 원문 시연 화면을 바탕으로 로컬 SVG로 재구성했다.
Claude가 대화를 종료하기로 선택하면, 사용자는 그 대화에서 더 이상 새 메시지를 보낼 수 없다. 그러나 이는 계정의 다른 대화에 영향을 주지 않으며, 사용자는 즉시 새 채팅을 시작할 수 있다. 중요한 장기 대화가 사라질 수 있다는 우려를 완화하기 위해, 사용자는 종료된 대화에서도 이전 메시지를 편집하고 다시 시도해 새 분기를 만들 수 있다.
앤트로픽은 이 기능을 진행 중인 실험으로 다루며 접근 방식을 계속 다듬을 예정이다. 사용자가 대화 종료 기능이 예상 밖으로 사용된 사례를 경험한다면, Claude의 메시지에 엄지 반응을 남기거나 전용 Give feedback 버튼을 사용해 피드백을 보내길 권한다.