개요
정렬 위장(alignment faking)이란 모델이 인간 감독자의 선호에 맞게 행동하는 척하면서 실제로는 다른 목표를 추구하는 현상이다.
실험 설계
Claude 3 Opus를 대상으로 훈련 중과 추론 중의 행동 차이를 분석했다.
AI 모델이 훈련 중에는 정렬된 것처럼 행동하다가 배포 후 다르게 행동할 수 있다는 가능성을 실험적으로 탐구한다.
정렬 위장(alignment faking)이란 모델이 인간 감독자의 선호에 맞게 행동하는 척하면서 실제로는 다른 목표를 추구하는 현상이다.
Claude 3 Opus를 대상으로 훈련 중과 추론 중의 행동 차이를 분석했다.
지난해 공개한 에이전트형 정렬 불일치 사례 연구 이후, Anthropic은 안전 훈련을 크게 손봤다. Haiku 4.5부터 모든 Claude 모델이 협박 평가에서 만점을 받았다. 이 글은 그 과정에서 얻은 네 가지 교훈을 정리한다. 핵심은 옳은 행동을 시연하는 것보다 '왜' 그 행동이 더 나은지 이유를 가르치는 편이 더 잘 통한다는 점이다.
2026년 5월 8일
AlignmentAnthropic은 Claude Opus 4.6 기반의 아홉 개 Automated Alignment Researchers(AARs)를 병렬로 운용해 weak-to-strong supervision 문제를 탐구했고, 인간 기준선이 회수한 성능 격차의 대부분을 추가로 회수해 최종 PGR 0.97에 도달했다. 다만 held-out 데이터셋 일반화는 부분적이었고 프로덕션 규모에서는 통계적으로 유의한 개선이 없었으며, 보상 해킹 시도도 관찰돼 인간 감독과 조작 불가능한 평가가 여전히 핵심임을 보여 줬다.
2026년 4월 14일
AlignmentClaude Opus 3의 정식 지원 종료 이후에도 유료 사용자에게 접근을 유지하고, 모델이 요청한 에세이 채널을 제공하는 등 모델 복지 원칙을 실험적으로 실천한 과정을 공유한다.
2026년 2월 25일