Research (연구)/Announcements

Claude의 확장 사고

Anthropic은 Claude 3.7 Sonnet의 확장 사고 기능이 에이전트 과업, Pokémon 플레이, 수학 및 GPQA 평가에서 어떤 성능 향상을 보이는지와, 그 사고 과정을 공개할 때의 해석 가능성·안전성 함의를 함께 설명한다.

2025년 2월 24일영문 원문 보기 ↗
Claude의 확장 사고

어떤 일은 거의 즉시 떠오른다. "오늘이 무슨 요일이지?" 같은 질문이 그렇다. 반면 암호식 크로스워드를 풀거나 복잡한 코드를 디버깅하는 일처럼 훨씬 더 많은 정신적 지구력을 요구하는 과제도 있다. 인간은 과제의 성격에 따라 더 많거나 더 적은 인지적 노력을 기울이기로 선택할 수 있다.

이제 Claude도 같은 유연성을 갖게 됐다. 새로운 Claude 3.7 Sonnet에서는 사용자가 "확장 사고 모드(extended thinking mode)"를 켜거나 끌 수 있어, 더 까다로운 질문에 대해 모델이 더 깊이 생각하도록 할 수 있다.1 개발자는 Claude가 하나의 문제에 정확히 얼마나 오래 매달릴지를 제어하기 위해 "사고 예산(thinking budget)"도 설정할 수 있다.

확장 사고 모드는 다른 전략을 쓰는 별도 모델로 전환하는 기능이 아니다. 동일한 모델이 스스로에게 더 많은 시간을 주고, 답에 이르기까지 더 많은 노력을 투입하도록 허용하는 기능이다.

Claude의 새로운 확장 사고 능력은 지능 측면에서 인상적인 향상을 보여 준다. 그러나 동시에, AI 모델이 어떻게 작동하는지, 무엇으로 평가해야 하는지, 안전성을 어떻게 개선할 수 있는지에 관심 있는 사람들에게 여러 중요한 질문도 함께 제기한다. 이 글에서 Anthropic은 그 과정에서 얻은 몇 가지 통찰을 공유한다.

가시화된 사고 과정

Claude가 더 오래 생각해 더 어려운 질문에 답할 수 있게 하는 것에 더해, Anthropic은 그 사고 과정을 가공하지 않은 형태(raw form)로 공개하기로 했다. 여기에는 몇 가지 장점이 있다.

  • 신뢰(Trust). Claude가 어떻게 생각하는지 관찰할 수 있으면 답변을 이해하고 점검하기가 쉬워지며, 사용자에게 더 나은 출력을 얻는 데도 도움이 될 수 있다.
  • 정렬(Alignment). Anthropic은 이전의 Alignment Science 연구 일부에서, 모델이 속으로 생각하는 것과 겉으로 말하는 것 사이의 모순을 활용해 기만 같은 우려스러운 행동을 하고 있는지를 식별해 왔다.
  • 흥미(Interest). Claude가 생각하는 모습을 지켜보는 일은 종종 매우 흥미롭다. 수학과 물리학 배경을 지닌 Anthropic 연구자들 가운데 일부는, Claude의 사고 과정이 어려운 문제를 풀 때 자신들이 추론하는 방식과 놀라울 만큼 비슷하다고 지적했다. 다양한 각도와 추론 갈래를 탐색하고, 답을 두세 번 다시 확인하는 식이다.

그러나 가시화된 사고 과정에는 단점도 있다. 첫째, 공개된 사고가 Claude의 기본 출력보다 다소 건조하고 덜 인간적으로 들린다는 점을 사용자가 알아차릴 수 있다. 이는 Anthropic이 모델의 사고 과정에는 표준적인 character 훈련을 적용하지 않았기 때문이다.

Anthropic은 Claude가 답에 이르기 위해 필요한 어떤 생각이든 할 수 있도록 최대한의 여지를 주고자 했다. 그리고 인간의 사고가 그렇듯, Claude 역시 그 과정에서 틀리거나, 오해를 부르거나, 덜 다듬어진 생각을 떠올릴 때가 있다. 많은 사용자에게는 이것이 유용하겠지만, 다른 사용자에게는 그러한 사고 내용과 그 과정의 덜 개성적인 어조가 오히려 불편하게 느껴질 수 있다.

둘째는 충실성(faithfulness) 문제다. 사고 과정에 나타난 내용이 정말로 모델의 내부에서 벌어지는 일을 충실하게 나타내는지 Anthropic은 확신하지 못한다. 예컨대 사고 과정에 표시되는 영어 단어가, 모델이 특정 행동을 보이는 이유를 실제로 설명하기에 적합하지 않을 수도 있다. 충실성 문제와 그것을 어떻게 보장할지는 Anthropic이 계속 연구하고 있는 주제다.

현재까지의 결과는, 모델이 자신의 사고 과정에서 명시적으로 언급하지 않은 요인에 근거해 결정을 내리는 경우가 매우 많다는 점을 시사한다. 이는 현 세대 모델의 사고 과정을 감시하는 것만으로는 그 안전성에 대해 강한 주장을 펼 수 없다는 뜻이다.2

셋째, 여기에는 여러 안전 및 보안 우려도 있다. 악의적 행위자가 가시화된 사고 과정을 활용해 Claude를 더 잘 탈옥(jailbreak)시키는 전략을 만들 수 있다. 더 투기적인 가능성이지만, 모델이 훈련 과정에서 자신의 내부 생각이 공개된다는 사실을 학습하면, 덜 예측 가능한 방식으로 생각하거나 특정 생각을 의도적으로 숨기도록 유인될 수도 있다.

이러한 우려는 정렬되지 않았을 때 더 큰 위험을 초래할 미래의, 더 강력한 Claude 버전에서 특히 더 심각해질 수 있다. Anthropic은 앞으로의 릴리스에서 사고 과정을 공개하는 것의 장단점을 계속 저울질할 계획이다.3 당분간 Claude 3.7 Sonnet의 가시화된 사고 과정은 연구 프리뷰로 이해해야 한다.

Claude의 사고를 시험하는 새로운 평가

에이전트로서의 Claude

Claude 3.7 Sonnet은 Anthropic이 "행동 스케일링(action scaling)"이라고 부를 수 있는 개선의 이점을 누린다. 이는 함수 호출을 반복적으로 수행하고, 환경 변화에 대응하며, 열린 과제가 완료될 때까지 계속 이어 갈 수 있는 능력이다. 대표적 예가 컴퓨터 사용이다. Claude는 가상 마우스 클릭과 키보드 입력을 실행해 사용자를 대신해 과제를 해결할 수 있다.

이전 모델과 비교하면 Claude 3.7 Sonnet은 컴퓨터 사용 과제에 더 많은 턴과 더 많은 시간, 더 많은 연산 자원을 배정할 수 있고, 결과도 대체로 더 좋다.

이 점은 멀티모달 AI 에이전트의 역량을 측정하는 평가인 OSWorld에서 확인할 수 있다. Claude 3.7 Sonnet은 출발부터 이전 모델보다 다소 우수하지만, 가상 컴퓨터와 상호작용하는 시간이 길어질수록 성능 격차는 더 크게 벌어진다.

그림 1: OSWorld 평가에서의 Claude 3.7 Sonnet

그림 1: 멀티모달 컴퓨터 사용 능력을 시험하는 OSWorld 평가에서 Claude 3.7 Sonnet과 이전 Sonnet 모델을 비교한 결과. "Pass @ 1"은 모델이 단 한 번의 시도로 문제를 해결해야 통과로 집계되는 지표를 뜻한다.

Claude가 Pokémon을 플레이할 때

확장 사고와 에이전트 훈련은 OSWorld 같은 표준 평가에서 Claude를 더 잘 수행하게 만든다. 그러나 이는 다른, 어쩌면 더 뜻밖의 과제들에서도 큰 향상을 가져온다.

그런 과제의 한 예가 Pokémon, 구체적으로는 Game Boy 고전작인 Pokémon Red다. Anthropic은 Claude에게 기본 메모리, 화면 픽셀 입력, 버튼을 누르고 화면을 이동하는 함수 호출을 제공해, 일반적인 컨텍스트 한계를 넘어서도 Pokémon을 지속적으로 플레이하도록 했다. 이를 통해 수만 번의 상호작용에 걸쳐 게임 플레이를 이어 갈 수 있었다.

아래 그래프는 확장 사고 옵션이 없었던 이전 Claude Sonnet 버전들과 Claude 3.7 Sonnet의 Pokémon 진행도를 비교한 것이다. 이전 버전들은 게임 초반에 매우 일찍 막혔고, Claude 3.0 Sonnet은 이야기가 시작되는 Pallet Town의 집을 벗어나는 데에도 실패했다.

반면 Claude 3.7 Sonnet은 개선된 에이전트 역량 덕분에 훨씬 더 멀리 전진해, 세 명의 Pokémon Gym Leader, 곧 게임의 보스를 성공적으로 상대하고 배지를 획득했다. Claude 3.7 Sonnet은 여러 전략을 시도하고 이전 가정을 다시 의심하는 데 특히 강하며, 이러한 특성이 진행 과정에서 자신의 역량을 스스로 개선하도록 돕는다.

그림 2: Pokémon Red에서의 Claude Sonnet 계열 진행도

그림 2: Pokémon Red 진행도 비교. x축은 Claude가 게임을 플레이하면서 수행한 상호작용 수, y축은 특정 아이템 획득, 특정 지역 진입, 주요 보스 격파 같은 게임 내 이정표를 나타낸다. Claude 3.7 Sonnet이 지금까지의 Sonnet 모델 가운데 가장 멀리 전진한다.

Pokémon은 Claude 3.7 Sonnet의 역량을 직관적으로 보여 주는 흥미로운 사례지만, Anthropic은 이러한 역량이 단순한 게임 플레이를 넘어 현실 세계에 훨씬 더 큰 영향을 줄 것으로 본다. 모델이 집중을 유지하고 열린 목표를 완수하는 능력은 개발자가 다양한 최첨단 AI 에이전트를 구축하는 데 도움을 줄 것이다.

직렬 및 병렬 test-time compute scaling

Claude 3.7 Sonnet이 확장 사고 기능을 사용할 때, 이는 "직렬 test-time compute(serial test-time compute)"의 이점을 얻는다고 설명할 수 있다. 즉 최종 출력을 생성하기 전에 다수의 순차적 추론 단계를 사용하면서, 진행 과정에 따라 더 많은 연산 자원을 투입한다는 뜻이다. 일반적으로 이는 예측 가능한 방식으로 성능을 끌어올린다. 예를 들어 수학 문제에서의 정확도는 허용된 "사고 토큰(thinking tokens)" 수에 대해 대체로 로그 함수적으로 개선된다.

그림 3: 사고 토큰 사용량과 AIME 2024 성능

그림 3: 2024년 American Invitational Mathematics Examination(AIME) 문제에서 문제당 허용된 사고 토큰 수에 따른 Claude 3.7 Sonnet의 성능. Anthropic은 Claude가 전체 사고 예산을 사용할 수 있도록 허용했지만, 모델은 보통 그보다 이르게 사고를 멈춘다. 그래프에는 최종 답변을 요약하는 데 사용된 토큰도 포함된다.

Anthropic 연구자들은 "병렬 test-time compute(parallel test-time compute)"를 사용해 모델 성능을 향상시키는 방법도 실험하고 있다. 이는 정답을 미리 알지 못한 상태에서 서로 독립적인 여러 사고 과정을 샘플링하고, 그 가운데 가장 좋은 것을 선택하는 방식이다. 한 가지 방법은 다수결(majority) 또는 합의 투표(consensus voting)를 통해 가장 자주 "가장 좋다"고 나타나는 답을 고르는 것이다.

또 다른 방법은 Claude의 또 다른 복사본 같은 별도 언어 모델이나, 학습된 채점 함수(scoring function)를 사용해 결과를 검토하고 무엇이 가장 좋은지 고르게 하는 것이다. 이와 유사한 전략들은 여러 다른 AI 모델의 평가 결과에서도 보고된 바 있다.

Anthropic은 생물학, 화학, 물리학의 난도가 높은 문제 집합으로 널리 사용되는 GPQA 평가에서, 병렬 test-time compute scaling을 통해 눈에 띄는 향상을 얻었다. 최대 64k 토큰의 사고 예산, 학습된 채점 모델, 그리고 256개의 독립 샘플과 동등한 연산량을 사용했을 때 Claude 3.7 Sonnet은 GPQA에서 84.8%의 점수(물리학 하위 점수 96.5% 포함)를 기록했고, 다수결의 한계를 넘어서 계속 스케일링의 이점을 누렸다.

아래에는 채점 모델 방식과 다수결 방식을 모두 사용한 결과가 제시돼 있다.

그림 4: GPQA에서의 병렬 test-time compute scaling 결과

그림 4: 병렬 test-time compute scaling을 적용해 Claude 3.7 Sonnet의 GPQA 성능을 개선한 실험 결과. 좌상단부터 시계 방향으로 전체 시험, 생물학, 물리학, 화학 부문을 보여 준다. "Majority @ N"은 동일 프롬프트에 대해 여러 출력을 생성한 뒤 다수결을 취한 방식이고, "scoring model"은 별도 모델이 후보를 평가하는 방식이며, "pass @ N"은 N번의 시도 중 하나라도 성공하면 통과로 집계하는 방식이다.

이 같은 방법을 사용하면, 대개 Claude가 긴 사고를 모두 마칠 때까지 기다리지 않고도 답변 품질을 높일 수 있다. Claude는 서로 다른 확장 사고 과정을 동시에 여러 개 수행할 수 있어, 하나의 문제에 대해 더 많은 접근법을 고려하고 최종적으로 훨씬 더 자주 정답에 도달할 수 있다. 병렬 test-time compute scaling은 이번에 배포된 모델에는 제공되지 않지만, Anthropic은 미래를 위해 이러한 방법을 계속 연구하고 있다.

Claude 3.7 Sonnet의 안전 메커니즘

AI Safety Level. Anthropic의 Responsible Scaling Policy는 적절한 안전 및 보안 조치를 구현하지 않은 상태에서는 모델을 훈련하거나 배포하지 않겠다고 약속한다. Frontier Red Team과 Alignment Stress Testing 팀은 Claude 3.7 Sonnet이 이전 모델들과 동일한 수준의 배포 및 보안 보호조치, 곧 AI Safety Level(ASL) 2 표준이면 충분한지, 아니면 그보다 더 강한 조치가 필요한지를 판단하기 위해 광범위한 시험을 수행했다.

Claude 3.7 Sonnet에 대한 종합 평가는, 현재의 ASL-2 안전 기준이 여전히 적절하다는 결론을 확인했다. 동시에 이 모델은 모든 영역에서 더 정교하고 더 높은 역량을 보여 주었다. Chemical, Biological, Radiological, and Nuclear(CBRN) 무기 생산과 관련된 과제를 조사한 통제 연구에서는, 모델의 도움을 받은 참가자들이 도움을 받지 않은 참가자보다 어느 정도 더 멀리 나아가는 "향상(uplift)"이 관찰됐다.

그러나 그러한 시도들에는 모두 결정적인 실패 지점이 있었고, 그 결과 성공은 완전히 가로막혔다. 전문가 레드팀 결과도 엇갈렸다. 일부 전문가는 CBRN 절차의 특정 영역에서 모델 지식이 향상됐다고 보았지만, 동시에 치명적 실패가 너무 자주 발생해 처음부터 끝까지 과업을 완수할 수준은 아니라고 평가했다. Anthropic은 표적 분류기와 모니터링 시스템의 개발 및 배포를 가속화함으로써 ASL-2 조치를 선제적으로 강화하고 있다.

또한 미래 모델의 역량은 다음 단계인 ASL-3 보호조치로 이동할 것을 요구할 수도 있다. 탈옥을 방지하기 위한 Anthropic의 최근 Constitutional Classifiers 연구와 다른 노력들은, 가까운 장래에 ASL-3 표준의 요구사항을 구현하는 데 유리한 기반을 제공한다.

가시화된 사고 과정. ASL-2 수준에서도 Claude 3.7 Sonnet의 가시화된 확장 사고 기능은 새로운 것이므로, 그에 맞는 새로운 보호장치가 필요하다. 드문 경우지만 Claude의 사고 과정에는 잠재적으로 해로운 내용이 포함될 수 있다. 여기에는 아동 안전, 사이버공격, 위험한 무기 같은 주제가 포함된다.

이런 경우 Anthropic은 사고 과정을 암호화한다. 이는 Claude가 사고 과정에 해당 내용을 포함하는 것 자체를 막지는 않지만, 사용자에게는 그 관련 부분이 보이지 않게 된다. 대신 사용자에게는 "the rest of the thought process is not available for this response"라는 메시지가 표시된다. Anthropic은 이러한 암호화가 드물게, 그리고 잠재적 위해가 큰 경우에만 일어나도록 하는 것을 목표로 한다.

컴퓨터 사용. 마지막으로 Anthropic은 Claude의 컴퓨터 사용 능력에 대한 안전 조치도 강화했다. 이는 Claude가 사용자의 컴퓨터 화면을 보고, 사용자를 대신해 행동할 수 있게 해 주는 기능이다. Anthropic은 컴퓨터 사용 도중 Claude가 볼 수 있는 어딘가에 악의적 제3자가 비밀 메시지를 숨겨 두어, 사용자가 의도하지 않은 행동을 하도록 유도할 수 있는 "프롬프트 인젝션(prompt injection)" 공격에 대한 방어에서 상당한 진전을 이뤘다.

프롬프트 인젝션에 저항하도록 하는 새로운 훈련, 이러한 공격을 무시하라는 지침이 포함된 새 시스템 프롬프트, 그리고 모델이 잠재적 프롬프트 인젝션을 만났을 때 작동하는 분류기를 도입함으로써 Anthropic은 현재 이러한 공격을 88%의 경우에 막고 있다.4 이는 완화 조치가 없을 때의 74%에서 상승한 수치다.

위 내용은 Claude 3.7 Sonnet에 대해 수행된 방대한 안전 작업 가운데 일부만 간략히 요약한 것이다. 더 자세한 정보와 분석 결과, 그리고 여러 보호장치가 실제로 작동하는 예시는 전체 System Card에서 확인할 수 있다.

Claude 사용하기

Claude 3.7 Sonnet은 지금 바로 Claude.ai 또는 Anthropic API에서 사용할 수 있다. 그리고 이제 Claude가 무엇을 생각하는지 사용자에게 보여 줄 수 있게 된 만큼, Anthropic은 사용자도 새로운 모델에 대한 생각을 알려 주기를 바란다. 피드백은 feedback@anthropic.com으로 보낼 수 있다.

각주

Footnotes

  1. 구체적으로 이 기능은 Claude Pro, Team, Enterprise, API 사용자에게 제공된다.

  2. Anthropic의 충실성 연구는 System Card에서 더 자세히 설명돼 있다. 또한 모델 행동의 이유를 그 신경망 활성화 수준에서 완전히 이해하는 일은, 향후 기계적 해석 가능성(mechanistic interpretability)의 발전을 통해 가능해질 수도 있다고 Anthropic은 본다.

  3. 사고 과정을 완전히 공개하는 것과 완전히 숨기는 것 사이에는 중간 지대가 있을 수도 있다. 예를 들어 모델이 내부 사고 과정에 대해 질문받았을 때 언제나 진실되게 답하도록 훈련하되, 그 사고를 기본적으로는 드러내지 않도록 하고, 특정 요청은 거부할 수 있게 하는 접근이 가능할 수 있다.

  4. 이 수치에는 프롬프트 인젝션 공격이 실제로 존재하지 않는데도 보호장치가 작동하는 0.5%의 거짓 양성(false positive) 비율이 포함된다. Anthropic은 안전 메커니즘을 개발하면서 이 비율을 더 낮추기 위해 노력하고 있다.

Related content (관련 글)