매일 수백만 명의 사용자가 Claude에 독점 코드부터 기밀 사업 전략에 이르기까지 민감한 정보를 맡긴다. Anthropic은 이러한 신뢰가 정당한 것이 되도록, 더 나아가 암호학적으로 보장되도록 하기 위한 새로운 기술을 연구하고 구축하고 있다.
여기서 "암호학적으로 보장된다"는 말은 무엇을 뜻할까. Anthropic은 Pattern Labs와 함께 발표한 새 보고서에서 기밀 추론(Confidential Inference)의 작동 원리를 설명한다. 기밀 추론은 암호화된 데이터를 처리하고, 그러한 데이터가 자신이 신뢰할 수 있음을 입증한 서버 안에서만 읽히도록 보장하기 위해 사용할 수 있는 도구들의 집합이다. 이 도구를 도입해야 할 주된 이유는 두 가지다.
- 모델 가중치 보안: Anthropic은 기밀 추론을, RAND의 Securing AI Model Weights 보고서가 다룬 것과 같은 점점 더 유능한 위협 행위자로부터 Claude 같은 프런티어 모델을 보호하려는 더 넓은 노력의 한 구성 요소로 활용할 수 있다.
- 사용자 보안: Anthropic은 기밀 추론을 통해 민감한 사용자 데이터가 비공개로 유지된다는 점을 입증할 수 있다.
Anthropic은 이 글과 함께 공개한 보고서를 통해 기밀 추론이 무엇인지, 또 그것이 사용자에게 어떤 이점을 제공할 수 있는지를 설명하고자 한다. 동시에, 그 과정에 포함되는 시스템의 보안을 Anthropic이 어떻게 사고하고 있는지도 공유하고자 한다. 이는 대화를 시작하기 위한 연구 스케치에 가깝다. Anthropic은 아직 이 작업의 초기 단계에 있으며, 이것이 앞으로 어떤 구체적 설계나 기능으로 발전할지 지금 시점에서 예측하기는 이르다고 본다.
아래에서는 기밀 추론 구현의 몇 가지 기술적 세부사항을 소개한다. 핵심은 다음과 같다. Anthropic은 사용자의 민감한 데이터가 처리되어야 하는 바로 그 순간을 제외하면 어디서나 암호화된 상태로 유지되도록 설계된 시스템을 구축하고 있다. 그리고 그 순간조차도, 극도로 제한되고 검증 가능한 환경 안에서만 복호화되도록 하려는 것이다.
추론 서비스
기밀 추론의 기본 원칙은 민감한 데이터가 처리 지점 외에는 계속 암호화된 상태로 남아 있어야 한다는 것이다. 이를 강제하기 위해 Anthropic은 기밀 컴퓨팅(confidential computing)의 확립된 방법들을 사용한다. 즉, 소프트웨어의 보안을 증명하는 신뢰 사슬(chain of trust)을 구축하고, 그 증명을 바탕으로 정확히 어떤 소프트웨어에 암호화 키 사용 권한을 줄 것인지를 통제한다.
사용자 데이터의 경우, 민감한 평문(cleartext), 곧 암호화되거나 다른 방식으로 가려지지 않은 텍스트를 직접 다뤄야 하는 지점은 두 곳이다.
- API Server. 프롬프트를 받아 토큰으로 변환하고, Claude API 요청 뒤에 있는 로직 대부분을 처리하는 서버다.
- Inference Server. 하드웨어 가속기에서 Claude의 "두뇌"를 실행해 프롬프트로부터 완성 토큰을 생성하는 서버다.
모델 가중치의 경우에는 Inference Server만 민감한 데이터를 받는다.
이 글에서는 Inference Server에 초점을 맞춘다. API Server의 보안 역시 동일하게 중요하지만, 여기서 설명하려는 범위는 아니다. 아직 모든 가속기가 기밀 컴퓨팅을 충분히 지원하는 것은 아니므로, Anthropic은 신뢰 환경 안에서 실행될 수 있는 작고 안전한 "모델 로더 및 호출기(model loader and invoker)" 위에 구현된 Inference Server를 검토하고 있다. 이 로더 프로그램은 몇 가지 단순한 작업을 수행한다.
- 암호화된 데이터를 받아 복호화한 뒤 가속기로 보낸다.
- 가속기에 대한 호출을 수행하고, 결과를 다시 암호화해 호출자에게 돌려준다.
복호화된 데이터에 접근할 수 있는 것은 이 "신뢰된" 로더뿐이다. 나머지 시스템은 "비신뢰" 영역에 속하지만, 로더에 요청을 보낼 수는 있다.
Anthropic은 자체 구현을 위해 이 설계에 기반한 시스템을 구축하고 있다. 이 구현에서는 Inference Server의 대부분이 "비신뢰" 측에서 실행된다. 이 부분은 자주 바뀔 수 있지만, 그 변경이 시스템 전체의 보안에 영향을 미치지는 못한다. 반면 작은 신뢰 로더는 하이퍼바이저가 격리한 별도 가상 머신에서 실행된다. 이 로더는 모델 아키텍처 세부사항과 무관하게 Inference Server에 "가상 가속기(virtual accelerator)"처럼 보인다.
이 "가상 가속기"는 Anthropic의 보안 연속 통합 서버가 서명한 프로그램만 받아들인다. 이는 실제로 실행되는 모든 코드가 여러 엔지니어의 검토를 거쳤음을 보장하기 위한 것이다.
최종적으로 Anthropic이 확보하고자 하는 것은, 로더가 올바르게 실행되기만 한다면 나머지 시스템이 무엇을 하든 기밀성 요구사항은 충족된다는 점이다. 따라서 로더가 실제로 올바르게 실행되고 있음을 확립하는 일이 결정적으로 중요하다.
신뢰 환경
보고서는 로더가 다음과 같은 특징을 갖춘 기밀 컴퓨팅 환경에서 실행되는 구성을 설명한다.
- 하드웨어에 의해 다른 워크로드와 격리된 암호화 메모리
- 비활성화된 디버깅 기능
- 올바른 코드가 실행 중임을 보여 주는 암호학적 증거
(1)은 일부 물리적 공격과 악성 하이퍼바이저에 대한 방어를 제공한다. 다만 가속기와 암호화된 호스트 메모리를 공유하는 데 필요한 기능은 아직 충분히 정립되지 않았다. Anthropic은 이 격차를 계속 줄여 나갈 계획이지만, 그동안에는 물리 데이터센터와 하이퍼바이저 소프트웨어의 보안을 컴퓨트 제공업체가 유지해 줄 것에 의존할 예정이다.
(2)와 (3)은 신뢰 플랫폼 모듈(trusted platform module, TPM)을 신뢰의 루트(root of trust)로 사용하는, 널리 지원되는 기밀 컴퓨팅 관행을 통해 달성할 수 있다. TPM은 부팅 과정의 각 단계를 측정하고, 최종 결과를 나타내는 해시를 보고한다. 이 해시는 로더 서버가 Anthropic이 기대한 방식으로 격리돼 있고, 서명되고 검토된 코드를 실행하고 있으며, 관련 디버깅 기능을 끄도록 구성돼 있다는 점에 대한 증명(attestation)을 형성한다.
키 서버(keyserver)는 이 증명을 검사하고, 수신자가 자신이 안전하다는 점을 입증했을 때에만 복호화 키를 내줄 수 있다.
어떤 환경을 "신뢰할 수 있다"고 판단할지는 궁극적으로 키 서버에 달려 있다. Anthropic은 다른 당사자가 신뢰 코드를 검증하고 독립적인 키 서버를 운영하는 기밀 컴퓨팅 모델도 함께 검토하고 있다. 이는 각 데이터 조각에 대해 더 강한 기밀성 보장을 제공할 수 있다.
향후 방향
프런티어 모델의 역량이 계속 커질수록, Anthropic은 보안 로더 계층에 추가적인 안전장치를 더해야 할 필요가 생길 수 있다고 본다. 여기에는 평문 모델 가중치를 보유한 서버에 대한 추가적인 송신 대역폭 제한(egress bandwidth limitations) 계층이나, 추론 실행을 위해 안전 분류기(safety classifier)의 서명을 요구하는 기능 등이 포함될 수 있다.
Anthropic은 이 기밀 추론 모델을 제시함으로써, Anthropic 환경의 지속적인 보안과 사용자 데이터의 기밀성을 보장하기 위해 어떤 추가 기능을 검토할 가치가 있는지에 대한 논의가 촉발되기를 바란다.
결론
이 연구는 모델 가중치를 보호하고 사용자 데이터를 지키려는 Anthropic의 지속적인 노력에 기여할 것이다. 사용자 요청을 보호하기 위해 이 모델을 적용하면, 고객 데이터는 강화된 하드웨어 기반 보안 통제가 적용되는 맥락에서만 복호화되도록 설계된다.
- 요청은 Anthropic 서버에 도착하기 전 지점에서 암호화된다.
- 요청이 API Server에 도착하면 복호화, 처리, 재암호화가 이뤄진 뒤 다음 단계로 전달된다.
- Inference Server는 요청을 암호화된 형태로 처리하며, 요청은 신뢰 로더로 보내질 때만 복호화된다.
- 완성 응답은 로더를 떠나기 전에 암호화되며, 다시 API Server를 거쳐 호출자에게 전달된다.
모델 가중치의 경우는 더 단순하다. 가중치는 암호화된 채 저장될 수 있고, 로더에서 복호화되며, 그 밖으로는 결코 유출되지 않는다.
하드웨어 설계자들은, 이미 그렇게 하지 않았다면, 자신들의 칩에 기밀 컴퓨팅을 통합하는 방안을 검토해야 한다. 가속기에 연결된 하드웨어 신뢰의 루트가 존재한다면, 이와 같은 시스템의 신뢰 경계는 상당히 줄어들 수 있다.
함께 일하기
기밀 추론에 대한 이 논의가 이러한 문제를 함께 탐구해 보고 싶다는 생각으로 이어진다면, Anthropic 웹사이트의 채용 페이지에서 "Security"와 "AI Research and Engineering" 섹션의 공개 채용을 살펴봐 주기 바란다.