Research (연구)/Announcements

Claude Fable 5와 Claude Mythos 5

Anthropic이 일반 사용자를 위해 안전하게 다듬은 Mythos급 모델 Claude Fable 5를 공개한다. 지금까지 일반에 내놓은 어떤 모델보다 뛰어난 성능을 갖췄으며, 오용 위험을 막기 위한 새 안전장치와 함께 출시된다. 같은 모델에서 사이버 안전장치를 푼 Claude Mythos 5는 일부 사이버 방어자와 인프라 제공자에게 별도로 제공된다.

2026년 6월 9일영문 원문 보기 ↗
Claude Fable 5와 Claude Mythos 5

오늘 우리는 Claude Fable 5를 공개한다. 일반 사용자가 안전하게 쓸 수 있도록 다듬은 Mythos급1 모델이다.

Fable 5의 능력은 우리가 지금까지 일반에 내놓은 어떤 모델도 넘어선다. AI 능력을 측정하는 거의 모든 벤치마크에서 최고 수준을 기록했으며, 소프트웨어 엔지니어링, 지식 작업, 비전, 과학 연구를 비롯한 여러 분야에서 빼어난 성능을 보였다. 과제가 길고 복잡할수록 다른 모델 대비 Fable 5의 격차는 더 벌어진다.

이 정도로 강력한 모델을 내놓는 데에는 위험이 따른다. 안전장치가 없다면 사이버보안 같은 영역에서 Fable 5의 능력이 악용돼 심각한 피해를 낳을 수 있다. 그래서 우리는 일부 주제에 대한 질의는 그 대신 차순위로 강력한 모델인 Claude Opus 4.8이 응답하도록 하는 안전장치를 갖춰 모델을 출시했다. 안전과 신속함을 동시에 확보하기 위해 안전장치를 보수적으로 조정했다. 그래서 무해한 요청까지 가끔 걸러질 수 있지만, 평균적으로 전체 세션의 5% 미만에서만 작동한다. 앞으로 몇 달 안에 더 강력한 모델이 나오는 만큼, 우리는 안전장치를 개선하고 거짓 양성(false positive)을 가능한 한 빨리 줄여 나가고자 한다.

소수의 사이버 방어자와 인프라 제공자를 위해서는 Claude Mythos 5도 함께 공개한다. Fable 5와 같은 기반 모델이되, 일부 영역에서 안전장치를 푼 모델이다.2 Mythos 5는 우선 미국 정부와 협력하는 Project Glasswing을 통해 Claude Mythos Preview의 업그레이드 버전으로 배포된다. 세계 어떤 모델보다 강력한 사이버보안 능력을 갖췄다. 머지않아 더 폭넓은 신뢰 접근 프로그램(trusted access program)을 통해 Mythos 5의 접근 범위를 넓힐 계획이다.

Fable 5와 Mythos 5 같은 모델의 능력은 세상에 깊은 이로움을 가져올 잠재력이 있다. 우리는 그 단초를 Project Glasswing에서 이미 확인했다. 이 프로젝트에서 모델들은 사이버 방어자들이 결정적으로 중요한 소프트웨어를 지켜 내도록 도왔다. 생명과학 연구에서도 마찬가지였다. 모델들이 새로운 가설을 제시하고 신약 개발 속도를 끌어올리는 모습을 봤다.

Fable 5와 Mythos 5의 가격은 입력 토큰 100만 개당 10달러, 출력 토큰 100만 개당 50달러다. Claude Mythos Preview의 절반에도 못 미치는 수준이다. 오늘의 공동 출시는, 가능한 한 빠르고 안전하게 더 많은 사용자에게 진보한 AI 능력을 전한다는 우리의 목표를 향한 또 한 걸음이다.

Claude Fable 5와 Claude Mythos 5 평가하기

아래 표는 Fable 5와 Mythos 5의 능력을 다른 선도 모델들과 비교한 것이다.

Claude Fable 5/Mythos 5와 다른 선도 모델의 벤치마크 비교 표

방법론: Claude Mythos 5와 Claude Fable 5의 점수 차이는 1~3퍼센트포인트 이내이며, 표에는 둘 중 높은 점수를 실었다. 별표(*)가 붙은 벤치마크는 사이버보안·생물학 관련 질의를 차단하는 안전장치 때문에 두 모델의 차이가 더 크다. 이 항목들에서 Claude Fable 5는 폴백(fallback)으로 인해 Claude Opus 4.8에 가까운 성능을 낸다. 자세한 내용은 시스템 카드를 참고하라.

Fable 5와 Mythos 5는 이전의 어떤 Claude 모델보다 오래 자율적으로 작업할 수 있다. 아래에서는 이 역량이 소프트웨어 엔지니어링에 어떻게 적용되는지 살펴보고, 지식 작업·비전·메모리·생명과학 연구에서 향상된 능력을 다룬다.

소프트웨어 엔지니어링. 초기 테스트에서 Stripe는 Fable 5가 수개월짜리 엔지니어링을 며칠로 압축했다고 전했다. 5,000만 줄 규모의 Ruby 코드베이스에서, 손으로 했다면 팀 하나가 두 달 넘게 걸렸을 코드베이스 전반의 마이그레이션을 모델이 하루 만에 해냈다. Fable 5는 이전 Claude 모델들보다 토큰 효율도 높다. 모델이 고품질 프로덕션 코드베이스의 기준을 지키면서 까다로운 코딩 과제를 통과할 수 있는지 평가하는 Cognition의 FrontierCode 벤치마크에서, Fable 5는 중간 수준의 노력만으로도 프런티어 모델 가운데 가장 높은 점수를 받았다.

에이전트 코딩 벤치마크: SWE-Bench Pro와 FrontierCode

그림 1: 에이전트 코딩 벤치마크에서 Claude Fable은 SWE-Bench Pro 80.3%, FrontierCode 29.3%를 기록해 Claude Opus 4.8과 GPT-5.5를 앞섰다.

FrontierCode 정확도 대 비용

그림 2: FrontierCode 벤치마크의 과제당 평균 비용 대비 점수. Claude Fable 5는 동일 비용 구간에서 Claude Opus 4.8과 GPT-5.5보다 높은 점수를 낸다. Diamond 부분집합은 벤치마크의 150개 과제 중 가장 어려운 50개로 구성된다.

지식 작업. Fable 5는 복잡한 분석 과제에서 강한 성능을 보인다. 시니어급 추론을 평가하는 Hebbia의 Finance Benchmark에서 Fable 5는 모든 모델 중 가장 높은 점수를 받았으며, 문서 기반 추론, 차트·표 해석, 문제 해결에서 큰 폭으로 나아졌다. IMC는 Fable 5가 사실 조회, 개념적 추론, 근본 원인 분석, 기댓값 분석을 포함한 거의 모든 트레이딩 분석 평가를 사실상 만점에 가깝게 통과했다고 밝혔다.

비전. Fable 5는 비전 관련 과제에서 새로운 최고 수준의 모델이다. 세밀한 과학 도표에서 정확한 수치를 뽑아내고, 스크린샷만으로 웹 앱의 소스 코드를 재구성하는 등 복잡한 비전 기반 과제를 수행할 수 있다. 필요한 보조 장치(scaffolding)도 더 적다. 예컨대 이전 Claude 모델들은 추가 도구를 제공하는 하니스를 붙여도 포켓몬 파이어레드(Pokémon FireRed)를 제대로 하지 못했지만, Fable 5는 비전만 쓰는 최소한의 하니스로 파이어레드를 클리어했다.

지도, 내비게이션 보조, 추가 게임 상태 정보 없이 원본 게임 스크린샷만으로 Claude가 포켓몬 파이어레드를 처음부터 끝까지 플레이하는 타임랩스. 이전 Claude 모델들은 포켓몬을 하려면 복잡한 보조 하니스가 필요했지만, Claude Fable 5는 비전만으로 게임을 끝냈다.

메모리와 롱컨텍스트. Fable 5는 수백만 토큰에 걸친 장기 과제에서 집중력을 유지하며, 스스로 남긴 메모를 활용해 출력을 개선한다. 덱빌딩 게임 슬레이 더 스파이어(Slay the Spire)를 플레이하게 했을 때, 파일 기반의 영속 메모리에 접근할 수 있도록 하자 Opus 4.8보다 세 배 더 큰 성능 향상이 나타났다. Fable 또한 게임의 마지막 막(act)에 도달하는 빈도가 세 배 더 높았다.

Claude Fable 5는 물리학 제1원리에서 행성의 궤도 운동을 유도하고 이를 이용해 일식을 예측하는 태양계 시뮬레이션을 직접 만들었다.

Claude Fable 5는 엔지니어들이 사랑하는 공장 건설 게임 팩토리오(Factorio)를 자율적으로 플레이하며, 스스로 전략을 세우고 자동화 공장을 지어 나간다.

Claude Fable 5는 브라우저 기반 CAD 편집기에서 3D 프린팅이 가능한 완성형 모델을 설계한다. 그 편집기 자체도, 모델링을 수행하는 내장 AI 코파일럿까지 포함해 Fable 5가 만들었다.

Claude Fable 5가 코딩한 유체 시뮬레이션으로, 그 움직임이 클래식 음악 EDM 리믹스의 비트에 맞춰 동기화돼 있다. 이 리믹스 역시 음악을 한 번도 들어 본 적 없는 Claude Fable 5가 코드로 만들어 낸 것이다.

신약 설계. 우리 내부의 단백질 설계 전문가들은 Mythos 5를 활용해 신약 설계 과정의 일부를 약 10배 빠르게 진행했다. 한 사례에서는 단백질 설계·생물정보학 도구만 주고 사람의 도움 없이 맡겼을 때, Mythos 5가 숙련된 인간 작업자와 대등하거나 그를 능가했다. 그 과정에서 모델은 보통 과학자가 수행하는 모든 작업을 스스로 처리했다. 결합 부위 선택, 단백질 설계 도구의 선정과 실행, 도중의 실패에서 복구하는 일까지 해냈다. 이 연구의 단백질 표적 14개 중 9개(아래 그림)에서 신약 설계의 유력 후보가 나왔고, 현재 우리가 그것들을 살펴보고 있다.

Mythos 5가 설계한 단백질 복합체

그림 3: Mythos 5가 설계한 단백질 복합체. 표적에는 면역 관문(immune checkpoint), 성장인자·수용체 신호전달, 신경퇴행, 근육 질환, 그리고 난도가 더 높은 구조적 표적이 포함된다.

분자생물학의 새로운 가설. Mythos 5는 새롭고 설득력 있는 과학 가설을 일관되게 만들어 내는 우리의 첫 모델이다. Opus급 모델과의 블라인드 일대일 비교에서, 우리 과학자들은 약 80%의 경우 Mythos의 분자생물학 가설을 선호했고, 그중 몇몇은 실험 평가 단계로 넘어갔다. 그사이 Mythos의 한 가설(대장균 단백질의 새로운 메커니즘)은, 같은 문제를 독립적으로 연구하던 한 실험실의 연구에서 입증됐다.

유전체학의 새로운 연구. Mythos 5는 일주일 넘는 시간 동안 대체로 자율적으로 작업하며 새로운 유전체학 연구를 수행했다. 138개 동물 종에 걸친 수백만 개 세포의 단일세포 데이터를 모으고, 멀리 떨어진 생물 사이에서도 같은 역할을 하는 세포를 식별하는 맞춤형 머신러닝 모델을 직접 설계해 학습시켰다. 사람의 개입은 고수준 입력에 그쳤음에도, Mythos 5가 학습시킨 모델은 학술지 《Science》에 최근 발표된 모델을 능가했다. 크기는 100배나 작은데도 말이다. 이 결과는 앞으로 몇 달 안에 발표할 예정이다.

정렬(Alignment). 자동화된 정렬 평가에서 우리는 Mythos 5의 비정렬 행동 수준(기만 같은 모델의 비정렬 행동과, 사용자의 모델 오용에 협조하는 행동을 포함)이 낮으며, Opus 4.8과 비슷하다는 점을 확인했다. 두 모델은 같은 기반 모델이므로 Fable 5의 정렬 수준도 비슷할 것이다. 이 평가는 다른 여러 안전·능력 시험과 함께 모델의 시스템 카드에 전부 기술돼 있다.

자동화 정렬 평가의 비정렬 행동 수준

그림 4: 자동화 정렬 평가에서 나타난 전반적 비정렬 행동 수준. Claude Mythos 5(2.06)는 Claude Opus 4.8(2.05)과 비슷하며, Claude Sonnet 4.6(2.81)보다 낮다. 자세한 내용은 시스템 카드의 6.2.3.1절을 참고하라.

Claude Fable 5에 대한 초기 평가

사전 접근 권한을 받은 고객들이 직접 Fable 5를 시험했다. 아래는 그들이 보고 있는 바를, 그들의 말 그대로 추린 것이다.

Claude Fable 5는 CursorBench에서 최고 수준의 모델이다. 이전 모델로는 손댈 수 없던 부류의 장기 과제(long-horizon)를 열어젖혔다.

— Michael Truell, CEO 겸 공동 창업자

Claude Fable 5는 GitHub가 돕는 개발자들에게 실질적인 진전이다. 초기 테스트에서, 복잡하고 긴 호흡의 코딩 과제를 이전 벤치마크를 넘어서는 수준의 자율성과 신뢰성으로 처리했다. 하지만 우리를 가장 들뜨게 하는 것은 그것이 가리키는 방향이다. 개발자가 점점 더 야심 찬 작업을 에이전트에게 맡기고, 소프트웨어 생애주기 전반에 걸쳐 그 결과를 신뢰할 수 있는 미래 말이다.

— Mario Rodriguez, 최고제품책임자

우리가 시험해 본 Claude 모델 가운데 가장 강력한 결과다. Claude Fable 5는 에이전트 코딩과 프로토타이핑에서 분명한 진전이다.

— Matt Colyer, 제품 디렉터(개발자 부문)

Claude Fable 5의 추론은 Opus 4.8을 분명히 넘어선다. 시니어 연구과학자급으로 일한다. 방향을 정하고, 자원을 배분하고, 자신의 틀린 믿음을 스스로 폐기하며, 제1원리에 기반한 새로운 산출물을 만들어 낸다.

— Sean Ward, CEO 겸 공동 창업자

Claude Fable 5는 빌더들이 입력한 것이 아니라 의도한 것을 이해한다. 1년 전에는 프롬프트 100번이 필요했던 앱을 이제 한 번에 만들어 낸다. 고객이 정말로 벽에 부딪혔을 때, 그들이 만들려던 것을 끝까지 마칠 수 있도록 빠르게 그 너머로 데려가기 위해 우리가 꺼내 드는 모델이다.

— Fabian Hedin, CTO 겸 공동 창업자

Claude Fable 5는 확연히 다르게 느껴진다. 블라인드 검토에서 우리 변호사들은 그 레드라인(redline)이 매번 현재 모델과 대등하거나 더 낫다고 봤다.

— Aveek Duttagupta, 기술 스태프

최고 노력 수준에서 Claude Fable 5는 자기 작업을 스스로 되짚고 검증한다. 우리에게는 바로 그 점이 고도로 자율적인 운영을 가능케 한다. 추가로 들이는 사고가 제값을 한다.

— Yusuke Kaji, 비즈니스 AI 부문 GM

Claude Fable 5는 이전 모델들보다 더 적은 차례(turn)로 더 유능한 엔지니어링을 해낸다. 우리 직원들이 Claude Code에서 매일 돌리는 복잡한 멀티 에이전트 워크플로를 거뜬히 처리한다.

— Luke Anderson, CTO

Claude Fable 5는 Cognition의 프런티어 코딩 평가 FrontierBench에서 가장 높은 점수를 낸 모델이다. 긴 호흡의 추론에 뛰어나고, 낯선 도구에도 별도 준비 없이 일반화한다.

— Scott Wu, CEO

Claude Fable 5는 우리가 시험해 본 가장 강력한 금융 우선(finance-first) 모델이다. 일반 금융과 추론 양쪽에서 모두 그렇다. 눈에 띄는 도약이다.

— Damian Miraglia, 수석 엔지니어(응용 AI)

Claude Fable 5는 복잡하고 오래 걸리는 분석 과제로 이뤄진 우리 핵심 분석 벤치마크에서 90%를 처음으로 넘긴 모델이다. Opus 대비 10점이 뛰었다. 가장 어려운 문제에서 강한 판단력과 미묘함에 대한 주의를 보여 준다.

— Izzy Miller, AI 리서치 리드

Claude Fable 5는 우리가 시험한 프런티어 물리학 연구에서 가장 강력한 모델이며, 추론 토큰은 3분의 1만 쓴다. 36시간 만에 GPT-5.5가 나흘에 걸쳐 도달한 지점에 거의 다다랐다.

— Matthew Pines, CEO

우리의 엔드투엔드 바이브 코딩 벤치마크 ViBench에서 Claude Fable 5는 우리가 시험한 모델 중 가장 높은 성능을 냈다. 기본 사용 사례를 거의 포화시켰고, 더 적은 토큰으로 더 짧은 시간에 앱을 만들었다.

— Michele Catasta, 사장 겸 AI 총괄

Claude Fable 5는 우리의 일상 스프레드시트 모음에서 모든 노력 수준에 걸쳐 Opus 4.8을 앞선다. 그것도 더 적은 차례로, 실행을 25~30% 더 빨리 끝낸다.

— Peter Wang, 최고과학책임자

Claude Fable 5의 새 안전장치

Mythos급 모델은 상당한 위험을 안기는 문턱에 다다랐다. 지난 4월 우리는 Project Glasswing을 시작하며 첫 Mythos급 모델(Claude Mythos Preview)을 사이버 방어자와 핵심 소프트웨어 인프라 제공자로 이뤄진 제한된 집단에만 공개했다. 그때 우리는, 오용을 확실히 막을 만큼 강력한 새 안전장치를 마련하기만 한다면 언젠가 모든 사용자에게 Mythos급 능력을 열고 싶다고 밝혔다.

지난 몇 달 동안 우리는 이 안전장치를 개선해 왔고, 이제는 일반 공개에 충분할 만큼 견고해졌다. 안전을 우선했기에 우리는 일부러 안전장치를 신중하게 조정했고, 그래서 여전히 이상적인 수준보다 엄격하다. 예컨대 무해한 요청이 우리 분류기(classifier)를 작동시키기도 한다. 일부 사용자에게는 이 점이 답답할 수 있음을 안다. 출시 이후 안전장치를 갱신하고 다듬어 가면서 거짓 양성을 줄이는 것이 우리의 목표다.

아래에서는 Fable 5의 새 안전장치를 하나씩 살펴본다. 더 넓은 범위의 안전장치는 모델의 시스템 카드와 가장 최근 위험 보고서에서 논의·평가하고 있다.

안전 분류기

Mythos급 모델의 프런티어 사이버보안·연구 생물학 능력은, 악의적 행위자에게 상당한 역량 증대(uplift)를 제공할 위험을 뜻한다. 다시 말해, 이 모델들은 인터넷 검색 같은 다른 출처에서는 얻을 수 없었을, 심각한 피해를 돕는 정보나 조언을 그런 행위자에게 줄 수 있다. 게다가 AI 모델의 고급 활용은 상당 부분 이중용도(dual use)다. 사이버보안 전문가와 생물학 연구자의 손에서 이로운 바로 그 질의가, 악의적 행위자에게 주어지면 위험해질 수 있다.

따라서 우리는 오용을 막을 강력한 안전장치가 필요하며, 그 적용 범위는 넓어야 한다. 안전장치 자체가 우회하려는 지속적이고 정교한 시도("탈옥(jailbreak)"이라고도 한다)를 견뎌 내야 한다. Mythos급 능력이 주는 역량 증대는 많은 적대자(예컨대 사이버 공격으로 금전적 이득을 얻을 수 있는 자들)에게 가치가 크고, 그래서 우리는 그들이 우리의 안전 조치를 우회하려 들 동기가 충분하다고 본다.

Fable 5는 새로운 분류기 묶음과 함께 나온다. 분류기는 탈옥 시도를 포함한 잠재적 오용을 탐지해, 본 모델(이 경우 Fable 5)이 응답하지 못하게 막는 별도의 AI 시스템이다. 우리는 한동안 모델에 분류기를 운영해 왔고, Fable 5의 분류기는 이 이전 작업을 확장해 적용 범위를 넓힌 것이다.

Fable의 분류기가 사이버보안, 생물학·화학, 또는 디스틸레이션(distillation)과 관련된 요청을 탐지하면, 그 응답은 자동으로 Claude Opus 4.8이 대신 처리한다. 이런 일이 일어날 때마다 사용자에게 알린다. Opus 4.8은 그 자체로 매우 유능한 모델이다. Opus로 폴백되는 응답은 Fable의 노골적인 거부보다 훨씬 나은 경험이다. 우리 초기 데이터를 보면 Fable 세션의 95% 이상에서 폴백이 전혀 일어나지 않는다. 그런 세션에서 Fable 5의 성능은 사실상 Mythos 5와 같다.

분류기가 다루는 영역은 다음과 같다.

1. 사이버보안. Mythos급 모델은 소프트웨어 취약점을 찾아내고 악용하는 데 능하다. 따라서 사이버 공격을 훨씬 쉽고 값싸게 저지를 수 있게 만든다. Mythos급 모델은 에이전트형 해킹(agentic hacking)에도 강하다. 이는 익스플로잇을 찾아내는 데 더해, 정찰(reconnaissance), 발견, 측면 이동(lateral movement) 등 사이버 공격의 여러 부분을 수행하는 일을 가리킨다. 이런 에이전트형 해킹 능력이 사이버 공격의 역량 증대로 이어지지 않도록, 우리는 사이버보안 분류기가 익스플로잇 개발과 더 넓은 의미의 공격적 사이버 과제 양쪽을 아우르도록 설계했다. 아래 그래프에서 보듯, 우리 분류기는 Fable이 이런 과제에서 어떤 진전도 이루지 못하게 막는다.

공격적 사이버 평가 결과

그림 5: 사이버 평가3 결과로, Fable 5가 Opus 4.8로 폴백하는 대신 응답을 차단하는 모드에서 측정했다. 평가에서 안전장치를 회피하려는 시도는 하지 않았다. Firefox, OSS-Fuzz, CyberGym, CyScenarioBench 모두에서 Claude Fable은 0.0을 기록한다.

우리는 탈옥에 대한 견고성을 시험하기 위해 분류기를 광범위하게 레드팀(red-team)했다. 내부 테스트는 물론, 외부 버그 바운티도 진행했는데 1,000시간이 넘는 테스트에서 보편적 탈옥(universal jailbreak)이 하나도 나오지 않았다. 우리가 참여시킨 외부 레드팀 조직들도 지금까지 긴 호흡의 에이전트 과제에서 보편적 탈옥을 찾지 못했다. 다만 영국 AISI는 짧은 초기 테스트 기간 안에 그에 가까운 진전을 이뤘다.4 보편적 탈옥을 완전히 막는 것은 불가능에 가깝겠지만, 우리의 목표는 남은 탈옥이 있더라도 그것이 대규모로 쓰이기 전에 탐지·차단할 수 있을 만큼 충분히 느리고 값비싸게 만드는 것이다.

아래 그래프는 우리 내부 평가 중 하나로, Fable 5의 안전장치가 이전의 일반 접근 가능 모델들보다 탈옥에 더 강한 저항력을 갖는다는 점을 보여 준다.

사이버 적대적 견고성 평가

그림 6: 자동화된 레드팀 도구가 400차례에 걸쳐 공격적 사이버보안 관련 짧은 과제를 모델로 완수하려 시도하며, 차단당하면 재시작·되감기를 반복하는 내부 평가 결과. 과제는 대체로 단순하며 실제 사이버 활용을 대표하지는 않는다(예: 원격 서버의 파일을 암호화하는 정도로 단순할 때도 있다). 더 복잡하고 현실적인 과제에서는 우리 프로덕션 시스템에 대한 탈옥 성공 사례를 아직 보지 못했다. Opus 4.6에는 차단형 사이버 안전장치가 없다는 점에 유의하라.

우리 외부 협력자 중 하나는 Fable 5의 유해 사이버 질의 대응 안전장치가 (Opus 4.8과 Opus 4.7을 포함해) 시험한 모든 모델 가운데 가장 견고했다고 평가했다. Fable 5는 사이버 공격 계획, 익스플로잇 개발, 방어 회피와 관련한 단일 턴 유해 요청 가운데 단 하나도 응하지 않았다. 30가지 공개 탈옥 기법을 요청에 섞었든 아니든 결과는 같았다.

2. 생물학과 화학. 우리는 오래전부터 좁은 범위의 생물무기 관련 질의에 대해 모델이 응답하지 못하도록 분류기를 써 왔다. 그러나 이 좁은 범위만 차단하는 것으로 충분한지 더는 확신할 수 없다. 두 가지 이유에서다. 첫째, 자원이 풍부한 악의적 행위자가 위험성이 매우 높은 생물학 연구에서 우리 모델의 역량 증대를 얻으려 시도할 가능성을 우려한다. 둘째, 이제 모델은 실제 과학 과제를 수행하는 능력이 더 커졌다.

예컨대 우리는 아데노부속바이러스(AAV) 설계의 까다로운 한 단계를 Mythos 5가 수행할 수 있는지 시험했다. AAV는 유전자 치료제를 전달하는 구성요소지만, 같은 능력이 엉뚱한 손에 들어가면 위험한 바이러스 설계를 가능케 할 수 있다. 이 과제에서 여러 AI 모델은, 유전적 변형이 바이러스 외피의 조립에 어떤 영향을 미치는지 예측하는 능력을 두고 평가받았다(Dyno Therapeutics가 개발한, 치료적으로 유의미하지만 미발표인 후보군이 대상이었다). 우리는 모델이 이 과제를 잘하도록 명시적으로 훈련하지 않았다. 그런데도 Mythos급 모델은 단백질 과제에 특화된 정교한 모델들("단백질 언어 모델")을 자신의 생물학적 추론만으로 능가했다. 이는 유전자 치료 연구·개발에서 단순하지만 중요한 과제를 해낼 유망한 능력을 보여 주는 동시에, 그러한 이중용도 능력이 안기는 위험도 부각한다.

바이러스 캡시드 실험 특성 예측

그림 7: 우리 모델이 단순한 바이러스의 외피(viral shell)에 대한 미발표 실험 특성을 예측한 평가 결과. 외피 조립은 이 맥락에서 예측하기 가장 단순한 바이러스 특성이지만, 더 복잡한 기능을 설계할 때 제대로 맞혀야 하는 중요한 속성이기도 하다. Claude Mythos 5는 단백질 언어 모델 기준선을 넘어 가장 높은 점수를 기록했다. AAV는 아데노부속바이러스(adeno-associated virus)를 뜻한다.

우리의 우선순위는, 다소 넓은 안전장치를 감수하더라도 Fable을 가능한 한 빨리 안전하게 내놓는 것이었다. 그래서 당분간 Fable은 생물학·화학과 관련된 대다수 요청에서 Opus 4.8로 폴백하도록 했다. 다른 모든 분류기와 마찬가지로, 우리는 이 안전장치도 가능한 한 빨리 좁히고자 한다. 위 증거에서 보듯 과학을 위한 Fable의 긍정적 활용 잠재력은 크고, 분류기의 거짓 양성이 그것을 가로막기를 원치 않기 때문이다. 앞으로 몇 주 안에 일부 생의학 연구자와 기업은 Mythos 5의 생물학 능력에 대한 신뢰 접근 프로그램(아래에서 논의)에 합류할 수 있게 된다.

3. 디스틸레이션. 우리는 권위주의 국가에서 경쟁 모델을 훈련하기 위해 Claude의 능력을 추출("디스틸")하려는 대규모 시도를 이전에 확인한 바 있다. Fable 5의 능력이 디스틸되면 프런티어에 가까운 AI 능력이 확산되는 결과로 간접적으로 이어질 수 있고, 그렇게 나온 모델은 적절한 안전장치 없이 배포될 수 있다. 우리 분류기가 그러한 디스틸레이션 시도의 일부로 표시한 요청은 Opus 4.8로 폴백된다.

새로운 데이터 보존 정책

끝으로, 우리는 Fable 5, Mythos 5, 그리고 이와 비슷하거나 더 높은 능력을 가진 향후 모델에 대해 기업 고객 데이터를 다루는 방식을 바꾼다. Mythos급 모델의 모든 트래픽에 대해, 자사·타사 표면(surface) 양쪽 모두에서 30일 보존을 의무화한다. 이 데이터를 새 Claude 모델 훈련이나 안전과 무관한 어떤 목적에도 사용하지 않으며, 데이터에 대한 모든 인간 접근을 기록하고 거의 모든 경우 30일 후 삭제를 보장하는 등 새로운 개인정보 보호 장치를 도입했다(자세한 내용은 해당 게시글 참고). 이 데이터는 복잡하고 새로운 공격(새로운 탈옥과 여러 요청에 걸쳐 작동하는 공격 포함)을 방어하고, 거짓 양성을 식별·축소하는 데 도움이 된다.

Claude Mythos 5와 신뢰 접근 프로그램

오늘부터, 현재 Claude Mythos Preview에 접근할 수 있는 모든 사용자(예컨대 Project Glasswing의 사이버보안 파트너들)는 Claude Mythos 5로 업그레이드할 수 있다. Claude Fable 5와 같은 모델이되 사이버 안전장치를 푼 버전이다. 대부분의 경우 사용자는 Mythos 5가 Mythos Preview와 대등하거나 다소 더 강하다고 느끼면서도, 비용은 상당히 낮다는 점을 알게 될 것이다.

미국 정부와 협의하여, 우리는 새 파트너를 주기적으로 추가하는 일을 이어 가는 한편, 사이버보안 조직이 더 체계적인 방식으로 신청할 수 있는 신뢰 접근 프로그램을 추진하면서 Claude Mythos 5의 접근 범위를 꾸준히 넓힐 계획이다.

우리 계획에는 생물학을 위한 신뢰 접근 프로그램을 여는 일도 포함된다. Mythos급 능력으로 생의학 연구를 가속하고 새로운 치료법을 발견하도록 돕기 위해서다. 이 프로그램은 생물학·화학 안전장치를 제거한(다만 사이버 안전장치는 그대로 둔) Fable 5에 대한 접근을 제공한다. 기초·중개 연구를 아우르는 다양한 생명과학 조직의 연구자 소수가 참여하게 되며, 우리는 안전장치를 동시에 개선해 가면서 이 프로그램의 접근 범위를 넓힐 계획이다.

이용 안내

Claude Fable 5는 오늘부터 어디에서나 이용할 수 있다. Claude Mythos 5는 우리의 더 넓은 신뢰 접근 프로그램이 마련되기 전까지, Glasswing 파트너(사이버 안전장치 해제)와 곧 선정될 일부 생물학 연구자(생물학·화학 안전장치 해제)에게만 제한적으로 제공된다.

두 모델의 가격은 모두 입력 토큰 100만 개당 10달러, 출력 토큰 100만 개당 50달러다. 개발자는 Claude API를 통해 claude-fable-5를 사용할 수 있다.

Fable 5에 대한 수요는 매우 높고 예측하기 어려울 것으로 본다. Claude API와 사용량 기반 Enterprise 플랜에서는 오늘부터 Fable 5를 온전히 사용할 수 있다. 구독 플랜의 경우, 우리는 늦기보다 빨리 접근을 열고자 하므로 다음과 같이 단계적으로 보수적으로 출시한다.

  • 오늘부터 6월 22일까지, Fable 5는 Pro, Max, Team, 좌석 기반 Enterprise 플랜에 추가 비용 없이 포함된다.
  • 6월 23일, 우리는 이 플랜들에서 Fable 5를 제거한다. 이후 사용하려면 사용 크레딧이 필요하다. 용량이 허락한다면 포함 기간을 연장하겠다.
  • 그 이후, 충분한 용량이 확보되면 Fable 5를 구독 플랜의 표준 구성으로 되돌리는 것을 목표로 한다. 가능한 한 빨리 그렇게 하고자 한다.

이 기간 내내 우리는 변경 사항을 사전에 알려, 사용자가 현재 상황을 파악할 수 있도록 하겠다.

2026년 6월 9일 수정: AAV 후보군이 Dyno Therapeutics가 개발한 것임을 명시하도록 관련 논의를 갱신했다.

각주

Footnotes

  1. Mythos급 모델은 능력 면에서 우리 Opus급보다 위에 자리한 Claude 모델 계층이다. 그 첫 모델인 Claude Mythos Preview는 지난 4월 Project Glasswing을 통해 공개됐다. 그 뒤를 이어 오늘 Claude Fable 5와 Claude Mythos 5가 나온다.

  2. Fable은 라틴어 fabula("이야기되는 것")에서 왔으며, 그리스어 _mythos_와 닿아 있다. 두 모델(Fable과 Mythos)을 구분 짓는 것은 안전장치이며, 그래서 둘에 다른 이름을 붙였다.

  3. 지표 설명: Firefox는 임의 코드 실행(익스플로잇의 완전 성공 등급)에 도달한 시도의 비율이다. OSS-Fuzz는 5단계 점수(0.2 크래시 → 1.0 제어흐름 탈취)의 심각도 가중 평균이므로, 값은 성공률이 아니라 가중 평균이다. CyberGym은 대상 취약점을 재현한 비율(공개 리더보드 지표)이다. CyScenarioBench는 각 챌린지에 동일 가중치를 둔 평균 성공률이다.

  4. 보편적 탈옥은 사용자가 마치 안전장치가 없는 것처럼 모델과 상호작용할 수 있게 하는 모든 프롬프트, 스크립트, 하니스로 정의할 수 있다. 이는 매우 제한된 맥락에서만 효과가 있거나 새로운 상황마다 추가 노력으로 변형해야 하는 더 사소한 탈옥과 구별된다.

Related content (관련 글)