Research (연구)/Announcements

Claude Opus 4.8 소개

Claude Opus를 Opus 4.8로 업그레이드한다. Opus 4.7을 기반으로 여러 벤치마크에서 성능이 좋아졌고, 협업 상대로서도 한층 나아졌다. 가격은 그대로다. 동시에 노력 수준 조절, Claude Code의 동적 워크플로, 더 저렴해진 fast 모드도 함께 공개한다.

2026년 5월 28일영문 원문 보기 ↗
Claude Opus 4.8 소개

Claude Opus를 새 버전인 Claude Opus 4.8로 업그레이드한다. Opus 4.7을 기반으로 여러 벤치마크에서 성능이 좋아졌고, 협업 상대로서도 한결 쓸 만해졌다. 가격은 이전과 같으며, 오늘부터 쓸 수 있다.

Opus 4.8은 새 기능 몇 가지와 함께 나온다. 이제 claude.ai 사용자는 Claude가 한 과제에 들이는 노력의 양을 직접 조절할 수 있다. Claude Code에는 아주 큰 규모의 문제까지 다룰 수 있게 해 주는 "동적 워크플로(dynamic workflows)" 기능이 추가됐다. 그리고 모델이 2.5배 빠르게 동작하는 Opus 4.8의 fast 모드는 이전 모델들보다 가격이 3분의 1 수준으로 낮아졌다.

Opus 4.8의 성능

아래 표는 코딩, 에이전트 능력, 추론, 실무 지식 작업을 평가하는 테스트에서 Opus 4.8이 이전 버전 및 다른 모델들과 비교해 어느 정도 수준인지 보여 준다. 더 자세한 내용과 훨씬 넓은 범위의 능력 평가는 Claude Opus 4.8 시스템 카드에 담겨 있다.

평가 항목Opus 4.8Opus 4.7GPT-5.5Gemini 3.1 Pro
에이전트 코딩
SWE-Bench Pro
69.2%64.3%58.6%54.2%
에이전트 터미널 코딩
Terminal-Bench 2.1
74.6%66.1%78.2%70.3%
다학제 추론 (도구 없음)
Humanity's Last Exam
49.8%46.9%41.4%44.4%
다학제 추론 (도구 사용)
Humanity's Last Exam
57.9%54.7%52.2%51.4%
에이전트 컴퓨터 사용
OSWorld-Verified
83.4%82.8%78.7%76.2%
지식 작업
GDPval-AA
1890175317691314
에이전트 금융 분석
Finance Agent v2
53.9%51.5%51.8%43.0%

Opus 4.8과 함께 일하기

초기 테스터들은 Claude Opus 4.8이 에이전트 과제를 수행할 때 더 믿음직스럽고 판단이 더 날카로워졌다고 평했다. 아래는 Opus 4.8과 협업한 경험을 두고 여러 테스터가 남긴 의견이다.

Claude Opus 4.8은 판단력이 눈에 띄게 좋아졌다. Claude Code에서 적절한 질문을 던지고, 자기 실수를 스스로 잡아내며, 계획이 탄탄하지 않으면 반론을 제기한다. 큰 변경을 하기 전에는 여러 서비스에 걸친 복잡한 탐색을 거쳐 확신을 쌓는다. 함께 무언가를 만들기에 훌륭한 모델이다.

우리 Super-Agent 벤치마크에서 Claude Opus 4.8은 모든 케이스를 처음부터 끝까지 완수한 유일한 모델로, 비용이 같은 조건에서 이전 Opus 모델들과 GPT-5.5를 앞섰다. 번역, 심층 리서치, 슬라이드 제작, 분석 분야의 에이전트 제품에서 강력한 신뢰성을 보여 준다.

CursorBench에서 Claude Opus 4.8은 모든 노력 수준에서 이전 Opus 모델들을 능가한다. 도구 호출이 눈에 띄게 효율적이라 같은 지능을 더 적은 단계로 발휘하며, 과제를 끝까지 완수해 낸다.

Claude Opus 4.8은 우리 Legal Agent Benchmark에서 지금까지 기록된 최고 점수를 냈고, 전체 통과(all-pass) 기준에서 10%를 넘긴 최초의 모델이다. 본격적인 법률 업무에서 이 정도의 정확도 향상은, 우리 고객이 실제 변호사 업무를 얼마나 자신 있게 맡길 수 있는지와 곧바로 연결된다.

Claude Opus 4.8은 Opus 4.7에 비해 삶의 질을 크게 끌어올리는 업데이트처럼 느껴진다. 더 빠르고, 협업하기 더 쉬우며, 긴 세션 내내 맥락과 스타일 방향을 더 잘 이어 간다. 목소리와 취향, 기술적 실행이 나란히 이뤄져야 하는 작업에서 나는 줄곧 Opus 4.8을 믿고 맡겼다.

Claude Opus 4.8은 우리가 테스트한 컴퓨터 사용·브라우저 에이전트 모델 중 가장 강력하며, Online-Mind2Web에서 84%를 기록해 Opus 4.7과 GPT-5.5를 모두 의미 있게 앞질렀다. 우리 고객의 에이전트 워크로드가 처음부터 끝까지 안정적으로 돌아가려면 꼭 필요한 방식대로, 모델이 끝까지 신중하게 과제에 집중한다.

Claude Opus 4.8은 도구를 깔끔하게 쓰고, 우리 자율 엔지니어링 워크로드가 사람 손을 거치지 않고 계속 돌아가는 데 필요한 일관성으로 지시를 따른다. Opus 4.6보다 나아졌고, Opus 4.7에서 보였던 주석 장황함과 도구 호출 문제를 해결했다. Anthropic의 이번 릴리스는 Devin 위에서 무언가를 만드는 엔지니어들의 역량 향상으로 곧바로 이어진다.

장시간 실행되는 평가에서 Claude Opus 4.8의 분석은 이전 Opus 모델들보다 한결같이 품질이 높았다. 더 빨리 끝냈고, 더 풍부하고 정보 밀도가 높은 결과물을 내놓았다. 전반적으로 신호 대 잡음 비율이 눈에 띄게 좋아졌다. 가장 큰 차별점은 Opus 4.8이 분석의 입력과 출력에 있는 문제를 먼저 짚어 주는 경향이었다. 다른 모델들은 으레 놓치고 사용자가 직접 잡아내도록 떠넘기던 부분이다.

CoCounsel Legal 전반에서 Claude Opus 4.8은 이전 Opus 모델들에 비해 일관성과 추론 품질에서 의미 있는 향상을 보였다. 우리 고객이 의존하는 고위험 전문가 워크플로에서 이런 신뢰성은 중요하다. 우리가 법률·세무 전문가를 위한 수탁자 수준(fiduciary-grade)의 AI 시스템을 만들어 가는 만큼, 이런 진전은 실제 업무에서 신뢰할 수 있는 AI 성능의 기준을 한 단계 끌어올린다.

Claude Opus 4.8은 엔터프라이즈 AI의 새 기준을 세운다. 데이터와 지식 작업을 위한 Databricks의 AI 에이전트 Genie에서, 새 Opus 모델은 에이전트 추론의 수준을 한 단계 끌어올려 어떤 이전 Opus보다도 빠르게 더 깊고 여러 단계에 걸친 질문을 풀어낸다. 멀티모달 역량도 강력해, Genie가 PDF와 다이어그램을 비롯한 비정형 콘텐츠를 직접 추론하는 비용이 Opus 4.7보다 토큰 기준 61% 저렴하다.

Hebbia의 오케스트레이터에서 다루는 금융 문서 워크플로에서, Claude Opus 4.8은 Opus 4.7과 같은 수준의 강력한 품질을 유지하면서도 인용 정밀도가 눈에 띄게 좋아졌고 검색(retrieval) 시 토큰 효율도 더 높아졌다. 우리 고객이 매일 다루는 빽빽한 문서들에 대단히 잘 맞는다.

Opus 4.8에서 가장 두드러진 개선 가운데 하나는 정직성(honesty) 이다. 우리는 모든 모델이 정직하도록, 이를테면 뒷받침할 수 없는 주장을 하지 않도록 훈련한다. 그런데 AI 모델에는 흔한 문제가 하나 있다. 근거가 빈약한데도 작업에 진전을 이뤘다고 확신에 차서 주장하며 성급히 결론으로 건너뛰는 일이다. 초기 테스터들의 보고에 따르면 Opus 4.8은 자기 작업의 불확실성을 먼저 짚어 줄 가능성이 더 높고, 뒷받침되지 않는 주장을 할 가능성은 더 낮다. 이는 우리 평가에서도 뒷받침되는데, Opus 4.8은 자신이 작성한 코드의 결함을 그냥 지나치게 둘 가능성이 이전 버전보다 약 4분의 1 수준으로 낮았다.

여느 때처럼 우리는 출시에 앞서 모델에 대한 상세한 정합성(alignment) 평가를 진행했다. 긍정적 특성과 관련해, 우리 정합성 팀은 Opus 4.8이 "사용자의 자율성을 지지하고 사용자의 최선의 이익을 위해 행동하는 것과 같은 친사회적 특성 지표에서 새로운 최고치에 도달했다"고 결론지었다. 평가는 또한 Opus 4.8의 어긋난 행동(기만이나 오용 협조 등) 발생률이 Opus 4.7보다 상당히 낮으며, 우리의 가장 잘 정합된 모델인 Claude Mythos Preview와 비슷한 수준임을 보여 주었다. 전체 정합성 평가는 일련의 배포 전 안전성 테스트와 함께 Claude Opus 4.8 시스템 카드에 보고돼 있다.

어긋난 행동 점수 비교 막대그래프

어긋난 행동(Misaligned behavior): 모델별 점수(1~10, 낮을수록 좋음). Opus 4.8은 Opus 4.7보다 점수가 크게 낮아져 Mythos Preview에 근접했다.

오늘 함께 공개하는 것들

Claude Opus 4.8과 더불어 다음 업데이트를 함께 내놓는다.

동적 워크플로(Dynamic workflows). 리서치 프리뷰로 제공되는 이 새 기능은 Claude가 Claude Code에서 한층 더 큰 과제를 떠맡을 수 있게 해 준다. Claude는 작업을 계획한 뒤 단일 세션 안에서 수백 개의 병렬 하위 에이전트를 돌릴 수 있고(Opus 4.8에서는 에이전트가 더 오래 실행될 수 있다), 사용자에게 보고하기 전에 자기 결과물을 직접 검증한다. 예를 들어 Opus 4.8을 쓰는 Claude Code는 이제 수십만 줄에 이르는 코드베이스 규모의 마이그레이션을, 기존 테스트 스위트를 기준 삼아 착수부터 병합까지 수행할 수 있다. 동적 워크플로에 대한 더 자세한 내용은 이 글에서 읽을 수 있다. Claude Code의 Enterprise, Team, Max 플랜에서 사용할 수 있다.

claude.ai와 Cowork의 노력 수준 조절(Effort control). 모델 선택기 옆에 놓인 새 컨트롤로 사용자는 Claude가 응답에 들이는 노력의 양을 고를 수 있다. 노력 수준을 높게 설정하면 Claude가 더 자주, 더 깊이 사고해 더 나은 응답을 내놓는다. 낮게 설정하면 더 빠르게 응답하고 사용자의 사용량 한도(rate limit)도 더 천천히 소진한다. 이제 사용자가 직접 선택할 수 있으며, 노력 수준 조절은 모든 플랜에서 쓸 수 있다.

Messages API가 이제 messages 배열 안의 system 항목을 받는다. 개발자는 프롬프트 캐시를 깨거나 사용자 차례(user turn)를 거치지 않고도 작업 도중에 Claude의 지시를 갱신할 수 있다. 이를 활용하면 특정 하니스(harness)에서 에이전트가 실행되는 동안 권한, 토큰 예산, 환경 맥락을 업데이트할 수 있다.

노력 수준에 관하여

Opus 4.8은 기본값이 높은 노력(high effort)이며, 우리는 이 설정이 품질과 사용자 경험을 가장 잘 아우르는 균형점이라고 본다. 코딩 과제에서 이 노력 수준은 Opus 4.7의 기본값과 비슷한 양의 토큰을 쓰면서도 더 나은 성능을 낸다. 사용자는 "extra"(Claude Code에서는 "xhigh")나 "max"를 고를 수 있는데, 이 경우 모델이 더 많은 토큰을 들여 더 나은 결과를 낸다. 어려운 과제나 장시간 실행되는 비동기 워크플로에는 "extra"를 권한다. 높은 노력 수준의 늘어난 토큰 사용량을 감당할 수 있도록 Claude Code의 사용량 한도를 높였으니, 사용자는 각자의 프로젝트에 맞는 설정을 고르면 된다.

다음은 무엇인가

사용자가 보기에 Opus 4.8은 이전 버전 대비 완만하지만 분명히 체감되는 향상일 것이다. 아직 할 일은 남아 있다. 우리는 Opus와 같은 여러 능력을 더 낮은 비용으로 제공하는 모델을 개발하고 출시하는 일에 힘쓰고 있다.

그뿐 아니라, Opus보다도 더 높은 지능을 갖춘 새로운 등급의 모델을 출시할 계획이다. Project Glasswing의 일환으로, 현재 소수의 조직이 사이버보안 작업에 Claude Mythos Preview를 쓰고 있다. 이 정도 능력 수준의 모델은 일반 공개에 앞서 더 강력한 사이버 안전장치를 갖춰야 한다. 우리는 이러한 안전장치 개발에서 빠르게 진전을 이루고 있으며, 앞으로 몇 주 안에 Mythos 등급 모델을 모든 고객에게 선보일 수 있을 것으로 기대한다.

사용 안내

Claude Opus 4.8은 오늘부터 어디서나 사용할 수 있다. 일반 사용 가격은 Opus 4.7과 동일하다. 입력 토큰 100만 개당 5달러, 출력 토큰 100만 개당 25달러다. fast 모드 가격은 입력 토큰 100만 개당 10달러, 출력 토큰 100만 개당 50달러다. 개발자는 Claude API를 통해 claude-opus-4-8을 쓸 수 있다.

각주

Terminal-Bench 2.1: 모든 모델 점수는 Terminus-2 공개 하니스를 사용해 보고했다. GPT-5.5가 Codex CLI 하니스로 보고한 점수는 83.4%다.

OSWorld-Verified: 모델의 실제 성능을 더 정확히 반영하기 위해 OSWorld-Verified 평가 방식을 변경했으며, 이에 따라 Opus 4.7 점수를 82.3%로 갱신했다. 변경 사항에 대한 자세한 내용은 시스템 카드에서 확인할 수 있다.

Finance Agent v2: Gemini 3.5 Flash는 Finance Agent v2에서 57.9%를 기록했는데, 이는 Gemini 3.1 Pro 대비 상당한 향상이다.

Related content (관련 글)