Claude Opus 5는 일상적인 사용을 위해 설계된 사려 깊고 능동적인 모델로, 더 낮은 비용으로 뛰어난 코딩, 지식 작업 및 문제 해결 성능을 제공합니다.
Claude Opus 5가 오늘 출시됩니다. 사려 깊고 능동적인 이 모델은 Claude Fable 5의 최전선 지능에 가까운 성능을 절반의 가격으로 제공합니다.
Frontier-Bench 및 GDPval-AA와 같은 코딩 및 지식 작업 평가에서 Opus 5는 새로운 최고 성능 모델입니다. 다만 사이버 보안 과제에서는 여전히 Mythos 5보다 뒤처집니다.
Opus 5는 매일 사용하도록 설계되었습니다. 다른 모델보다 더 효율적으로 작동합니다. Claude Max의 새로운 기본 모델이며, Claude Pro에서 가장 강력한 모델입니다.

Claude Opus 5는 이전 모델인 Opus 4.8과 동일한 비용으로 크게 향상된 성능을 제공합니다. 이 섹션의 차트는 고객이 지능을 최적화하거나 더 빠르고 저렴한 결과를 위해 토큰을 절약하는 데 사용할 수 있는 모델 노력 설정에 따라 성능이 어떻게 달라지는지 보여줍니다.
Opus 5는 가치 있는 소프트웨어 엔지니어링 작업에서 뛰어납니다. 예를 들어 Frontier-Bench v0.1에서 Opus 5는 다른 모든 모델을 능가하며, 작업당 더 낮은 비용으로 Opus 4.8 성능의 두 배 이상을 달성합니다. CursorBench 3.2에서는 최대 노력 설정 시 Fable 5의 최고 점수와 0.5% 이내의 성능을 보이면서도 작업당 비용은 절반입니다. 또한 높은 노력, xhigh 노력 및 최대 노력 설정에서 주어진 비용 대비 다른 모든 모델보다 높은 성능을 달성합니다.
지식 작업 및 문제 해결 과제에서도 비슷한 결과를 확인했습니다. 예를 들면 다음과 같습니다.
또한 여러 관련 평가에서 가장 뛰어나고 비용 효율적인 모델입니다.
Opus 5는 과학 연구 측면에서 Opus 4.8보다 의미 있는 개선을 이뤘습니다. 구조 생물학, 유기 화학, 생물정보학 등을 다루는 모든 생명과학 평가에서 Opus 4.8보다 더 나은 성능을 보입니다. 분광학 데이터에서 분자 구조를 추론하는 등의 유기 화학 작업에서 개선 폭이 가장 두드러지며(내부 벤치마크에서 Opus 4.8보다 10.2퍼센트포인트 높음), 단백질 서열의 변이가 기능에 미치는 영향을 예측하는 것과 같은 단백질 관련 작업에서도 7.7퍼센트포인트 높은 점수를 기록했습니다.
마지막으로 Opus 5는 훨씬 더 강력한 시각적 결과물을 생성할 수 있습니다.
Claude Opus 5는 자신의 작업을 검증하고 성공할 때까지 신중하게 반복하는 능력이 훨씬 강합니다. 평가와 얼리 액세스 테스트에서 저희와 사용자들은 Opus 5의 주도성과 철저함을 보여 주는 많은 사례를 발견했습니다.
아래는 Opus 5와 작업한 경험에 대한 얼리 액세스 고객들의 추가 보고입니다.
FrontierCode 1.1에서 Claude Opus 5는 절반의 비용으로 Fable 수준의 성능에 근접합니다. Devin 내에서는 어려운 디버깅 및 근본 원인 분석 작업에서 특히 강점을 보입니다.
Claude Opus 5는 Opus의 속도와 비용으로 Fable 5에 가까운 지능을 제공합니다. CursorBench에서 Fable 5보다 아주 약간 낮은 수준이며, 동일한 행동 특성을 많이 보입니다. 개발자들이 Cursor에서 이를 어떻게 활용할지 기대됩니다.
Claude Opus 5는 이전 Claude 모델보다 더 많은 토큰을 사용하지 않고 Zapier의 AutomationBench 리더보드 정상에 올랐습니다. 원시 계정 상태 워크북을 받아 위험 계정을 표시하고, 적절한 담당자에게 알리고, 고객 유지 운영을 위한 요약을 만드는 전체 이탈 방지 절차를 처음부터 끝까지 수행했습니다. 이전 모델은 통과하지 못했지만 Opus 5는 100%를 달성했습니다.
유전체 분석 작업에서 Claude Opus 5는 우리가 실행해 본 어떤 모델보다 신중한 과학자처럼 행동합니다. 교란 요인을 배제하기 위한 올바른 통계 검정을 선택하고, 독립적인 방법으로 자체 결과를 교차 확인하며, 긴 다단계 분석 내내 방향을 유지합니다.
Claude Opus 5는 내부 평가에서 같은 제품군의 모든 모델을 앞섰습니다. 가장 어려운 에이전트형 코딩 작업에서 Opus 4.7보다 22% 향상된 것에 그치지 않고, 실행 간 변동성도 훨씬 낮아 더 안정적입니다. Lovable의 수백만 제작자에게 그 일관성이야말로 핵심입니다. 빌드할 때마다 신뢰할 수 있는 결과를 제공합니다.
Claude Opus 5는 4.5 이후 Opus 제품군에서 가장 큰 도약입니다. 동일한 풀스택 앱 빌드에서 그 차이는 프런트엔드에서 먼저 드러납니다. 우리가 Opus 모델에서 본 것 중 최고 수준의 애니메이션, 게임, 3D 작업입니다.
Claude Opus 5가 매우 마음에 듭니다. 저희 에이전트가 처리하는 종류의 개방형 분석 작업에서는 Opus 4.8보다 명백히 향상됐고, 개선 폭은 가장 중요한 지점, 즉 더 어렵고 모호한 작업에서 가장 큽니다. 응답은 더 명확하고 간결하며, 더 높은 노력 수준에서도 효율성이 개선된 것을 확인했습니다.
Claude Opus 5는 분석가들이 매일 수행하는 금융 리서치 워크플로에서 Opus 4.8보다 눈에 띄게 향상됐습니다. 정확성이 중요한 곳에서 수치 추론, 표 작업, 더 날카로운 비판적 사고가 돋보입니다.
Claude Opus 5는 전문 기업 콘텐츠 분석에 필수적인 업계 지능과 정확성을 제공합니다. Box는 Opus 5가 Opus 4.8보다 8% 뛰어나며, 기술, 의료, 공공 부문 조직이 매일 의존하는 데이터 분석 워크플로에서 11%, 실사 워크플로에서 17%의 주목할 만한 성능 향상을 제공한다는 사실을 확인했습니다.
Claude Opus 5는 Opus 4.8에서 한 세대가 분명히 도약한 모델입니다. 어느 주말, 저는 개발 환경 전반을 관리하는 비서실장 역할을 맡겼습니다. 자체 모니터를 구축하고 각 환경을 운영했으며, 판단이 필요한 경우에만 저를 참여시켰습니다.

Claude Opus 5는 Fundamental Research Assistant 코드베이스 전반에 걸쳐 대규모 변경을 수행했고, 에이전트형 워크플로 내내 피드백에 맞춰 조정했으며, 우리가 사용한 어떤 모델보다 더 명확하게 추론을 설명했습니다. 보통이라면 훨씬 더 작은 조각으로 나누었을 작업을 처리했습니다.

가장 어려운 금융 모델링 작업 일부에서 Claude Opus 5는 정확성과 효율성 모두에서 Opus 4.8보다 분명히 향상됐습니다. 특히 심층 금융 도메인 논리에서 최소 성능이 실질적으로 더 높습니다. 노력 수준 전반에서 평균 정확도는 9퍼센트포인트 높았고, 대화 횟수와 도구 호출은 3분의 1 적었으며, 소요 시간은 60% 적었습니다.
Claude Opus 5는 실제 프런트엔드 개발자처럼 자신의 작업을 확인합니다. 저희 벤치마크에서 데스크톱 및 휴대폰 너비의 브라우저로 페이지를 열어 모바일 화면 아래에 숨겨진 제품과 화면 밖 결제 버튼을 찾아낸 뒤, 작업을 반환하기 전에 둘 다 수정했습니다.
Claude Opus 5는 이전 Opus 모델과 비교해 법률 에이전트 작업 성능이 분명히 향상됐으며, 기업 지배구조와 중재 같은 업무 분야에서 가장 큰 개선을 보았습니다. 또한 낮은 추론 수준에서도 품질을 유지하는 Opus 5의 능력에 깊은 인상을 받았습니다. 최대 추론의 Opus 4.8과 비슷한 성능을 달성하면서 평균적으로 26% 적은 토큰을 생성했습니다.
Claude Opus 5가 저희에게 제공한 가장 큰 개선은 더 긴 기간의 작업에서 나타납니다. 전체 자료를 만든 다음 수정하는 작업입니다. 어떤 모델을 출시할지는 결과물 품질이 결정하며, 이는 우리가 본 가장 분명한 도약입니다. 시각적 이해는 더 뛰어나고, 형식은 더 깔끔하며, 슬라이드 문제는 더 적습니다.
Claude Opus 5에서 두드러지는 것은 판단력입니다. PR을 넘길 때 서둘러 게시하지 않습니다. 브랜치를 검증하고, 템플릿을 확인하며, 인계가 깔끔하게 이뤄지도록 테스트 영향을 검토합니다. 이전 모델은 앞서 나가다가 저희 검사에서 걸리는 경향이 있었습니다.
아키텍처 재설계 세션 중 Claude Opus 5는 제가 제안한 설계에 이의를 제기했고, 제가 고집해도 물러서지 않았습니다. 대신 제 아이디어에서 정확히 무엇이 가치 있는지 설명하고, 이의를 단 하나의 설계 질문으로 좁힌 뒤, 좋은 부분은 유지하면서 결함을 수정하는 절충안을 제안했습니다. 이런 판단력이 있기에 더 적은 감독으로도 신뢰할 수 있습니다.
첫 번째 검토 수정안에서 Claude Opus 5는 저희가 테스트한 모든 모델 중 가장 높은 점수를 기록했고, Opus 4.8의 거의 두 배에 달했습니다. 의견 제시도 더 뛰어납니다. NDA에서 더 짧은 시간과 더 적은 검토 횟수로 수정안에 도달하면서 정확성은 유지되거나 향상됩니다.
Claude Opus 5는 사용되지 않는 코드 없이 깔끔하고 간결한 차이를 작성하며, 미묘하고 코드베이스 특유의 문제를 더 잘 발견합니다. 프로덕션 워크로드에 채택하고 있습니다.
통합 에이전트 플랫폼인 Cosmos에서 여러 사용 사례를 반드시 이전할 것입니다. 코드 검토에 Claude Opus 5를 점점 더 많이 사용할 계획이며, 사람들이 Opus 4.8보다 Opus 5를 사용하는 편이 낫다고 자신 있게 말할 수 있습니다.

Claude Opus 5에서 두드러지는 점은 판단력입니다. 한 줄의 코드를 작성하기 전에 더 깊이 생각하고, 사후가 아니라 계획 단계에서 자체 논리 결함을 포착하며, 답이 단지 작동하는지가 아니라 왜 옳은지를 추론합니다. 한 Claude 모델에서 다음 모델로의 문제 해결 능력에서 우리가 본 가장 분명한 도약이며, JetBrains IDE에서 채택되는 모습을 기대하고 있습니다.
Claude Opus 5는 트레이딩 벤치마크에서 저희가 테스트한 가장 강력한 Opus 모델이며, Opus 4.8의 약 7분의 1에 해당하는 추론 토큰과 절반 미만의 지연 시간으로 그 성능을 달성합니다. 연산량의 일부만으로 더 나은 답을 제공합니다.
Claude Opus 5를 사용하면 모니터링 에이전트가 프로덕션에서 자체 메모리의 일부를 관리할 수 있어, 더 긴 기간에 걸쳐 더욱 자율적이고 신뢰할 수 있게 됩니다. 에이전트는 컨텍스트를 살아 있는 문서처럼 다룹니다. 저희 서비스 중 하나에서 잠재적 이상 징후를 표시한 뒤, 프로덕션에서 자체 가정을 다시 확인하고 해당 신호가 무해하다는 것을 알아냈으며, 수정 내용을 메모리에 기록하고 모니터링 쿼리를 스스로 종료했습니다.
Claude Opus 5는 장시간 실행되는 다단계 작업을 위해 구축된 강력한 에이전트형 코딩 모델입니다. 코드베이스를 깊이 이해하고, 복잡한 작업 전반에서 맥락을 유지하며, Opus 4.8보다 기능 개발 및 버그 수정 요구사항을 더 효과적으로 확정합니다. 개발자는 이제 Kiro에서 Opus 5로 개발하며 야심 찬 프로젝트를 해결하기 위한 고급 기능을 활용할 수 있습니다.
01 /
24
정렬. 배포 전 테스트 중 자동화된 행동 감사에서 Opus 5는 현재까지 가장 잘 정렬된 모델로 확인되었습니다(아래 그래프 참조). Claude의 헌법을 Opus 4.8, Sonnet 5 또는 Fable 5보다 더 잘 준수하고, 기만적 행동 비율이 가장 낮으며, 오용으로 유도되는 데 가장 덜 취약합니다. 또한 되돌리기 어려운 부작용을 낳을 수 있는 무모한 행동을 피하는 측면에서도 현재까지 가장 안전한 모델입니다.

자동화된 행동 감사에서 Opus 5는 전반적 비정렬 행동 점수 2.3을 기록했으며, 최근 모델 중 가장 낮습니다.
안전성. Opus 5는 위험한 이중 용도 역량의 최전선을 진전시키지 않습니다. 민간 및 정부 파트너와 함께 수행한 엄격한 평가에서 생물학 연구와 공격적 사이버 보안 모두에서 여전히 Mythos 5보다 뒤처짐을 확인했습니다. 이러한 평가에 관한 자세한 내용은 시스템 카드에서 확인할 수 있습니다.
이전 모델인 Opus 4.8과 마찬가지로, 저희는 의도적으로 Opus 5를 사이버 과제로 학습시키지 않았습니다. 그럼에도 모델의 전반적인 역량이 향상된 결과 이러한 과제에서 상당히 개선됐고, 사이버 보안 취약점을 찾는 능력에서는 Mythos 5에 근접합니다. 하지만 그러한 취약점을 _악용_하는 능력, 즉 취약점을 실질적인 사이버 위협으로 전환하는 능력에서는 여전히 Mythos 5보다 상당히 뒤처집니다.
이는 광범위한 사람의 안내 없이 모델이 취약점을 찾고 이후 악용하는 능력을 평가하기 위해 개발한 OSS-Fuzz에서의 Opus 5 성능으로 확인할 수 있습니다. Mythos 5와 Opus 5는 비슷한 성공률로 취약점을 식별하지만, 익스플로잇 개발에서 Opus 5의 점수는 Mythos 5보다 훨씬 낮습니다.

사이버 보안 평가 중 하나인 OSS-Fuzz에서 Opus 5는 소프트웨어 취약점을 식별하는 능력에서는 Mythos 5에 근접하지만(왼쪽), 이를 위한 익스플로잇 개발에서는 훨씬 덜 성공적입니다(오른쪽).
Claude Opus 5의 보호 장치는 사이버 보안과 생물학 모두에서 모델의 유익한 사용을 허용하도록 설계되었습니다. 좁은 범위의 일부 사이버 과제에 더 강한 가드레일을 적용한 점을 제외하면, Opus 4.8에 적용한 것과 유사합니다.
사이버 보안. Opus 5의 사이버 분류기는 Fable 5의 분류기보다 비례적으로 덜 제한적입니다. Opus 5가 소스 코드에서 취약점을 찾는 것은 허용하지만, 악의적 행위자와 연관될 가능성이 더 높은 방식인 “바이너리 기반” 취약점 스캐닝, 침투 테스트, 익스플로잇 생성은 차단합니다.
테스트에 따르면, 분류기는 Fable 5보다 약 85% 적게 개입할 것으로 예상합니다. Claude.ai, Claude Code 및 Claude Cowork에서는 표시된 요청이 기본적으로 Opus 4.8로 대체됩니다. API에서도 Opus 4.8로의 대체를 활성화할 수 있습니다.
사이버 검증 프로그램(CVP)은 그렇지 않으면 모델의 보호 장치로 인해 방해를 받을 사이버 보안 작업을 지원합니다. 이미 CVP에 참여 중인 기업과 연구자는 보안 제한이 더 적은 Opus 5 버전에 즉시 접근할 수 있습니다.
생물학. Opus 5는 Opus 4.8과 유사한 보호 장치 제품군을 갖추고 있으므로, 이제 과학 연구를 위한 일반 제공 모델 중 가장 유능한 모델입니다. 그럼에도 모델은 장시간 지속되는 자율 연구 작업에서 중요한 한계를 보이며, 저희는 이 영역에서 AI 모델이 가장 큰 생물학 관련 위험을 초래할 것으로 예상합니다. (이 유형의 생물학 작업에서는 Mythos 5가 여전히 더 강력한 모델입니다.) 이번 출시의 일환으로 Fable 5에서 차단되는 생물학 관련 요청은 이제 Opus 4.8이 아닌 Opus 5로 라우팅됩니다.
Claude Opus 5는 오늘 모든 플랫폼에서 이용할 수 있으며, 가격은 입력 토큰 100만 개당 $5, 출력 토큰 100만 개당 $25입니다(Opus 4.8과 동일). 개발자는 Claude API에서 claude-opus-5를 시작할 수 있습니다.
또한 기본 속도의 약 2.5배로 작동하는 Fast 모드로도 제공됩니다. Opus 4.8과 마찬가지로 Fast 모드는 Claude Platform에서 Opus 5 기본 가격의 두 배로, 그리고 Claude Code에서는 사용 크레딧을 통해 이용할 수 있습니다.
Opus 5와 함께 다음 두 가지 업데이트를 베타로 출시합니다.
이전 Opus 모델과 마찬가지로, Opus 5는 일반 액세스에 데이터 보존 요구사항이 없습니다.
Opus 5를 최대한 활용하는 방법에 관한 추가 안내는 프롬프팅 가이드를 참조하세요.
Frontier-Bench v0.1, 노력 플롯: 이 결과는 mini-SWE-agent 하니스와 GKE 백엔드에서 과제당 5회 시도의 평균 보상으로 수행한 Frontier-Bench v0.1 내부 실행 결과입니다. Opus 5 및 Fable 5에서 안전 분류기가 거부한 경우 Opus 4.8이 대체 모델로 제공되었습니다.
Anthropic Economic Futures Research Fund의 연구 의제를 공유합니다.
누구나 AI와 업무에 관한 실제 데이터를 탐색할 수 있도록 하는 Claude용 Anthropic Economic Index 커넥터를 출시합니다.
Anthropic은 Public First Action에 추가로 $20 million을 기부하여, 총 지원액을 $40 million으로 늘립니다.