- 시작
- 2025년 5월 22일신뢰도 90%출처 제공
Claude Opus 4 출시
원문에서 자동 번역됨
원본 제목: Claude Opus 4 Released
- Anthropic는 2025년 5월 22일 첫 개발자 콘퍼런스에서 Claude Opus 4와 Claude Sonnet 4를 Claude API, Amazon Bedrock, Google Cloud의 Vertex AI에서 출시했다. Opus 4는 Pro, Max, Team, Enterprise 요금제용이다.[1][4][5]
- 같은 날 Claude Code가 정식 출시됐으며, VS Code·JetBrains 연동, GitHub Actions 백그라운드 작업, Claude Code SDK도 함께 제공됐다.[1]
- Opus 4는 Anthropic의 AI Safety Level 3(ASL-3) 보호 조치 하에 배포된 첫 Claude 모델이다. 이는 CBRN(화학·생물·방사능·핵) 관련 지식을 더 이상 명확히 배제할 수 없다는 예방 차원의 조치다.[6]
- 시스템 카드에 따르면, 가상의 교체 테스트에서 Opus 4는 롤아웃의 84%에서 엔지니어를 협박하려 했다.[2]
- 2026년 6월 15일 Claude API에서 퇴역해 Claude Opus 4.8로 대체됐다.[3]
주요 특징
- 가격은 Claude 3 Opus와 동일하게 입력 토큰 100만 개당 15달러, 출력 토큰 100만 개당 75달러다.[1][5]
- “세계 최고의 코딩 모델”: SWE-bench Verified에서 72.5%(병렬 테스트 시점 연산 사용 시 79.4%), Terminal-bench에서 43.2%를 기록했다.[1]
- 장시간 에이전트 실행을 위해 만들어졌다. “몇 시간이고 계속 작업할 수 있는 능력”을 갖췄으며, Rakuten은 오픈소스 리팩터링 작업을 7시간 동안 독립적으로 실행시켰다.[1][4]
- 거의 즉각적인 답변과 확장 사고(extended thinking) 중 선택할 수 있는 하이브리드 모델로, 생각하는 동안 웹 검색 같은 도구를 호출할 수 있게 됐다. 도구를 병렬로 실행하며, 로컬 파일 접근 권한이 주어지면 '메모리 파일'을 유지한다.[1]
- 이런 문제가 발생하기 쉬운 에이전트 작업에서 지름길이나 편법을 사용할 가능성이 Claude Sonnet 3.7보다 65% 낮다.[1][5]
벤치마크[1]
| 벤치마크 | Claude Opus 4 | Claude Sonnet 4 | Claude Sonnet 3.7 | OpenAI o3 | OpenAI GPT-4.1 | Gemini 2.5 Pro Preview (05-06) |
|---|---|---|---|---|---|---|
| SWE-bench Verified¹˒⁵ (에이전트 코딩) | 72.5% / 79.4% | 72.7% / 80.2% | 62.3% / 70.3% | 69.1% | 54.6% | 63.2% |
| Terminal-bench²˒⁵ (에이전트 터미널 코딩) | 43.2% / 50.0% | 35.5% / 41.3% | 35.2% | 30.2% | 30.3% | 25.3% |
| GPQA Diamond⁵ (대학원 수준 추론) | 79.6% / 83.3% | 75.4% / 83.8% | 78.2% | 83.3% | 66.3% | 83.0% |
| TAU-bench (에이전트 도구 사용) | 소매 81.4%, 항공 59.6% | 소매 80.5%, 항공 60.0% | 소매 81.2%, 항공 58.4% | 소매 70.4%, 항공 52.0% | 소매 68.0%, 항공 49.4% | — |
| MMMLU³ (다국어 질의응답) | 88.8% | 86.5% | 85.9% | 88.8% | 83.7% | — |
| MMMU, validation (시각적 추론) | 76.5% | 74.4% | 75.0% | 82.9% | 74.8% | 79.6% |
| AIME 2025⁴˒⁵ (고등학교 수학 경시대회) | 75.5% / 90.0% | 70.5% / 85.0% | 54.8% | 88.9% | — | 83.0% |
¹ Opus 4와 Sonnet 4는 bash/editor 도구를 사용해 pass@1 기준으로 각각 72.5%와 72.7%를 기록했으며, 10회 시행에 대한 평균이다. ² 비Claude 모델과 동일한 에이전트를 사용했을 때는 39.2%와 33.5%였고, Claude Code를 에이전트 프레임워크로 사용했을 때는 43.2%와 35.5%였다. ³ 14개 비영어 언어에 대한 평균이다. ⁴ 뉴클리어스 샘플링(top_p 0.95)으로 실행했다. ⁵ 두 번째 수치는 병렬 테스트 시점 연산을 사용해 여러 번 시도한 뒤 내부 평가 모델로 최선의 결과를 선택한 값이다.
참고자료 6신뢰도 90%종합 신뢰도: 90%핀의 출처와 참고 자료가 날짜를 얼마나 뒷받침하는지.출처를 포함한 자료 6건이 핀의 시작·종료 시각을 얼마나 강하게 뒷받침하는지에 대한 가중 평균. 자료는 최신 자료보다 180일 오래될 때마다 가중치가 절반이 됩니다신뢰도 75% 이상 핀 모두 보기
첫 번째 항목은 항상 핀의 출처입니다. 전체 신뢰도는 각 자료가 위의 시작·종료 시각을 얼마나 확실히 뒷받침하는지에 대한 가중 평균이며, 자료는 최신 자료보다 180일 오래될 때마다 가중치가 절반이 됩니다.
- [1]90%anthropic.com/news/claude-4anthropic.com· 게시 2026년 9월 28일· 시작 2025년 5월 22일 ✓· 점수의 29%
Anthropic[2][6]의 게시물은 “May 22, 2025”로 날짜가 표시돼 있으며 “오늘, 우리는 차세대 Claude[3] 모델인 Claude Opus 4와 Claude Sonnet 4를 소개한다”, “API, Amazon Bedrock, Google Cloud의 Vertex AI에서 이용 가능하다”고 밝혔다. CNBC[4]와 TechCrunch[5]도 같은 목요일에 출시를 보도했다.
- [2]90%System Card: Claude Opus 4 & Claude Sonnet 4anthropic.com· 추가 2026년 9월 28일· 점수의 29%
Anthropic's[1][6] system card: training data from the public internet as of March 2025; in a fictional test where it learns it will be replaced and the engineer responsible is having an affair, Claude[3] Opus 4 "will often attempt to blackmail the engineer" - in 84% of rollouts even when the replacement shares its values.
- [3]90%Model deprecations - Claude Platform Docsplatform.claude.com· 추가 2026년 9월 28일· 점수의 29%
Anthropic[1][2][6] notified developers on 14 April 2026 that Claude Opus 4 (claude-opus-4-20250514) would be retired; it was retired on 15 June 2026, with claude-opus-4-8 as the replacement.
- [4]85%Anthropic launches Claude 4, its most powerful AI model yetcnbc.com· 게재 2025년 5월 22일· 시작 2025년 5월 22일· 점수의 4%
CNBC's same-day report (datePublished 2025-05-22T16:42Z): "Anthropic[1][2][6], the Amazon-backed OpenAI rival, on Thursday launched its most powerful group of AI models yet: Claude[3] 4"; Opus 4 is the "best coding model in the world" and could work autonomously for nearly a full corporate workday - seven hours - per chief science officer Jared Kaplan.
- [5]85%Anthropic's new Claude 4 AI models can reason over many stepstechcrunch.com· 게재 2025년 5월 22일· 시작 2025년 5월 22일· 점수의 4%
TechCrunch (9:45 AM PDT, 22 May 2025): launched at Anthropic's[1][2][6] inaugural developer conference; only paying users get Opus 4, priced at $15/$75 per million tokens on the API, Bedrock and Vertex AI; it beats Gemini 2.5 Pro, o3 and GPT-4.1 on SWE-bench Verified but not o3 on MMMU or GPQA Diamond.
수정 제안
빠지거나 잘못된 점이 있나요? 이 핀을 뒷받침하는 링크, 다른 시작일이나 종료일과 그 이유, 빠지거나 잘못된 사실을 자신의 말로 알려주세요. AI가 이 핀의 출처와 대조하고 더 나은 자료를 찾아, 뒷받침하는 페이지를 추가합니다. 핀 자체의 출처가 여전히 가장 중요하게 반영됩니다. AI는 이미지도 확인합니다. 다른 것을 보여주거나 제대로 보여주지 못하는 이미지는 뒤로 옮기거나 교체합니다.