- 시작
- 2025년 9월 29일신뢰도 90%출처 제공
Claude Sonnet 4.5 출시
원문에서 자동 번역됨
원본 제목: Claude Sonnet 4.5 Released
- Anthropic는 이를 “세계 최고의 코딩 모델. 복잡한 에이전트를 구축하는 데 가장 강력한 모델. 컴퓨터를 사용하는 데 가장 뛰어난 모델”이라고 소개했다.[1][4]
- Claude API와 Claude 앱에서 claude-sonnet-4-5로 “오늘부터 어디서나 이용 가능”해졌다. Mike Krieger는 이것이 기본 모델이 될 것이며 “거의 모든 사용 사례”에 추천한다고 밝혔다.[1][5]
- Claude Code 체크포인트와 네이티브 VS Code 확장 프로그램, API의 컨텍스트 편집 기능과 메모리 도구, Claude 앱의 코드 실행 및 파일 생성 기능, 그리고 Claude Code의 기반 인프라인 Claude Agent SDK와 함께 출시됐다.[1][4]
- “지금까지 출시한 것 중 가장 정렬(align)이 잘 된 최전선 모델”로, 아부(sycophancy)와 기만(deception) 비율이 더 낮으며 AI Safety Level 3(ASL-3) 보호 조치 하에 출시됐다.[1][3][4]
- Claude Opus 4.1 출시 2개월도 채 지나지 않아 나왔으며, 당시 Anthropic의 기업 가치는 1,830억 달러로 평가됐다.[4][5]
주요 특징
- Sonnet 4와 마찬가지로 입력 토큰 100만 개당 3달러, 출력 토큰 100만 개당 15달러다. 컨텍스트 윈도우는 20만 토큰, 최대 출력은 6만 4,000토큰이며 신뢰할 수 있는 지식 컷오프는 2025년 1월이다.[1][2]
- SWE-bench Verified에서 테스트 시점 연산 없이 10회 시행 평균으로 77.2%를, 병렬 테스트 시점 연산 사용 시 82.0%를 기록했다.[1]
- OSWorld 컴퓨터 사용에서 61.4%로 선두를 달리는데, 4개월 전 Sonnet 4가 선두였을 때는 42.2%였다.[1]
- Anthropic는 복잡한 다단계 작업에서 30시간 넘게 집중력을 유지하는 것을 관찰했다. CNBC는 Opus 4가 7시간을 유지했다고 언급했다.[1][5]
- 금융, 법률, 의학, STEM 분야 전문가들은 이 모델의 도메인 지식과 추론 능력이 Opus 4.1을 포함한 이전 모델들보다 훨씬 앞서 있다고 평가했다.[1]
벤치마크[1]
| 벤치마크 | Claude Sonnet 4.5 | Claude Opus 4.1 | Claude Sonnet 4 | GPT-5 | Gemini 2.5 Pro |
|---|---|---|---|---|---|
| 에이전트 코딩 (SWE-bench Verified) | 77.2% / 82.0% with parallel test-time compute | 74.5% / 79.4% with parallel test-time compute | 72.7% / 80.2% with parallel test-time compute | 72.8% (GPT-5) / 74.5% (GPT-5-Codex) | 67.2% |
| 에이전트 터미널 코딩 (Terminal-Bench) | 50.0% | 46.5% | 36.4% | 43.8% | 25.3% |
| 에이전트 도구 사용 (τ2-bench), 소매 | 86.2% | 86.8% | 83.8% | 81.1% | — |
| 에이전트 도구 사용 (τ2-bench), 항공 | 70.0% | 63.0% | 63.0% | 62.6% | — |
| 에이전트 도구 사용 (τ2-bench), 통신 | 98.0% | 71.5% | 49.6% | 96.7% | — |
| 컴퓨터 사용 (OSWorld) | 61.4% | 44.4% | 42.2% | — | — |
| 고등학교 수학 경시대회 (AIME 2025) | 100% (python) / 87.0% (no tools) | 78.0% | 70.5% | 99.6% (python) / 94.6% (no tools) | 88.0% |
| 대학원 수준 추론 (GPQA Diamond) | 83.4% | 81.0% | 76.1% | 85.7% | 86.4% |
| 다국어 질의응답 (MMMLU) | 89.1% | 89.5% | 86.5% | 89.4% | — |
| 시각적 추론 (MMMU validation) | 77.8% | 77.1% | 74.4% | 84.2% | 82.0% |
| 금융 분석 (Finance Agent) | 55.3% | 50.9% | 44.5% | 46.9% | 29.4% |
참고자료 5신뢰도 89%종합 신뢰도: 89%핀의 출처와 참고 자료가 날짜를 얼마나 뒷받침하는지.출처를 포함한 자료 5건이 핀의 시작·종료 시각을 얼마나 강하게 뒷받침하는지에 대한 가중 평균. 자료는 최신 자료보다 180일 오래될 때마다 가중치가 절반이 됩니다신뢰도 75% 이상 핀 모두 보기
첫 번째 항목은 항상 핀의 출처입니다. 전체 신뢰도는 각 자료가 위의 시작·종료 시각을 얼마나 확실히 뒷받침하는지에 대한 가중 평균이며, 자료는 최신 자료보다 180일 오래될 때마다 가중치가 절반이 됩니다.
- [1]90%anthropic.com/news/claude-sonnet-4-5anthropic.com· 게시 2026년 9월 28일· 시작 2025년 9월 29일 ✓· 점수의 29%
게시물은 “Sep 29, 2025”로 날짜가 표시돼 있으며 “Claude[2] Sonnet 4.5는 오늘부터 어디서나 이용 가능하다”고 밝혔다. 문서 페이지에는 “Released September 29, 2025”라고 나와 있고, TechCrunch[4]도 “월요일”에 출시됐다고 보도했다.
- [2]90%Claude Sonnet 4.5 - Claude Platform Docsplatform.claude.com· 추가 2026년 9월 28일· 점수의 29%
Anthropic's[1][3] model page: claude-sonnet-4-5-20250929, 200K context window, 64K max output, $3/$15 per million tokens, extended thinking, text and images in, a January 2025 reliable knowledge cutoff, "Released September 29, 2025".
- [3]90%System Card: Claude Sonnet 4.5anthropic.com· 추가 2026년 9월 28일· 점수의 29%
Anthropic's[1] system card for Claude[2] Sonnet 4.5, "a new hybrid reasoning large language model" (September 2025), with the alignment and safety evaluations behind its ASL-3 release.
- [4]85%Anthropic launches Claude Sonnet 4.5, its best AI model for codingtechcrunch.com· 게재 2025년 9월 29일· 시작 2025년 9월 29일· 점수의 7%
TechCrunch, 2025-09-29: "On Monday, Anthropic[1][3] launched a new frontier model called Claude[2] Sonnet 4.5" at Sonnet 4's $3/$15; researcher David Hershey saw it code autonomously for up to 30 hours; it arrives less than two months after Claude Opus 4.1.
- [5]85%Anthropic launches Claude Sonnet 4.5, its latest AI model that's 'more of a colleague'cnbc.com· 게재 2025년 9월 29일· 시작 2025년 9월 29일· 점수의 7%
CNBC, 2025-09-29: available to all users from the $183 billion startup; Mike Krieger says it will be the default and recommends it for "basically every use case"; it runs autonomously for 30 hours against Opus 4's seven.
수정 제안
빠지거나 잘못된 점이 있나요? 이 핀을 뒷받침하는 링크, 다른 시작일이나 종료일과 그 이유, 빠지거나 잘못된 사실을 자신의 말로 알려주세요. AI가 이 핀의 출처와 대조하고 더 나은 자료를 찾아, 뒷받침하는 페이지를 추가합니다. 핀 자체의 출처가 여전히 가장 중요하게 반영됩니다. AI는 이미지도 확인합니다. 다른 것을 보여주거나 제대로 보여주지 못하는 이미지는 뒤로 옮기거나 교체합니다.