- 시작
- 2025년 2월 24일신뢰도 90%출처 제공
Claude 3.7 Sonnet 출시
원문에서 자동 번역됨
원본 제목: Claude 3.7 Sonnet Released
- Anthropic는 Claude 3.7 Sonnet을 “지금까지 나온 가장 지능적인 모델이자 시장에 나온 최초의 하이브리드 추론 모델”이라고 소개했다. 거의 즉각적인 답변을 주거나 “사용자에게 보여지는 확장된 단계적 사고”를 할 수 있는 단일 모델이다.[1][4]
- Free, Pro, Team, Enterprise 등 모든 Claude 요금제와 Claude Developer Platform, Amazon Bedrock, Google Cloud의 Vertex AI에 제공됐다. 확장 사고(extended thinking)는 무료 등급을 제외한 모든 곳에서 이용할 수 있다.[1][4]
- Anthropic의 첫 에이전트 코딩 도구인 Claude Code가 이와 함께 터미널에서 작동하는 제한적 리서치 프리뷰로 출시됐고, GitHub 연동은 모든 Claude 요금제에 도입됐다.[1]
- 이전 모델보다 불필요한 거부 응답을 45% 줄였으며 ASL-2 표준으로 출시됐다.[1][2]
- 버전 번호가 3.5에서 3.7로 뛰었으며, 2025년 2월 Claude 3.7 Sonnet이 Twitch에서 실시간으로 포켓몬 레드(Pokémon Red)를 플레이하기 시작했다.[3][4]
주요 특징
- 두 모드 모두 입력 토큰 100만 개당 3달러, 출력 토큰 100만 개당 15달러이며 사고(thinking) 토큰도 포함된다.[1][4]
- API 사용자는 12만 8,000토큰의 출력 한도까지 원하는 크기로 사고 예산(thinking budget)을 설정할 수 있어, 속도와 비용을 품질과 맞바꿀 수 있다.[1]
- Anthropic의 차트에 따르면 SWE-bench Verified에서 62.3%(맞춤형 스캐폴드 사용 시 70.3%)로 업그레이드된 3.5 Sonnet의 49.0%를 앞섰고, TAU-bench에서는 81.2%(소매)와 58.4%(항공)를 기록했다.[1]
- Anthropic는 수학·코딩 경시대회보다는 실제 업무 작업에 맞춰 최적화를 덜 했다고 밝혔다.[1]
- 표준 모드에서는 업그레이드된 Claude 3.5 Sonnet이며, 확장 사고 모드에서는 답변 전에 숙고하는데, 이는 수학, 물리학, 지시 이행, 코딩에 도움이 된다.[1]
벤치마크[1]
| 벤치마크 | Claude 3.7 Sonnet (64K extended thinking) | Claude 3.7 Sonnet (no extended thinking) | Claude 3.5 Sonnet (new) | OpenAI o1¹ | OpenAI o3-mini¹ (high) | DeepSeek R1 (32K extended thinking) | Grok 3 Beta (extended thinking) |
|---|---|---|---|---|---|---|---|
| 대학원 수준 추론 (GPQA Diamond)³ | 78.2% / 84.8% | 68.0% | 65.0% | 75.7% / 78.0% | 79.7% | 71.5% | 80.2% / 84.6% |
| 에이전트 코딩 (SWE-bench Verified)² | — | 62.3% / 70.3% | 49.0% | 48.9% | 49.3% | 49.2% | — |
| 에이전트 도구 사용 (TAU-bench), 소매 | — | 81.2% | 71.5% | 73.5% | — | — | — |
| 에이전트 도구 사용 (TAU-bench), 항공 | — | 58.4% | 48.8% | 54.2% | — | — | — |
| 다국어 질의응답 (MMMLU) | 86.1% | 83.2% | 82.1% | 87.7% | 79.5% | — | — |
| 시각적 추론 (MMMU validation) | 75% | 71.8% | 70.4% | 78.2% | — | — | 76.0% / 78.0% |
| 지시 이행 (IFEval) | 93.2% | 90.8% | 90.2% | — | — | 83.3% | — |
| 수학 문제 해결 (MATH 500) | 96.2% | 82.2% | 78.0% | 96.4% | 97.9% | 97.3% | — |
| 고등학교 수학 경시대회 (AIME 2024)³ | 61.3% / 80.0% | 23.3% | 16.0% | 79.2% / 83.3% | 87.3% | 79.8% | 83.9% / 93.3% |
Pass@1은 여러 시행(AIME와 SWE-bench Verified는 최대 16회)에 대한 평균이며, 두 번째 수치는 병렬 테스트 시점 연산의 도움을 받은 값이다. ¹ o1의 TAU-bench 결과는 OpenAI가 발표했다가 이후 삭제한 것으로, TAU-bench 결과는 서로 비교할 수 없을 수 있다. ² 62.3%는 bash/editor 도구와 “사고 도구(thinking tool)”를 사용해 500개 문제에 대해 얻은 pass@1이며, 70.3%는 내부 채점과 맞춤형 스캐폴드를 사용해 축소된 문제 집합에서 얻은 값이다. DeepSeek R1은 Agentless 프레임워크를 사용한다. ³ Claude 3.7 Sonnet의 높은 GPQA·AIME 2024 점수는 병렬 테스트 시점 연산을 사용한 내부 채점 값이며, o1과 Grok 3의 점수는 64개 샘플을 사용한 다수결 투표(majority voting) 값이다.
참고자료 4신뢰도 85%종합 신뢰도: 85%핀의 출처와 참고 자료가 날짜를 얼마나 뒷받침하는지.출처를 포함한 자료 4건이 핀의 시작·종료 시각을 얼마나 강하게 뒷받침하는지에 대한 가중 평균. 자료는 최신 자료보다 180일 오래될 때마다 가중치가 절반이 됩니다신뢰도 75% 이상 핀 모두 보기
첫 번째 항목은 항상 핀의 출처입니다. 전체 신뢰도는 각 자료가 위의 시작·종료 시각을 얼마나 확실히 뒷받침하는지에 대한 가중 평균이며, 자료는 최신 자료보다 180일 오래될 때마다 가중치가 절반이 됩니다.
- [1]90%anthropic.com/news/claude-3-7-sonnetanthropic.com· 게시 2026년 9월 28일· 시작 2025년 2월 24일 ✓· 점수의 32%
게시물은 “Feb 24, 2025”로 날짜가 표시돼 있으며 “오늘 우리는 Claude 3.7 Sonnet을 발표한다”, “이제 모든 Claude 요금제에서 이용할 수 있다”고 밝혔다. TechCrunch[4]는 “월요일(2월 24일)에 모든 사용자와 개발자에게 배포되고 있다”고 전했다.
- [2]90%Claude 3.7 Sonnet System Cardanthropic.com· 추가 2026년 9월 28일· 점수의 32%
Anthropic's[1] system card for "a hybrid reasoning model": it explains why users see the model's thinking, and states "Claude 3.7 Sonnet is released under the ASL-2 standard".
- [3]75%Claude (AI) - Wikipediaen.wikipedia.org· 추가 2026년 9월 28일· 점수의 32%
The Sonnet table dates Claude 3.7 Sonnet to 24 February 2025; the article adds that in February 2025 Claude 3.7 Sonnet playing Pokémon Red began streaming on Twitch to thousands of viewers.[1]
- [4]85%Anthropic launches a new AI model that 'thinks' as long as you wanttechcrunch.com· 게재 2025년 2월 24일· 시작 2025년 2월 24일· 점수의 3%
TechCrunch, 2025-02-24: the model "is rolling out to all users and developers on Monday"; free users get the standard mode, only paid plans the reasoning; $3/$15 per million tokens against o3-mini's $1.10/$4.40 and DeepSeek R1's $0.55/$2.19; "(Yes, the company skipped a number.)"
수정 제안
빠지거나 잘못된 점이 있나요? 이 핀을 뒷받침하는 링크, 다른 시작일이나 종료일과 그 이유, 빠지거나 잘못된 사실을 자신의 말로 알려주세요. AI가 이 핀의 출처와 대조하고 더 나은 자료를 찾아, 뒷받침하는 페이지를 추가합니다. 핀 자체의 출처가 여전히 가장 중요하게 반영됩니다. AI는 이미지도 확인합니다. 다른 것을 보여주거나 제대로 보여주지 못하는 이미지는 뒤로 옮기거나 교체합니다.