- 시작
- 2024년 10월 22일신뢰도 90%출처 제공
Claude 3.5 Sonnet 업그레이드 출시
원문에서 자동 번역됨
원본 제목: Claude 3.5 Sonnet Upgrade Released
- Anthropic는 “이전 모델보다 전반적으로 향상되었으며 특히 코딩에서 크게 개선된” “업그레이드된 Claude 3.5 Sonnet”을 발표하며 당일 모든 사용자에게 제공했고, 새로운 Claude 3.5 Haiku는 그달 말에 나올 예정이라고 밝혔다.[1]
- 컴퓨터 사용(computer use) 기능이 퍼블릭 베타로 등장했다. Claude가 화면을 보고, 커서를 움직이고, 버튼을 클릭하고, 타이핑을 하는 기능으로, Anthropic는 3.5 Sonnet을 “퍼블릭 베타로 컴퓨터 사용을 제공하는 최초의 최전선 AI 모델” - “아직 실험적이며, 때때로 다루기 번거롭고 오류가 발생하기 쉽다” - 이라고 소개했다.[1][4]
- 커서를 조작하기 위해 Claude는 각 스크린샷에서 움직여야 할 픽셀 수를 계산한다. Anthropic는 계산기나 텍스트 편집기 같은 간단한 소프트웨어로 이 능력을 훈련시켰다.[3]
- 개발자는 그날 바로 Anthropic API, Amazon Bedrock, Google Cloud의 Vertex AI에서 이를 사용할 수 있었다. Asana, Canva, Cognition, DoorDash, Replit, The Browser Company가 초기 사용자였으며, Amazon은 조기 접근 권한을 가졌다.[1][5]
- 출시 전 미국과 영국의 AI Safety Institute가 공동으로 테스트했다. Anthropic는 이를 ASL-2 등급으로 유지했으며, 컴퓨터 사용 여부와 위해 발생 여부를 감지하는 분류기(classifier)를 추가했다.[1]
주요 특징
- 가격과 속도는 6월의 3.5 Sonnet과 동일하다.[1]
- SWE-bench Verified는 33.4%에서 49.0%로 올라 OpenAI의 o1-preview를 포함한 모든 공개 이용 가능 모델을 앞섰다.[1]
- TAU-bench 에이전트 도구 사용 점수는 소매 도메인에서 62.6%에서 69.2%로, 항공 도메인에서 36.0%에서 46.0%로 올랐다.[1]
- OSWorld에서는 스크린샷만으로 14.9%를 기록해 그 다음으로 좋은 시스템의 7.8%를 앞섰고, 더 많은 단계를 허용했을 때는 22.0%를 기록했다.[1][2]
- 스크롤, 드래그, 확대·축소는 여전히 어려웠으며, Anthropic는 위험도가 낮은 작업부터 시작하라고 권고했다.[1]
벤치마크[1]
| 벤치마크 | Claude 3.5 Sonnet (new) | Claude 3.5 Haiku | Claude 3.5 Sonnet | GPT-4o* | GPT-4o mini* | Gemini 1.5 Pro | Gemini 1.5 Flash |
|---|---|---|---|---|---|---|---|
| 대학원 수준 추론 (GPQA Diamond) | 65.0% (0-shot CoT) | 41.6% (0-shot CoT) | 59.4% (0-shot CoT) | 53.6% (0-shot CoT) | 40.2% (0-shot CoT) | 59.1% (0-shot CoT) | 51.0% (0-shot CoT) |
| 학부 수준 지식 (MMLU Pro) | 78.0% (0-shot CoT) | 65.0% (0-shot CoT) | 75.1% (0-shot CoT) | — | — | 75.8% (0-shot CoT) | 67.3% (0-shot CoT) |
| 코드 (HumanEval) | 93.7% (0-shot) | 88.1% (0-shot) | 92.0% (0-shot) | 90.2% (0-shot) | 87.2% (0-shot) | — | — |
| 수학 문제 해결 (MATH) | 78.3% (0-shot CoT) | 69.2% (0-shot CoT) | 71.1% (0-shot CoT) | 76.6% (0-shot CoT) | 70.2% (0-shot CoT) | 86.5% (4-shot CoT) | 77.9% (4-shot CoT) |
| 고등학교 수학 경시대회 (AIME 2024) | 16.0% (0-shot CoT) | 5.3% (0-shot CoT) | 9.6% (0-shot CoT) | 9.3% (0-shot CoT) | — | — | — |
| 시각 질의응답 (MMMU) | 70.4% (0-shot CoT) | — | 68.3% (0-shot CoT) | 69.1% (0-shot CoT) | 59.4% (0-shot CoT) | 65.9% (0-shot CoT) | 62.3% (0-shot CoT) |
| 에이전트 코딩 (SWE-bench Verified) | 49.0% | 40.6% | 33.4% | — | — | — | — |
| 에이전트 도구 사용 (TAU-bench), 소매 | 69.2% | 51.0% | 62.6% | — | — | — | — |
| 에이전트 도구 사용 (TAU-bench), 항공 | 46.0% | 22.8% | 36.0% | — | — | — | — |
* Anthropic의 평가표는 일반적인 모델과 달리 응답 전 계산에 상당한 시간이 걸리는 OpenAI의 o1 모델군을 제외한다.
참고자료 5신뢰도 90%종합 신뢰도: 90%핀의 출처와 참고 자료가 날짜를 얼마나 뒷받침하는지.출처를 포함한 자료 5건이 핀의 시작·종료 시각을 얼마나 강하게 뒷받침하는지에 대한 가중 평균. 자료는 최신 자료보다 180일 오래될 때마다 가중치가 절반이 됩니다신뢰도 75% 이상 핀 모두 보기
첫 번째 항목은 항상 핀의 출처입니다. 전체 신뢰도는 각 자료가 위의 시작·종료 시각을 얼마나 확실히 뒷받침하는지에 대한 가중 평균이며, 자료는 최신 자료보다 180일 오래될 때마다 가중치가 절반이 됩니다.
- [1]90%anthropic.com/news/3-5-models-and-computer-useanthropic.com· 게시 2026년 9월 28일· 시작 2024년 10월 22일 ✓· 점수의 46%
게시물은 “Oct 22, 2024”로 날짜가 표시돼 있으며 “업그레이드된 Claude 3.5 Sonnet은 이제 모든 사용자에게 제공된다. 오늘부터 개발자는 컴퓨터 사용 베타로 빌드할 수 있다”고 밝혔다. TechCrunch[4]와 CNBC[5]도 같은 날 “화요일”에 출시됐다고 보도했다.
- [2]90%Model Card Addendum: Claude 3.5 Haiku and Upgraded Claude 3.5 Sonnetassets.anthropic.com· 추가 2026년 9월 28일· 점수의 46%
Anthropic's[1][3] model card addendum: the upgraded 3.5 Sonnet sets new state-of-the-art results in agentic coding (SWE-bench Verified), agentic tasks (TAU-bench) and computer use from screenshots (OSWorld), with a 14.9% average OSWorld success rate from screenshots alone.
- [3]90%Developing a computer use modelanthropic.com· 게재 2024년 10월 22일· 점수의 3%
Anthropic's[1][2] research post on the skill: Claude looks at screenshots and "counts how many pixels vertically or horizontally it needs to move a cursor in order to click in the correct place", and was trained on simple software such as a calculator and a text editor without internet access.
- [4]85%Anthropic's new AI model can control your PCtechcrunch.com· 게재 2024년 10월 22일· 시작 2024년 10월 22일· 점수의 3%
TechCrunch, 2024-10-22: "Anthropic[1][2][3] on Tuesday released an upgraded version of its Claude 3.5 Sonnet model that can understand and interact with any desktop app" through a Computer Use API in open beta on the API, Bedrock and Vertex AI.
- [5]85%Amazon-backed Anthropic debuts AI agents that can do complex tasks, racing against OpenAI, Microsoft and Googlecnbc.com· 게재 2024년 10월 22일· 시작 2024년 10월 22일· 점수의 3%
CNBC, 2024-10-22: chief science officer Jared Kaplan says it can do tasks with "tens or even hundreds of steps"; Amazon had early access and beta testers included Asana, Canva and Notion; released Tuesday in public beta for developers.
수정 제안
빠지거나 잘못된 점이 있나요? 이 핀을 뒷받침하는 링크, 다른 시작일이나 종료일과 그 이유, 빠지거나 잘못된 사실을 자신의 말로 알려주세요. AI가 이 핀의 출처와 대조하고 더 나은 자료를 찾아, 뒷받침하는 페이지를 추가합니다. 핀 자체의 출처가 여전히 가장 중요하게 반영됩니다. AI는 이미지도 확인합니다. 다른 것을 보여주거나 제대로 보여주지 못하는 이미지는 뒤로 옮기거나 교체합니다.