소넷 5.5는 낮거나 중간 추론 강도에서 반복 작업을 빠르고 적은 비용으로 처리할 후보지만, 높은 강도에서는 오퍼스보다 실제 작업 비용이 더 들 수 있습니다. 앤트로픽이 2026년 9월 28일 발표한 Claude Sonnet 5.5(클로드 소넷 5.5)는 범위가 정해진 코딩과 문서 작업을 겨냥합니다. 상위 모델의 변화는 오퍼스 5.5 가격·성능 글에서 함께 볼 수 있습니다. (공식 발표)

초기 개발자 토론에서는 낮은 강도의 비용 효율과 모델 선택을 둘러싼 관심이 함께 나왔습니다. API를 붙여 쓰는 사람에게는 가격뿐 아니라 추론 기본값과 응답 처리 방식도 중요한 변화입니다. 아래 내용은 2026년 9월 30일 확인 기준입니다. (HN 토론, API 이전 안내)

한눈에 보기

궁금한 점 이번 발표의 핵심
어떤 모델인가 Claude 5.5 계열의 두 번째 모델, 일상적인 코딩·지식 작업에 초점
어떤 일에 맞나 버그 수정, 문서·슬라이드·스프레드시트, 디자인, 빠른 반복
이전 소넷과 성능 차이는 코딩·업무·화면 조작·차트 읽기 평가에서 개선, 시험별 조건은 다름
API 토큰 가격은 100만 토큰당 입력 $2·출력 $10·캐시 읽기 $0.20
실제 작업 비용은 최대 추론의 독립 평가에서 Sonnet $7.60, Opus $5.98
기본 추론 강도는 Claude 앱·Claude Code는 Medium, Claude Platform API는 High
기존 API에서 바뀌는 것은 추론 기본 동작, 내용 블록 처리, 강제 도구 선택 등
한국에서 쓸 수 있나 Claude.ai·상용 API 지원 국가에 한국 포함, 클라우드별 지역은 별도
안전 보호는 고위험 사이버 요청은 Sonnet 5로 대체, 생물학 보호는 Sonnet 5와 같음

가격·설정·제공 범위는 공식 발표와 개발자 문서, 한국 지원은 지원 국가 목록을 기준으로 했습니다. 아래 성능 표와 속도·절감 주장은 앤트로픽의 공개 평가이며, Artificial Analysis의 비교는 별도의 독립 평가입니다. 커뮤니티 반응은 초기 경험담으로 구별했습니다.

코딩에서는 이전 소넷보다 무엇이 좋아졌나요?

에이전트 코딩은 모델이 코드를 한 번 써 주는 데서 끝나지 않고, 파일을 읽고 명령을 실행하며 수정과 검증을 반복하는 방식입니다. 따라서 함수 하나를 잘 만드는 능력과 여러 파일을 고쳐 작업을 끝내는 능력을 나눠 보면 선택이 쉬워집니다. 앤트로픽은 소넷 5.5가 코드베이스를 빨리 파악하고 도구 호출을 묶어 처리해 단계와 비용을 줄인다고 소개합니다. (발표의 코딩 설명)

앤트로픽 공개 코딩 평가 Sonnet 5 Sonnet 5.5 Opus 5.5 GPT-6 Sol
Terminal-Bench 4.0 10.3% 70.6% 66.4% 미기재
FrontierCode 1.1, Main 42.4% 46.2% (Max) 54.4% 49.3%, Xhigh 52.1%
CursorBench 4.0 34.1% 55.5% 57.8% 미기재

Terminal-Bench는 명령줄에서 여러 단계의 전문 작업을 끝내는 시험입니다. 저장소를 살피고 실행 결과에 맞춰 고치는 작업과 관련 있습니다. FrontierCode는 에이전트의 코드 변경이 병합될 만한지를 평가하고, CursorBench는 실제 Cursor 세션에서 나온 모호한 다중 파일 작업을 다룹니다. 요구가 덜 정리된 버그 수정이나 여러 파일에 걸친 변경이라면 뒤의 두 평가도 함께 볼 지점입니다. (평가 설명과 표)

Terminal-Bench의 Opus 값은 Xhigh 최고점이고 FrontierCode의 Sonnet 값은 Max입니다. Sonnet은 FrontierCode에서 Xhigh가 Max보다 높았으며, Max에서는 하위 에이전트의 타임아웃·범위 밖 수정 사례가 있었다고 발표 주석은 설명합니다. 강도를 올릴수록 모든 시험에서 좋아지는 식으로 읽기보다, 시험과 설정을 함께 보는 이유입니다. (공식 표 주석)

업무로 옮기면, 범위가 분명한 버그 수정과 빠른 수정·검증 반복에 소넷을 먼저 비교할 수 있습니다. 복잡하고 열린 문제에서 판단을 오래 유지하는 능력은 오퍼스가 여전히 더 강하다는 것이 앤트로픽의 설명입니다. Terminal-Bench 한 항목의 우위와 전체 개발 업무의 적합성을 구별할 지점입니다. (모델별 역할 설명)

문서와 지식 업무에서는 오퍼스에 얼마나 가까워졌나요?

지식 업무는 자료를 읽고 답하는 일에 더해, 내용을 정리해 보고서·슬라이드·스프레드시트 같은 결과물을 만드는 일을 포함합니다. 이때는 단답형 문제 점수보다 자료를 여러 단계로 다루고 결과물을 끝내는 평가가 관련 있습니다. 소넷 5.5는 아래 두 업무 평가에서 오퍼스 5.5와 가까운 점수를 냈습니다. (공식 업무 평가)

앤트로픽 공개 업무 평가 Sonnet 5 Sonnet 5.5 Opus 5.5 GPT-6 Sol
GDPval-AA v2.1 1449 1844 1846 1487
AA-Briefcase v1.1 1359 1811 1822 1483

GDPval-AA는 44개 직종과 9개 주요 산업의 실제 업무형 과제를 다룹니다. AA-Briefcase는 여러 단계를 오래 이어 가는 지식 업무를 평가합니다. 이 표의 숫자는 정답률 퍼센트가 아니라 각 평가의 점수입니다. 보고서를 반복 작성하거나 자료를 모아 업무 산출물을 만드는 사람에게 모델을 좁히는 근거가 됩니다. (시험 설명)

앤트로픽은 디자인 감각과 문서 다듬기를 강조합니다. 발표에 실린 내부 사례에서는 기업의 분기 실적 자료와 통화 기록, 슬라이드 양식을 주고 10장짜리 운영 검토 자료를 만들게 했으며, 전문가 두 명이 첫 초안을 바로 보낼 만하다고 평가했다고 소개합니다. 이는 회사가 고른 사례입니다. 실제로 반복 작성하는 양식이 있다면 그 양식으로 수정 횟수와 결과 품질을 비교하는 데 연결할 수 있습니다. (지식 업무 사례)

표 주석에 따르면 GDPval·AA-Briefcase는 구조화 출력 버그가 있던 사전 배포판 결과이며, 앤트로픽은 영향이 작고 수정됐다고 밝혔습니다. 일부 GPT-6 Sol 값은 업데이트 전일 수 있다는 주석도 있습니다. (평가 주석)

추론·화면 조작·차트 읽기는 어떻게 달라졌나요?

텍스트 답변과 화면을 보며 일하는 능력은 구별해서 볼 수 있습니다. 전문 지식을 묻는 시험, 컴퓨터를 조작하는 시험, 차트에서 정보를 읽는 시험은 각각 다른 작업에 대응합니다. (공식 성능 표)

앤트로픽 공개 평가 Sonnet 5 Sonnet 5.5 Opus 5.5 조건
Humanity’s Last Exam 54.9% 64.5% 67.7% 도구 사용
OSWorld 2.1 57.0% 80.1% 81.8% 부분 점수
Chartography 15.6% 61.6% 64.4% 도구 미사용

Humanity’s Last Exam은 여러 전문 분야에 걸친 어려운 추론 문제를 다룹니다. 위 값은 도구를 함께 쓴 결과입니다. OSWorld는 컴퓨터 화면을 보고 조작해 과제를 수행하는 능력을 평가합니다. 부분 점수를 인정하는 방식이므로 80.1%를 모든 작업의 완전 성공 비율로 바꿔 읽기보다 평가 방식까지 함께 보면 좋습니다. Chartography는 시각적 차트 인식 시험으로, 위 표에서는 도구를 쓰지 않고 차트를 읽었습니다. (평가 이름·조건)

슬라이드 속 차트를 읽어 보고서를 만들거나 화면 조작으로 업무를 이어 가는 경우, 이전 소넷과 비교할 근거가 늘었습니다. 앤트로픽은 스크린샷만 보며 포켓몬 레드를 끝낸 첫 소넷이라는 사례도 소개합니다. 게임 완주는 긴 화면 기반 작업의 사례이고, 자신이 사용하는 업무 프로그램의 성공률은 그 프로그램에서 따로 비교할 항목입니다. (이미지 이해와 게임 사례)

토큰 단가가 절반이면 실제 비용도 절반인가요?

API 비용은 읽은 입력, 만든 출력, 캐시 사용량에 따라 달라집니다. 토큰은 모델이 글을 처리하는 단위이며, 캐시는 반복해서 읽는 내용을 재사용하는 기능입니다. 소넷 5.5의 단가는 소넷 5와 같습니다. 아래는 일반 입력·출력 가격이며 구독료와 구별됩니다. (공식 가격, 모델 비교 가격)

API 가격, 100만 토큰당 Sonnet 5.5 Opus 5.5
새 입력 $2 $4
출력 $10 $20
캐시 읽기 $0.20 $0.20
캐시 쓰기, 5분 $2.50 $5

새 입력·출력은 소넷이 절반이고, 캐시 읽기는 같습니다. 캐시 쓰기는 재사용할 내용을 처음 저장하는 비용입니다. 따라서 이미 캐시된 저장소를 많이 읽는 작업과 긴 출력을 만드는 작업의 절감 폭이 달라집니다. 캐시 쓰기 가격은 공식 API 가격표의 5분 항목을 기준으로 했습니다.

캐시 없이 입력 10만 토큰과 출력 5만 토큰을 똑같이 쓴다면 소넷은 0.1 × $2 + 0.05 × $10 = $0.70, 오퍼스는 0.1 × $4 + 0.05 × $20 = $1.40입니다. 여기서는 같은 토큰 수라 절반이 됩니다. 앤트로픽의 작업당 최대 30% 절감은 소넷 5 대비 자사 시험 결과로, 토큰 수와 작업 단계까지 달라졌을 때의 주장입니다. (가격·절감 발표)

프롬프트 캐시의 최대 90% 절감은 캐시 적중으로 입력을 재사용할 때의 조건이고, 배치 처리의 50% 할인은 비동기로 요청을 모아 처리하는 방식에 붙습니다. 실시간 답변을 받는 일반 요청과 가격 조건을 나누면 견적을 잡기 쉽습니다. (캐시·배치 가격 안내)

최대 추론에서는 토큰 수가 달라집니다. Artificial Analysis의 Intelligence Index는 여러 평가를 묶은 종합 지수이며, 아래 두 모델은 모두 Adaptive Reasoning·Max Effort·Default Fallback 설정입니다. (독립 평가 비교)

독립 평가, 최대 추론 설정 Sonnet 5.5 Opus 5.5
Intelligence Index 56 58
작업당 비용 $7.60 $5.98
작업당 출력 토큰 약 193K 약 119K

이 평가에서 소넷은 출력 토큰을 약 1.62배 썼고, 작업당 비용은 약 27% 높았습니다. 출력에는 추론 토큰도 포함됩니다. 작업당 비용은 입력·캐시·추론·답변 가격을 합쳐 평가별 가중치를 적용한 평균입니다. 위 토큰 수는 평가 전체 합계가 아니라 작업 하나당 평균입니다. (비용과 토큰 산식)

따라서 이 숫자는 그 평가 묶음에서의 비교에 쓰는 값이며, 일반 작업 한 건의 API 견적은 실제 입력과 출력으로 계산합니다. 가장 높은 강도가 필요하다면 오퍼스도 함께 비교할 이유가 생깁니다. 반대로 단계를 줄이고 빠르게 여러 번 고치는 작업이라면 낮거나 중간 강도의 소넷이 먼저 시험할 조합입니다.

추론 강도는 어디서 시작하고, 속도는 얼마나 빨라졌나요?

추론 강도인 effort는 모델이 문제를 얼마나 오래 생각할지 조절하는 설정입니다. 강도를 높이면 대체로 시간과 토큰을 더 쓰며, 작업에 따라 점수 개선 폭이 다릅니다. 앤트로픽은 소넷 5.5가 소넷 5보다 출력을 30% 이상 빠르게 생성한다고 발표했습니다. 이는 출력 생성 속도에 대한 주장으로, 파일 읽기·도구 실행·추론까지 합친 전체 작업 시간과 나눠 볼 수 있습니다. (속도와 effort 설명)

쓰는 곳 Sonnet 5.5 기본 effort
Claude 앱 Medium
Claude Code Medium
Claude Platform API High

API로 옮길 때 output_config.effort를 명시하면 앱에서 비교한 강도와 맞출 수 있습니다. 앤트로픽은 여러 평가에서 Low·Medium이 소넷 5의 최고점을 약 10분의 1 작업 비용으로 넘었다고 주장합니다. CursorBench의 Low, Terminal-Bench의 Medium 등이 해당 예입니다. (기본값과 비용 곡선)

읽기와 수정이 반복되는 작업은 Medium으로 시작해 결과와 비용을 적고, 필요한 경우 High 이상으로 올려 비교할 수 있습니다. 범위가 넓고 판단이 계속 바뀌는 과제는 처음부터 오퍼스와 같은 입력으로 비교하면 모델과 강도를 동시에 고르는 데 도움이 됩니다.

직접 API를 붙였다면 무엇을 바꿔야 하나요?

모델 ID만 바꾸는 배포에서 특히 중요한 것은 추론이 켜지는 기본 동작과 응답의 형태입니다. 소넷 5.5는 thinking 필드를 생략해도 adaptive thinking을 사용합니다. 모델이 과제에 맞춰 추론량을 조절하는 방식입니다. 기존 모델과 호출 방식별 차이는 공식 마이그레이션 안내에 정리돼 있습니다.

기존의 thinking-off 동작을 옮기려면 thinking: {"type":"between_tools"}를 씁니다. 이는 답변 전에 하는 추론을 끄는 가장 낮은 설정입니다. 도구를 쓰면 도구 호출 사이의 진행 내용은 thinking 블록으로 돌아올 수 있습니다. 이 값은 Low·Medium·High에서 가능하고 Xhigh·Max에서는 400 오류가 납니다. 예전의 thinking: {"type":"disabled"}도 소넷 5.5에서 400 오류를 냅니다. (추론 설정 이전)

응답을 읽는 코드는 다음 세 항목을 함께 보면 됩니다. (응답 블록 처리 안내)

  • 내용을 타입별로 읽습니다. 응답 첫 블록이 추론이면 content[0].text에 직접 접근하는 코드가 깨질 수 있습니다. type이 text인 블록에서 답변을 읽습니다.
  • 도구 호출 루프에서 추론 블록을 그대로 돌려보냅니다. 텍스트가 비어 있고 서명만 있는 블록도 포함합니다. 이전 응답을 텍스트만 추려 재구성하는 코드와 차이가 생깁니다.
  • 출력 예산을 다시 잡습니다. thinking 토큰은 출력 과금과 max_tokens에 포함됩니다. 같은 한도에서도 화면에 보이는 답변에 남는 토큰 수가 달라집니다.

tool_choice의 any·tool 타입도 400 오류를 냅니다. {"type":"auto"}를 쓰고 인자 형식이 중요하면 strict 도구 정의를 검토하는 것이 공식 이전 방향입니다. strict는 도구 인자 형식을 맞추며 특정 호출의 실행을 강제하는 기능과 구별됩니다. Bedrock에서는 소넷 5.5의 strict 도구 사용을 포함한 구조화 출력을 지원하지 않아, auto 선택 후 코드에서 인자를 검증하는 방식으로 안내합니다. (강제 도구 선택 이전)

출발 모델에 따라 샘플링 값, assistant prefill(답변 시작 부분 미리 채우기), 토큰 예산, 컴퓨터 사용 헤더의 변경도 있습니다. 기존 요청 하나와 도구 호출이 여러 번 이어지는 요청 하나를 골라, 공식 체크리스트와 함께 응답 처리·오류·최종 비용을 비교하면 배포 전 변경 범위를 좁힐 수 있습니다.

한국에서는 어디서 쓸 수 있고, 데이터 보관은 어떻게 되나요?

9월 28일 발표 기준 소넷 5.5는 Claude와 Claude Platform, AWS·Google Cloud·Microsoft Azure 등에 제공됩니다. Claude Platform의 모델 ID는 claude-sonnet-5-5입니다. Zero Data Retention(데이터 무보관) 제공도 발표에 명시됐습니다. (제공 안내)

한국은 Claude.ai와 상용 API의 지원 국가 목록에 모두 들어 있습니다. 여기서 한국 지원은 서비스 이용 가능 국가에 대한 정보입니다. 클라우드를 통해 사용할 때의 서울 리전 처리 여부, 서비스별 가격과 계정 조건은 선택한 공급자의 제공 범위와 연결됩니다.

데이터 무보관이 필요한 업무에서는 발표의 제공 여부와 별개로 계약·계정에 적용되는 조건을 확인해 사용할 수 있습니다. 같은 발표에서 Haiku 5.5는 수 주 내 합류 예정으로 소개됐습니다. 9월 30일 현재 이 글에서는 출시된 모델로 다루지 않습니다. (제공 범위와 Haiku 일정)

보안 보호는 평소 개발 작업에 어떤 영향을 주나요?

앤트로픽은 약 1,850개 시나리오의 자동 행동 감사에서 소넷 5와 대부분 같거나 개선됐다고 설명하며, 평가가 모든 실패를 잡지는 못한다고 밝혔습니다. 사이버 능력은 Opus 5급에 가까워져 고위험 요청을 소넷 5로 눈에 보이게 대체합니다. 일반 개발·버그 찾기는 허용한다고 안내합니다. (안전 보호 설명)

생물학 보호는 소넷 5와 같고, 대다수 연구·교육·임상은 영향을 받지 않지만 미생물학·바이러스학 요청은 오탐될 수 있다고 설명합니다. reasoning 추출 방지 분류기는 추론 내용을 대량 추출해 모델 능력을 복제하는 공격을 막는 장치입니다. preserved thinking은 이전 추론을 유지하는 기능이며, 추론이 생성 계정에 묶여 계정 사이에서 분리됩니다. (보호와 한계 설명)

허가받은 보안 감사나 생명과학 업무도 자신의 대표 요청으로 보호 동작을 살펴볼 수 있습니다. 요청이 대체되면 원래 모델의 토큰 단가·성능만으로 예상한 결과와 차이가 생기기 때문입니다. 앞의 독립 평가에서 Default Fallback은 기본 모델 대체 동작을 포함하는 설정입니다. (공식 보호 설명, 독립 평가 설정)

개발자 반응은 어떤가요? (9월 30일 기준)

Hacker News 출시 토론은 수집한 원문에서 874점·604개 댓글이었습니다. 호평은 코딩 점수와 낮은 강도의 비용 효율에 모였습니다. 비용에 대한 불만으로는 높은 강도에서 토큰을 많이 쓰면 오퍼스보다 비용이 더 들 수 있다는 지적, 어떤 모델과 강도를 골라야 할지 헷갈린다는 반응이 나왔습니다.

일부 댓글은 Terminal-Bench에서 소넷이 오퍼스를 앞선 결과가 안전장치의 거절·대체 동작에 영향을 받았는지 따졌습니다. 보호 동작까지 포함한 점수가 실제 사용 경험을 반영한다는 반론도 나왔습니다. 이는 댓글에서 제기한 해석이며, 점수 차이의 원인으로 확정한 내용과 구별했습니다. (성능·보호 동작 토론)

보안 업무의 불만으로는 허가받은 버그 찾기가 Cyber로 표시돼 막혔다는 HN 이용자 사례가 있습니다. 같은 댓글 묶음에서는 보안 검증 프로그램의 적용 모델과 안내가 불분명하다는 논쟁도 나왔습니다. (보안 업무 사례와 논쟁)

r/ClaudeAI 출시 토론에서도 소넷의 코딩·문서 점수와 Medium 속도를 반기는 댓글, 비용과 모델 선택에 대한 혼란이 함께 보입니다. 보안 감사나 일반 코딩에서 보호가 과하게 작동했다는 이용자들은 방어 업무까지 막힐 수 있다고 불만을 제기했습니다. 보호의 필요성을 이해한다는 의견과 거절을 겪지 않았다는 댓글도 있습니다.

이 토론에는 Opus 등 다른 Claude 모델에서 겪은 거절 사례도 섞여 있습니다. 따라서 보호에 대한 논쟁과 소넷 5.5 자체의 경험을 나눠 읽으면 좋습니다. 초기 커뮤니티 경험담이며, 한국어 답변 품질을 비교한 후기는 이번 확인 자료에서 찾지 못했습니다. (Reddit 댓글 원문)

오퍼스 글과 함께 읽으면 무엇을 비교할 수 있나요?

오퍼스 5.5 가격·성능 글은 긴 코딩과 지식 업무에 대한 상위 모델의 변화를 다룹니다. 반복 수정에는 소넷 Medium, 복잡하고 열린 판단에는 오퍼스를 놓고 같은 과제를 비교하는 출발점으로 사용할 수 있습니다.

결과 품질, 고친 횟수, 전체 시간, 입력·캐시·출력 비용을 한 줄에 기록하면 낮은 단가와 낮은 작업 비용을 구별하기 쉬워집니다. 낮은 강도의 소넷으로 충분히 끝나는 작업과 높은 강도를 계속 요구하는 작업을 나누면, 모델 이름만으로 고르는 것보다 기준이 선명해집니다.

참고한 자료

확인일은 2026년 9월 30일입니다. 사건일은 9월 28일, 이 글의 최초 발행일은 9월 29일이며 이번 보강 날짜와 구별했습니다.