오퍼스 5.5는 단가와 기본 추론 설정을 함께 개선했지만, 실제 절감액은 작업별 토큰 사용량·캐시·추론 강도에 달립니다. 앤트로픽이 2026년 9월 22일 출시한 Claude Opus 5.5(클로드 오퍼스 5.5)는 긴 코딩과 지식 업무를 겨냥합니다. 개발자 커뮤니티는 가격 인하를 반기면서도 벤치마크와 개인 작업의 차이를 경계합니다. 9월 30일 기준 서울 인리전 발표의 대상은 Opus 5이며 Opus 5.5와 구별할 부분입니다. (공식 발표, HN 토론, AWS 서울 발표)
한눈에 보기
| 궁금한 점 | 이번 발표의 핵심 |
|---|---|
| 어떤 모델인가 | 긴 코딩·지식 업무를 위한 Claude Opus 5.5 |
| 성능은 | 업체 평가에서 코딩·업무·화면 조작 점수 상승 |
| API 비용은 | 100만 토큰당 입력 $4·출력 $20 |
| 기본 설정은 | adaptive thinking 항상 켜짐, effort medium |
| 제공 범위는 | Claude 유료 구독·API·Bedrock·Google Cloud·Foundry |
| 서울 처리는 | 서울 인리전 발표는 Opus 5 대상 |
| 이전 주의점은 | thinking 비활성화·강제 도구 선택·블록 처리 변경 |
가격과 설정은 개발자 문서, 성능과 40% 절감은 업체 발표, 지역은 AWS 자료를 기준으로 구별했습니다. 아래 공식 표는 업체가 수행한 평가입니다. 커뮤니티 경험담도 통제된 비교 결과와 다릅니다.
API 가격과 실제 작업 비용은 얼마나 줄었나요?
오퍼스 5.5는 Claude 5.5 계열의 첫 모델입니다. 앤트로픽은 코딩, 컴퓨터 조작, 지식 업무에서 오퍼스 5보다 좋아졌고 출력 속도도 30% 이상 빨라졌다고 발표했습니다. 긴 작업을 맡길 때 중요한 가격도 내렸습니다. (앤트로픽 발표)
| API 기본 가격, 100만 토큰당 | Opus 5 | Opus 5.5 | 변화 |
|---|---|---|---|
| 새 입력 | $5 | $4 | 20% 인하 |
| 출력 | $25 | $20 | 20% 인하 |
| 캐시에서 다시 읽는 입력 | $0.50 | $0.20 | 60% 인하 |
캐시는 이전에 읽은 대화나 파일 내용을 재사용하는 기능입니다. 코드 저장소를 살피며 여러 차례 질문하는 작업에서는 같은 내용을 다시 읽는 일이 많아서, 캐시 가격 인하가 특히 중요합니다. 앤트로픽이 말한 “보통 작업 비용 40% 절감”은 자사 테스트에서 토큰 사용량까지 합친 결과입니다. 토큰 단가 자체의 인하 폭은 위 표처럼 20~60%입니다.
숫자로 보면 차이가 선명합니다. 새 입력 10만 토큰, 캐시 읽기 100만 토큰, 출력 10만 토큰을 쓰는 작업이라면 기본 요금은 오퍼스 5에서 $3.50, 오퍼스 5.5에서 $2.60입니다. 같은 양의 토큰을 썼을 때 약 26% 줄어듭니다. 실제 청구액은 답변 길이와 캐시 적중량에 따라 달라집니다. (모델 가격 안내)
코딩에서는 이전 모델보다 무엇이 좋아졌나요?
에이전트 코딩은 모델이 저장소를 살피고 도구로 수정·실행·검증을 반복하는 방식입니다. 첫 답변이 그럴듯한지를 넘어 여러 단계의 작업을 끝내는 능력이 중요합니다. 발표 표의 코딩 시험은 서로 다른 환경을 다루므로, 자신의 업무와 가까운 항목을 먼저 보는 데 쓸 수 있습니다. (공식 평가 표)
| 공식 코딩 평가 | Opus 5 | Opus 5.5 |
|---|---|---|
| Terminal-Bench 4.0 | 52.3% | 66.4% |
| FrontierCode v1.1 | 48.0% | 54.4% |
| CursorBench 4.0 | 46.6% | 57.8% |
Terminal-Bench는 명령줄에서 여러 단계의 전문 작업을 처리하는 시험입니다. 파일과 명령을 다루는 개발 에이전트에 가까운 항목입니다. FrontierCode는 복잡한 코드 변경을 보는 데 참고할 수 있고, CursorBench는 실제 Cursor 세션에서 나온 모호한 다중 파일 작업을 평가합니다. 요구사항이 완전히 정리되지 않은 상태에서 여러 파일을 고치는 일이라면 마지막 항목이 특히 관련 있습니다. 짧은 함수 자동완성은 그 작업에 맞는 별도 결과로 비교하는 편이 좋습니다. (시험 설명)
발표는 별도 표시가 없으면 max effort를 사용했습니다. Terminal-Bench는 Opus 5.5의 xhigh와 GPT-6 Astra의 high 등 모델별 최고 점수 설정을 비교합니다. 동일한 추론 강도·시간·비용 조건의 비교라고 읽지 않는 이유입니다. 기본 medium에서 자신의 저장소 테스트를 얼마나 통과하는지가 실제 선택에 더 가까운 질문입니다. (평가 각주)
지식 업무와 과학 문제에서도 좋아졌나요?
문서 결과물, 자동화, 어려운 지식 질문과 과학 과제는 필요한 능력이 다릅니다. 아래 수치는 하나의 종합 성능으로 뭉뚱그리기보다 내 과제에 가까운 시험을 고르는 데 쓰는 자료입니다. GDPval-AA의 숫자는 점수이고 나머지는 백분율이므로 각 행의 단위에 맞춰 비교합니다. (공식 업무 평가)
| 공식 업무·지식 평가 | Opus 5 | Opus 5.5 |
|---|---|---|
| GDPval-AA v2.1 | 1708 | 1846 |
| AutomationBench | 26.9% | 40.0% |
| Humanity’s Last Exam | 63.6% | 67.7% |
| Terminal-Bench-Science | 29.0% | 58.7% |
GDPval-AA는 전문 지식 업무의 결과물을 보는 평가입니다. 보고서나 업무 산출물을 맡길 때 참고하되 우리 조직의 형식·인용·검토 기준도 따로 살펴볼 부분입니다. Humanity’s Last Exam은 어려운 지식 문제를 다룹니다. 일상의 사실 질문은 근거와 오류를 별도로 확인할 항목입니다. (평가 설명)
AutomationBench는 Zapier의 자동화 평가이며 안전장치 개입을 실패로 셌습니다. 서비스 여러 개를 연결하는 업무에서 유용한 참고점이지만, 성공률은 도구 사용 능력뿐 아니라 정책의 영향도 받습니다. 정상 업무가 중단되면 완료 여부와 중단 이유를 함께 기록하는 편이 어떤 부분에서 막혔는지 구분하기 쉽습니다. (AutomationBench 조건)
Terminal-Bench-Science에는 모델별 오차 범위가 있습니다. 안전장치가 개입한 일부 사이버보안 과제는 Opus 4.8, 생물학과 최전선 LLM 개발 과제는 Opus 5가 수행했다는 조건도 붙습니다. 따라서 이 수치는 대체 수행 조건과 함께 읽을 자료입니다. 과학·보안 과제라면 점수 외에 허용 범위와 사람의 검증 절차가 중요한 항목입니다. (평가 조건)
컴퓨터 화면 조작과 차트 이해는 어떤가요?
컴퓨터 사용은 모델이 화면을 보고 클릭·입력 같은 동작을 이어 가는 기능입니다. 텍스트 API만으로 연결하기 어려운 업무에 유용하지만 잘못된 판단이 실제 동작으로 이어질 수 있습니다. 발표의 OSWorld 2.1과 Chartography는 화면 조작과 차트 이해를 별도로 살펴볼 항목입니다. (공식 시각·컴퓨터 평가)
| 공식 평가 | Opus 5 | Opus 5.5 |
|---|---|---|
| OSWorld 2.1 | 74.0% (partial) | 81.8% (partial) |
| Chartography | 83.4% | 89.0% |
OSWorld의 partial 표시는 원표 그대로 남겼습니다. 이 표시를 지우고 전체 환경의 완전한 성공률처럼 쓰면 의미가 달라집니다. 차트 이해와 서비스 조작은 서로 다른 능력을 봅니다. 보고서 그래프 설명에는 Chartography를, 화면 기반 반복 업무에는 OSWorld를 먼저 참고할 수 있습니다. 실제 도입에서는 결제·삭제 같은 되돌리기 어려운 동작에 사람의 확인을 두는 방법을 검토할 수 있습니다. 이는 점수로 검증된 운영 효과가 아니라 적용할 때의 점검 제안입니다. (평가 표)
성능과 작업당 비용은 어떻게 나왔을까요 (9월 27일 기준)
독립 평가 기관 Artificial Analysis는 오퍼스 5.5의 최대 추론 설정에 Intelligence Index 58점을 매겼습니다. 당시 이 기관이 측정한 모델 중 가장 높은 점수입니다. 실제 명령줄 작업을 푸는 Terminal-Bench 4.0에서는 59.6%로 오퍼스 5보다 약 11%포인트 높았고, GPT-6 Astra의 최고 설정과 비슷했습니다.
가격에서는 예상 밖의 결과도 있었습니다. 같은 평가에서 오퍼스 5.5의 최대 추론 설정은 오퍼스 5보다 출력 토큰을 약 1.6배 썼고, 작업당 비용은 비슷했습니다. 토큰 하나는 싸졌지만 더 길게 생각하고 답하면 최종 비용이 늘 수 있다는 이야기입니다. 앤트로픽의 40% 절감 수치와 이 결과는 서로 다른 작업과 추론 설정에서 측정됐습니다. 실제로 맡길 일을 정한 뒤 완료 품질·걸린 시간·사용량을 함께 비교하면 조건별 차이를 확인하기 좋습니다.
캐시·Batch·추론 설정은 비용에 어떻게 영향을 주나요?
비캐시 입력 10만·출력 1만 토큰을 고정하면 Opus 5 요금은 $0.75, Opus 5.5는 $0.60입니다. 입력 단가의 0.1배와 출력 단가의 0.01배를 더한 값으로 정확히 20% 줄어듭니다. 원화 결제액이나 구독 요금이 아니라 공개 달러 단가로 계산한 API 사용료입니다. (가격 근거)
캐시는 반복되는 프롬프트 앞부분을 재사용하는 기능입니다. 읽기만 아니라 처음 쓰는 비용도 따로 듭니다. Opus 5의 5분 캐시 쓰기 $6.25는 5.5에서 $5로 내려갔습니다. 5.5의 1시간 캐시 쓰기는 $8, 읽기는 $0.20이며 모두 100만 토큰당입니다. 캐시 가능한 프롬프트 최소 길이는 512토큰입니다. 긴 저장소 지침이나 문서가 반복될 때 유용하지만 한 번만 보내는 짧은 요청은 새 입력 단가로 계산합니다. (캐시 조건)
Batch API는 요청을 일괄 처리하는 방식이며 입력·출력 가격에 50% 할인이 있습니다. 바로 답을 받아야 하는 대화와 구별해 비동기로 끝나도 되는 대량 작업에서 검토할 옵션입니다. 기본 호출 예시에 Batch 할인을 섞지 않은 이유는 처리 조건이 다르기 때문입니다. 업체의 일반 작업 40% 절감 역시 단가만 아니라 작업당 토큰 사용량 감소까지 합친 자사 측정치입니다. (요금 안내, 절감 조건)
adaptive thinking은 과제에 따라 생각하는 양을 조절하는 기능이며 Opus 5.5에서는 항상 켜져 있습니다. 기본 effort는 medium으로 Opus 5의 high와 다릅니다. 모델 이름만 바꾸고 기본값을 쓰면 비교 설정도 달라집니다. thinking 토큰도 max_tokens 한도와 출력 과금에 포함될 수 있어 최종 답이 짧아도 실제 사용량을 확인할 부분입니다. (개요, 이전 가이드)
짧은 문서 정리와 장기 코드 변경에는 필요한 추론 강도가 다를 수 있습니다. medium에서 품질을 확인하고 더 깊은 설정과 비교하면서 완료 품질·지연시간·사용량을 같이 기록하는 방법이 있습니다. 가장 높은 설정을 상시 쓰기보다 비용 증가가 결과 개선으로 이어지는지를 보는 방식입니다. 이 글의 비용 설명은 공개 요금표 계산과 기록된 평가에 근거합니다.
Fast mode는 같은 가격으로 더 빠른가요?
Fast mode는 Claude API와 Claude Code의 연구 프리뷰이며 최대 2.5배 속도를 내세웁니다. 단가는 입력 $8·출력 $40으로 기본 모드의 두 배이며 다른 클라우드 제공사에는 적용되지 않습니다. 앞의 비캐시 입력 10만·출력 1만 토큰이면 $1.20입니다. 응답 대기시간이 중요한 작업에서 추가 요금과 비교할 옵션입니다. (공식 속도·가격)
최대 속도 배수와 실제 요청의 전체 지연시간은 구별할 항목입니다. 실제 지연시간은 입력 길이와 출력 길이, 추론 강도에도 달립니다. 급하지 않은 대량 작업이라면 Batch 조건을 따로 비교할 수 있고, Bedrock 호출에 Claude API의 Fast mode를 자동 적용할 수 있다고 생각하지 않는 게 좋습니다. (모델 안내)
한국에서 쓰는 것과 서울 안에서 처리하는 것은 같나요?
Claude 구독의 제공 범위는 Pro·Max·Team·Enterprise이며 API 모델 ID는 claude-opus-5-5입니다. Bedrock·Google Cloud·Microsoft Foundry에도 제공됩니다. API 단가 인하와 월 구독료는 다른 조건이고 실제 계정의 사용 한도도 별도로 볼 항목입니다. (공식 제공 범위, 모델 개요)
9월 30일 AWS 자료에서 Opus 5.5는 us.·eu.·au.·jp.·global. 지리 추론 프로필과 일부 명시 리전으로 제공됩니다. 추론 프로필은 요청을 처리할 지역 범위를 정하는 경로입니다. 한국에서 접속할 수 있다는 사실과 서울 안에서만 데이터가 처리된다는 조건은 다릅니다. 특히 지리 단위나 global 프로필 제공을 서울 인리전 제공으로 바꾸어 읽으면 안 됩니다. (AWS Opus 5.5 발표)
같은 날 서울 ap-northeast-2 인리전 발표 대상은 Opus 5와 Sonnet 5입니다. 서울 안에서만 추론해야 하는 독자는 Opus 5.5와 이름을 혼동하지 않는 것이 중요합니다. Bedrock은 해당 지역의 용량·쿼터·온디맨드 가격을 따르므로 실제 청구액은 선택한 Bedrock 경로의 요금으로 계산합니다. 사용 경로를 정하고 해당 요금·할당량을 확인할 부분입니다. 한국 계정 호출과 한국어 품질은 직접 시험할 항목으로 남아 있습니다. (서울 발표, Bedrock 경로)
기존 API와 에이전트에서 무엇을 바꿔야 하나요?
thinking 비활성화 요청과 tool_choice의 any·특정 tool 강제 선택은 오류가 납니다. 생각을 끄는 대신 effort를 조절하고, 도구 선택에는 auto와 strict tool use 또는 structured outputs를 검토할 수 있습니다. 기존 강제 호출과 동작이 완전히 같다고 가정하지 않고 기존 요청으로 검증할 항목입니다. (마이그레이션 가이드)
thinking 블록은 대화 중 수정 없이 그대로 되돌려 보내고 응답은 블록 위치가 아닌 type으로 읽습니다. 도구 호출을 이어 가는 앱에서 중간 블록을 제거하거나 요약해 재사용하는 저장 방식이 있다면 확인할 부분입니다. 첫 블록이 항상 최종 텍스트라고 가정한 처리도 살펴봅니다. (블록 처리)
도구 호출 사이의 진행 문구는 기본 표시 설정에서 비어 있을 수 있습니다. 화면이 조용하다고 실행 자체가 멈췄다고 판단하기보다 thinking 블록과 display 설정을 구별해 확인합니다. 진행 상태를 스트리밍하는 앱이라면 답변 품질 외에 사용자에게 상태가 계속 보이는지도 시험할 항목입니다. (진행 텍스트 안내)
Claude API와 Google Cloud의 컴퓨터 사용은 computer_20251124 대신 computer_toolset_20260801로 바꾸지만 Bedrock은 기존 도구를 유지합니다. 여러 클라우드에 같은 요청을 보내는 앱이라면 경로별로 나눠 점검합니다. 기존 요청 한 건·도구 호출 대화·진행 문구·컴퓨터 사용을 각각 시험하면 요청 오류와 품질 저하를 구분하기 쉽습니다. 이 목록은 문서 변경점에 따른 점검 제안입니다. (플랫폼별 변경)
안전장치가 강해졌다는 말에는 어떤 한계가 있나요?
앤트로픽은 고위험 사이버보안·생물학 관련 Fable 5.1급 안전장치를 적용했고, 자사 행동 감사에서 현재까지 시험한 모델 중 가장 강했다고 발표했습니다. 실제 업무에서는 허용 범위와 중단 사례를 따로 확인할 부분입니다. 검증된 보안 실무자 접근은 별도 프로그램 대상이며 일반 API 제공과 고위험 작업의 허용 범위는 다른 문제입니다. (공식 안전성 설명, 시스템 카드)
일부 평가에서 이전 모델이 대체 수행한 조건도 이 제한과 함께 읽을 부분입니다. 정상적인 코딩·보안 요청이 막혔다는 후기는 공식 안전 평가와 구별합니다. 안전장치가 항상 과도하거나 항상 정확하다고 일반화하기보다 내가 맡길 업무에서 어느 요청이 중단되는지 살펴보면 적용 범위를 판단하는 데 도움이 됩니다. (HN 토론)
반응은 어떤가요 (9월 30일 기준)
출시 당일 올라온 Hacker News 토론은 1,800점 넘게 받았고 댓글이 1,100개를 넘었습니다. 각자 다른 입력과 설정에서 얻은 경험담이며 통제된 비교 결과가 아닙니다. 주로 나온 이야기는 다섯 가지입니다.
- 가격: 캐시 읽기가 $0.50에서 $0.20으로 내린 점을 반기는 댓글이 많았습니다. 상위 모델인 Fable 5.1과 비슷한 성능을 더 싸게 쓸 수 있다면 Fable을 고를 이유가 줄어든다는 의견도 나왔습니다.
- 글투: 오퍼스 5의 길고 장황한 답변에 지쳤다며 이번에는 고쳐지길 바란다는 댓글이 여럿 있었습니다. 앤트로픽은 글이 읽기 쉬워졌다고 소개했지만, 토론이 출시 당일이라 실제로 나아졌는지에 대한 평가보다 기대가 대부분이었습니다.
- 사용 한도: 출시와 함께 구독자가 사용 한도를 초기화할 수 있게 해 준 점을 반기는 댓글이 있었습니다. 국내 GeekNews에도 한도 초기화 쿠폰을 하나씩 받았다는 댓글이 달렸습니다.
- 가격 대비 성능과 벤치마크: medium effort에서 가격 대비 성능이 괜찮다는 경험담과, 벤치마크와 개인 과제의 차이를 경계하는 의견이 함께 있었습니다.
- 안전장치: 정상적인 코딩·사이버보안 요청이 막힌다는 불만이 나왔습니다. 공식 안전 평가와 구별되는 사용자 경험담입니다.
- 의심: 출시 직후에는 성능이 좋다가 몇 주 뒤 떨어진다는 의심을 드러낸 댓글도 일부 있었습니다.
한국어 답변 품질을 검증한 국내 자료는 이번 조사에서 확보하지 못했습니다.
어디서 쓸 수 있고, 누구에게 맞을까요
Claude 웹·앱의 Free 요금제에는 Opus가 없습니다. 공식 요금제 표에는 Pro·Max·Team에서 Opus를 쓸 수 있다고 나옵니다. 앤트로픽은 오퍼스 5.5 출시와 함께 이 유료 요금제의 5시간 사용 한도를 늘렸다고 밝혔습니다. 구독에는 사용량 제한이 있고, Claude 웹·앱과 Claude Code의 사용량은 같은 풀에서 계산됩니다. (Claude 요금제)
개발자는 Claude API에서 모델 ID claude-opus-5-5를 선택할 수 있습니다. API의 기본 추론 강도는 medium, 최대 입력 맥락은 100만 토큰, 최대 출력은 12만 8천 토큰입니다. 위 가격은 API의 달러 기준 가격이며, Claude 구독료와는 별개입니다. Google Cloud·Amazon Bedrock·Microsoft Foundry에서도 쓸 수 있고, 가격과 활성화 방법은 플랫폼마다 다를 수 있습니다. (모델 문서)
매일 긴 코드 작업이나 자료 분석을 돌린다면, 오퍼스 5.5는 먼저 시험해 볼 만한 선택지입니다. 간단한 질문을 가끔 하는 정도라면 Opus가 들어 있는 유료 요금제까지는 필요 없을 수 있습니다. API를 쓰는 팀이라면 같은 작업을 기본 medium과 높은 추론 설정으로 각각 돌려 끝낸 일·수정 횟수·걸린 시간·토큰 비용을 비교하면 됩니다.
함께 읽으면 어떤 선택에 도움이 되나요?
소넷 5.5 글은 같은 Claude 계열의 가격과 effort를 비교할 때, GPT-6.1 Sol 글은 다른 공급자의 모델·API 가격을 살펴볼 때 함께 읽을 수 있습니다. 최고 점수만 비교하기보다 같은 입력과 완료 기준으로 품질·시간·사용량을 기록하는 방법이 실용적입니다. 서울 내 처리가 필요한 독자는 모델명 외에 호출 경로도 별도로 확인할 항목입니다. (모델 개요)
참고한 자료
- Opus 5.5 마이그레이션 가이드
- Anthropic 시스템 카드
- AWS Opus 5.5 제공
- AWS 서울·싱가포르 인리전 발표
- 앤트로픽: Claude Opus 5.5 발표 (2026-09-22)
- Claude Platform: Opus 5.5 모델·가격·이용 범위
- Claude 공식 요금제
- Artificial Analysis: 독립 성능·비용 평가 (2026-09-22)
- Hacker News 출시 토론
- GeekNews 출시 글
가격·제공 범위·마이그레이션 조건·AWS 제공 범위는 2026년 9월 30일에, 외부 평가와 구독 관련 내용은 9월 27일에 확인했습니다. 비용 예시는 공개 가격표로 계산한 값입니다.