한국 AWS 개발자는 서울 리전에서 Grok 4.7(그록 4.7) 호출을 시작할 수 있습니다. 다만 Global 경로는 한국 내 처리를 보장하지 않으므로, 바뀐 성능·작업 비용과 데이터 경로를 함께 보고 4.6에서 옮길지 결정하는 편이 좋습니다. AWS가 9월 28일 Bedrock에 추가한 모델로, 서울 출발 가용성과 단가는 9월 30일 모델 카드를 기준으로 정리했습니다. 출시 HN 토론에서는 간결한 영어 답변을 좋아하는 의견과 설명이 너무 짧다는 불만이 함께 나왔습니다. 대안으로는 클로드 소넷 5.5와 GPT-6.1 Sol을 함께 비교할 수 있습니다.
한눈에 보기
| 궁금한 점 | 이번 발표의 핵심 |
|---|---|
| 어떤 모델인가요? | xAI의 코딩·장시간 에이전트·지식 업무용 모델. 텍스트·이미지를 받아 텍스트를 생성합니다. |
| 성능은 얼마나 달라졌나요? | 외부 평가의 코딩 56 대 47, 장시간 업무 Elo 1,657 대 1,546입니다. |
| 성능의 대가는 무엇인가요? | 종합 평가 과제당 출력 약 81,000 대 38,000토큰. 추론 설정도 서로 다릅니다. |
| 단가는 얼마인가요? | Global Standard는 100만 토큰당 입력 $2·출력 $6·캐시 읽기 $0.50. 4.6과 같습니다. |
| 기본 설정은 무엇인가요? | 500K 컨텍스트, 추론 항상 활성화, 기본 강도 high. low부터 xhigh까지 선택합니다. |
| 한국에서 쓸 수 있나요? | 서울 ap-northeast-2에서 Global 호출 가능. 처리는 전 세계 지원 상업 리전으로 분산됩니다. |
| 전환할 때 무엇이 걸리나요? | 4.7은 Runtime만 지원. Mantle 사용자는 URL·모델 ID·권한을 바꿉니다. 서버 측 도구 사용은 미지원입니다. |
요금·API·지역은 AWS 4.7 모델 카드와 4.6 모델 카드, 기본 추론 설정은 AWS 발표에 근거합니다. 성능 수치는 AWS가 인용한 Artificial Analysis의 외부 평가이며, 학습·자체 검증·안전성 설명은 AWS가 소개한 xAI의 주장입니다. 아래 비용은 그 자료로 계산한 예시이고, 이 블로그의 Bedrock 실측값은 아닙니다.
4.6에서 무엇이 달라졌나요?
코딩 에이전트는 더 잘 일하나요?
코딩 에이전트는 도구를 써서 코드를 고치고 결과를 확인하는 작업 흐름입니다. AWS가 인용한 Artificial Analysis의 Coding Agent Index는 4.7이 56, 4.6이 47입니다. 종합 성능인 Intelligence Index는 46 대 44로, 코딩 쪽 차이가 더 크게 나타납니다. 이 코딩 평가는 도구를 묶어 실행하는 환경인 xAI의 하네스를 사용하므로, 다른 도구·권한·테스트 환경에 연결하면 결과도 달라질 수 있습니다. (AWS 평가 비교)
xAI는 더 큰 기반 모델을 쓰고 여러 시간이 걸리는 어려운 문제에 긴 강화학습을 적용했다고 설명합니다. 강화학습은 결과에 대한 보상을 바탕으로 행동을 조정하는 학습 방식입니다. 어려운 과제에서 더 오래 작업하고 다음 단계 전에 스스로 결과를 점검하도록 했다는 설명이 핵심입니다. 초기 오류가 뒤 단계로 이어지는 코드 수정·에이전트 작업에 관심을 둘 만한 변화지만, 효과는 공급자의 설명과 실제 프로젝트 테스트를 구분해 판단할 수 있습니다. (AWS가 소개한 xAI 학습 설명)
문서·프레젠테이션 같은 긴 업무에도 차이가 있나요?
여러 단계에 걸쳐 산출물을 만드는 업무에서도 차이를 볼 만합니다. 장시간 지식 업무를 평가하는 AA-Briefcase Elo는 1,657 대 1,546, 전문 업무 산출물을 비교하는 GDPval-AA Elo는 1,695 대 1,605입니다. Elo는 상대적인 평가 결과를 점수화한 값이라, 100점 차이를 성공률 100%포인트나 생산성 증가율로 읽기보다 모델 간 비교 지표로 보는 편이 맞습니다. (AWS 외부 평가 표)
xAI는 문서·프레젠테이션 생성과 법률·의료·금융 지식 업무가 개선됐다고도 설명합니다. 긴 자료를 읽고 산출물을 여러 번 고치는 작업이라면 살펴볼 대목입니다. 다만 Bedrock의 출력 형식은 텍스트이므로, 모델의 문서 생성 역량과 앱이 실제 파일을 만들어 저장하는 기능을 나누어 설계할 수 있습니다. (AWS 발표 · 입출력 모델 카드)
사실 오류는 얼마나 줄었나요?
AWS 비교표의 AA-Omniscience Index는 32 대 30, 같은 평가의 **환각률은 29% 대 34%**입니다. 환각은 사실과 다른 내용을 그럴듯한 답으로 생성하는 현상입니다. 4.7의 환각률이 이 평가에서 5%포인트 낮아졌다는 의미이며, 한국어 업무 문서 전체에 그대로 적용할 오류 확률과는 구분됩니다. 출처 대조가 중요한 업무에서는 정답률뿐 아니라 틀린 답을 확인하는 비용도 비교할 수 있습니다. (AWS 평가 수치)
이 수치들은 4.7은 xhigh, 4.6은 평가별 기록 강도라는 조건 차이가 있습니다. 같은 추론 강도에서 생긴 순수한 버전 차이로 읽기보다, 공개된 설정에서 얻은 성능과 소모 토큰을 함께 보는 비교입니다. 평가 과제당 출력은 아래 비용 예시에 사용합니다. (AWS 평가 조건)
단가가 같으면 실제 작업 비용도 같을까요?
토큰은 모델이 텍스트를 읽고 생성할 때 세는 단위입니다. 같은 100만 토큰 가격이어도 답을 얻기까지 더 많은 토큰을 쓰면 비용이 늘어납니다. 9월 30일 AWS 모델 카드 기준, 4.7과 4.6의 Global Standard 단가는 입력 $2·출력 $6·캐시 읽기 $0.50으로 동일합니다. (4.7 가격 · 4.6 가격)
| 4.7 추론 프로필·티어 | 입력 / 100만 토큰 | 출력 / 100만 토큰 | 캐시 읽기 / 100만 토큰 |
|---|---|---|---|
| Global Standard | $2.00 | $6.00 | $0.50 |
| Global Priority | $3.50 | $10.50 | $0.875 |
| Global Flex | $1.00 | $3.00 | $0.25 |
| Geo(US) Standard | $2.20 | $6.60 | $0.55 |
| Geo(US) Priority | $3.85 | $11.55 | $0.9625 |
| Geo(US) Flex | $1.10 | $3.30 | $0.275 |
Standard는 약정 없이 사용량대로 내는 기본 티어입니다. Priority는 우선 처리에 Standard의 1.75배, Flex는 시간에 덜 민감한 작업에 0.5배를 적용합니다. 표의 두 추가 티어 금액은 모델 카드의 배수로 계산했습니다. 빠른 처리에 값을 더 내는지, 급하지 않은 작업의 단가를 낮출지 선택하는 항목이며, 실제 지연 시간은 별도 측정 대상입니다. service_tier는 각각 default(또는 생략), priority, flex입니다. (AWS 티어·배수)
출력량 차이를 달러로 바꾸면 얼마인가요?
AWS 발표가 인용한 Intelligence Index의 과제당 출력은 4.7 약 81,000토큰, 4.6 약 38,000토큰입니다. Global Standard 출력 단가 $6을 적용하면 다음과 같습니다. (출력량 출처 · 단가 출처)
| 모델 | 평가 과제당 출력 | 출력분 비용 계산 |
|---|---|---|
| Grok 4.7 | 약 81,000토큰 | 81,000 ÷ 1,000,000 × $6 = 약 $0.486 |
| Grok 4.6 | 약 38,000토큰 | 38,000 ÷ 1,000,000 × $6 = 약 $0.228 |
이는 외부 평가의 토큰량에 Bedrock 공개 단가를 대입한 출력분만의 예시입니다. 입력·캐시·재시도는 제외했고, 두 모델의 평가 설정도 다릅니다. 특정 업무가 반드시 두 배 비싸진다는 예측이나 동일 작업을 직접 호출한 청구 기록으로 쓰기보다, 낮은 토큰 단가만 보고 비용을 판단할 때 놓치기 쉬운 차이를 보여 줍니다.
반복되는 긴 시스템 지시나 참고 문서는 자동 프롬프트 캐싱의 대상이 됩니다. 캐싱은 앞서 처리한 입력을 재사용해 캐시 읽기 단가를 적용하는 방식입니다. Global Standard에서는 새 입력 $2 대신 캐시 읽기 $0.50가 적용되는 부분이 비용을 줄입니다. 실제 계산에서는 새 입력 × 입력 단가 + 캐시 입력 × 캐시 읽기 단가 + 출력 × 출력 단가를 각각 100만 토큰 단위로 합치고, 선택한 프로필·티어와 추론 강도에 따른 사용량을 기록하면 됩니다. (AWS 캐싱 설명 · 요금 모델 카드)
추론 기본값은 무엇이고 어떤 작업에 맞춰야 하나요?
4.7은 추론이 항상 켜져 있으며 강도는 low, medium, high, xhigh, **기본값은 high**입니다. 추론 강도는 답을 내기 전에 문제를 얼마나 깊게 검토할지 조절하는 설정으로, 추론 토큰 사용량과 비용·지연에 영향을 줍니다. 요청에서 생략하면 기본 강도로 실행되므로 반복 호출 앱은 의도한 값을 명시하는 편이 비교하기 쉽습니다. (AWS 기본값·추론 설명)
짧은 분류·정보 추출은 low부터 결과의 정확도를 확인하고, 여러 단계에서 오류가 누적될 수 있는 계획·코딩 에이전트는 높은 강도로 결과가 개선되는지 시험할 수 있습니다. 높은 강도로 한 번 성공하는 경우와 낮은 강도로 여러 번 고치는 경우의 총 토큰·완료 시간을 비교하면 자기 업무의 기준을 잡기 쉽습니다. 이는 작업별 시험 방법이며, 이 블로그의 실행 결과로 제시하는 권장 강도와는 구분됩니다.
두 버전 모두 컨텍스트 창은 500K, 즉 50만 토큰입니다. 한 요청에서 다룰 맥락의 용량은 그대로이고, xAI는 4.7이 긴 작업에서 이를 더 효과적으로 활용한다고 설명합니다. 큰 창만 보고 더 긴 자료가 항상 정확하게 처리될 것이라고 기대하기보다, 자신의 문서에서 필요한 정보를 빠짐없이 찾는지 검증할 수 있습니다. (4.7 모델 카드 · 4.6 모델 카드 · AWS 학습 설명)
서울에서 호출하면 데이터도 한국 안에서 처리되나요?
호출을 시작하는 리전과 실제 처리 리전은 별개입니다. 9월 30일 AWS 4.7 모델 카드는 서울 ap-northeast-2를 Global 호출 가능 리전으로 표시합니다. 기존 글에서 AWS 발표문에 서울 출발이 명시되지 않았다고 적었던 부분은 이 모델 카드 기준으로 바로잡았습니다. (AWS 지역 가용성)
| 추론 방식 | 4.7 제공 범위 | 처리 지역의 의미 |
|---|---|---|
| In-Region | 미제공 | 단일 리전 안에서 처리하는 방식. 4.7의 서울 내 처리 선택지는 없습니다. |
| Geo Cross-Region | US 한정 | 미국 지역 안에서 라우팅하는 프로필입니다. |
| Global Cross-Region | 서울 출발 포함 | 전 세계 지원 상업 리전으로 라우팅합니다. |
교차 리전 추론은 요청을 다른 리전으로 보내 처리하는 방식입니다. 서울 출발 Global이 한국 내 처리를 보장하지 않는 점이 한국 개발자에게 중요한 제약입니다. 한국 내 처리 조건이 있는 업무는 현재 제공 방식과 조건이 맞는지 먼저 살피고, 미국 내 처리 조건이라면 US 프로필의 출발 리전·권한을 확인할 수 있습니다. 모델 카드의 지역표에서 서울 행은 Global만 가능으로 표시되고 Geo(US)는 불가로 표시되므로, 서울에서 US 프로필을 호출하는 방식은 선택지가 아닙니다. (AWS 모델 카드 · AWS 프로필 설명)
이 블로그의 직접 Bedrock 호출·한국어 품질 시험 기록은 없고, 실제 계정 권한과 지연 시간도 미검증 상태입니다. 먼저 Bedrock 콘솔에서 사용할 리전의 모델 가용성을 확인한 뒤 공개 가능한 짧은 입력으로 접근 권한과 응답 시간을 시험하는 순서가 좋습니다. AWS 발표도 첫 호출 전에 계정의 모델 가용성을 확인하도록 안내합니다. (AWS 첫 요청 안내)
기존 4.6 통합에서는 무엇을 바꿔야 하나요?
Mantle을 썼다면 URL과 모델 ID를 어떻게 옮기나요?
4.6 모델 카드는 Mantle과 Runtime 경로를 함께 표시하지만, 4.7은 bedrock-runtime에서만 제공됩니다. 기존 4.6 Mantle 호출의 모델명만 바꾸는 전환보다 런타임 URL·프로필 ID·권한까지 점검하는 전환이 필요합니다. (4.6 경로 · 4.7 경로)
OpenAI 호환 API의 기본 URL은 https://bedrock-runtime.{region}.amazonaws.com/openai/v1입니다. 요청 모델에는 기반 모델 ID xai.grok-4.7 대신 global.xai.grok-4.7 또는 us.xai.grok-4.7 추론 프로필 ID를 넣습니다. 서울 Global 호출을 선택했다면 출발 리전은 ap-northeast-2, 요청 ID는 global.xai.grok-4.7로 맞추는 방식입니다. (AWS 프로그래밍 접근)
지원 API는 Responses, Chat Completions, InvokeModel, Converse입니다. OpenAI 호환 코드를 옮길 때는 Responses·Chat Completions가 출발점이고, 여러 Bedrock 모델을 공통 메시지 형식으로 다루려면 Converse를 검토할 수 있습니다. Responses에서는 reasoning 설정으로, Converse에서는 additionalModelRequestFields의 reasoning_effort로 강도를 지정합니다. Converse 응답은 첫 블록에 추론이 들어갈 수 있으므로 content[0]을 답으로 가정하기보다 text 블록을 찾아 읽는 AWS 예시도 확인할 만합니다. (AWS 요청·추론 예시)
인증과 IAM 권한에서는 무엇을 확인하나요?
IAM은 AWS의 사용자·역할·리소스 접근 권한을 관리하는 체계입니다. AWS는 bedrock:InvokeModel 권한 평가에 계정의 기본 프로젝트, 요청한 추론 프로필, 기반 모델이 함께 들어간다고 안내합니다. us.xai.grok-4.7에만 권한이 있으면 global.xai.grok-4.7 호출 권한은 별도로 확인하는 식입니다. 교차 리전 라우팅 때문에 기반 모델 권한도 처리 가능한 리전 범위와 맞추어 살필 수 있습니다. (AWS IAM 예시)
OpenAI 호환 호출의 Bearer 토큰 인증에는 bedrock:CallWithBearerToken도 필요합니다. AWS SDK의 Converse 호출은 일반 AWS 자격 증명으로 요청에 서명하는 SigV4 방식이므로 인증 경로가 다릅니다. AWS는 장기 Bedrock API 키를 탐색용으로 쓰고 운영 환경에는 IAM 기반의 만료되는 단기 토큰을 사용하도록 안내합니다. 인증 정보는 글이나 로그에 남기지 않고, 애플리케이션이 실제로 사용하는 경로에 맞는 자격 증명과 최소 권한을 설정할 수 있습니다. (AWS 인증·운영 안내)
어떤 부가 기능을 쓸 수 있고 무엇이 빠져 있나요?
모델이 에이전트 업무에 강하다는 설명과 Bedrock이 도구를 대신 실행해 준다는 기능은 별개입니다. 4.7 모델 카드에서 서버 측 도구 사용은 미지원입니다. 도구를 실행할 애플리케이션 계층과 필요한 API 지원을 별도로 점검할 수 있습니다. 토큰 세기(Count tokens)와 지능형 프롬프트 라우팅도 미지원이므로 이 기능을 전제로 짠 기존 통합은 호출 전에 확인할 항목입니다. (AWS 기능 표)
| 지원 기능 | 언제 유용한가요? |
|---|---|
| 자동 프롬프트 캐싱 | 매 단계 같은 긴 지시·참고 자료를 보내는 입력 비용을 줄일 때 |
| 구조화 출력 | 정해진 JSON Schema 형식으로 정보를 뽑아 후속 프로그램에 넘길 때 |
| Guardrails | 요청·응답에 콘텐츠·주제·개인정보 정책을 붙일 때 |
| 호출 로그 | 모델 요청·응답 기록을 확인해 문제 원인을 분석할 때 |
| 스트리밍 | 전체 답이 끝나기 전에 생성되는 텍스트를 화면에 보여 줄 때 |
| 애플리케이션 추론 프로필 | 앱별 사용량·비용 구분에 활용하되 Invoke·Converse 경로에서 쓸 때 |
애플리케이션 추론 프로필은 Invoke·Converse에서만 지원하고 Responses·Chat Completions에서는 미지원입니다. 같은 모델을 쓰더라도 API 선택에 따라 운영 기능이 달라집니다. 입력은 텍스트·이미지, 출력은 텍스트이며, 표의 기능 지원은 9월 30일 모델 카드 기준입니다. (AWS 기능·입출력 표 · AWS 구조화 출력·로그 설명)
안전장치는 무엇을 해 주고 어떤 한계가 남나요?
AWS의 Guardrails는 요청에 ID·버전을 붙여 콘텐츠 필터, 금지 주제, 개인정보 가림, 단어 정책 등을 요청과 응답에 적용하는 기능입니다. 여러 단계를 자동으로 실행하는 앱에서는 모델의 답변 성향과 별개로 업무 정책을 붙이는 데 쓸 수 있습니다. (AWS Guardrails 설명)
xAI는 새 안전장치 체계를 적용했고 자사 시험에서 거절과 탈옥 저항이 가장 강한 모델이라고 주장합니다. 탈옥은 모델의 안전 제한을 우회하려는 입력을 말합니다. AWS 발표는 정당한 보안 연구를 덜 막으면서 위험한 요청은 거절하려는 방향과 일부 보안 파트너 대상 초대형 방어 연구 접근도 소개합니다. 이는 공급자의 안전성 설명이며, 이 블로그의 독립 검증으로 옮겨 적지 않았습니다. (AWS가 소개한 xAI 안전성 주장)
실무 선택의 제약은 안전 설명만으로 끝나지 않습니다. Global의 처리 지역, 서버 측 도구 실행 부재, API별 운영 기능 차이를 함께 맞춰야 합니다. 한국어 품질·계정별 접근·실제 지연은 앞서 밝힌 미검증 항목으로 남겨 두고 해당 업무에서 확인한 결과를 선택 근거로 삼을 수 있습니다. (AWS 지역·기능 카드)
출시 반응은 어떤가요? (2026년 9월 30일 기준)
9월 21일 xAI 출시를 다룬 Hacker News 토론은 9월 30일 확인한 사본에서 609점·댓글 539개입니다. Bedrock 사용 후기가 아니라 모델 전반에 대한 반응으로 출시 당시 기대와 개인 경험이 섞여 있습니다.
호평 쪽에서는 간결하고 평이한 영어 답변을 좋아한다는 의견이 반복됩니다. 반대로 답이 너무 짧거나 설명되지 않은 용어가 나와 다시 묻는다는 불만도 있습니다. 일부 댓글은 벤치마크 순위와 자기 코딩 과제의 결과가 다르다며 점수만으로 선택하는 데 회의적입니다. 읽기 편한 답을 원하는 사람과 충분한 설명을 원하는 사람의 기준이 다르다는 점이 참고할 만합니다. (HN 원문 토론)
이 자료에서 한국어 실사용 후기는 확인되지 않습니다. 영어 답변에 대한 호평을 한국어 품질이나 Bedrock 호출 경험으로 일반화하기보다 자기 입력에서 설명 수준과 작업 성공 여부를 함께 확인하는 참고 관점으로 볼 수 있습니다.
어떤 글과 함께 읽고 무엇부터 비교하면 좋을까요?
클로드 소넷 5.5는 추론 강도를 올리면 토큰 단가와 문제당 비용의 관계가 어떻게 달라지는지 비교할 때, GPT-6.1 Sol은 비용을 줄이면서 코딩·전문 업무 모델을 고르는 다른 선택지를 볼 때 함께 읽을 수 있습니다.
4.6에서 옮길지 판단하는 시험은 세 가지로 나눌 수 있습니다. 먼저 데이터 처리 지역과 계정 권한이 맞는지 확인하고, 다음으로 같은 입력·도구·성공 기준을 두 모델에 적용합니다. 마지막으로 추론 강도와 프로필·티어를 기록해 완료된 작업당 비용·걸린 시간·재시도 횟수를 비교합니다. 종합 점수가 높다는 이유보다 지금 앱에서 이득이 생기는지가 전환의 기준입니다.
참고한 자료는 무엇인가요?
핵심 발표·모델 카드·토론은 2026년 9월 30일 기준으로 대조했습니다. 외부 평가의 수치·조건은 AWS가 인용한 내용을 사용했고, 평가 사이트와 요금표는 독자가 최신 조건을 확인할 경로로 함께 둡니다.
- AWS, Grok 4.7 Bedrock 제공 발표 — 학습 설명, 외부 평가 비교, 기본값, API·IAM·안전성.
- AWS, Grok 4.7 모델 카드 — 가격·티어 배수·지역·기능 지원.
- AWS, Grok 4.6 모델 카드 — 이전 버전의 가격·컨텍스트·경로 비교.
- Artificial Analysis — 독립 평가 원사이트. 이 글의 수치는 AWS 발표에 인용된 표 기준입니다.
- Grok 4.7 HN 출시 토론 — 609점·댓글 539개, 모델 일반에 관한 반응.
- Amazon Bedrock 요금표 — 사용 전 최신 프로필·티어별 요금 확인 경로. 본문 단가는 모델 카드 기준입니다.