SageMaker에서 모델을 운영하는 개발자는 추론 속도 측정과 배포 후보 비교를 코딩 에이전트에 자연어로 요청할 수 있게 됩니다. AWS는 2026년 10월 5일 Agent Toolkit for AWS의 aws-ai-ml 스킬을 발표했습니다. Kiro·Claude Code·Codex 같은 에이전트가 검토하고 실행할 수 있는 SageMaker Python SDK v3 코드를 생성하는 방식입니다. (공식 발표)

한눈에 보기

궁금한 점 이번 발표의 핵심
무엇이 나왔습니까? 기존 코딩 에이전트에 SageMaker 추론 최적화·벤치마크 작업 지침을 더하는 aws-ai-ml 스킬입니다.
무엇을 맡깁니까? 기존 엔드포인트 부하 시험, 모델의 인스턴스·설정 추천, 여러 벤치마크 실행의 비교입니다.
결과는 무엇입니까? 실행 가능한 SDK v3 코드와 실측 지표를 바탕으로 한 배포 후보입니다.
어디서 사용합니까? 로컬의 MCP 호환 에이전트 또는 미리 구성된 이미지가 있는 SageMaker Studio JupyterLab 공간입니다.
준비 조건은 무엇입니까? 로컬 툴킷 경로는 AWS CLI 2.35 이상과 uv, 실제 API 실행은 SageMaker 권한이 있는 AWS 자격 증명이 필요합니다.
비용은 얼마입니까? 스킬 전용 가격은 발표에 제시되지 않았습니다. 실제 작업·엔드포인트 컴퓨팅 요금은 별도로 살펴봅니다.
한국에서도 제공됩니까? 스킬 발표에는 리전 안내가 없습니다. 기반인 추론 최적화 추천 기능은 4월 출시 때 도쿄·싱가포르 등 7개 리전으로 안내됐고 서울은 목록에 없었습니다.

아래 기능과 설치 조건은 AWS 발표·공식 저장소 설명을 따릅니다. 이 글에서는 설치나 AWS 부하 시험을 직접 실행하지 않았습니다. 발표의 약 10분 설정 안내도 AWS가 제시한 예상 시간입니다. (공식 발표 · 툴킷 저장소)

기존 코딩 에이전트에 무엇이 더해집니까?

SageMaker AI는 모델을 학습하고 배포하는 AWS 서비스입니다. 여기서 추론은 배포된 모델에 입력을 보내 답을 받는 과정이며, 엔드포인트는 그 요청을 받는 접점입니다. 어떤 GPU 인스턴스와 서버 설정을 고르느냐에 따라 요청 처리량과 지연, 운영 비용이 달라집니다. (공식 발표)

스킬은 에이전트가 특정 작업을 수행하도록 지침과 참고 자료를 묶은 패키지입니다. MCP(Model Context Protocol)는 에이전트와 외부 도구를 연결하는 규약입니다. 툴킷 저장소는 스킬의 로컬 지침과 AWS MCP Server의 API 접근·문서 검색 역할을 나눠 설명합니다. 문서 검색이나 스킬 발견과 달리, AWS API 호출과 스크립트 실행에는 계정 자격 증명이 들어갑니다. (툴킷 구성 안내)

이번 스킬은 “이 모델을 예산 안에서 운영할 인스턴스를 찾아 달라”는 목적을 SDK 코드로 옮기는 데 초점을 둡니다. 정보가 부족하면 에이전트가 모델 위치나 목표를 물어보고, 사용자는 생성된 코드를 읽고 수정해 자신의 환경에서 실행합니다. 추천 결과를 살펴보는 단계와 실제 리소스를 만드는 단계를 구분해 검토할 수 있습니다. (공식 발표)

기존 엔드포인트에서 무엇을 측정합니까?

이미 배포된 모델이 있다면 엔드포인트를 지정해 벤치마크를 요청합니다. 발표는 에이전트가 SDK의 Workload.synthetic()와 start_benchmark()를 이용한 부하 시험 노트북을 생성한다고 설명합니다. 결과는 추정이 아니라 실제 인프라에 요청을 보내 얻는 측정값이며, 에이전트는 실행 전 해당 엔드포인트가 부하 시험에 적합한지 확인하도록 안내됩니다. 측정 뒤에는 성능 개선 방법도 함께 제안하며, 발표는 그 예로 프리필 디코딩(prefill decoding)을 듭니다. (벤치마크 사용 경로)

지표 읽는 방법
요청·출력 토큰 처리량 초당 몇 요청과 출력 토큰을 처리하는지 봅니다.
p50·p99 요청 지연 전체 요청 중 각각 50%·99%가 해당 시간 안에 끝나는지를 봅니다. 느린 요청을 살필 때 p99가 유용합니다.
첫 토큰 시간 요청을 보낸 뒤 첫 출력이 나오기까지의 대기 시간입니다.
토큰 간 지연 출력을 이어 내는 동안 토큰 사이의 간격입니다.
동시성 동시에 처리하는 요청 수와 그때의 성능을 봅니다.

대화 서비스에서는 첫 응답이 빨리 보여도 긴 답변의 완성 시간이 길 수 있습니다. 반대로 전체 처리량이 높아도 일부 사용자가 오래 기다릴 수 있습니다. 따라서 지표를 함께 읽으면 “더 빠르다”가 첫 출력인지, 전체 요청 완료인지, 많은 요청의 처리인지 구체화할 수 있습니다. 위 표는 발표가 열거한 측정 항목을 풀어 쓴 것입니다. (공식 발표의 측정 항목)

운영 엔드포인트에는 시험 트래픽도 실제로 들어갑니다. 실사용 요청과 겹칠 수 있으므로, 이 작업은 코드 생성만 하는 요청과 실행 영향이 다릅니다. 시험 대상·부하 조건·실행 시점을 먼저 정하면 에이전트가 확인할 정보도 분명해집니다. (공식 발표의 부하 시험 조건)

모델만 있다면 배포 후보는 어떻게 찾습니까?

발표는 모델 출처에 따라 세 경로를 설명합니다. S3에 저장한 미세 조정·사용자 모델은 S3 URI와 최적화 목표를 전달합니다. SageMaker JumpStart의 공개 기반 모델은 모델 ID로 시작합니다. Hugging Face Hub 모델은 모델 이름을 전달하며, 접근 제한 모델은 라이선스 동의와 Hugging Face 토큰 조건을 에이전트가 안내합니다. (모델별 추천 경로)

에이전트는 후보 인스턴스와 설정을 평가하는 코드를 만들고 처리량·지연·첫 토큰 시간·동시성 같은 지표를 갖춘 순위 형태의 배포 선택지를 제시합니다. “가장 싼 인스턴스”를 찾는 팀도 목표 응답 시간이나 예상 요청량을 함께 전달하면 비용과 서비스 조건을 나란히 검토할 수 있습니다. (공식 발표)

기존 최적화 추천 기능 안내는 비용·지연·처리량 중 하나의 목표를 정하고 최대 세 인스턴스 유형을 비교하는 흐름을 설명합니다. 이 설명은 추천 기반 기능의 맥락이며, 새 스킬에 자연어 요청을 했을 때 모든 세부 설정이 자동 확정된다는 뜻으로 확대하지 않습니다. (기존 최적화 추천 안내)

두 실행을 비교하면 모델 성능까지 알 수 있습니까?

벤치마크 작업 이름 두 개를 주면 에이전트가 처리량과 지연, 첫 토큰 시간 등의 차이를 비교하는 코드를 생성합니다. 발표는 지표별 차이를 백분율로 보여 주며 양수면 두 번째 실행이 더 낫다는 뜻으로 표시하고, 존재하지 않는 실행이 있으면 먼저 시험할지 제안한다고 설명합니다. 설정 변경 전후나 인스턴스 변경의 효과를 살펴보는 데 쓰는 기능입니다. (실행 간 비교 안내)

비교할 때는 모델뿐 아니라 인스턴스·GPU 수·입출력 길이·동시 요청 조건도 함께 봅니다. AWS 발표의 표본 비교는 서로 다른 하드웨어를 사용하므로, 이 글에서는 그 수치를 모델 자체의 우열 근거로 옮기지 않았습니다. 같은 모델의 설정을 바꾼 효과를 보려면 나머지 시험 조건을 맞춰 두는 방식이 해석에 도움이 됩니다. (공식 발표의 하드웨어 조건)

어디서 사용할 수 있으며 이용 조건은 무엇입니까?

로컬 설치 안내는 AWS CLI 2.35 이상과 Python 도구 실행·패키지 관리 도구인 uv를 전제로 합니다. 아래는 발표에 나온 설치 명령입니다. 첫 명령은 에이전트를 감지하고 툴킷·AWS MCP Server를 구성하며, 둘째 명령은 aws-ai-ml 스킬을 추가합니다. (공식 설치 안내)

aws configure agent-toolkit
npx skills add aws/agent-toolkit-for-aws/skills/aws-ai-ml

이후 에이전트 채팅에서 사용 가능한 스킬을 물어 aws-ai-ml이 보이는지 확인하고 작업 목적을 전달합니다. 발표는 Kiro·Claude Code의 런타임 스킬 검색도 소개합니다. 에이전트별 플러그인·MCP 설정은 툴킷 저장소의 개별 안내로 확인할 수 있습니다. (공식 발표 · 에이전트별 툴킷 안내)

Studio 경로는 대상 계정·리전에서 Studio 도메인과 사용자 프로필을 열고 JupyterLab → Create JupyterLab space로 새 공간을 만드는 흐름입니다. 공유 설정은 Private, Image는 스킬이 포함된 이미지로 선택합니다. 발표는 스킬 동기화가 private 공간에서만 이뤄지며, 로컬 스킬을 바꾼 기존 공간에서는 미리 구성된 이미지가 반영되지 않을 수 있어 새 공간을 권합니다. 첫 기동 예상은 5~10분이고, 이후 터미널에서 사용하는 에이전트를 인증합니다. (Studio 사용 절차)

실제 실행 코드는 사용자 자격 증명으로 동작합니다. 엔드포인트 생성과 벤치마크·추천 작업에 필요한 SageMaker API 권한을 가진 계정이 전제입니다. “스킬 자체를 위한 추가 IAM 설정은 없다”는 설명과 계정의 서비스 실행 권한은 별개입니다. (권한 조건)

리전도 따로 봐야 합니다. 새 스킬 발표에는 제공 리전 안내가 없습니다. 스킬이 호출하는 추론 최적화 추천 기능은 2026년 4월 22일 출시 때 미국 동부(버지니아 북부·오하이오), 미국 서부(오리건), 도쿄, 싱가포르, 아일랜드, 프랑크푸르트 7개 리전으로 안내됐고 서울은 목록에 없었습니다. 서울 리전에 모델을 운영하는 팀은 10월 6일 현재 이 목록을 기준으로, 추천 작업을 도쿄 등 다른 리전에서 돌릴지 또는 기존 엔드포인트 벤치마크부터 시험할지 정하게 됩니다. 이후 리전이 늘었는지는 AWS 콘솔과 문서에서 다시 확인합니다. (기존 기능의 제공 리전)

비용과 요금은 무엇을 기준으로 계산합니까?

새 스킬 발표에는 요금표나 고정 작업 가격이 없습니다. 비용에 관한 안내는 끝부분의 “계속 요금이 나가지 않도록 만든 리소스를 삭제하라”는 정리 단계뿐입니다. 즉 스킬이 만든 코드로 띄운 엔드포인트와 작업은 일반 SageMaker 리소스처럼 과금되므로, 코드가 만들 리소스와 실행 시간을 기준으로 비용을 살펴봅니다. (새 스킬 발표의 정리 단계)

기존 추론 최적화 추천 안내는 추천 생성에 추가 비용이 없더라도 최적화 작업과 벤치마크용 엔드포인트에는 표준 컴퓨팅 요금이 발생한다고 설명합니다. 이미 ML Reservations(예약 용량)를 가진 계정은 벤치마크를 추가 비용 없이 돌릴 수 있어 최적화 작업 비용만 든다고 덧붙입니다. 이 조건은 기존 기능의 설명이며 새 스킬 전체의 무상 이용이나 모든 계정의 비용 면제로 해석하지 않습니다. (기존 기능의 요금 설명)

따라서 생성 코드를 검토할 때는 비교할 인스턴스와 실행할 작업 수, 시험 시간, 시험 뒤 유지할 엔드포인트를 함께 정하는 것이 실무적인 비용 판단입니다. 추천 순위에 나온 성능 조건을 실제 서비스의 요청 패턴과 맞춰 읽으면, 단순히 큰 GPU를 선택하는 것보다 배포 후보를 구체적으로 좁힐 수 있습니다. (공식 추천 흐름)

반응 (2026년 10월 6일 확인 기준)

공개된 사용자 반응은 아직 확인되지 않았습니다.

참고한 자료

확인일은 2026년 10월 6일입니다.