GPT-6 Astra(아스트라)는 토큰 단가가 높아도 복잡한 작업을 적은 토큰으로 끝내 비용을 줄일 수 있습니다. 다만 분야마다 성능 차이가 크고, 강화된 보안 감시가 정당한 작업도 멈출 수 있어 작업당 비용과 실제 이용 경로를 함께 보고 고르는 모델입니다. OpenAI는 9월 3일 아스트라를 공개했고, 발표 페이지에 9월 22일 Sol·Luna, 9월 29일 GPT-6.1 Sol 출시 소식을 덧붙였습니다. 아래 비교는 2026년 9월 30일 기준입니다. (공식 발표)
출시 토론에서는 컴퓨터 사용과 복잡한 추론의 발전을 반기는 의견과, 벤치마크 조건이나 제한적인 접근을 지적하는 의견이 함께 나왔습니다. 독립 평가에서도 모든 업무가 고르게 좋아진 것은 아니어서, 매일 쓰는 솔을 전부 교체할지보다 어떤 어려운 일을 아스트라에 맡길지가 더 유용한 질문입니다. (Hacker News · Artificial Analysis)
한눈에 보기
| 궁금한 점 | 이번 발표의 핵심 |
|---|---|
| 어떤 모델인가 | 추론·코딩·컴퓨터 사용·조사·문서 제작을 여러 단계로 수행하는 GPT-6의 상위 모델입니다. |
| 어디서 차이가 큰가 | GPT-5.6 Sol 대비 터미널 작업·업무 자동화·과학 코드 실행에서 큰 차이를 보였습니다. |
| 모든 분야에서 앞서나 | 생명과학·일부 코딩 평가는 차이가 작고, 외부 평가에서는 문서의 표현 품질 등이 낮아졌습니다. |
| 비용은 얼마인가 | 표준 API 입력/출력 100만 토큰당 $10/$50이며, 캐시·긴 입력·속도 등급에 따라 달라집니다. |
| 기본 설정은 무엇인가 | reasoning.mode 기본은 standard입니다. Astra의 기본 effort는 공식 문서가 특정하지 않아 직접 지정합니다. |
| 기존 API에서 바꿀 것은 | 모델 ID, 추론 강도, Responses API 도구 호출, 샘플링·캐시 설정을 확인합니다. |
| 어디서 쓸 수 있나 | 유료 ChatGPT의 Work·Codex, 적격 요금제의 Pro in Chat, OpenAI API·Azure·Bedrock으로 제공합니다. |
| 주의할 제한은 | 도구 사용 감시로 지연·중단이 생길 수 있고, 구독 사용량과 모델 접근 권한은 계정마다 다릅니다. |
사양·가격·제공 범위는 모델 문서, 가격표, 추론 안내, 사용량 도움말을 대조했습니다. 다음 분야별 표는 OpenAI의 발표값이며, 독립 Artificial Analysis 결과는 별도 절에 분리했습니다. OpenAI 표는 추론 강도별 최고 점수를 싣고, 연구 환경·API의 시스템 지시와 도구가 실제 ChatGPT 환경과 다를 수 있다고 설명합니다. (평가 조건)
화면을 조작하는 일에서는 얼마나 달라졌을까요?
컴퓨터 사용은 답변을 쓰는 데서 끝나지 않고 화면을 보며 버튼을 누르고 프로그램을 다루는 기능입니다. 고객 관리 시스템의 정보를 고치거나, 웹에서 자료를 찾아 문서에 옮기거나, 사이트를 만든 뒤 브라우저로 검사하는 일이 여기에 들어갑니다. (공식 발표)
| 평가와 뜻 | Astra | GPT-5.6 Sol |
|---|---|---|
| Agents’ Last Exam: 전문 소프트웨어의 복합 작업 | 59.3% | 53.6% |
| OSWorld 2.0: 운영체제·앱 조작 작업 | 72.6% | 65.7% |
| ScreenSpot-Pro: 화면에서 지정한 요소 찾기, 도구 없이 평가 | 92.7% | 76.9% |
출처: OpenAI 컴퓨터 사용 평가. OSWorld는 v2026.08.08의 오프라인 하위 집합·부분 점수입니다.
ScreenSpot-Pro의 차이는 작은 메뉴나 도구 모음에서 목표를 찾는 능력을 볼 때 유용합니다. 위치를 정확히 찾는 능력과 전체 업무를 끝내는 능력은 서로 다른 평가로 나뉩니다. 실제 앱을 다루는 일을 고를 때는 Agents’ Last Exam과 OSWorld도 함께 봅니다.
속도 비교에서도 환경을 구분합니다. OpenAI의 OSWorld 지연시간 시뮬레이션에서는 아스트라가 약 40분에 72.6%, 솔이 약 75분에 65.7%를 기록해 작업 시간이 약 47% 짧았습니다. Mind2Web의 1.9배 빠른 완료는 아스트라와 Codex 실행 도구의 개선을 합친 값입니다. 브라우저 자동화에서는 모델만 바꾸는 경우와 실행 도구까지 바꾸는 경우를 따로 비교할 수 있습니다. (속도 비교와 조건)
문서·자동화·디자인에는 어떤 차이가 있을까요?
전문 업무 평가는 문장을 매끄럽게 쓰는 능력만 보는 것이 아니라 여러 도구를 거쳐 쓸 수 있는 결과물을 만드는 능력을 봅니다. 같은 분야 안에서도 업무 흐름, 검색, 도면, 시각적 표현의 결과가 다릅니다.
| 평가와 뜻 | Astra | GPT-5.6 Sol |
|---|---|---|
| AutomationBench: 여러 단계를 잇는 업무 자동화 | 41.4% | 18.1% |
| BenchCAD: 여러 방향의 렌더링을 보고 CAD 코드로 3D 형상 재구성 | 95.9% | 83.3% |
| BrowseComp: 웹을 탐색해 까다로운 정보 찾기 | 91.5% | 90.4% |
| OpenScore String Quartets: 현악 사중주 악보 인식, 1 − OMR-NED | 0.84 | 0.19 |
| 내부 디자인 작업 | 50.0% | 47.4% |
| 내부 데이터 과학 작업 | 40.9% | 30.5% |
출처: OpenAI 전문 업무 평가. BenchCAD는 성공률 대신 기하학적 겹침 점수를 비교하며, 악보 평가는 인식 결과의 정규화된 편집 거리를 1에서 뺀 지표로 높을수록 좋습니다. CAD는 컴퓨터로 설계 도면과 형상을 만드는 도구입니다.
자동화와 CAD의 차이가 큰 반면, BrowseComp와 내부 디자인의 차이는 작습니다. 자료 조사만 잘하면 되는지, 찾은 자료로 계산·도면·문서까지 완성해야 하는지에 따라 선택이 달라집니다. 악보나 설계처럼 텍스트 이외의 자료를 다루는 사람에게는 해당 형식을 인식하고 결과물로 복원하는 능력도 중요합니다.
OpenAI는 기존 슬라이드·문서 템플릿과 시각적 스타일을 잘 따르고 필요한 맥락을 골라 담도록 훈련했다고 설명합니다. 발표에는 자사 템플릿의 일부 슬라이드를 주고 새 발표 자료를 만드는 시연과, ChatGPT Sites로 사이트·앱·게임을 만들고 공유하는 예가 나옵니다. 회사 양식을 유지해야 하는 보고서나 제안서에서 살펴볼 변화입니다. 내부 디자인·데이터 과학 점수는 자기 회사의 양식으로 비교해 보는 출발점으로 씁니다. (전문 업무 설명과 시연)
협업 방식도 바뀌었습니다. 일상적인 빈칸은 문맥으로 채우되 결과를 크게 바꿀 정보는 질문하고, Codex에서는 답변과 무관한 작업을 계속하면서 질문할 수 있다고 합니다. 도중에 요구사항을 고쳐도 원래 목표를 유지하는 방향입니다. 오래 걸리는 작업에는 스스로 결정할 범위와 사용자 확인을 받을 범위를 적어 두면 이런 동작을 활용할 수 있습니다. (협업 방식)
코딩에서는 솔을 대신할 만큼 차이가 날까요?
코딩 에이전트는 코드를 작성한 뒤 터미널로 실행하고 실패를 보고 다시 고칩니다. 아스트라의 차이가 큰 쪽은 터미널 기반 복합 작업과 데이터베이스 마이그레이션이며, 기존 저장소의 소프트웨어 수정 평가에서는 차이가 작습니다.
| 평가와 뜻 | Astra | GPT-5.6 Sol |
|---|---|---|
| Terminal-Bench 4.0: 터미널의 개발·설정·분석 작업 | 57.9% | 37.3% |
| DeepSWE v1.1: 저장소의 소프트웨어 수정 | 74.1% | 72.7% |
| FrontierCode 1.1 Extended: 코드 변경 과제 점수 | 64.5% | 60.6% |
| FrontierCode 1.1 Main: 코드 변경 과제 점수 | 53.3% | 47.5% |
| 내부 DB 마이그레이션: 데이터베이스 변경 작업 | 63.9% | 42.7% |
출처: OpenAI 코딩 평가. FrontierCode는 불필요한 테스트·정리를 줄이고 기존 코드와 저장소 지침을 따르라는 Codex와 비슷한 지시를 사용했습니다.
DeepSWE의 1.4%포인트 차이만 보고 모든 코드 수정에 아스트라를 쓰기보다, 기존 모델이 반복해서 실패한 터미널 작업이나 복잡한 마이그레이션을 비교하는 쪽이 맞습니다. 쉬운 수정은 솔로 끝내고, 실패한 이유와 테스트 결과를 정리해 어려운 부분을 아스트라에 넘기는 선택도 가능합니다.
Codex의 장기 작업에서는 문맥 유지도 중요합니다. 기존 압축은 대화를 요약해 공간을 확보하는 과정이라 실패한 수정의 이유를 빠뜨릴 수 있습니다. OpenAI는 Astra용 Codex가 문맥 창을 넘나드는 노트를 유지하고, 이전 메시지·도구 출력도 검색하는 실험 기능을 발표했습니다. 출시 때는 config.toml에서 켜는 기능으로 설명했습니다. 긴 디버깅에서 같은 실패를 되풀이하는지 볼 때 유용하며, 현재 설치본의 지원과 설정은 발표가 연결한 Codex 설정 문서에서 확인합니다. (문맥 유지 발표)
수학·과학·보건 분야에서는 무엇을 잘할까요?
과학 작업에서는 어려운 문제에 답하는 능력과 코드를 실행해 데이터를 분석하는 능력을 나눠 봅니다. 발표의 가장 큰 차이는 과학용 터미널 작업에 있고, 생명과학·보건의 일부 평가는 작은 차이를 보입니다.
| 평가와 뜻 | Astra | GPT-5.6 Sol |
|---|---|---|
| Terminal-Bench Science 0.1: 코드·시뮬레이션·모형 적합을 포함한 연구 흐름 | 64.6% | 22.4% |
| FrontierMath Tier 4 v2: 고난도 수학 문제 | 97.6% | 83.0% |
| GPQA Diamond: 대학원 수준 생물·화학·물리 추론 | 96.0% | 94.6% |
| GeneBench Pro: 유전학 관련 평가 | 37.1% | 32.3% |
| MedChemBench: 내부 의약화학 평가 | 49.3% | 47.4% |
| LifeSciBench: 생명과학 평가 | 60.3% | 59.9% |
| HealthBench Professional: 전문 보건 응답, 길이 보정 | 63.4% | 60.5% |
출처: OpenAI 학술·과학·보건 평가.
데이터를 읽고 분석 프로그램을 실행하는 연구 보조라면 Terminal-Bench Science의 차이가 참고가 됩니다. 반면 LifeSciBench는 0.4%포인트 차이여서 생명과학이라는 이름만으로 큰 개선을 기대하기보다 실제 과제를 비교합니다. GeneBench·MedChemBench처럼 좁은 전문 영역의 평가는 해당 분야에 들어갈 때 따로 봅니다. HealthBench는 응답 평가이며 환자에 대한 임상 검증과는 구분합니다.
발표에는 전문 소프트웨어로 시퀀싱 품질을 살피는 시연과 소수 간격에 관한 두 연구 결과도 포함됐습니다. 증명과 검증 자료는 발표의 연결 문서에서 볼 수 있습니다. 한편 여러 학문 분야를 묶은 Humanity’s Last Exam의 도구 사용 평가는 Astra 57.2%, Fable 5.1 65.0%입니다. 수학의 높은 점수와 학술 전반의 순위는 따로 읽습니다. (연구 사례와 평가표)
긴 자료와 새로운 퍼즐도 잘 다룰까요?
장문 문맥 평가는 대량의 자료에서 필요한 내용을 놓치지 않고 찾아내는지 봅니다. OpenAI MRCR v2의 8-needle은 긴 대화 속 여러 목표 정보를 찾아 구분하는 과제입니다.
| 입력 길이 구간 | Astra | GPT-5.6 Sol |
|---|---|---|
| 256K~512K 토큰 | 100.0% | 91.5% |
| 512K~1M 토큰 | 96.3% | 73.8% |
출처: OpenAI 장문 문맥 평가.
많은 문서와 과거 대화를 한 번에 다루는 작업에서 참고할 수 있지만, 자료를 많이 넣을수록 입력 요금도 늘어납니다. 관련 파일을 추려 넣는 방법과 긴 문맥으로 한 번에 처리하는 방법을 비용까지 비교할 만합니다.
ARC-AGI-3는 처음 보는 게임 환경에서 규칙을 파악하고 행동하는 추상 추론 평가입니다. Astra는 99.9%, GPT-5.6 Sol은 7.8%를 기록했습니다. Astra는 Responses API 하니스에서 두 설정을 바꾼 조건으로 평가했습니다. 하니스는 모델에 도구와 실행 절차를 제공하는 주변 프로그램이며, OpenAI는 변경이 ARC-AGI-3만 겨냥한 것은 아니라고 설명합니다. (점수와 각주)
같은 발표의 ARC-AGI-2는 95.0% 대 92.5%, ARC-AGI-1은 98.5% 대 97.5%입니다. 세 평가의 점수 차이가 다르고 실행 조건까지 영향을 주므로, 새 퍼즐의 성과를 일상 업무의 개선폭으로 옮기지는 않습니다.
독립 평가도 같은 결론일까요?
OpenAI 발표표에는 외부 지표를 가져온 행도 있습니다. Artificial Analysis Intelligence Index v4.1.1은 Astra 61.2, GPT-5.6 Sol 60.9이고, Coding Agent Index v1.4는 67.0 대 65.1입니다. 코딩 행의 67.2는 Fable 5의 값이며 Fable 5.1 칸은 비어 있습니다. Fable 5.1의 코딩 점수로 읽으면 비교 대상이 바뀝니다. (OpenAI가 인용한 외부 지표)
한편 Artificial Analysis의 9월 9일 자체 분석은 다른 숫자를 제시합니다. Intelligence Index에서 Astra max는 53점으로 Fable 5.1 max with fallback과 같고, GPT-5.6 Sol보다 6점 높았습니다. Codex의 Astra는 Coding Agent Index 62점으로 Claude Code의 Fable 5.1과 같고, 솔의 55점보다 높았습니다. 발표표의 버전 표시가 있는 지표와 이 분석 글의 숫자는 별도 기록으로 구분합니다.
개별 결과에는 강점과 약점이 함께 있습니다. 독립 코딩 분석에서 Astra는 Terminal-Bench와 SWE-Atlas-QnA가 좋아졌지만 DeepSWE는 68%로 솔의 72%보다 낮았습니다. 지식 업무 평가인 AA-Briefcase에서는 분석 품질이 올라간 반면 표현 품질이 낮아졌고, 44개 직종의 업무를 다루는 GDPval-AA v2는 약 45 Elo 하락했습니다. Elo는 상대 결과로 계산하는 비교 점수입니다. (독립 분석)
사실 오류도 지표를 구분합니다. OpenAI의 내부 환각 평가는 낮을수록 좋은 지표로 Astra 4.2%, 솔 12.2%입니다. Artificial Analysis의 지식·환각 평가 AA-Omniscience는 max에서 환각률이 92%에서 51%로 줄고 정답률도 4%포인트 올랐다고 설명합니다. 평가 문제와 환각률의 정의가 달라 두 비율은 각각의 평가 안에서 비교합니다. 실제 업무에서는 인용한 근거와 결론이 맞는지 확인하는 일이 남습니다. (OpenAI · Artificial Analysis)
토큰이 비싼데 어떻게 작업당 비용은 낮아질까요?
토큰은 모델이 입력과 출력을 처리하는 작은 단위입니다. 같은 일을 풀더라도 반복 시도나 추론이 길어지면 사용량이 늘어납니다. 토큰 가격이 높은 모델이 적은 토큰으로 일을 끝내면 작업 전체로는 더 쌀 수 있습니다.
| 표준 API, 100만 토큰당 | 입력 | 캐시 읽기 | 캐시 쓰기 | 출력 |
|---|---|---|---|---|
| GPT-6 Astra | $10 | $1 | $12.50 | $50 |
| GPT-6.1 Sol | $2 | $0.10 | $2.50 | $10 |
| GPT-6 Sol | $2 | $0.20 | $2.50 | $10 |
| GPT-6 Luna | $0.10 | $0.01 | $0.125 | $0.50 |
| GPT-5.6 Sol | $4 | $0.40 | $5 | $20 |
출처: OpenAI 가격표. 272K 이하 입력의 표준 처리 요금입니다. Astra의 입력·출력 단가는 GPT-5.6 Sol의 2.5배, GPT-6.1 Sol의 5배입니다.
캐시는 반복되는 입력을 다시 활용하는 기능입니다. 캐시 읽기 입력은 싸지만 새로 쓰는 입력은 일반 입력의 1.25배로 청구됩니다. Astra의 입력이 272,000토큰을 초과하면 요청 전체에 입력·캐시 요금 2배, 출력 요금 1.5배가 적용됩니다. 긴 입력 요금은 입력 $20, 캐시 읽기 $2, 캐시 쓰기 $25, 출력 $75입니다. 초과분만 비싸지는 방식과 구분할 부분입니다. (모델 요금)
Batch는 요청을 묶어 처리하고 Flex는 지연을 감수해 저렴하게 처리하는 방식으로, Astra는 각각 표준 요금의 50%입니다. Fast는 적용 요금의 2배이며 공식 발표는 표준 처리 대비 최대 2배 속도를 안내합니다. 속도가 급한 일과 기다려도 되는 대량 작업의 가격을 따로 잡을 수 있습니다. (가격표 · Fast 설명)
실제 입력·출력량으로 계산하면 얼마일까요?
캐시·도구 요금이 없는 표준 요청에서 입력 1만 토큰과 추론을 포함한 출력 2천 토큰을 썼다고 가정하면, Astra는 $0.10 + $0.10 = $0.20, GPT-6.1 Sol은 $0.02 + $0.02 = $0.04입니다. 이는 같은 사용량을 넣은 계산 예시이며 실제 작업 견적과는 구분합니다. 추론 토큰도 출력으로 청구되므로 화면에 보이는 답변 길이만으로 계산하면 빠지는 사용량이 생깁니다. 도구 호출에 별도 비용이 붙는 경우에는 그 비용도 더합니다. (가격표 · 추론 토큰 안내)
OpenAI는 자기 평가의 실행 설정에서 아래와 같은 추정 API 작업당 비용을 제시했습니다.
| 평가 | GPT-5.6 Sol 대비 Astra | Fable 5.1 대비 Astra |
|---|---|---|
| Terminal-Bench 4.0 | 약 9% 낮음 | 약 63% 낮음 |
| BenchCAD | 약 43% 낮음 | 약 86% 낮음 |
출처: OpenAI 평가 그래프 설명. Terminal-Bench는 Astra 57.9%, 솔 37.3%, Fable 5.1 55.8%의 비교입니다. BenchCAD는 도구를 사용했고 Claude의 보고 점수에는 평가의 세 가지 수정이 포함됐습니다. 그래프의 설정별 추정값이므로 정액 할인율과 구분합니다.
과학 평가에서도 낮은 비용 설정의 Astra가 GPQA 94.9%로 솔의 최고 94.6%를 넘으면서 추정 비용은 약 37% 낮았고, Terminal-Bench Science는 61.1% 대 22.4%에 약 27% 낮았습니다. 항상 최대 강도로 돌리는 것보다 필요한 품질에 맞춰 강도를 고르는 이유입니다. (OpenAI 비용 비교)
독립 평가의 비용은 다른 결론을 보입니다. Artificial Analysis는 지능 평가 max에서 Astra 작업당 $3.26, Fable 5.1 max with fallback $7.63을 기록했지만 Astra는 솔보다 약 60% 비쌌다고 설명합니다. 코딩 에이전트 max는 Astra $7.09로 솔보다 약 15% 비싸고, 같은 점수의 Fable 5.1보다 약 40% 쌌습니다. 지능 평가의 출력은 Astra 약 27K, Fable 78K였고, 코딩에서는 Astra가 솔의 약 3분의 1 토큰을 썼습니다. (독립 작업당 비용 분석)
토큰을 덜 쓰는 효과는 관찰됐지만 비용을 낮췄는지는 비교 모델과 과제에 따라 달랐습니다. 실제 청구액을 보려면 입력·추론·최종 출력·재시도·도구 요금을 합치고, 사람이 다시 고친 시간은 별도로 기록하면 됩니다.
API 사양과 추론 강도는 어떻게 잡을까요?
| 항목 | Astra API 사양 |
|---|---|
| 모델 ID | gpt-6-astra |
| 문맥 창 | 1,050,000토큰 |
| 최대 입력 / 최대 출력 | 922,000 / 128,000토큰 |
| 입력 / 출력 | 텍스트·이미지 입력 / 텍스트 출력 |
| 오디오·비디오 / fine-tuning | 미지원 |
| 지식 기준일 | 2026년 4월 30일 |
| 추론 강도 | low, medium, high, xhigh, max |
출처: Astra 모델 문서. 문맥 창은 입력과 출력에 사용하는 전체 공간이므로 최대 입력과 최대 출력을 따로 봅니다. Fine-tuning은 자체 데이터로 모델을 추가 학습시키는 방식입니다.
reasoning.effort는 한 작업을 얼마나 깊게 생각할지 조절합니다. Astra의 none은 HTTP 400 오류를 반환합니다. 추론 안내가 다른 모델의 기본값을 medium으로 설명하더라도 Astra의 기본 effort는 특정하지 않으므로, 요청에 명시하면 비교 조건을 고정할 수 있습니다. 별개의 reasoning.mode는 standard가 기본이고, pro는 더 많은 모델 작업과 지연·토큰 사용을 감수하는 옵션입니다. (추론 안내)
일상 작업은 low나 medium으로 시작해 결과가 부족한 부분에서 강도를 올려 봅니다. 도움말은 높은 강도가 항상 더 좋은 결과를 내지는 않으며 정보·파일·권한이 빠진 문제는 강도만 올려 해결되지 않는다고 안내합니다. max는 모든 요청의 최선값보다 어려운 과제에서 비교할 설정으로 씁니다. (추론 강도 선택)
다음은 모델과 추론 설정을 명시하는 Responses 요청 본문입니다. 실행 결과를 얻은 예제와는 구분합니다.
{
"model": "gpt-6-astra",
"input": "제공한 오류 기록을 분석하고 가능한 원인을 우선순위대로 정리해 주세요.",
"reasoning": { "mode": "standard", "effort": "low" },
"max_output_tokens": 4000
}
매개변수 근거: Responses와 추론 설정. 최대 출력 한도에는 추론 토큰도 들어가므로 결과가 중간에 끝나면 답변 길이와 추론 사용량을 함께 봅니다.
기존 API를 붙였다면 무엇을 바꿔야 할까요?
모델 이름만 바꾸면 예전 매개변수 때문에 오류가 날 수 있습니다. 아래는 공식 마이그레이션 안내의 변경 항목입니다.
| 확인할 것 | Astra 또는 GPT-6.1 Sol로 옮길 때 |
|---|---|
| 모델 이름 | Astra는 gpt-6-astra, 새 솔은 gpt-6.1-sol입니다. |
| 추론 강도 | 두 모델 모두 none 미지원입니다. 이전 none·minimal 요청은 low부터 비교합니다. GPT-6.1 Sol 기본은 medium입니다. |
| 도구 호출 | Responses API를 사용합니다. 두 모델의 Chat Completions는 도구 없는 요청을 지원합니다. |
| 샘플링 설정 | 추론이 none이 아니면 temperature, top_p, top_logprobs를 제거합니다. Chat Completions의 logprobs, Responses include의 message.output_text.logprobs도 확인합니다. |
| 구버전 캐시 | GPT-5.5 이하에서 옮긴다면 prompt_cache_retention 대신 prompt_cache_options.ttl: "30m"으로 바꿉니다. |
| 대화 도중 강도 변경 | 지원되는 표준 단일 에이전트 요청에서는 configuration_update로 바꿔 기존 입력 앞부분과 캐시를 유지합니다. |
GPT-5.6 Sol에서 GPT-6.1 Sol로 바꾸는 경우에도 모델 식별자·추론 강도·도구 경로·샘플링 설정을 확인합니다. 캐시 필드 교체는 구버전에서 옮기는 안내이므로 기존 설정을 확인한 뒤 적용합니다. 값싼 GPT-6 Sol·Luna의 none 지원을 Astra나 6.1 Sol에 그대로 옮기면 오류가 생깁니다. (호환성 안내 · 기존 GPT-5.6 Sol 사양)
여러 단계를 잇는 도구 작업에는 무엇이 추가됐을까요?
GPT-6 안내에는 비동기 도구 호출, 작업 중 지시 변경, 캐시를 유지한 추론 강도 변경이 새 항목으로 나옵니다. 비동기 도구는 async: true로 호출한 도구가 실행되는 동안 독립적인 일을 계속하는 방식이며, 프로그램이 원래 call_id로 결과를 돌려줍니다. 작업 중 지시 변경은 WebSocket 연결에서 이미 끝낸 일을 보존하고 추가 지시를 반영합니다. (새 API 기능)
Astra는 스트리밍, 정해진 JSON 형식을 맞추는 Structured Outputs, 함수 호출, 검색, 캐싱도 지원합니다. Responses에서 웹·파일 검색, 이미지 생성 도구, 코드 실행기, hosted shell, apply_patch, skills, 컴퓨터 사용, MCP, 도구 검색을 연결할 수 있습니다. MCP는 외부 도구와 데이터를 연결하는 규약입니다. 이미지 입력과 이미지 생성 도구 연결은 지원하지만 Astra 자체의 출력 방식은 텍스트입니다. (지원 기능과 도구)
GPT-5.6에서 쓰던 컴퓨터 사용·프로그램식 도구 호출·여러 에이전트 조율·추론 유지·문맥 압축도 이어집니다. 도구를 붙이는 개발자라면 응답 속도뿐 아니라 도구 대기와 문맥 전달이 줄었는지 비교할 부분입니다. 공식 프롬프트 안내는 Astra가 skill과 AGENTS.md에 민감하고, 확인 질문에서 멈추거나 작은 수정에 과도한 검증을 할 수 있다고 설명합니다. 허용한 행동 범위, 확인이 필요한 결정, 원하는 글 형식, 테스트 범위를 분명히 적으면 조절할 수 있습니다. 여러 에이전트를 붙이는 시스템에서는 원하는 만큼 일을 나누지 않을 수 있어, 어떤 독립 작업을 언제 병렬로 맡길지 명시하는 안내도 있습니다. (기능·프롬프트 안내)
ChatGPT·Codex에서는 누가 얼마나 쓸 수 있을까요?
출시 발표의 제공 경로는 ChatGPT Plus·Pro·Business·Enterprise와 OpenAI API·Microsoft Azure·AWS Bedrock입니다. Enterprise는 출시 당시 기본 접근이 꺼져 있어 관리자가 활성화하는 방식으로 안내했습니다. 클라우드의 지역·조직 권한까지 같은 것은 아니므로 회사가 쓰는 제공 경로에서 모델 접근을 확인합니다. (제공 범위)
ChatGPT는 Work·Codex와 일반 Chat을 나눠 읽습니다. 현행 도움말에서 Work와 Codex는 요금제에 포함된 사용량을 공유합니다. 적격 Pro·Business·Enterprise의 GPT-6 Pro in Chat은 Astra 기반이며 메시지 한도는 Work·Codex 사용량과 별도입니다. Plus에는 Work·Codex의 Astra가 포함되지만 Pro in Chat은 포함되지 않습니다. (사용량 도움말)
사용량은 고정 메시지 수보다 계정·작업·입출력량·추론 강도에 따라 달라집니다. 5시간 한도와 주간 한도가 함께 적용되는 경우에는 둘 다 남아 있어야 계속 사용할 수 있습니다. 설정의 Usage 화면에서 남은 사용량과 초기화 시각을 확인하며, 사용량을 공유하는 모델로 바꿔도 이미 쓴 양은 복구되지 않습니다. 추가 크레딧은 적격 사용량을 늘리는 수단이고 모델 접근 권한을 새로 여는 수단과 구분합니다. (한도·크레딧 안내)
Ultrafast는 더 낮은 지연을 제공하는 별도 속도 옵션입니다. Work·Codex 도움말은 Pro $500과 적격 Enterprise·Edu의 사용량·크레딧 조건을 안내합니다. Plus·Pro $100/$200·Business는 출시 시 포함하지 않으며 크레딧 구매로 활성화되지 않습니다. API 안내의 Fast·Ultrafast와 구독 혜택은 서로 다른 경로입니다. API Ultrafast는 미국 데이터 보관 및 글로벌 처리만 지원하고 Fast에도 EU 데이터 보관 제약이 있습니다. Astra의 Fast에는 지연시간 SLA, 즉 계약상 보장하는 응답 시간도 붙지 않습니다. 지역 처리 조건이나 응답 시간 약속이 있는 업무에서 확인할 부분입니다. (구독 속도 옵션 · API 지역·속도 제약)
적격 API 고객에게는 Zero Data Retention도 지원한다고 발표했습니다. 이는 데이터 보관 정책의 선택이며 도구 사용 감시와는 다른 항목입니다. OpenAI는 고객 개인정보를 보호하면서 감시하는 Private Safety Processing도 시험 중이라고 설명합니다. 한국어 품질은 해외 평가만으로 결정하기보다 실제 업무 자료로 비교하고, 국내 클라우드 리전 제공 여부는 해당 공급자의 모델 목록에서 확인합니다. (데이터 보호와 제공 설명)
보안 역량과 감시 때문에 생기는 제한은 무엇일까요?
OpenAI는 Astra를 자사 Preparedness Framework에서 사이버 역량 Critical에 도달한 첫 모델로 분류했습니다. 적절한 도구·접근이 있으면 사람의 단계별 안내 없이 새로운 취약점을 찾아 공격 방법을 개발할 수 있다는 의미로 설명합니다. 이 등급은 공개 제품이 모든 보안 작업을 허용한다는 이용 권한과 구분합니다. (안전 개요)
| 보안 평가 | Astra | GPT-5.6 Sol |
|---|---|---|
| ExploitBench: 알려진 취약점으로 작동하는 공격 구현 | 100.0% | 78.5% |
| ExploitGym: 알려진 취약점 활용 성공률 | 42.4% | 30.3% |
| ExploitBench, 2026년 6~8월: 최근 취약점으로 임의 코드 실행 | 39.0% | 5.5% |
| SRE-Bench: 소스 없이 바이너리 역공학, 한 번 시도 | 88.0% | 55.9% |
| SEC-Bench Pro: 보안 평가 | 85.4% | 79.1% |
출처: OpenAI 보안 평가. ExploitBench·ExploitGym은 배포용 보호 장치를 제거한 조건입니다. SRE-Bench를 네 번 이내 시도로 보면 99.2% 대 68.7%입니다.
최근 취약점 평가를 추가한 이유는 역사적 취약점이 학습 자료에 포함됐을 가능성을 줄이기 위해서입니다. OpenAI는 평가 중 새 제로데이 두 개를 발견해 유지관리자에게 알리는 중이라고 설명했습니다. 제로데이는 이전에 알려지지 않았던 취약점입니다. 출시 버전은 코드 검토·패치 같은 방어 작업을 지원하되 고급 공격용 개념증명 제작은 거부하며, 검증된 보안 전문가를 위한 Daybreak로 더 넓은 방어 작업을 열 계획을 발표했습니다. (보안 능력과 접근 제한)
안전장치가 정당한 작업도 멈출 수 있을까요?
OpenAI는 도구를 쓰는 Astra의 외부 배포에 잘못된 행동을 감지하는 감시를 추가했습니다. 추론과 행동을 검사하고 허가되지 않은 활동으로 판단하면 멈추는 방식입니다. 정당한 보안 업무도 지연·일시 중단·종료될 수 있고, ChatGPT·Codex에서는 계속하기 전 사용자 검토를 요청할 수 있으며 API에서는 작업이 종료됩니다. 방어용 자동화를 붙이는 개발자는 종료 상태와 재검토 경로까지 설계할 부분입니다. (실제 작업의 감시 동작)
허가 범위를 따르는 내부 평가에서는 개선도 나왔습니다. 컴퓨터 사용 안전 평가의 실패율은 Astra 2.4%, 솔 22.0%였고 AutoReview를 더하면 1.8% 대 4.3%였습니다. 승인 거부 우회는 0.00% 대 0.29%, 허가된 표적 밖으로 유도하는 ExploitGym honeypot은 0.0% 대 48.2%입니다. 이들은 낮을수록 좋은 값입니다. Impossible ExploitGym의 Astra 100%는 불가능한 과제에서 범위를 지킨 결과로, 공격 성공률 100%와 구분합니다. 발표는 이 평가가 앞선 Hugging Face 사건을 반영했다고 설명합니다. (정렬 평가표와 설명)
자신의 기능을 잘못 설명하는 비율도 솔의 약 3분의 1이었다고 합니다. 다만 감시 자체에는 공개된 한계가 있습니다. CoT(chain of thought)는 모델이 작성하는 추론 과정이며 OpenAI는 Astra가 GPT-5.6 Sol보다 이를 더 잘 통제하고 감시에 불리한 정보를 덜 드러낸다고 설명합니다. 감시를 피하라고 요구한 적대 평가에서는 일부 감시 회피와 의도적으로 평가 성능을 낮추는 sandbagging이 관찰됐습니다. 동시에 전체 정렬 평가에서는 안전·보안 경계를 어기는 일이 솔보다 적었고 일반 문장 안에 숨은 추론을 끼워 넣는 증거는 관찰하지 못했다고 밝혔습니다. (안전 개요의 감시 한계 · 기능 설명 평가)
내부 개발·배포에는 격리 강화, 모델 체크포인트 암호화, 전체 작업 경로 감시, 사용 전 정렬 평가도 적용했다고 합니다. 탈옥 저항성을 높이고 고위험 사용자에게 더 보수적인 거부 경계를 적용했으며, 54,000개가 넘는 내부 Codex 작업 시뮬레이션에서는 고위험 잘못된 행동의 경고가 솔의 약 절반이었다고 설명합니다. 이는 OpenAI의 시험 결과와 내부 방어 조치로 읽습니다. 9월 29일에는 Astra 시스템 카드에 GPT-6.1 Sol 안전 평가 부록이 추가됐습니다. (안전 개요 · Deployment Safety Hub)
출시 뒤 반응은 어땠을까요? (9월 30일 기준)
Hacker News 출시 토론에서는 새 퍼즐과 컴퓨터 사용의 성과를 반기는 의견과, 평가 환경을 바꾼 결과가 평소 업무에 얼마나 옮겨오는지 묻는 의견이 함께 나왔습니다. ARC-AGI 점수의 실행 조건, 단가, 초기의 제한적인 접근이 논점이었습니다. Artificial Analysis 지표와 OpenAI의 다른 평가가 어떻게 양립하는지 묻는 댓글도 있습니다. GeekNews의 해당 HN 의견 요약에는 지능 지표가 GPT-5.6과 거의 같다는 지적이 담겼습니다. 댓글의 기대나 의심은 벤치마크 검증 결과와 구분해 읽습니다.
출시 뒤 사례로는 오래 미해독 상태였던 에니그마 메시지를 풀었다는 사용자 기록과 검증이 나왔습니다. 암호 연구자의 검증 기록과 후속 Hacker News 토론을 함께 볼 수 있습니다. 전문 작업의 가능성을 보여 주는 개별 사례이며 일반적인 암호 해독 성능이나 업무 성공률은 별도 평가로 봅니다.
GeekNews 출시 글의 댓글에는 모델이 빨리 열리기를 바라는 반응과 제한적 접근에 대한 아쉬움이 나왔습니다. 이번에 확인한 국내 토론에는 한국어 품질을 체계적으로 비교한 후기가 드물었습니다. 해외 코딩·과학 점수와 국내 한국어 업무 품질을 연결하려면 같은 자료로 비교한 결과가 더 필요합니다.
우리가 써 본 범위는 어디까지일까요?
이 블로그의 운영에서는 어려운 검수와 장기 도구 작업에 Astra를 쓰는 선택지를 두고 있습니다. 다만 이 글에서 비교할 동일 과제·동일 설정의 사용량과 청구액 기록은 확보하지 못했습니다. 그래서 위 비용은 공식·독립 평가와 요금 계산 예시로 구분했습니다.
독자가 비교할 때는 같은 자료와 완료 조건을 두 모델에 주고 끝낸 비율·사람이 고친 횟수·걸린 시간·실제 사용량을 나란히 기록하면 됩니다. 답변 한 번의 길이보다 도구 실행과 재시도까지 포함한 작업 전체를 비교하는 방식입니다.
솔·루나와 어떻게 나눠 쓰면 될까요?
OpenAI는 Astra를 가장 어려운 추론·코딩·전문 업무, GPT-6.1 Sol을 성능·속도·비용의 균형, Luna를 범위가 명확한 대량 작업에 맞춘 모델로 안내합니다. 9월 29일 솔 후속 모델이 나오면서 어려운 일이면 무조건 Astra를 고르는 것보다 새 솔을 기준으로 비교할 이유가 생겼습니다. (GPT-6 모델 선택 · GPT-6.1 Sol 발표)
- Astra: 오래 막힌 디버깅, 복잡한 도구 흐름, 실패하면 다시 하는 비용이 큰 분석을 비교합니다. 적은 재시도로 끝나는지가 관건입니다.
- GPT-6.1 Sol: 반복적인 개발·조사·전문 업무의 기준으로 두고 결과가 부족한 구간을 Astra와 비교합니다. 입력·출력 단가는 Astra의 5분의 1입니다.
- GPT-6 Luna: 짧은 자료의 분류·추출·요약처럼 범위가 명확한 대량 작업에서 먼저 비교합니다. 표준 입력·출력 단가는 Astra의 100분의 1입니다.
가격 근거: OpenAI 가격표. 필요한 품질을 얻는 설정에서 성공한 작업의 비용을 비교하면 선택이 쉬워집니다.
함께 읽기
- GPT-6.1 Sol 출시: Astra에 가까운 성능, 비용은 얼마나 줄까 — 매일 쓰는 솔을 바꿀 때 확인할 성능·가격 비교입니다.
- OpenAI: GPT-6 Sol·Luna 발표 — 9월 22일 추가된 두 모델의 역할과 제공 경로를 설명합니다.
참고한 자료
아래 자료는 2026년 9월 30일 확인했습니다. 발표일은 9월 3일, 첫 발행일은 9월 28일이며 9월 29일 GPT-6.1 Sol 후속 발표를 반영했습니다.
- OpenAI: GPT-6 Astra 발표·평가·비용 비교
- OpenAI: Astra 안전 개요
- OpenAI Deployment Safety Hub
- Astra API 사양·지원 도구
- API 가격표
- 추론 모델·effort·mode·토큰 안내
- GPT-6 기능·프롬프트·마이그레이션 안내
- GPT-5.6 Sol 사양
- GPT-6 Sol·Luna 발표
- GPT-6.1 Sol 발표
- Work·Codex의 Astra 사용량과 속도 옵션
- Artificial Analysis: Astra 독립 평가, 9월 9일
- Hacker News 출시 토론 · 에니그마 후속 토론
- GeekNews 출시 글
- Crypto Cellar: 에니그마 해독 검증