OpenAI가 9월 3일 GPT-6 Astra(아스트라)를 공개했습니다. 자료 조사, 코드 작성, 브라우저 조작처럼 여러 단계를 이어서 맡기는 일에 초점을 맞춘 모델입니다. 9월 22일에는 더 저렴한 GPT-6 Sol(솔)과 Luna(루나)가 뒤따라 나왔습니다.

  • 아스트라: 한 번에 제대로 끝내야 하는 어려운 일. 가장 비쌉니다.
  • 솔: 코딩과 복잡한 업무를 여러 번 반복하는 일.
  • 루나: 요약·분류처럼 목적이 분명한 대량 작업. 가장 쌉니다.

출시 3주 동안 아스트라는 수십 년 된 암호를 스스로 풀어 화제가 됐고, 독립 평가에서는 비싼 단가에 비해 작업당 비용이 낮게 나왔습니다. 반면 벤치마크 점수가 과장됐다는 의심과, 초기에 일부 조직에만 열려 기다려야 했다는 불만도 나왔습니다.

세 모델, 무엇이 다른가

모델 공개일 잘 맞는 일 API 입력 / 출력 (100만 토큰당)
GPT-6 Astra 9월 3일 여러 도구를 쓰는 어려운 작업, 긴 분석과 검수 $10 / $50
GPT-6 Sol 9월 22일 코딩과 복잡한 업무의 반복 $2 / $10
GPT-6 Luna 9월 22일 요약·분류 같은 대량 작업 $0.10 / $0.50

가격은 OpenAI API 가격표의 짧은 입력 기준입니다. 입력이 길면 요금이 약 두 배가 됩니다.

같은 일에 입력 10만 토큰, 출력 2만 토큰을 쓴다고 하면 아스트라 $2.00, 솔 $0.40, 루나 $0.02입니다. 다만 모델마다 답을 만드는 데 쓰는 토큰 수가 달라서, 실제 작업 비용 차이는 아래 독립 평가에서 보듯 이 비율보다 작아지기도 합니다.

성능은 어느 정도인가 (9월 28일 기준)

Artificial Analysis 종합 평가: 아스트라의 최대 추론 설정은 Intelligence Index 53점으로, 같은 시점 최고였던 Claude Fable 5.1과 공동 1위였습니다. 문제 하나를 푸는 데 든 비용은 아스트라 $3.26, Fable 5.1 $7.63이었습니다. 같은 점수를 절반 이하 비용으로 낸 셈인데, 비결은 출력 토큰입니다. 아스트라는 문제당 약 2만 7천 토큰을 써서 Fable 5.1(약 7만 8천)의 3분의 1 수준이었습니다. (Artificial Analysis, 9월 9일)

같은 평가에서 눈에 띄는 점이 두 가지 더 있습니다.

  • 환각이 크게 줄었습니다. 모르는 것을 지어내는 비율이 이전 GPT-5.6 Sol의 92%에서 51%로 내려갔습니다.
  • 글의 완성도는 아쉽습니다. 긴 보고서 평가에서 분석 품질은 올랐지만, 표현 품질은 이전 GPT-5.6 Sol보다 낮게 나왔습니다.

ARC-AGI-3: 처음 보는 퍼즐 게임을 규칙부터 알아내며 푸는 평가입니다. 평가 기관이 만든 기본 도구로는 62.7%, OpenAI가 제공하는 추론 유지 도구를 붙이면 98~99.9%가 나왔습니다. 도구에 따라 점수가 크게 달라졌는데, 99.9%라는 숫자가 먼저 퍼지면서 의심하는 목소리도 나왔습니다. (ARC Prize, 9월 3일)

솔과 루나: 코딩 에이전트 평가에서 솔은 57점으로 이전 세대보다 2점 올랐고, 루나는 41점으로 2점 내려갔습니다. 대신 문제당 비용이 솔 $1.06, 루나 $0.07로 이전 세대보다 절반 안팎으로 싸졌습니다. (Artificial Analysis, 9월 22일)

3주 동안 나온 반응 (9월 28일 기준)

에니그마 암호를 혼자 풀었습니다. 1941년 독일군이 보낸 에니그마 메시지 하나가 2005년부터 아무도 풀지 못한 채 남아 있었습니다. 한 사용자가 아스트라에게 "공개된 미해독 에니그마 메시지 중 풀 수 있는 게 있는지 보라"고만 지시했고, 아스트라는 에니그마 모의 장치 프로그램을 직접 짜고 독일 기록 보관소 자료까지 뒤져 이틀 만에 풀었습니다. 이를 검증한 암호 연구자는 사람이라면 몇 주에서 몇 달 걸릴 일이라고 적었습니다. (검증 기록 · Hacker News 토론, 735점) 비슷한 시기 1차 세계대전 독일군 무선 암호를 풀었다는 사례도 올라왔습니다. (Hacker News, 400점)

출시 토론은 기대 반, 의심 반이었습니다. Hacker News 출시 토론은 2,200점 넘게 받고 댓글이 2천 개를 넘었습니다.

  • 벤치마크: ARC-AGI-3 점수에 놀라는 댓글이 가장 많았습니다. "평가에 맞춰 튜닝한 것 아니냐"는 의심도 일부 따라붙었습니다.
  • 배포 방식: 첫날은 일부 조직에만 열려서, 기다려야 하는 사용자들의 불만이 이어졌습니다.
  • 가격: 입력 $10, 출력 $50이 비싸다는 반응이 있었습니다.

국내에서는 GeekNews 출시 글에 "아스트라가 빨리 열렸으면 좋겠다"는 댓글과, 아직 쓸 수 없는 계정에 사용 한도 초기화권을 준다는 소식이 올라왔습니다. 한국어 답변 품질을 비교한 후기는 아직 찾기 어렵습니다.

어디서, 어떻게 고를까

아스트라는 ChatGPT의 Plus·Pro·Business·Enterprise와 API에서 쓸 수 있습니다. 조직 계정은 관리자가 모델을 켜야 할 수 있습니다. (OpenAI 발표) 솔과 루나는 같은 유료 요금제와 Edu의 ChatGPT Work·Codex, 그리고 API에서 제공되며, 무료·Go 이용자는 데스크톱 앱에서 루나를 쓸 수 있습니다. 솔과 루나는 일반 Chat 대화에는 아직 들어가지 않았습니다. (OpenAI 발표)

고르는 순서는 이렇게 잡으면 됩니다.

  • 계약서 검토나 복잡한 개발처럼 실패하면 다시 하는 비용이 큰 일은 아스트라부터 시험합니다.
  • 코드를 계속 고치고 검증하는 일은 솔을 기준으로 삼고, 어려운 구간만 아스트라와 비교합니다.
  • 짧은 자료를 대량으로 분류하거나 요약한다면 루나를 쓰고, 결과 일부를 뽑아 확인합니다.

같은 일을 두 모델에 맡겨 끝낸 비율, 사람이 고친 횟수, 걸린 시간, 실제 사용량을 비교하면 어느 쪽이 싼지 바로 보입니다.

참고한 자료

가격, 이용 범위, 평가, 반응은 2026년 9월 28일에 확인했습니다.