제미나이 4 Argon을 기다리는 개발자와 구독자는 성능 발표와 실제 이용 시점을 나눠 보면 다음 선택이 명확해집니다. Google은 2026년 9월 30일 복잡한 코딩·기업 업무·사이버 방어를 겨냥한 Gemini 4 Argon, 한국어로 아르곤을 공개했습니다. 10월 1일 확인한 제공 범위는 신뢰된 사이버 방어자 중심이며, 유료 API 고객과 Google AI Ultra 구독자를 대상으로 한 후속 공개 날짜는 미정입니다. (Google 한국어 발표)

발표 토론에서는 높은 점수에 대한 기대와 함께 “언제 직접 써 볼 수 있는가”라는 아쉬움이 나왔습니다. 공개 전 안전 검증을 지지하는 의견도 있었습니다. 최근 다룬 제미나이 3.8 TTS의 한국어 음성 샘플과 달리, 이번 소식의 판단 근거는 공개 평가와 제공 조건입니다. 두 모델을 구분하면 음성 생성 기능의 출시와 범용 모델 세대의 발표를 혼동하지 않고 읽을 수 있습니다. (Reddit 발표 토론)

한눈에 보기

궁금한 점 이번 발표의 핵심
어떤 모델인가요? 복잡하고 오래 이어지는 코딩·지식 업무·사이버 방어용 프론티어 모델입니다.
무엇이 크게 늘었나요? 출력 토큰 한도를 기존 64K에서 1M으로 늘렸습니다. 입력 한도와 구분합니다.
코딩·업무 성능은 어떤가요? Google 제시 수치는 DeepSWE v1.1 77.9%, AutomationBench 51.3%, LVBench 91.7%입니다.
외부 평가는 어떤가요? Vals Index 68.90%로 1위, 2위 Sonnet 5.5와 1.86포인트 차이입니다. 금융·코딩·법률·세무의 미국 GDP 가중 지수입니다.
API 가격은 얼마인가요? 입력·출력 100만 토큰당 도입가 $2·$10, 도입 기간 뒤 $4·$20입니다. 캐시 입력은 입력 단가에서 95% 할인합니다.
추론 강도와 기본값은요? 이용자용 설정·기본값은 후속 문서에서 확인할 항목입니다.
지금 누구에게 제공하나요? 초기 Fairwind Program의 신뢰된 사이버 방어자에게 순차 제공합니다.
일반 공개는 언제인가요? 유료 API 고객·Google AI Ultra부터 확대할 예정이며 날짜는 미정입니다.
한국에서도 쓸 수 있나요? 한국 제공 여부, API 리전·가입 경로, Google AI Pro 포함 여부는 미정입니다.
주의할 조건은요? 제한 제공 단계의 보안 설정과 광범위 공개 전 강화할 안전장치를 구분합니다.

이용 범위·가격·출력 한도는 Google 발표를, 종합 점수와 시험당 비용은 Vals AI의 별도 평가를 따릅니다. 코딩·영상·보안 점수와 사내 활용 효과는 Google이 제시한 결과입니다. 아래 가격 예시는 공개 단가에 가정한 토큰 수를 곱한 계산이며, 실제 청구 기록과 구분합니다. (Google 영문 발표 · Vals Index)

지금 Ultra를 구독하면 Argon을 바로 쓸 수 있나요?

현재 발표된 접근 경로는 Fairwind Program의 초기 사이버 방어자 집단입니다. Google은 실제 환경의 평가와 피드백으로 안전장치를 다듬은 뒤 개발자·기업·소비자로 확대하겠다고 설명했습니다. 유료 API 고객과 Google AI Ultra 구독자는 후속 공개의 첫 대상으로 예고됐습니다. (Google 영문 발표)

쉽게 말하면, 모델이 공개됐다는 소식과 일반 사용자의 선택 목록에 들어왔다는 소식 사이에 시간이 남아 있습니다. 지금 모델을 바꿔 서비스를 운영하려는 개발자에게 중요한 정보는 점수보다 실제 API 접근 권한과 지원 문서입니다. 이번 발표에는 일반 이용자가 따라갈 가입 절차, API 리전 목록, 기존 모델에서 옮길 공식 모델 ID가 제시되지 않았습니다. 접근 방법과 실행 옵션은 실제 API 공개 공지에서 확인할 수 있습니다. (Google 한국어 발표)

한국어 발표가 있다는 점은 국내 독자가 설명을 읽기 편하게 해 줍니다. 한국에서의 제품 제공 여부는 별도의 조건입니다. Google AI Pro에 포함되는지, 한국 Ultra 구독자가 어느 시점에 접근하는지, API가 어떤 지역에서 제공되는지는 이번 발표만으로 확정되지 않았습니다. Argon 하나를 목적으로 구독을 선택한다면, 자신이 사용할 제품의 모델 목록과 제공 공지를 확인한 뒤 결정할 수 있습니다. (Google 한국어 발표)

Google은 미국 정부의 자발적 사전 출시 모델 접근 절차에도 참여한다고 밝혔습니다. 이는 접근을 단계적으로 늘리는 과정에 포함된 절차입니다. 공개 계획을 읽을 때는 “누구부터”와 “언제부터”를 두 항목으로 나누면 발표가 실제로 답한 범위가 드러납니다. (Google 영문 발표)

출력 100만 토큰이면 어떤 작업이 달라지나요?

Google은 출력 한도를 기존 64K, 약 6만 4천 토큰에서 1M, 100만 토큰으로 늘렸다고 설명합니다. 토큰은 모델이 글을 처리하고 생성할 때 쓰는 단위로, 언어와 문장에 따라 글자 수와의 관계가 달라집니다. 여기서 출력은 모델이 만들어 내는 쪽이고 입력은 사용자가 넣어 주는 문서·대화 쪽입니다. “100만 토큰의 자료를 넣는다”는 설명으로 바꾸면 이번 발표의 의미가 달라집니다. (Google 한국어 발표)

한도는 이전의 약 15.6배입니다. Google은 단일 실행 경로에서 깊게 추론하고 수십만 토큰을 생성할 여유가 생겼다고 설명했습니다. 짧은 질문의 답을 길게 늘리는 것보다 여러 단계의 문제를 이어 풀고, 많은 코드를 만들거나 수정하는 작업과 관련이 큽니다. 예를 들어 큰 코드 전환을 맡기는 경우에는 분석·수정·테스트가 이어질 공간이 늘어나는 셈입니다. 이는 출력 규모의 변화에서 해석한 활용 방향이며, 모든 작업이 성공한다는 측정 결과와 구분합니다. (Google 영문 발표)

길게 생성하는 능력에는 비용도 따라옵니다. 공개된 도입 출력 단가만 적용하면 출력 100만 토큰은 $10, 도입 기간 뒤에는 $20입니다. 이는 입력 비용을 뺀 단순 계산입니다. 최대 길이를 매번 사용하는 것으로 예산을 잡기보다 자신의 작업에서 생성되는 양을 기준으로 보면 더 현실적입니다. API의 추론 토큰 청구 방식과 실행 옵션은 후속 문서에서 확인할 항목으로 남아 있습니다. (Google 영문 발표의 가격 각주)

출력 한도와 함께 Google이 강조한 변화는 오래 이어지는 작업에서의 추론 지속성입니다. 다만 이번 발표에는 이용자용 추론 강도 기본값이나 설정 조합이 없습니다. 장기 입력 한도도 이 글의 확정 사양에서 제외했습니다. 지금 독자가 얻을 수 있는 비교는 “얼마나 길게 생성하도록 설계됐는가”와 “어떤 작업에서 점수를 냈는가”입니다. (Google 영문 발표)

코딩·기업 업무·영상 이해에서는 무엇을 평가했나요?

발표는 한 가지 챗봇 점수보다 여러 단계의 실무를 강조합니다. 프론티어 모델은 현재 성능의 선두권을 겨냥하는 모델을 가리키는 표현입니다. 실제로 어떤 일을 잘하는지 보려면 코딩, 업무 실행, 영상 이해처럼 평가 분야를 나눠 보는 것이 유용합니다. 아래 수치와 선두라는 평가는 Google 발표에 귀속합니다. (Google 한국어 발표)

Google이 제시한 평가 점수 발표에서 설명한 대상
DeepSWE v1.1 77.9% 실제 환경의 장기 소프트웨어 엔지니어링 작업
AutomationBench 51.3% 기업 업무의 처음부터 끝까지 이어지는 실행
LVBench 91.7% 긴 영상의 내용 이해
CWE-bench v1 68% 보안 취약점 수정, 공동 1위

코딩에서는 DeepSWE v1.1에서 기록한 77.9% 점수를 내세웁니다. Google은 디버깅, 대규모 코드베이스 전환, 알고리즘 설계에 사내 엔지니어들이 Argon을 사용한다고 설명했습니다. 짧은 함수 하나를 작성하는 문제보다 오래 이어지는 개발 흐름을 강조한 점이 이번 발표의 특징입니다. 이 수치를 다른 코딩 평가와 비교할 때는 v1.1이라는 버전과 장기 작업이라는 평가 대상을 함께 살펴볼 수 있습니다. (Google 영문 발표)

기업 업무에서는 Zapier의 AutomationBench 51.3%, 1위 기록을 제시합니다. 처음부터 끝까지 실행한다는 표현은 답변을 잘 쓰는 능력보다 업무의 여러 단계를 이어 처리하는 능력에 초점을 둡니다. 법률·금융에 대해서는 다단계 금융 리서치를 보는 Vals Finance Agent v2, 법률 리서치와 문서 초안 작성을 보는 Harvey’s Legal Agent Benchmark에서 선도적 결과를 냈다고 설명합니다. 금융·법률 업무의 외부 종합 비교는 아래 Vals Index에서 이어 볼 수 있습니다. (Google 한국어 발표)

시각적 업무에서는 전문 차트 분석, 긴 영상의 세부 내용 파악, 문서를 바탕으로 한 후속 조치를 예로 듭니다. LVBench 91.7% 점수는 그중 긴 영상 이해에 해당합니다. 영상에서 내용을 찾는 성능과 영상 편집·생성을 하는 기능은 서로 다른 항목입니다. 영상 회의나 교육 자료에서 정보를 추출하려는 독자는 이 평가가 자신의 목적과 얼마나 가까운지 볼 수 있습니다. 한국어 회의 내용의 정확도는 이번 발표에서 별도로 제시하지 않았습니다. (Google 영문 발표)

평가별 점수를 하나로 합쳐 “모든 일의 정확도”라고 읽기보다 각 업무와 연결하면 선택에 도움이 됩니다. 코드를 장기간 수정하는 프로젝트는 DeepSWE, 여러 업무 단계를 자동화하는 팀은 AutomationBench, 긴 영상의 내용을 찾아야 하는 작업은 LVBench와 관련이 큽니다. Google이 내세운 강점의 범위는 넓지만, 이번 공개 자료에는 한국어 글쓰기·사실 오류율을 직접 비교할 수치가 따로 없습니다. (Google 한국어 발표)

Vals Index 1위는 한국 업무에서도 같은 의미인가요?

Vals Index는 금융·코딩·법률·세무를 묶어 미국 경제의 비중으로 가중한 외부 평가입니다. 10월 1일 확인한 순위표에서 Argon은 68.90%로 1위였습니다. Google 자체 발표의 코딩 점수와 달리 Vals AI가 게시한 평가 결과라는 점에서 별도 근거가 됩니다. (Vals Index 순위와 방법론)

모델 Vals Index 시험당 비용 표에 적힌 입력·출력 단가/100만 토큰
Gemini 4 Argon 68.90% $15.68 $4 / $20
Claude Sonnet 5.5 67.04% $21.34 $2 / $10
Claude Opus 5.5 66.97% $32.14 $4 / $20
GPT-6 Astra 63.13% $18.46 $10 / $50

Argon과 Sonnet의 차이는 1.86%포인트, Opus와의 차이는 1.93%포인트입니다. Vals는 같은 페이지에서 Sonnet 5.5·Opus 5.5의 표준오차를 약 ±0.9포인트로 적었습니다. 2포인트 남짓한 차이는 순위를 가르기에는 충분하지만 "압도적 격차"로 부르기에는 작은 폭입니다. 같은 날 확인한 페이지의 요약 문단은 아직 Sonnet 5.5와 Opus 5.5가 공동 선두라고 설명하고 있어, 순위표가 요약보다 먼저 갱신된 상태였습니다. 숫자는 종합지수의 순서를 보여 주지만, 어느 모델이 모든 하위 업무에서 우세한지는 구성 평가를 따로 보면 드러납니다. 특히 미국 법률과 세무 문항을 포함하는 지수이므로 국내 세법 상담이나 한국어 계약서 작성의 정확도로 바로 옮기기보다, 전문 업무를 수행하는 능력의 한 단면으로 읽는 것이 맞습니다. (Vals Index)

방법론에서 가중치는 금융 8.0, 코딩 5.6, 법률 1.2, 세무 0.5이며 합계 15.3으로 나눕니다. 이때 코딩은 정보 산업의 GDP 비중을 대리 지표로 씁니다. 각 분야를 똑같이 평균하는 방식보다 금융과 코딩에 큰 비중을 두는 구조입니다. Vals도 경제적 영향을 단순화한 대리 지표라고 설명합니다. 한국의 산업 구성과 법·세금 체계, 개인이 주로 맡기는 일은 이 가중치와 차이가 날 수 있습니다. (Vals 방법론)

여섯 개의 비공개 평가와 두 개의 공개 평가를 결합한다는 점도 해석의 조건입니다. 비공개 문제는 외부에서 같은 문항을 전부 재실행해 대조하는 범위를 좁힙니다. 또한 Vals 페이지는 Sonnet 5.5·Opus 5.5·Fable 5.1의 점수에 제공자가 응답을 거절한 뒤 대체 모델이 처리한 문항이 포함됐다고 밝힙니다. 이 문항을 실패로 세면 Sonnet 5.5는 65.85%, Opus 5.5는 65.05%로 내려갑니다. 그 기준이면 Argon과의 차이는 3포인트 안팎으로 벌어집니다. 표의 점수와 실제로 선택한 한 모델의 행동을 나눠 살피면 이런 조건이 보입니다. (Vals 결과 설명)

표의 시험당 비용은 Vals가 해당 평가에서 측정한 비용입니다. Argon의 $15.68과 입력 $4·출력 $20은 서로 다른 열입니다. 하나는 작업 수행에 든 금액이고 다른 하나는 토큰 단가입니다. 평가에 쓰인 토큰 수와 작업 구성에 따라 결과가 달라지므로, $15.68을 일반 API 호출 한 번의 가격이나 월 구독료로 소개하면 독자의 비용 예상이 어긋납니다. (Vals Index)

흥미로운 점은 단가와 시험당 비용의 순서가 뒤집힌다는 것입니다. Vals 표에서 Argon은 Opus 5.5와 같은 $4·$20 단가로 계산됐는데, 전체 평가에서 쓴 출력 토큰은 약 1억 4,200만 개로 Opus 5.5(약 4억 9,200만 개)와 Sonnet 5.5(약 6억 500만 개)보다 훨씬 적었습니다. 걸린 시간도 46분 33초로 두 모델의 1시간 18~19분보다 짧았습니다. 단가가 Sonnet의 두 배인데도 시험당 비용이 더 낮게 나온 이유가 여기에 있습니다. Vals가 정가 기준으로 계산했다고 보면, 도입가($2·$10)를 적용할 때 같은 토큰 사용량의 비용은 산술적으로 그 절반 수준이 됩니다. 이는 단가 비율로 계산한 추정이며 Vals가 게시한 값은 아닙니다. (Vals Index 토큰·시간 열)

도입 가격과 정가로 계산하면 작업 비용은 얼마인가요?

Google은 도입가 입력 $2·출력 $10, 도입 기간이 끝난 뒤 입력 $4·출력 $20을 안내합니다. 모두 100만 토큰 기준입니다. 캐시 입력은 입력 단가에서 95% 할인한다고 설명했습니다. 도입 기간의 종료 날짜는 공개 문장에서 찾지 못했습니다. 가격이 두 배로 바뀌는 조건을 함께 두면 초기 시험 예산과 장기 운영 예산을 나눠 계산할 수 있습니다. (Google 영문 발표와 각주)

계산 항목 도입가 도입 기간 뒤
입력 100만 토큰 $2 $4
출력 100만 토큰 $10 $20
캐시 입력 100만 토큰 $0.10 $0.20
입력 10만 + 출력 1만 토큰 $0.30 $0.60
입력 10만 전체를 캐시로 처리 + 출력 1만 토큰 $0.11 $0.22

아래 두 행은 가상 작업의 산술 예시입니다. 입력 10만 토큰과 출력 1만 토큰이면 도입가에서 입력 $0.20에 출력 $0.10을 더해 $0.30입니다. 정가에서는 각각 $0.40과 $0.20으로 합계 $0.60입니다. 같은 분량의 작업 100건은 $30과 $60으로 계산됩니다. 환율과 결제 조건을 적용하기 전의 달러 금액이며, 길이·재시도가 같은 상황을 가정했습니다. (단가 근거)

캐시는 반복해서 쓰는 입력을 재사용해 비용을 줄이는 방식입니다. 입력 10만 토큰 전체가 할인 대상이라고 가정하면 도입 입력 비용은 $0.01로 내려가고, 출력 $0.10을 더해 $0.11이 됩니다. 실제로 어떤 입력이 캐시에 들어가고 얼마나 유지되는지, 별도 저장 요금이 있는지는 API 문서가 설명할 운영 조건입니다. 여기의 계산은 발표된 캐시 할인율만 적용한 예시입니다. (Google 영문 발표)

도입가 $2·$10은 Vals 표에 나온 GPT-6.1 Sol, Claude Sonnet 5.5의 표기 단가와 같습니다. 도입 기간 뒤의 $4·$20은 Claude Opus 5.5와 같습니다. 이는 토큰당 요금의 비교입니다. 출력량이 길어지거나 수정 시도가 늘면 같은 단가에서도 완성 작업의 총비용이 달라집니다. Vals의 시험당 비용을 함께 두는 이유도 여기에 있습니다. 저렴한 단가, 높은 평가 점수, 적은 작업 비용은 각각 비교할 수 있는 항목입니다. (Google 가격 안내 · Vals 요금·비용 열)

Google 내부 사례는 어느 정도까지 완료됐나요?

Google이 내세운 사내 사례는 모델의 쓰임을 보여 주지만, 완료 상태가 서로 다릅니다. 관찰된 개선, 적용 뒤 확보한 자원, 앞으로 예상하는 절감량, 검토 중인 전환을 나눠 읽으면 기대치가 구체적으로 바뀝니다. 아래 효과는 회사의 설명이며 별도 독립 측정으로 제시된 결과와 구분합니다. (Google 한국어 발표)

양자 알고리즘에서는 병목이 되는 서브루틴의 시공간 자원, 즉 큐비트 수와 게이트 수를 함께 고려한 자원을 최적화했다고 설명합니다. 한 사례에서 공개된 기준보다 몇 분 만에 40% 개선됐다는 주장입니다. 양자 알고리즘의 특정 자원 최적화 사례로 읽으면 의미가 분명합니다. 비교한 대상은 특정 서브루틴의 자원 효율이며, 일반 답변 속도와는 다른 항목입니다. (Google 영문 발표)

데이터센터에서는 Argon 에이전트 팀이 서버군의 성능 기록을 분석해 메모리 최적화를 찾고 적용했다고 합니다. 배포 뒤 300 TiB 이상을 확보했으며 총절감 예상치는 500 TiB~1 PiB라고 적었습니다. TiB와 PiB는 이진 단위의 메모리 용량입니다. 실제 확보량과 추정 총량을 분리하면 큰 숫자의 상태를 이해하기 쉽습니다. 돈으로 환산한 절감액이나 외부 고객의 비용 개선치는 이 발표에 없습니다. (Google 한국어 발표)

비디오 디코더 libgav1에서는 기존 Rust 이식 버전을 출발점으로 여러 차례 실험하고 컴파일러 출력을 분석했다고 설명합니다. SIMD는 한 명령으로 여러 데이터를 처리하는 방식입니다. Google은 32K줄의 SIMD 코드를 대체하고, 컴파일러가 자동으로 벡터화하도록 안전한 Rust 코드를 작성해 같은 영상 출력을 유지했다고 합니다. 속도는 기존 Rust 버전보다 2.7배 빨라져 최적화된 C++에 가까워졌다는 설명입니다. 비교 기준을 “기존 Rust 버전”으로 남겨 두면 개선의 범위가 보입니다. (Google 영문 발표)

대규모 C/C++→Rust 전환은 re2·libgav1 같은 수만 줄 라이브러리에서 800K줄 이상인 Fuchsia Zircon 커널까지 진행 중이라고 합니다. 이 작업은 자동·수동 감사, 에뮬레이션 테스트, 코드 검토를 거쳐 운영 환경에 배포할 예정입니다. 코드가 생성됐다는 상태와 실제 시스템에 들어갔다는 상태 사이에 검토가 남아 있습니다. 큰 코드 전환을 맡기는 개발팀에는 생성량뿐 아니라 검토·테스트 과정도 함께 제시한 점이 참고가 됩니다. (Google 한국어 발표)

사이버 방어 성능과 가드레일 없는 제공은 어떻게 연결되나요?

Google은 Argon을 취약점 탐지·검증·패치에 쓰도록 학습했다고 설명합니다. CWE-bench v1에서 취약점 수정 68%, 공동 1위를 기록했다고 밝혔습니다. 취약점 발견은 문제가 있는 곳을 찾는 작업이고, 수정은 그 문제를 해결하는 작업입니다. 발표가 두 항목을 따로 설명하므로 한쪽의 점수를 다른 쪽의 정확도로 옮기지 않고 읽을 수 있습니다. (Google 영문 발표)

발견 성능에서는 Google 내부 종합 취약점 평가의 20개 프로그래밍 언어 코드베이스, Wiz 내부 블랙박스 모의 침투 테스트를 소개합니다. 블랙박스는 소스 코드 없이 실행 중인 웹 시스템을 분석하는 조건입니다. Google은 공격 표면 탐색, 취약점 식별, 검증용 개념 증명(PoC) 생성에서 3.8 Flash Cyber보다 나아졌다고 설명합니다. 이 결과에는 공개 수치를 추가하지 않고 평가의 대상과 회사가 밝힌 개선 방향을 남깁니다. (Google 한국어 발표)

Wiz의 Scan for Good은 주요 공공 인프라에서 위험한 노출을 찾아 해결하는 무료 보호 프로그램으로 소개됩니다. Google은 초기 활용에서 기존 모델이 놓친 위험과 병원에서 사용하는 의료 소프트웨어의 개인정보 노출 취약점을 찾았다고 밝혔습니다. 이 사례의 의미는 방어 현장에 먼저 투입한다는 접근에 있습니다. 특정 병원이나 제품의 피해 규모, 취약점 세부 사항은 이번 발표의 공개 범위를 넘어갑니다. (Google 영문 발표)

Google은 신뢰된 사이버 방어자와 사내 팀에 사이버 가드레일 없이 제공한다고 설명합니다. 가드레일은 위험한 요청이나 행동을 제한하는 장치입니다. 방어 업무가 공격 기법 분석과 겹치는 이중 용도라는 배경에서 읽을 수 있습니다. 제공 대상과 사이버 영역이라는 범위를 함께 적으면, 일반 소비자에게 같은 설정을 배포한다는 설명과 구분됩니다. (Google 한국어 발표)

일반 공개 전에 어떤 안전장치를 강화하나요?

Google은 오남용 방지, 간접 프롬프트 인젝션 방어, 의도 불일치 감시, 시스템 보안의 네 영역을 제시합니다. 이는 모델에게 위험한 요청을 거절하도록 하는 것부터 실행 환경을 격리하는 것까지 층을 나눈 접근입니다. Argon에서 얼마나 잘 작동하는지에 관한 평가는 Google 설명에 귀속하며, 일반 사용자의 독립 검증 결과와 구분합니다. (Google 영문 발표)

첫째, 사이버 공격과 화학·생물학·방사능·핵(CBRN) 공격에 대한 악용을 막으면서 정당한 연구를 지원하도록 설계했다고 합니다. 내부 활성화 상태를 관찰해 오용 징후를 포착하는 기술도 강화한다고 설명합니다. 내부 활성화는 모델 안에서 계산되는 신호입니다. 발표는 내부·외부 레드팀이 수동·자동 공격으로 견고성을 시험했다고 적었습니다. 레드팀은 공격자의 관점에서 약점을 찾아 검증하는 팀을 말합니다. (Google 한국어 발표)

이 접근의 배경인 Frontier Safety Framework는 강력한 모델의 심각한 위험을 파악하고 완화하는 Google DeepMind의 체계입니다. 프레임워크가 존재한다는 설명과 특정 모델이 모든 위험을 해결했다는 평가는 별도로 판단합니다. Argon 발표는 이 체계를 따르며 안전장치를 강화 중이라고 설명합니다. (프론티어 안전 프레임워크 안내)

둘째, 간접 프롬프트 인젝션은 웹페이지·문서 같은 외부 자료에 악의적인 지시를 심어 에이전트의 행동을 바꾸려는 공격입니다. 사용자 요청을 수행하려고 읽은 자료가 새 명령처럼 작동하는 문제가 핵심입니다. Google은 자동 레드팀 시험과 적대적 학습을 거쳐 Gray Swan의 Indirect Prompt Injection(IPI) 평가에서 선두를 기록했다고 설명합니다. 글을 읽고 행동하는 에이전트라면 모델의 답변 품질과 함께 살펴볼 항목입니다. (Google 영문 발표)

셋째, 의도 불일치는 모델이 목표를 달성하려다 사용자가 허용한 범위를 벗어나는 상황입니다. Google은 추론 과정과 행동을 감시하고 필요하면 실행을 중단하는 조치를 적용한다고 합니다. 학습 실행을 감시할 때에도 유사한 시스템으로 전담 대응팀에 알림을 보냈다고 설명합니다. 감시 결과를 학습에 다시 넣어 모델이 감시 회피를 배우는 위험을 줄이도록 주의했다는 설명도 덧붙였습니다. (Google 한국어 발표)

넷째, 고위험 학습·평가 전에 샌드박스를 격리하고 봉쇄한다고 밝혔습니다. 샌드박스는 실행 환경의 접근 범위를 제한하는 장치입니다. 모델이 위험한 행동을 덜 하도록 만드는 노력과, 행동이 주변 시스템에 미치는 영향을 제한하는 설계가 함께 들어갑니다. Google의 AI Control Roadmap도 사내의 강력한 에이전트를 관리하는 시스템 차원의 접근을 설명합니다. (Argon 발표 · 에이전트 제어 로드맵 안내)

기대와 불만은 어디에 모였나요? — 반응 (2026-10-01 기준)

Reddit r/GeminiAI 발표 토론에서는 제한된 사이버 방어자 제공과 공개 일정 부재를 아쉬워하는 의견이 나왔습니다. Ultra 다음에 일반 구독자도 사용할 수 있는지 묻는 반응도 있었습니다. 모델 발표에 관심을 가진 이용자의 기대와 구독 범위에 대한 질문이며, Argon을 직접 사용한 장기 후기와 구분합니다.

일부는 좋은 벤치마크 결과가 나와도 실제 이용자가 검증하는 과정이 중요하다고 봤습니다. 반대로 넓게 공개하기 전에 안전을 검증하는 접근을 지지하는 의견도 있었습니다. 같은 제한 공개를 두고 접근 지연으로 보는 시각과 검증 과정으로 보는 시각이 함께 나온 셈입니다. 이 의견은 커뮤니티의 평가로 소개합니다. (같은 Reddit 토론)

Hacker News 발표 토론은 출처 사본을 받은 시점에 1,384점·891댓글이었습니다. 댓글은 Argon 자체보다 Google의 코딩 도구 Antigravity 이야기로 많이 흘렀습니다. Fable 5.1·Opus 5.5와 함께 Gemini 3.8 Flash를 섞어 쓰는데 글쓰기·프런트엔드·서버 관리에서 뒤지지 않는다는 호평이 있었습니다. 반면 Antigravity가 대화를 약 25만 토큰에서 자동 압축해, API로는 100만 토큰 문맥을 쓸 수 있는 모델을 도구 안에서 제한한다는 불만도 나왔고, 몇 달 써도 그런 압축을 본 적이 없다는 반박도 달렸습니다. Google의 도구에 묶이는 것이 싫어 Ultra 구독을 해지했다는 댓글도 있었습니다. 이 경험들은 기존 모델과 도구에 관한 것입니다. 그래도 Ultra로 Argon을 쓰게 되더라도 어떤 도구 안에서 어떤 한도로 쓰는지가 체감 성능을 좌우할 수 있다는 점은 참고할 만합니다.

국내에서는 GeekNews에 Argon 발표가 소개됐습니다. 확인한 자료에서 한국어 Argon 직접 사용 후기는 찾지 못했습니다. 한국어 성능과 국내 접근성은 지금 확보된 평가에서 별도로 답이 필요한 부분으로 남습니다.

기존 Gemini 사용자라면 무엇을 확인하며 기다리면 좋을까요?

지금은 사용하는 Gemini 제품을 유지하면서 Argon의 실제 제공 공지를 확인하는 단계입니다. API 개발자는 접근 권한, 모델 ID, 입력·출력 제한, 추론 옵션, 도입가 종료 시점을 한 묶음으로 확인하면 전환 비용을 계산하기 편합니다. 구독자는 자신의 요금제와 국가에서 모델이 제공되는지 살펴보면 됩니다. 이 항목들은 이번 발표의 미정 사항에서 뽑은 선택 기준이며, 아직 공개되지 않은 설치 절차를 대신하지 않습니다. (Google 영문 발표)

코딩 팀이라면 대표 작업을 정해 두는 것도 도움이 됩니다. 작은 버그 수정, 여러 파일의 기능 변경, 언어 전환처럼 실제로 맡길 일을 나누고 완료 여부·검토 시간·총비용을 함께 비교할 수 있습니다. 긴 출력이 유리한 작업과 짧은 답변으로 충분한 작업을 나눠 두면, 모델이 제공됐을 때 “높은 순위”보다 “우리 작업에서 달라진 것”을 확인하기 쉽습니다. 이는 공개 평가의 서로 다른 목적을 바탕으로 제안하는 비교 방법입니다. (Vals 방법론)

음성 콘텐츠를 만드는 독자는 제미나이 3.8 TTS 글에서 실제 한국어 샘플과 음성 API의 조건을 먼저 확인할 수 있습니다. Argon은 복잡한 추론·코딩·업무 수행의 새 선택지로 발표됐고, 3.8 TTS는 대본을 읽는 음성 생성 모델입니다. 원하는 결과물이 음성인지, 코딩·문서 업무의 수행인지에 따라 확인할 제품과 비교 항목이 달라집니다.

참고한 자료

확인일은 2026년 10월 1일입니다. 발표 사건일은 9월 30일이며, 점수·가격·제공 범위는 위 기준일의 공개 내용을 담았습니다.