AI 에이전트 시대 개막! 구글, 코딩 자체를 버리고 ‘제미나이 3.6 플래시’ 정체 공개
AI 에이전트 시대 개막! 구글, 코딩 자체를 버리고 '제미나이 3.6 플래시' 정체 공개

구글이 AI 에이전트 시장을 정조준했다.
코딩 성능 경쟁에서 한 발 물러선 만큼, 실제 업무 현장에서 에이전트를 돌리는 비용과 속도를 끌어내리는 데 방점을 찍었다. 새 플래시(Flash) 시리즈 모델 두 종을 동시에 공개하면서다. 업계는 이번 행보가 생성형 AI 시장의 무게중심이 최고 지능 경쟁에서 운영 효율 경쟁으로 넘어가고 있음을 보여주는 신호로 읽는다.
먼저 제미나이 3.6 플래시다. 이 모델은 거대 언어 모델의 핵심 성능인 추론 능력 극대화를 일부러 좁히고, 대신 토큰 효율과 응답 속도, 운영비 절감을 한꺼번에 끌어올렸다. 동일 작업을 더 적은 연산으로 처리하도록 내부 추론 단계와 도구 호출 횟수를 줄였고, 결과적으로 한 번 응답을 만들 때 들어가는 비용 자체를 낮췄다.
독립 AI 평가기관 아티피셜 애널리시스의 분석에 따르면 제미나이 3.6 플래시는 직전 모델 대비 출력 토큰 사용량을 17% 절감했고, 소프트웨어 엔지니어링 역량을 측정하는 ‘딥SWE’ 벤치마크에서는 최대 65%까지 토큰 소모를 줄였다. 멀티모달 이해와 문서 분석, 지식 기반 업무 능력은 오히려 업그레이드됐다. 개발자 입장에서는 동일 품질을 더 싼 값에 얻게 됐다는 의미다.
가격도 함께 내려갔다. 공개된 API(응용 프로그래밍 인터페이스) 책정에 따르면 입력 토큰 100만 개당 1.50달러(약 2천 원), 출력 토큰 100만 개당 7.50달러(약 1만 원)다. 직전 세대 출력 가격인 9달러와 비교하면 16% 이상 저렴해진 수치다. 토큰 사용량 감소와 단가 인하가 동시에 적용되면서, 에이전트를 대규모로 굴리는 기업 고객의 비용 곡선이 크게 눌릴 것으로 보인다.
성능 향상의 폭도 만만치 않다. 딥SWE에서는 37%에서 49%로 점프했고, 머신러닝 연구 역량을 평가하는 ‘MLE’ 벤치에서는 63.9%를 찍어 직전 세대(49.7%)를 14%포인트 이상 앞질렀다. 컴퓨터 조작 능력을 보는 ‘OS월드-베리파이드’에서는 83.0%, 지식 기반 업무 평가인 ‘GDPval-AA v2’에서는 1421점을 기록하며 전 세대를 일제히 추월했다.
다만 종합 지능에서는 프론티어급 모델과 명확한 격차가 있다. 아티피셜 애널리시스 지능 지수(AAII) 50점은 메타의 ‘뮤즈 스파크 1.1′(51점)에조차 1점 모자란 결과다. 코딩 역량도 아쉽다. ‘SWE-벤치 프로’와 ‘터미널 벤치’, 딥SWE 모두에서 ‘GPT-5.6 루나’와 ‘클로드 소네트 5’, ‘그록 4.5’에 밀렸다. 반면 컴퓨터 사용 능력과 차트 해석(CharXiv 리즈닝), 100만 토큰 길이 문맥 처리(GDM-MRCR v2) 부문에서는 모두 1위를 차지했다.
이 결과는 구글의 전략적 선택을 그대로 드러낸다. 최고 지능 1위를 노리기보다, 에이전틱 워크플로우에 가장 잘 맞는 균형점을 찾겠다는 의지다. 실제로 제미나이 API와 제미나이 엔터프라이즈에는 ‘컴퓨터 사용(Computer Use)’ 기능이 기본 도구로 내장됐다. AI 에이전트가 실제 컴퓨터 화면을 보면서 마우스와 키보드를 움직여 업무를 처리하는 시나리오가 표준 옵션이 됐다는 뜻이다.
초기 도입 고객 반응도 긍정적이다. 법률 AI 트업 하비(Harvey)와 기업 데이터 분석 기업 헤비아(Hebbia)는 문서 분석, 차트 해석, 데이터 가공, 보고서 작성 과정에서 체감 성능이 뚜렷이 좋아졌다고 밝혔다. 반복적이고 대량의 문서를 처리해야 하는 업무에서 비용 대비 효율이 가장 크게 개선됐다는 평가다.
안전장치도 한 단계 강화됐다. 제미나이 3.6 플래시에는 화학·생물학·방사능·핵(CBRN) 무기 개발과 사이버 공격 악용을 사전에 막기 위한 ‘프론티어 세이프티(Frontier Safety)’ 보호 체계가 새로 적용됐고, 사용자가 안전 가드레일을 우회하려는 탈옥 공격에 대한 저항성도 함께 높였다.
함께 공개된 제미나이 3.5 플래시-라이트는 초고속·저가형 라인업이다. 초당 350개 출력 토큰을 생성하며, 입력 100만 개당 0.30달러, 출력 100만 개당 2.50달러에 이용할 수 있다. 전체 가격표에서 가장 싼 모델로 분류된다. 직전 세대인 제미나이 3.1 플래시-라이트와 비교하면 코딩과 장문 처리 능력이 크게 끌어올랐고, 일부 벤치마크에서는 상위 모델인 제미나이 3 플래시를 오히려 앞서는 결과도 나왔다. SWE-벤치 프로 54.2%, OS월드-베리파이드 74.0%는 출시 시점 기준 가성비 모델 중 최상위권이다.
개발자는 업무 성격에 따라 사고(thinking) 단계를 세 단계로 나눠 쓸 수 있다. 최소(Minimal), 낮음(Low), 높은(Higher). 대규모 문서 일괄 처리나 AI 검색처럼 고속·저비용이 필요한 작업은 최소 또는 낮음으로 두고, 복잡한 다단계 의사결정이 필요한 업무에만 높은 단계를 적용하면 된다. 동일 모델을 토큰 단가 차등 없이 쓰는 방식보다 전체 운영비를 훨씬 정밀하게 조절할 수 있다.
이번 발표에서 눈에 띈 건 차세대 주력 모델로 주목받던 ‘제미나이 3.5 프로‘가 함께 공개되지 않았다는 점이다. 구글이 밝힌 바에 따르면 현재 파트너사들과 실 테스트를 진행 중이며, 준비가 마무리되는 대로 일반에 공개한다는 입장이다. 동시에 차세대 모델 ‘제미나이 4’는 이미 사전학습 단계에 들어갔다는 사실도 함께 공개됐다. 최고 지능 트랙을 잠시 멈춰 두면서 운영 효율 트랙을 전면에 세운 형태다.
업계는 이번 결정을 시장 환경 변화의 연장선으로 본다. AI 토큰 비용이 기업의 핵심 비용 항목으로 부상하면서, 추론 성능 1점之争보다 단가와 응답 속도 차별화가 실질적인 매출 변수로 자리 잡았다는 분석이다. 저가·고속 모델로 에이전트 시장을 먼저 선점하고, 그 위에 차세대 플래그십을 얹겠다는 구상이다. 모델 라인업 전체를 작업 유형별 맞춤화하는 흐름이 본격화되는 모습이다.
결국 이번 발표는 단순한 신규 모델 출시가 아니다. AI 시장이 ‘더 똑똑한 모델’에서 ‘더 싸고 더 빠르게 굴러가는 모델’로 무게중심을 옮기는 과정에서, 구글이 어느 쪽에 먼저 배팅할지 명확히 선언한 행보다. 코딩 1점보다 운영 효율 1점, 지식 한계보다 비용 절감, 지능 격차보다 에이전트 체감 성능의 가치를 선택한 결과다.
Justin Parker


댓글 0
첫 댓글을 남겨보세요.