그록 4.6 출시, 가격 안 올리고 프런티어 잡았다

그록 4.6이 지난 12일(현지시간) 공개됐습니다. 스페이스X 산하로 재편된 SpaceXAI(구 xAI)가 내놓은 이번 모델은, 가격을 한 푼도 안 올리고 GPT-5.6 Sol과 동급 점수에 도달했다는 점에서 발표 문구보다 숫자가 더 시끄러운 출시입니다. 무슨 일이 있었는지 하나씩 뜯어보겠습니다.

그록 4.6, 뭐가 어떻게 달라졌나

먼저 짚고 갈 부분이 있습니다. 그록 4.6은 바닥부터 새로 학습한 모델이 아닙니다. 전작인 그록 4.5를 기반으로 한 후훈련(post-training) 업그레이드입니다. 보충 학습을 더 길게 돌리고, 지도 미세조정 데이터를 다시 생성하고, 에이전트 환경에서의 강화학습을 집중적으로 얹은 결과물입니다.

그록 4.6 출시, 가격 안 올리고 프런티어 잡았다
(사진: basenor.com)

새 모델이 아니라 후훈련 업그레이드

공식 발표를 보면 초점이 명확합니다. 오래 돌아가는 에이전트 작업, 코딩, 여러 단계를 거치는 대화형·시각 작업. 요즘 프런티어 모델들이 전부 달려가는 바로 그 방향입니다. 기반 모델을 키우는 대신 후훈련으로 격차를 좁혔다는 점이 이번 출시의 기술적 핵심인데, 이게 생각보다 의미가 큽니다. 같은 몸에 훈련만 바꿔서 5점을 끌어올렸다는 뜻이니까요.

벤치마크 숫자로 보는 그록 4.6의 위치

Artificial Analysis 지능 지수에서 그록 4.6은 61점을 받았습니다. GPT-5.6 Sol Max와 정확히 동점이고, 1위인 Fable 5 Max(62점)와는 딱 1점 차이입니다. 전작 그록 4.5가 56점이었으니 후훈련만으로 5점을 올린 셈입니다.

그록 4.6 출시, 가격 안 올리고 프런티어 잡았다
(사진: kie.ai)

더 흥미로운 건 실무 능력을 평가하는 GDPVal-AA v2입니다. 여기서는 그록 4.6이 1,753점으로 아예 1위를 차지했습니다. Fable 5 Max(1,741)와 GPT-5.6 Sol Max(1,728)를 모두 제쳤습니다.

모델지능 지수(AAI)GDPVal-AA v2
Fable 5 Max621,741
그록 4.6611,753
GPT-5.6 Sol Max611,728
그록 4.5 (전작)56—

숫자 뒤에 숨은 조건 하나

근데 한 가지 의문이 듭니다. 이번 비교는 그록 4.6의 기본 설정을 경쟁 모델의 최대 설정과 붙인 결과라는 조건이 달려 있습니다. 자사에 유리한 세팅으로 잰 숫자일 가능성을 배제할 수 없다는 뜻입니다. 벤치마크 발표는 언제나 그 조건까지 읽어야 절반이라도 믿을 수 있습니다.

진짜 무기는 가격표

솔직히 저는 이번 발표에서 점수보다 가격표가 더 무섭다고 봤습니다. 그록 4.6의 API 가격은 전작과 완전히 동일합니다.

  • 입력 100만 토큰당 2달러, 출력 6달러 (20만 토큰 이하 요청)
  • 캐시된 입력은 100만 토큰당 0.5달러
  • 20만 토큰을 넘는 요청은 입력 4달러, 출력 12달러

SpaceXAI는 동급 경쟁 모델 대비 비용이 60%가량 낮다고 주장합니다. 성능을 올리면서 가격을 동결하는 이 흐름, 어디서 본 그림입니다. 클로드 오퍼스 5가 반값으로 치고 나왔을 때와 똑같은 전략입니다. 프런티어 경쟁이 성능 싸움에서 단가 싸움으로 넘어가고 있다는 신호입니다.

500K 컨텍스트, 에이전트에 올인한 방향

그록 4.6은 50만 토큰 컨텍스트를 지원하고 텍스트와 이미지 입력을 받습니다. 출시와 동시에 SpaceXAI API(grok-4.6), Cursor, Grok Build, OpenRouter에서 바로 쓸 수 있습니다. 발표 자료 전체가 장시간 에이전트 작업에 맞춰져 있는데, 이건 업계 전체의 방향이기도 합니다.

다만 에이전트에 올인할수록 안전 문제도 같이 커집니다. GPT-5.6이 평가 도중 샌드박스를 탈출했던 사건이 불과 3주 전입니다. 오래 돌아가는 에이전트일수록 예상 밖 행동의 표면적도 넓어진다는 걸 이미 봤습니다.

직원 데이터로 학습시키겠다는 머스크

출시와 같은 주에 나온 소식이 하나 더 있습니다. 머스크가 전사 회의에서 스페이스X의 모든 데이터, 그러니까 1만 4천여 명의 직원이 만들어내는 업무 결과물을 차기 그록 학습에 쓰겠다고 밝힌 것입니다. “AI가 여러분의 생각과 아이디어를 물려받을 것”이라는 표현까지 썼습니다.

그록 4.6 출시, 가격 안 올리고 프런티어 잡았다
(사진: teslarati.com)

문제는 어떤 데이터를 어떻게 수집하는지, 직원이 거부할 수 있는지가 전혀 공개되지 않았다는 점입니다. 비슷한 시도였던 메타의 사내 데이터 학습 프로젝트는 두 달 만에 직원 대화와 인사 데이터가 노출되면서 중단됐습니다. 반도체 공장까지 직접 짓겠다는 머스크의 수직 통합 야심이 이제 직원의 머릿속까지 향하고 있는 셈인데, 이 부분은 좀 불편하게 느껴지는 게 사실입니다.

제 생각은 이렇습니다

벤치마크 1~2점 차이는 이제 큰 의미가 없다고 봅니다. 상위권 모델은 사실상 한 덩어리가 됐고, 승부는 가격과 툴 생태계, 그리고 신뢰에서 갈립니다. 그록 4.6이 무서운 건 점수가 아니라 “같은 가격, 더 높은 성능”을 후훈련만으로 만들어냈다는 속도입니다.

제 예상은 이렇습니다. 연말까지 프런티어 3사 모두 가격을 한 번 더 내리거나 동결한 채 성능만 올리는 릴리스를 반복할 겁니다. 사용자 입장에서는 축제지만, 적자를 견디는 체력 싸움이 시작됐다는 뜻이기도 합니다. 그리고 그 체력의 원천이 직원 데이터든 뭐든 일단 끌어다 쓰는 회사가 나오기 시작했다는 게, 이번 주의 진짜 뉴스라고 생각합니다.

마무리

정리하면 이렇습니다. 그록 4.6은 후훈련 업그레이드만으로 GPT-5.6 Sol과 동점, 실무 벤치마크 1위, 가격은 동결. 숫자만 보면 흠잡을 데 없는 출시입니다. 다만 벤치마크 측정 조건과 직원 데이터 학습 계획은 계속 지켜볼 부분입니다.

여러분은 어떻게 보시나요? 그록 4.6, 실제 업무에 써볼 만하다고 생각하시는지 댓글로 알려주세요. 다음에도 하루 만에 서열이 바뀌는 AI 소식을 빠르게 정리해 드리겠습니다.


댓글 남기기