OpenAI 할라피뇨(Jalapeño)의 첫 성능 측정 결과가 8월 25일 공개됐습니다. 자체 설계한 추론 전용 칩이 엔비디아 GB300보다 와트당 처리량은 최대 1.9배 높고, 응답 지연은 최대 3.6배 짧았다는 내용입니다. 그런데 이 숫자를 그대로 믿어도 되는 걸까요.
목차
- OpenAI 할라피뇨, 무엇이 공개됐나
- 벤치마크 숫자를 하나씩 뜯어보면
- 700W 대 1,400W, 전력이 진짜 승부처입니다
- 9개월 만의 테이프아웃, 칩을 설계한 건 AI였습니다
- 그런데 이 비교, 공정한 걸까요
- 엔비디아의 반론과 시장의 계산
- OpenAI 할라피뇨가 바꿀 1년 뒤 풍경
- 자주 묻는 질문
OpenAI 할라피뇨, 무엇이 공개됐나
OpenAI 할라피뇨는 OpenAI가 브로드컴과 함께 설계한 첫 자체 추론 가속기입니다. TSMC 3나노 공정으로 제조되며 정격 전력은 700W, 실제 측정된 지속 전력은 550W 이하였다고 회사는 밝혔습니다. 학습이 아니라 추론(inference), 즉 이미 만들어진 모델이 사용자 요청에 답하는 단계에 초점을 맞춘 칩입니다.

측정에 쓰인 도구는 반도체 분석사 세미애널리시스(SemiAnalysis)의 공개 벤치마크 InferenceX입니다. 단순 연산 성능이 아니라 요청 하나가 들어와서 답이 완성돼 나갈 때까지의 전체 파이프라인을 처리량·전력·지연 시간 세 축으로 동시에 잰다는 점이 특징입니다. 테스트 모델은 GPT-OSS 120B, DeepSeek R1 670B, Kimi K2.5 1T 세 가지로, 모두 OpenAI 바깥에서도 검증 가능한 공개 가중치 모델입니다. 자사 모델만 골라 유리하게 잰 게 아니라는 점은 짚어둘 만합니다.
공식 자료는 OpenAI 뉴스룸의 Jalapeño 첫 결과 발표에서 원문 그대로 확인할 수 있습니다.
벤치마크 숫자를 하나씩 뜯어보면
OpenAI 할라피뇨가 내세운 대표 수치는 세 모델 전반에서 와트당 처리량 1.5~1.9배, 종단 지연 1.7~3.6배 단축입니다. 상호작용이 잦은 워크로드에서는 성능 격차가 2.1~4.1배까지 벌어졌다고 합니다.

모델별로 나눠 보면 상대가 달라집니다. 아래 표가 공개된 수치를 정리한 것입니다.
| 테스트 모델 | 비교 대상 | kW당 최대 처리량 | 종단 지연 |
|---|---|---|---|
| GPT-OSS 120B | GB200 (1,200W) | 85,448 vs 44,960 (약 1.9배) | 1.03초 vs 1.80초 |
| DeepSeek R1 670B | GB300 (1,400W) | 19,641 vs 11,781 (약 1.7배) | 1.65초 vs 5.99초 |
| Kimi K2.5 1T | GB300 (1,400W) | 18,195 vs 11,862 (약 1.5배) | 1.56초 vs 5.31초 |
지연 시간 격차가 더 눈에 띕니다
개인적으로 인상적이었던 쪽은 처리량보다 지연 시간입니다. DeepSeek R1에서 5.99초가 1.65초로 줄었다는 건 체감 반응 속도가 완전히 달라진다는 뜻입니다. 특히 여러 단계를 순차적으로 밟는 에이전트 작업에서는 한 단계의 지연이 뒤로 계속 누적되기 때문에, 이 차이가 최종 작업 완료 시간에서는 훨씬 크게 벌어집니다.
‘이전 최고 속도에서의 처리량’이라는 항목
발표 자료에는 기존 시스템이 낼 수 있던 최고 토큰 속도를 기준선으로 잡고 같은 속도에서 처리량을 비교한 항목도 있는데, 여기서는 53배에서 104배까지 차이가 납니다. 다만 이건 기존 시스템이 한계점에서 효율이 급격히 무너지는 구간을 잡은 수치라, 일상적인 운영 조건의 격차로 읽으면 과장이 됩니다. 마케팅적으로 가장 화려한 숫자이면서 가장 조심해서 봐야 할 숫자라고 생각합니다.
700W 대 1,400W, 전력이 진짜 승부처입니다
이번 발표에서 반복적으로 강조된 기준은 ‘칩 한 장당’이 아니라 ‘전력 1kW당’입니다. OpenAI 할라피뇨는 700W이고 비교 대상인 GB300은 1,400W입니다. 칩 하나만 놓고 절대 성능을 재면 이야기가 달라질 수 있지만, 데이터센터를 짓는 입장에서는 전력이 곧 제약 조건입니다.

이 대목은 최근 흐름과 정확히 맞물립니다. AI 데이터센터의 병목은 이미 GPU 물량이 아니라 전력과 메모리로 넘어갔습니다. 실제로 메모리 가격 상승이 GPU 가격에 그대로 전가되는 상황은 엔비디아 가격 인상 15%, 범인은 메모리였다에서 이미 짚어본 적이 있습니다. 같은 전력으로 두 배 가까운 일을 처리할 수 있다면, 부지와 변전 설비를 새로 확보하지 않고도 서비스 규모를 키울 수 있다는 뜻입니다.
OpenAI가 지난해 10월 브로드컴과 맺은 계약 규모가 10기가와트 수준이라는 점을 떠올리면, 와트당 효율 1.5배는 회계상 수천억 원대의 차이로 환산됩니다. 이게 이번 발표의 진짜 메시지에 가깝다고 봅니다.
9개월 만의 테이프아웃, 칩을 설계한 건 AI였습니다
기술적으로 더 흥미로운 부분은 따로 있습니다. 초기 설계부터 테이프아웃까지 걸린 기간이 9개월이라는 점입니다. 통상 신규 아키텍처 ASIC은 2년 안팎이 걸립니다.
OpenAI는 자사 모델을 설계 루프에 직접 투입했다고 설명합니다. 구현 후보를 탐색하고, 검증 사이클을 단축하고, 산술 회로를 최적화하는 데 모델이 쓰였다는 것입니다. 더 나아가 코덱스(Codex)와 GPT-Astra를 이용해, 원래 생산 계획에 없던 공개 가중치 모델 세 개를 두 달 만에 고성능 수준까지 끌어올렸다고 합니다. 선택된 어텐션·MoE 블록에서는 AI가 생성한 커널이 사람 전문가가 짠 것보다 1.5~1.8배 빨랐다는 수치도 함께 공개됐습니다.
- 설계 기간: 초기 설계 → 테이프아웃 9개월
- 공정: TSMC 3나노, 정격 700W (측정 지속 전력 550W 이하)
- 파트너: 브로드컴 (실리콘 구현·네트워킹·인터커넥트)
- 배치 일정: 2026년 말부터 OpenAI 자체 인프라에 투입
- 로드맵: 2세대 개발 중, 3세대 구상 단계
칩을 만드는 AI가 다시 그 칩 위에서 돌아가는 구조입니다. 이 되먹임이 몇 세대만 돌아도 설계 주기 자체가 업계 평균에서 이탈할 가능성이 있습니다. 저는 오히려 이 부분이 벤치마크 숫자보다 장기적으로 무섭다고 생각합니다.
그런데 이 비교, 공정한 걸까요
솔직히 이 부분은 좀 의문이 남습니다. OpenAI 할라피뇨는 HBM4를 쓰는 것으로 알려져 있고(삼성전자 공급설이 나옵니다), 비교 대상인 GB200·GB300은 HBM3E 세대입니다. 메모리 대역폭이 곧 성능인 디코드 구간에서 한 세대 앞선 메모리를 쓰고 승리를 선언하는 건 조건이 같지 않습니다.
같은 HBM4를 쓰는 엔비디아 루빈(Rubin)이 정확한 비교 상대인데, 루빈의 실측 데이터는 아직 이 벤치마크에 올라와 있지 않습니다. 세미애널리시스 역시 이 비교가 다소 불완전하다는 취지의 단서를 달았습니다. 즉 지금 시점의 정확한 문장은 “엔비디아를 이겼다”가 아니라 “현재 상용 중인 엔비디아 시스템보다 와트당 효율이 좋다” 정도입니다.
다만 그렇다고 성과가 깎이는 것도 아닙니다. 1세대 ASIC이 상용 최강 GPU 랙과 같은 표에 올라간 것 자체가 전례가 드뭅니다. 기술 자료 원문 비교는 톰스하드웨어의 분석이 참고할 만합니다.
엔비디아의 반론과 시장의 계산
젠슨 황 CEO의 반응은 담담했습니다. 요지는 두 가지입니다. 첫째, 이런 XPU들은 하나의 클라우드나 하나의 서비스를 위한 추론 전용 칩이라는 것. 둘째, 엔비디아는 학습부터 추론까지 AI 수명주기 전체를 커버하며 어떤 모델이든 돌아가는 범용성(fungibility)이 강점이라는 것입니다. 어떤 모델이 성공하든 결국 자사 매출로 돌아온다는 논리입니다.
틀린 말은 아닙니다. OpenAI 본인들도 발표문에서 “앞으로도 엔비디아를 포함한 파트너 가속기를 학습과 추론 양쪽에 폭넓게 배치하겠다”고 명시했습니다. 실제 데이터센터는 한 종류 칩으로 채워지지 않습니다.
다만 시장이 주목하는 건 점유율이 아니라 마진입니다. 추론 워크로드가 전체 AI 연산의 3분의 2를 넘어선 상황에서, 가장 큰 고객이 그 영역만 떼어내 직접 만들기 시작하면 가격 협상력이 달라집니다. 트렌드포스는 2026년 AI 서버 시장에서 ASIC 기반 시스템 비중이 27.8%에 이를 것으로 봤습니다. 공교롭게도 이 발표는 엔비디아 실적 발표 직전에 나왔고, 실적이 나쁘지 않았음에도 주가가 눌린 배경에 이 서사가 있었다고 봅니다.
OpenAI 할라피뇨가 바꿀 1년 뒤 풍경
제 예상으로는 1년 뒤 구도가 이렇게 정리될 것 같습니다. 학습용 대형 클러스터는 여전히 엔비디아가 가져가고, 추론은 자체 실리콘과 GPU가 혼재하는 이원 구조로 굳어질 겁니다. 구글 TPU, 아마존 트레이니움, 메타 MTIA가 이미 같은 길을 걸었고 OpenAI 할라피뇨가 마지막 큰 조각을 채운 셈입니다.
비유하자면 클라우드 초기에 서버를 사서 쓰던 회사들이 결국 자체 데이터센터를 짓게 된 흐름과 비슷합니다. 규모가 임계점을 넘으면 사는 것보다 만드는 게 싸집니다. OpenAI 할라피뇨는 그 임계점을 통과했다는 신호에 가깝습니다.
국내 입장에서 볼 대목도 있습니다. HBM4 공급망에 삼성전자와 SK하이닉스가 걸려 있고, 추론 전용 NPU를 만드는 국내 팹리스에게는 시장 자체가 커진다는 뜻이기도 합니다. 관련해서는 리벨리온 엔비디아 회동 이야기도 함께 보시면 맥락이 이어집니다.
자주 묻는 질문
OpenAI 할라피뇨를 일반 사용자가 살 수 있나요?
아닙니다. 외부 판매 계획은 발표되지 않았고, 2026년 말부터 OpenAI 자체 인프라에 순차 투입됩니다. 사용자가 체감하는 변화는 챗GPT와 API의 응답 속도, 그리고 중장기적으로는 요금 구조 쪽에서 나타날 가능성이 큽니다.
학습용으로도 쓸 수 있나요?
이번에 공개된 1세대는 추론에 최적화된 설계입니다. 프리필과 디코드 구간의 데이터 이동을 줄이는 데 초점이 맞춰져 있어, 학습 워크로드는 당분간 기존 GPU 클러스터가 담당합니다.
엔비디아 주식에는 어떤 영향인가요?
단기 심리에는 부담 요인이지만, 추론 시장 자체가 커지는 국면이라 물량 감소로 곧장 이어진다고 보기는 어렵습니다. 다만 투자 판단은 개인의 책임이며, 구체적인 매매는 전문가와 상담하시기 바랍니다. 이 글은 정보 제공 목적이며 투자 권유가 아닙니다.
정리하며
OpenAI 할라피뇨의 이번 결과는 “엔비디아가 끝났다”는 이야기가 아니라, AI 인프라의 경쟁 축이 칩 성능에서 전력당 효율로 넘어갔다는 선언에 가깝습니다. 진짜 판정은 루빈과 같은 조건으로 붙는 다음 라운드에서 나올 겁니다. 여러분은 이 결과를 어떻게 보셨는지 댓글로 알려주세요. 다음 세대 비교 결과가 나오면 이어서 다루겠습니다.