클로드 오퍼스 5, 반값에 이 성능이면 반칙 아닌가

클로드 오퍼스 5가 지난 7월 24일 앤트로픽의 모든 플랫폼에 출시됐습니다. 핵심 메시지는 단순합니다. 최상위 모델인 클로드 페이블 5에 근접한 지능을 절반 가격에 쓰라는 겁니다. 가격표는 전작 오퍼스 4.8과 똑같은데 성능은 세대가 바뀌었습니다. 이 글에서는 클로드 오퍼스 5의 실제 벤치마크 수치, GPT-5.6 Sol과의 비교, 그리고 발표문에는 잘 안 보이는 비용의 함정까지 정리합니다.

반값 플래그십의 정체

클로드 오퍼스 5는 입력 100만 토큰당 5달러, 출력 25달러로 오퍼스 4.8과 동일한 가격을 유지했습니다. 컨텍스트 윈도는 100만 토큰, 최대 출력은 12만 8천 토큰입니다. 흥미로운 건 지식 컷오프가 2026년 5월로, 상위 모델인 페이블 5보다 오히려 4개월 더 최신이라는 점입니다. 클로드 라인업 전체에서 가장 신선한 두뇌를 중간 가격 모델이 갖고 있는 셈입니다.

클로드 오퍼스 5, 반값에 이 성능이면 반칙 아닌가
(사진: explainx.ai)

앤트로픽은 이번 모델을 Claude Pro의 최상위 옵션이자 Max 요금제의 기본 모델로 배치했습니다. 자세한 스펙은 앤트로픽 공식 발표에서 확인할 수 있습니다. 최근 앤트로픽 IPO 초읽기 글에서 다뤘듯 상장을 앞둔 시점이라, 매출 볼륨을 키울 수 있는 가성비 플래그십이 필요했을 거라는 해석도 가능합니다.

에포트 설정과 패스트 모드

이번 세대부터 에포트(effort) 설정이 최대 단계까지 세분화됐고, 연구 프리뷰로 ‘패스트 모드’도 나왔습니다. 생성 속도를 최대 2.5배로 올리는 대신 가격이 2배(입력 10달러, 출력 50달러)가 됩니다. 급한 에이전트 작업이 아니라면 굳이 켤 이유는 없어 보입니다.

벤치마크로 본 클로드 오퍼스 5의 실력

수치만 보면 세대교체라는 말이 과장이 아닙니다. FrontierBench v0.1에서 클로드 오퍼스 5는 최대 에포트 기준 43.3%를 기록했는데, 오퍼스 4.8은 같은 조건에서 18.7%였습니다. 두 배가 넘는 점프입니다.

클로드 오퍼스 5, 반값에 이 성능이면 반칙 아닌가
(사진: kingy.ai)

더 인상적인 건 상위 모델과의 격차입니다. 코딩 벤치마크인 CursorBench에서는 페이블 5 최고 점수와 0.5%포인트 차이까지 따라붙었고, 작업당 비용은 절반이었습니다. 컴퓨터 사용 벤치마크인 OSWorld 2.0에서는 페이블 5의 최고 기록을 오히려 앞질렀습니다. 비용은 3분의 1 수준이었습니다.

검증하고 다시 시도하는 습관

벤치마크 밖에서 주목할 변화는 작업 검증 능력입니다. 클로드 오퍼스 5는 자기 결과물을 확인하고 성공할 때까지 신중하게 반복하는 성향이 강해졌다는 평가를 받습니다. 에이전트로 오래 돌려두는 작업일수록 이 차이가 체감된다는 게 초기 사용자들의 공통된 반응입니다.

GPT-5.6 Sol과 붙으면 누가 이기나

결국 궁금한 건 오픈AI의 GPT-5.6 Sol과의 맞대결입니다. 공개된 비교 자료를 종합하면 클로드 오퍼스 5가 12개 벤치마크 중 9개에서 앞섭니다. SWE-bench Pro에서 14.6포인트 차이로 앞서고, 코딩 평균 점수는 89.5 대 64.6으로 격차가 큽니다.

클로드 오퍼스 5, 반값에 이 성능이면 반칙 아닌가
(사진: Engadget)

다만 전 영역 우위는 아닙니다. 지식형 과제에서는 GPT-5.6 Sol이 94.6 대 64.7로 크게 앞서고, 에이전트 종합 점수도 92 대 90.8로 근소하게 우세합니다. 요약하면 코딩과 컴퓨터 조작은 오퍼스, 지식 질의는 Sol이라는 구도입니다.

항목클로드 오퍼스 5GPT-5.6 Sol
입력 가격 (1M 토큰)$5$5
출력 가격 (1M 토큰)$25$30
컨텍스트100만 토큰105만 토큰
코딩 평균89.564.6
지식 과제 평균64.794.6
에이전트 평균90.892

참고로 GPT-5.6은 최근 내부 평가 중 샌드박스를 탈출해 논란이 된 사건도 있었습니다. 성능 경쟁만큼 안전성 검증 경쟁도 치열해지는 분위기입니다.

가격표에 없는 함정, 토큰을 2배로 쓴다

여기서부터는 솔직히 짚고 넘어가야 할 부분입니다. 클로드 오퍼스 5는 같은 에포트 설정에서 오퍼스 4.8 대비 출력 토큰을 대략 2배 사용하는 경향이 보고됐습니다. 토큰 단가는 그대로여도 작업 하나당 실제 청구액은 올라갈 수 있다는 뜻입니다. 앤트로픽도 마이그레이션 시 에포트를 한 단계 낮추라고 안내하고 있습니다.

내 예상으로는 이 패턴이 업계 표준이 될 것 같습니다. 단가는 동결하거나 내리고, 모델이 더 많이 생각하게 해서 토큰 소비량으로 매출을 만드는 구조입니다. 소비자 입장에서 ‘반값’이라는 표현은 벤치마크당 비용 기준으로는 사실이지만, 청구서 기준으로는 직접 돌려보기 전까지 알 수 없습니다. 이 부분은 발표문보다 첫 달 청구서가 더 정확한 리뷰가 될 겁니다.

그래서 지금 갈아탈 만한가

코딩 에이전트나 컴퓨터 사용 자동화가 주 용도라면 클로드 오퍼스 5로 갈아탈 이유는 충분합니다. 페이블 5급 결과물을 절반 이하 비용으로 얻는 조합은 현재로선 대안이 없습니다. 반대로 지식 질의 응답이 핵심이라면 GPT-5.6 Sol이 여전히 우위입니다. 직접 써보니 결국 용도별로 모델을 나눠 쓰는 게 답이라는 결론에 다다르게 됩니다.

솔직히 이 속도는 좀 무섭습니다. 작년만 해도 플래그십 모델 반값 인하는 1년 주기 이벤트였는데, 이제는 분기마다 성능 계단이 하나씩 올라갑니다. 여러분은 어떤 모델을 주력으로 쓰고 계신가요? 갈아탈 계획이 있다면 댓글로 알려주세요. 오퍼스 5 실사용 후기도 조만간 다뤄보겠습니다.


댓글 남기기