AI가 다음 세대 AI를 만든다는 말은 그동안 비유에 가까웠습니다. 그런데 앤트로픽 클로드가 자사 AI 연구개발 업무의 26%를 사람 대신 주도하고 있다는 수치가 공식적으로 공개되면서, 이 표현이 측정 가능한 숫자로 바뀌었습니다. 앤트로픽은 9월 17일(현지시간) 내부 모니터링 지표를 발표하며 프런티어 AI 기업이 자체 R&D 자동화 수준을 구체적인 숫자로 내놓은 첫 사례를 만들었습니다.
불과 반년 전인 2026년 2월만 해도 이 수치는 1% 미만이었습니다. 그 사이에 무슨 일이 있었고, 이 26%라는 숫자를 어떻게 읽어야 하는지 정리했습니다.
목차
- 앤트로픽 클로드의 26%, 정확히 무엇을 센 숫자인가
- 에이전트 3만 개가 동시에 일하는 회사
- 안전 연구에 배정된 컴퓨팅은 6%
- RSI, 아직 도착하지 않은 지점
- 앤트로픽 클로드 지표를 스스로 공개한 이유
- 내가 이 지표에서 걸리는 부분
- 정리
앤트로픽 클로드의 26%, 정확히 무엇을 센 숫자인가
앤트로픽은 자사의 모든 AI 연구개발 업무를 분류한 뒤, 각 작업을 AI가 어느 수준까지 자동화하고 있는지 평가했습니다. 기준으로는 연구기관 에포크 AI가 만든 ‘자동화 수준(Automation Level)’ 척도를 썼습니다.

AL0부터 AL5까지, 여섯 단계 척도
척도는 AL0부터 AL5까지 여섯 단계입니다. AL0은 AI가 전혀 개입하지 않는 단계, AL3은 사람의 지시에 따라 상당한 작업을 수행하는 ‘협업’ 단계, AL4는 높은 수준의 지시 하나만으로 대부분의 작업을 처음부터 끝까지 해내는 ‘주도’ 단계입니다. AL5는 사람의 개입 없이 완전히 자율적으로 일하는 수준입니다.
공개된 수치를 단계별로 보면 이렇습니다.
- AL4(주도) 이상: 2026년 2월 1% 미만 → 8월 26%
- AL3(협업) 이상: 90% 초과
- AL5(완전 자율): 0% — 단 한 건도 없음
26%와 90%를 헷갈리면 안 되는 이유
여기서 중요한 건 26%와 90%의 차이입니다. 90%는 “클로드와 함께 일했다”에 가깝고, 26%는 “연구자가 방향만 주고 클로드가 끝까지 해냈다”에 해당합니다. 언론 제목에 자주 등장하는 ‘90%’를 26%와 같은 의미로 읽으면 실제보다 상황을 과대평가하게 됩니다. 그리고 AL5가 0%라는 점은 앤트로픽 클로드가 아직 사람 없이 혼자 후속 모델을 설계하고 훈련하는 단계는 아니라는 뜻입니다.
에이전트 3만 개가 동시에 일하는 회사
두 번째 지표는 에이전트에 대한 감독과 개입 수준입니다. 앤트로픽 클로드 기반 에이전트가 실제로 몇 개나 돌아가는지를 보여 주는 대목입니다. 2026년 8월 기준, 앤트로픽이 가장 많이 쓰는 내부 플랫폼에서 연구와 엔지니어링 작업을 수행하는 에이전트가 한 번에 약 3만 개씩 돌아가고 있었습니다.

이 에이전트들은 반자율적으로 장시간 작업하고, 서로에게 업무를 위임하기도 합니다. 앤트로픽은 이들을 커버리지(모니터링을 거치는 행동의 비율), 검토 지연시간(행동 발생 후 검토까지 걸리는 시간), 에스컬레이션 비율(차단·수정되거나 추가 검토 대상이 되는 비중) 세 가지로 관리한다고 밝혔습니다.
10억 건 중 차단된 건 0.002%
실제 규모도 공개됐습니다. 8월 한 달 동안 검토된 에이전트 결정은 10억 건 이상, 이 중 차단된 비율은 0.002%였습니다. 약 4만 7천 건 중 한 건꼴입니다. 모든 행동은 실행 전에 온라인 모니터를 거치며, 보통 수 초 안에 판정이 끝납니다.
3만 개라는 숫자를 사람 규모로 바꿔 생각해 보면 감이 옵니다. 직원 수백 명 규모의 회사가 수만 명 몫의 작업 흐름을 돌리고 있다는 뜻이니까요. 차단율 0.002%는 얼핏 안정적으로 보이지만, 분모가 10억이면 차단된 건수만 해도 2만 건입니다. 이런 규모에서는 ‘비율이 낮다’는 표현과 ‘절대 건수가 적다’는 표현이 전혀 다른 말이 됩니다.
안전 연구에 배정된 컴퓨팅은 6%
세 번째 지표는 컴퓨팅 자원 배분입니다. 앤트로픽 클로드를 훈련하고 굴리는 데 쓰이는 연산 자원 가운데 안전 연구 몫이 얼마나 되는지를 처음 수치로 밝힌 부분입니다. 앤트로픽은 2026년 7월 특정 기간의 전체 컴퓨팅 사용량을 분석해, AI R&D와 안전 연구에 각각 얼마나 투입되는지 조사했습니다.

결과는 AI R&D에 쓰인 컴퓨팅의 6%가 안전 연구에 배정됐다는 것이었습니다. 그리고 AI가 직접 AI R&D를 수행한 작업만 따로 놓고 보면 그 비중이 12%로 올라갔습니다.
앤트로픽은 이 숫자를 그대로 ‘안전 투자 수준’으로 읽지 말라고 덧붙였습니다. 안전 연구는 프런티어 모델 훈련보다 실험 설계와 연구자의 분석에 시간이 더 들어가는 작업이라, 컴퓨팅을 상대적으로 적게 쓰면서도 인력은 많이 투입될 수 있기 때문입니다. 절대값보다는 같은 기준으로 기업 간·시기별 변화를 비교하는 용도로 쓰라는 취지입니다.
이 단서는 타당합니다. 다만 그렇게 되면 6%라는 숫자 자체는 판단 근거로서 힘이 약해집니다. 비교할 상대가 생겨야 의미가 생기는 지표인데, 아직 같은 방식으로 공개한 회사가 없습니다.
RSI, 아직 도착하지 않은 지점
이 발표의 배경에는 재귀적 자기개선(Recursive Self-Improvement, RSI)이라는 개념이 있습니다. AI 시스템이 자신보다 더 뛰어난 후속 모델을 스스로 만들어 내고, 그 과정이 반복되며 사람의 개입이 점점 줄어드는 상태를 말합니다.
앤트로픽은 자사 모델이 RSI에 도달했다고 주장하지 않았습니다. 오히려 RSI를 ‘가능한 결과이지 필연적 결과는 아니다’라고 명시했고, 모델이 자율적으로 후속 모델을 설계하고 훈련하는 단계는 아니라고 선을 그었습니다. 이번 지표의 목적은 도달 선언이 아니라, 그 방향으로 얼마나 가까워지고 있는지를 외부에서도 볼 수 있게 만드는 것입니다.
이 발표가 왜 지금 나왔는지는 같은 주의 흐름을 보면 짐작이 됩니다. 앤트로픽의 다리오 아모데이 CEO가 프런티어 모델의 성능 향상 속도를 늦추자고 공개 제안했고, 샘 올트먼과 데미스 허사비스가 신중론에 동조한 반면 젠슨 황과 마크 저커버그는 반대했습니다. 속도 조절 논쟁이 한창인 시점에, 속도를 측정하는 자를 먼저 내놓은 셈입니다. 이 논쟁이 국내 시장에 어떻게 번졌는지는 AI 속도조절론에 코스피가 급락했던 상황을 다룬 글에서 정리한 적이 있습니다.
앤트로픽 클로드 지표를 스스로 공개한 이유
앤트로픽은 “프런티어 AI 연구소가 알고 있는 것과 대중이 알고 있는 것 사이의 격차를 최대한 줄여야 한다”고 밝혔습니다. 앞으로 이 지표를 정기적으로 공개하고, 독립적인 제3자 평가기관이 내부 프로세스와 시스템, 데이터에 접근하도록 하겠다는 계획도 함께 내놨습니다. 발표 원문은 앤트로픽 공식 뉴스룸에서 확인할 수 있습니다.
회사 입장에서 이건 손해가 아닙니다. 규제 논의가 본격화되기 전에 자기가 만든 척도를 업계 표준으로 만들어 두면, 이후 모든 비교가 그 기준 위에서 이뤄집니다. AI 업계의 속도 경쟁이 어떤 식으로 지표 싸움이 되는지는 딥시크와 알리바바의 클로드 증류 논란에서도 비슷한 패턴이 보였습니다. 선의와 전략은 여기서 깔끔하게 구분되지 않습니다.
그렇다고 공개 자체를 깎아내릴 이유도 없습니다. 아무도 내놓지 않던 숫자를 처음 꺼낸 쪽이 기준을 갖는 건 자연스러운 일이고, 검증 가능한 숫자가 하나도 없는 것보다는 편향된 기준이라도 있는 편이 낫습니다.
내가 이 지표에서 걸리는 부분
솔직히 가장 걸리는 건 26%라는 숫자가 아니라, 앤트로픽 클로드를 평가한 이 숫자를 앤트로픽이 직접 매겼다는 점입니다. 어떤 작업을 ‘AI R&D 업무’로 셀지, AL3과 AL4의 경계를 어디에 그을지는 전부 회사 내부 판단입니다. 분류 기준을 조금만 조정해도 26%는 15%가 될 수도, 40%가 될 수도 있습니다. 제3자 평가기관을 들이겠다는 약속이 실제로 이행되기 전까지, 이 수치는 자체 보고 이상은 아닙니다.
상승 곡선을 그대로 연장하면 안 됩니다
두 번째로, 2월 1% 미만에서 8월 26%까지의 상승 곡선을 그대로 연장하는 해석은 경계하는 편이 좋습니다. 이런 곡선은 대개 쉬운 작업부터 먼저 자동화되면서 가파르게 오르다가, 판단과 맥락이 많이 필요한 영역에 닿으면 완만해집니다. 같은 속도라면 내년 이맘때 100%가 되어야 하는데, 그렇게 될 가능성은 낮다고 봅니다. 오히려 내년에는 30%대 후반에서 증가세가 눈에 띄게 둔해지지 않을까 예상합니다. 진짜 관전 포인트는 26%가 40%가 되는 순간이 아니라, AL5가 0%에서 처음 벗어나는 순간입니다. 그 지점이 성격이 다른 선입니다.
마지막으로 현실적인 이야기입니다. 이 지표는 앤트로픽 내부 이야기이고, 지금 챗봇을 쓰는 일반 사용자의 사용 경험이 당장 바뀌지는 않습니다. 다만 모델 세대 교체 주기가 짧아진다는 뜻이기는 합니다. 최근 GPT-6 아스트라가 공개되던 시점에도 느꼈지만, 모델 업데이트 간격은 계속 줄어드는 중입니다.
정리
핵심만 다시 짚으면 이렇습니다. 앤트로픽 클로드는 자사 AI 연구개발 업무의 26%를 주도 수준으로 수행하고 있고, 이 비율은 반년 만에 1% 미만에서 여기까지 왔습니다. 협업 이상 수준은 90%를 넘었지만, 사람이 전혀 개입하지 않는 완전 자율 작업은 아직 0%입니다. 에이전트는 한 번에 3만 개가 돌아가고, 8월 한 달 10억 건이 넘는 결정 중 0.002%가 차단됐습니다. AI R&D 컴퓨팅의 6%는 안전 연구에 배정됐습니다.
이 숫자들이 말해 주는 건 AI가 자기 자신을 만들기 시작했다는 선언이 아니라, 그 방향으로 가고 있는지를 이제야 겨우 재기 시작했다는 사실입니다. 재는 도구를 재는 대상이 직접 만들었다는 점은 여전히 남는 문제고요. 제3자 검증이 실제로 붙는지가 다음 확인 지점이 될 것 같습니다.
다음 분기 지표가 나오면 26%가 어디까지 갔는지, AL5가 여전히 0%인지 이어서 정리하겠습니다. 이 숫자를 어떻게 보셨는지 댓글로 남겨 주세요. AI 업계 흐름을 계속 따라가고 싶다면 테크 트렌드 카테고리를 즐겨찾기에 추가해 두시면 좋습니다.