Grok 4.6, ARC-AGI-3에서 GPT-5.6 Sol과 동률, 비용은 3분의 1

ARC 프라이즈 공식 검증 — ARC-AGI-1 87.5%, ARC-AGI-3에서 GPT-5.6 Sol과 비슷한 점수를 3분의 1 비용으로

H
Huuush발행 2026.08.14 · 4분 read에디터: Jay Kim

3줄 요약

  • ARC 프라이즈(ARC Prize)가 Grok 4.6 의 검증 결과를 공개했다.
  • ARC 프라이즈는 프랑수아 숄레(François Chollet)와 마이크 크넙(Mike Knoop)이 만든 비영리 벤치마크 재단이다. 모델 제작사가 자체 발표하는 수치가 아니라, 재단이 직접 API로 모델을 돌려 채점한 뒤 "Verified" 배지 를 붙이는 방식이라 신뢰도가 높다.
  • ARC 프라이즈 공식 X 계정이 8월 14일 오전 10:20 KST에 올린 검증 결과는 다음과 같다( 원문 ).
ARC-AGI-2 리더보드 차트 — Grok 4.6이 비용 대비 점수에서 가파른 상승 곡선을 그리는 모습

ARC 프라이즈(ARC Prize)가 Grok 4.6의 검증 결과를 공개했다.

ARC 프라이즈는 프랑수아 숄레(François Chollet)와 마이크 크넙(Mike Knoop)이 만든 비영리 벤치마크 재단이다. 모델 제작사가 자체 발표하는 수치가 아니라, 재단이 직접 API로 모델을 돌려 채점한 뒤 "Verified" 배지를 붙이는 방식이라 신뢰도가 높다.

ARC-AGI 3단계, Grok 4.6은 어디쯤 있나

ARC 프라이즈 공식 X 계정이 8월 14일 오전 10:20 KST에 올린 검증 결과는 다음과 같다(원문).

테스트점수태스크당 비용
ARC-AGI-187.5%$0.30
ARC-AGI-267.1%$0.76
ARC-AGI-32.11%$5,600

ARC-AGI-1·2는 정적 추론 문제, ARC-AGI-3은 상호작용이 필요한 에이전트형 문제다. 뒤로 갈수록 난도가 급격히 오르는 구조라 점수도 함께 떨어진다.

비용 대비 성능 — GPT-5.6 Sol과 나란히, 가격은 3분의 1

ARC 프라이즈가 함께 짚은 대목은 ARC-AGI-3에서의 비용 효율이다.

xhigh 추론 모드의 Grok 4.6은 high 추론 모드의 GPT-5.6 Sol과 비슷한 점수를 냈다. 그런데 비용은 태스크당 $5,600으로, Sol의 $15,200보다 3분의 1 수준이었다.

세 개 차트 모두 ARC 프라이즈 공식 리더보드 기준 "Verified" 마크가 찍혀 있어, 자체 벤치마킹이 아닌 제3자 검증 결과라는 점이 명확하다.

점수보다 비용 곡선을 보세요

ARC-AGI 점수 자체는 일반 업무와 거리가 있어 보일 수 있다. 하지만 이 벤치마크가 재는 것은 정형화되지 않은 새로운 문제를 얼마나 잘 푸는지다.

코딩 에이전트나 리서치 자동화처럼 "정해진 답이 없는 작업"에 모델을 붙일 때는, 단순 정확도보다 이번처럼 점수 대비 비용 곡선을 함께 봐야 실제 운영비를 가늠할 수 있다.

참고로 xAI는 8월 12일 Grok 4.6을 공식 발표하면서 AA Intelligence Index, GDPVal-AA, CursorBench 등 자체 지표를 앞세웠다. ARC-AGI 수치는 xAI 공식 발표 자료에는 없고, 이번 ARC 프라이즈의 독립 검증에서만 확인된다 — 서드파티 벤치마크의 정상적인 운영 방식이다.

특정 추론 강도의 비용이라는 것

이 수치는 ARC 프라이즈가 공개한 최신 검증치이며, 이 글 작성 시점 기준 다른 독립 기관의 재현 검증은 확인되지 않았다. ARC-AGI-3의 $5,600·$15,200 같은 비용은 특정 추론 강도(xhigh·high) 설정값이므로, 설정을 낮추면 비용과 점수 모두 달라질 수 있다.

모델 선택 전에는 자사 워크로드와 유사한 조건으로 직접 소규모 테스트를 해보는 편을 권한다.

자주 묻는 질문

이 글에서 다룬 벤더