벤치마크(ARC-AGI)

벤치마크란 여러 AI 모델의 능력을 동일한 시험으로 정량 비교하는 표준 평가입니다. 그중 ARC-AGI는 François Chollet가 2019년 제안한 추상화·추론 벤치마크로, 학습하지 않은 새로운 문제를 푸는 일반화 능력을 측정합니다.

다른 표기: 벤치마크 · ARC-AGI · ARC AGI · arc-agi-2

AI 벤치마크란 무엇인가요?

벤치마크는 여러 AI 모델을 같은 문제로 시험해 성능을 숫자로 비교할 수 있게 한 표준 평가입니다. 코딩·수학·추론 등 능력별로 다양한 벤치마크가 존재합니다.

다만 특정 시험에 맞춰 최적화된 점수가 실제 실력을 그대로 뜻하지는 않으므로, 점수는 참고 지표로 보는 것이 바람직합니다.

ARC-AGI 벤치마크는 무엇을 측정하나요?

ARC-AGI(Abstraction and Reasoning Corpus)는 François Chollet가 2019년 논문 「On the Measure of Intelligence」에서 제안한 벤치마크입니다. 사람에게는 쉽지만 통째로 외우기는 어려운 규칙 추론 과제로 구성돼, 학습하지 않은 새로운 문제를 푸는 일반화 능력을 봅니다.

그래서 '사전학습 없이(without pretraining)' 얼마나 푸는지가 자주 언급됩니다. 2025년 공개된 후속 ARC-AGI-2는 난도를 더 높인 버전입니다.

AI 벤치마크 순위·리더보드는 어디서 보나요?

특정 모델의 점수나 순위는 시점에 따라 계속 바뀌므로, 여기서 고정된 서열을 제시하기보다 공식 리더보드를 직접 확인하는 편이 정확합니다. ARC-AGI는 ARC Prize 공식 사이트에서 리더보드를 공개합니다.

비교할 때는 같은 버전(예: ARC-AGI-1과 -2)과 같은 조건에서 측정된 점수인지를 반드시 맞춰서 봐야 합니다.

벤치마크 점수를 볼 때 주의할 점

같은 이름의 벤치마크라도 버전·설정·측정 방식이 다르면 점수를 직접 비교하기 어렵습니다. 또 문제나 답이 학습 데이터에 섞여 들어간 '데이터 오염'이 있으면 점수가 부풀 수 있습니다.

따라서 한 벤치마크의 최고 점수만 보기보다, 여러 벤치마크와 실제 사용 후기를 함께 참고하는 것이 좋습니다.