
AI 평가가 실제로 측정하는 것
벤치마크 점수는 모델이 고정된 질문 세트 하나에서 특정한 채점 방식으로 어떤 성과를 냈는지 알려 줍니다. 그 모델이 여러분의 데이터에서 작동할지는 알려 주지 않습니다. 2025년에 언어 모델 벤치마크 445개를 검토한 연구에 따르면 결과에 통계 검정을 조금이라도 적용한 곳은 16%에 불과했고, 별도의 연구는 테스트한 모델의 약 절반이 학습 중에 벤치마크 내용을 이미 본 적이 있음을 보여 줍니다. AI 시스템을 구매하기 전에 자사의 실제 사례로 작은 라벨링 세트를 만들고 그것으로 측정하세요.
AI 공급업체의 발표 자료에는 항상 자사 막대가 다른 막대보다 높은 차트가 들어 있습니다. 그 차트는 대개 정확합니다. 그리고 대개 구매자가 실제로 묻는 질문, 즉 이것이 자사의 문서, 자사의 티켓, 자사의 이미지에서 작동하느냐는 질문과는 무관합니다.
이 간극은 마케팅의 부정직함이 아닙니다. 측정의 문제이며, 여러분이 직접 확인할 수 있을 만큼 꼼꼼하게 기록되어 있습니다.
벤치마크는 측정 도구이고, 측정 도구에는 검증이 필요하다
직접 볼 수 없는 것을 측정하는 학문에서는 측정 도구의 값이 의미를 갖기 전에 그 도구가 신뢰를 얻어야 합니다. 측정하는 속성이 정의되어 있어야 합니다. 테스트가 그 속성과 상관된 다른 무언가가 아니라 그 속성 자체를 측정한다는 점이 입증되어야 합니다. 결과에는 그중 얼마가 노이즈인지에 대한 추정이 따라야 합니다. 심리측정학에서는 이를 구성 타당도라고 부르며, 흔한 절차입니다.
언어 모델 벤치마크는 바로 이런 종류의 측정 도구입니다. ‘추론’과 ‘유용성’은 직접 관찰할 수 없으므로 벤치마크가 이를 대신합니다. 그 대체물이 제대로 작동하는지는 답할 수 있는 질문이고, 2025년 29명의 검토자로 구성된 팀이 자연어 처리와 머신러닝 주요 학회에서 가져온 벤치마크 445개를 대상으로 이 질문에 답했습니다. 이 연구는 NeurIPS 2025의 Datasets and Benchmarks 트랙에 발표되었습니다.
수치는 천천히 읽어 볼 만합니다.
- 16.0% 만이 통계 검정이나 불확실성 추정을 조금이라도 수행했습니다. 나머지 84%는 다시 실행하면 얼마나 달라질지 아무런 표시 없이 숫자를 보고합니다.
- 목표를 정의한 벤치마크 중 47.8% 는 논란이 있는 현상, 즉 해당 분야에서 정의에 합의하지 못한 무언가를 측정하고 있었습니다.
- 81.3% 가 정확한 문자열 일치로 채점했고, 40.7%는 다른 방법을 전혀 쓰지 않았습니다. 표현만 다른 정답도 오답으로 처리됩니다.
- 42.6% 가 기존 벤치마크의 문항을 재사용했습니다. 이렇게 한 테스트의 결함이 그것을 점검해야 할 테스트로 퍼집니다.
445개 벤치마크의 대부분은 측정 도구를 한 번도 검증하지 않았습니다. 출처: NeurIPS 2025, Measuring what Matters.
그렇다고 벤치마크가 쓸모없다는 뜻은 아닙니다. 벤치마크 점수는 보이는 것보다 약한 주장이며, 그 주장의 강도가 함께 표시되는 경우는 드물다는 뜻입니다.
오염 문제는 숫자를 더욱 약하게 만든다
벤치마크는 모델이 아직 답을 보지 않았을 때만 작동합니다. 현대의 학습용 말뭉치는 충분히 크고 폭넓게 수집되기 때문에, 이를 보장하기는 어렵고 틀리기는 쉽습니다.
상하이 교통대학교의 연구자들은 수학적 추론 데이터셋인 GSM8K와 MATH에서 31개 모델에 벤치마크 유출의 흔적이 있는지 테스트했습니다. 암기 여부를 감지하기 위해 퍼플렉시티와 n-그램 예측 정확도를 사용했습니다. 약 절반이 벤치마크 데이터로 학습한 흔적을 보였습니다. 가장 뚜렷한 사례에서 Qwen-1.8B는 GSM8K 학습 세트의 223개 예제, MATH 학습 세트의 67개 예제, 그리고 MATH 테스트 세트의 25개 예제에서 다섯 단어로 이루어진 모든 연속 구절을 재현했습니다. 테스트 세트는 보지 않은 상태로 남아 있는 것 자체가 목적인 부분입니다.
테스트의 일부를 암기한 모델은 그 테스트에서 좋은 점수를 받지만, 다른 어떤 작업의 성능에 대해서도 알려 주지 않습니다. 겉으로 보면 그냥 뛰어난 모델과 똑같아 보입니다.
연구 현장에서는 어떻게 보였나
제 박사 연구는 사전 학습된 모델이 라벨이 붙은 예제 없이, 학습한 적 없는 시각 작업을 수행하도록 만드는 것이었습니다. 먼저 NeurIPS 2023에서 확산 모델을 이용한 의미적 대응점 찾기를, 이어서 2024년 Computer Vision and Pattern Recognition 학회에서 같은 종류의 모델로 키포인트 찾기를 발표했습니다. 두 연구 모두 표준 라벨링 벤치마크로 측정했습니다. 이 분야가 방법을 비교하는 방식이 그렇기 때문입니다.
그 수치는 진짜였고 비교는 공정했습니다. 하지만 기업이 묻는 질문, 즉 그 방법이 자사의 이미지에서, 자사의 해상도로, 자사의 조명 조건에서, 자사가 정의한 정답 기준으로 작동하느냐는 질문에는 답할 수 없었습니다. 벤치마크 성능과 실제 운영 성능은 서로 다른 측정입니다. 모델을 논문에서 제품으로 옮겨 본 사람이라면 누구나 이 간극을 보았을 것입니다.
직접 만든 평가만이 여러분의 결정에 맞춰진 평가다
해결책은 화려하지 않지만 효과가 있습니다. AI 시스템을 도입하기로 결정하기 전에 자사 업무에서 실제 사례를 모으고 올바른 결과를 직접 라벨링하세요. AI 프로젝트에서 누군가 쓰는 반나절 중 가장 유용한 시간입니다.
쉬운 사례가 아니라 현실에서 표본을 뽑으세요. 형식이 깨진 것까지 포함해 실제 리드, 실제 티켓, 실제 청구서, 실제 사진을 가져오세요. 깨끗한 예제로만 만든 세트는 여러분이 갖고 있지 않은 시스템을 측정합니다.
처음에는 라벨링된 항목 100~300개를 목표로 하세요. 대부분 맞히는 시스템과 우연보다 조금 더 자주 맞히는 시스템을 구분하기에 충분하고, 한 사람이 실제로 오후 한나절에 끝낼 수 있을 만큼 적은 양입니다.
결과를 보기 전에 정답이 무엇인지 적어 두세요. 같은 팀의 두 사람도 어떤 리드가 적격이었는지, 어떤 문서가 제대로 처리되었는지를 두고 자주 의견이 갈립니다. 그 불일치를 문서로 정리하는 일은 무엇을 사든 사지 않든 가치가 있으며, 나중에 하면 정의가 결과에 맞춰 휘어집니다.
모호한 사례는 모호하다고 라벨링하세요. 자사 팀이라면 상부에 올렸을 사례에 양자택일의 답을 강요하면, 올바른 행동을 벌하는 테스트가 됩니다.
일부는 따로 보관하세요. 공급업체를 포함해 시스템을 만들거나 조정하는 누구도 보지 못하는 부분을 남겨 두세요. 그 보관해 둔 부분의 점수만이 액면 그대로 받아들일 수 있는 점수입니다.
자사 라벨링 담당자들 사이의 불일치율을 기록하세요. 두 직원의 의견이 85% 일치한다면, 85%를 기록한 시스템은 그 작업에서 사람 수준으로 작동하는 것입니다. 99%를 약속하는 공급업체는 다른 무언가를 측정하고 있거나 여러분의 답을 본 것입니다.
공급업체에 물어볼 것
유용한 질문은 점수가 아니라 방법에 관한 것입니다.
보고된 숫자를 무엇으로 측정했는지, 그리고 시스템을 그 같은 데이터로 조정했는지 물어보세요. 시스템이 틀리는 사례에서의 성능을 요청하세요. 검토된 445개 벤치마크에서는 오류 분석이 거의 없었고, 운영상의 위험은 대개 그곳에 있습니다. 공급업체가 한 번도 본 적 없는 세트에서는 숫자가 어떻게 될지 묻고, 실제로 그런 세트를 제공하세요. 신뢰 구간, 또는 평가를 여러 번 실행한 결과를 요청하세요.
이런 질문에 답할 수 있는 공급업체는 제대로 일하고 있는 것입니다. 순위표의 자리로만 답하는 공급업체는 다른 사람의 테스트에서 자신이 몇 위인지 알려 준 것에 불과합니다.
저희가 적용하는 방식
저희 AI 시스템 카탈로그의 모든 시스템은 정해진 순서에 따라 만들어지며, 두 번째 단계는 절약되는 시간을 누군가 이야기하기 전에 고객의 실제 사례를 직접 라벨링한 세트에 합의하는 것입니다. 벤치마크 숫자를 근거로 규모를 키우는 일은 없습니다. 대부분의 계약을 여는 AI Opportunity Audit는 이 라벨링 세트를 결과물로 만들어 내며, 이후 저희가 무언가를 구축하든 하지 않든 그것은 여러분의 것입니다.
평가는 서면으로 정한 중단 기준을 의미 있게 만드는 요소이기도 합니다. 정해진 성능 수준에서 멈추기로 미리 합의하더라도, 성능을 측정하는 방법에 합의하지 않았다면 빈 약속입니다.
출처
- Measuring what Matters: Construct Validity in Large Language Model Benchmarks, NeurIPS 2025 Datasets and Benchmarks 트랙: arxiv.org/abs/2511.04703
- Benchmarking Benchmark Leakage in Large Language Models, Xu, Wang, Fan, Liu: arxiv.org/html/2404.18824v1
문의하기