logo

LLM 벤치마크

벤치마크 Benchmarks

언어 모형의 성능을 객관적이고 일관되며 재현 가능하게 측정하기 위해 만든 표준화된 문제나 과업의 집합

  • 객관적 비교: 여러 모형에 같은 시험을 적용해 상대적 강점 비교
  • 연구 방향 제시: 모형이 공통으로 어려워하는 문제 발견
  • 발전 속도 추적: 시간에 따른 성능 변화 측정
  • 약점 분석: 수학, 코딩, 멀티모달 이해 등 능력별 취약점 확인

벤치마크의 한계

  • 데이터 오염: 테스트 문제가 훈련 데이터에 포함되어 점수가 부풀 가능성
  • 리더보드 과최적화: 일반 능력보다 특정 시험의 점수만 높이도록 개발 방향이 치우칠 가능성
  • 제한된 평가 범위: 높은 점수가 실제 환경의 유용성이나 안전성을 완전히 보장하지 않음
  • 포화: 상위 모형의 점수가 비슷해져 성능 차이를 구분하기 어려움
  • 평가자 의존: LLM이 채점하는 벤치마크는 평가 모형의 오류와 편향을 물려받을 수 있음

대표 벤치마크

  • 학술 지식과 추론
    • GPQA Diamond: 검색 없이 풀기 어려운 대학원 수준의 과학 질문
    • Humanity's Last Exam: 여러 학문 분야의 전문가가 만든 고난도 문제
    • FrontierMath: 미공개 문제를 포함한 고급 수학 추론
  • 추상 추론
    • ARC-AGI-3: 처음 보는 상호작용 환경에서 규칙을 파악하고 적응하는 능력
  • 멀티모달 이해
    • MMMU-Pro: 이미지가 실제로 필요한 다학문 문제의 이해와 추론
    • CharXiv-Reasoning: 과학 논문의 복잡한 도표 이해와 추론
  • 소프트웨어 개발과 컴퓨터 사용
    • SWE-bench Verified·Pro: 실제 저장소의 이슈를 해결하고 패치를 작성하는 능력
    • Terminal-Bench: 격리된 터미널에서 개발·시스템 관리 과업을 끝까지 수행하는 능력
    • OSWorld: 운영체제와 응용 프로그램을 조작해 실제 컴퓨터 과업을 수행하는 능력
  • 도구 사용과 에이전트
    • BFCL: 함수와 도구를 정확히 선택하고 호출하는 능력
    • -bench: 사용자와 대화하며 정책·검색·업무 도구를 함께 다루는 능력
    • BrowseComp: 웹에서 찾기 어려운 정보를 여러 단계로 탐색하는 능력
  • 전문 업무
    • HealthBench: 실제 의료 대화에서 응답의 유용성과 안전성
    • GDPval: 여러 직업의 문서·슬라이드·스프레드시트 등 업무 산출물
    • Agents' Last Exam: 다양한 전문 분야의 장기 실행 과업을 완료하는 능력

같은 이름의 벤치마크도 데이터셋 버전, 공개·비공개 문제, 도구 허용 여부, 추론 강도, 에이전트 실행 틀, 시도 횟수에 따라 점수가 다를 수 있음

예시: Humanity's Last Exam

  • Humanity's Last Exam은 여러 분야의 전문가가 만든 고난도 문제로 구성
  • 다음 이미지는 묘비에서 발견된 팔미라 문자 비문의 번역을 요구

팔미라 문자로 쓰인 로마 시대 비문

벤치마크 성능의 변화

2012년부터 2024년까지 주요 AI 벤치마크에서 인간 기준 대비 성능 변화

  • 여러 전통 벤치마크에서 AI 성능이 인간 기준에 가까워지거나 넘어섬
  • 이는 AI가 모든 면에서 인간 수준이라는 뜻이 아니라 기존 시험의 구분력이 빠르게 약해질 수 있음을 보여 줌
  • 포화된 벤치마크는 더 어렵고 현실적인 과업으로 교체해야 함

그림 출처: Stanford AI Index 2025

평가 사이트

Arena.ai

Arena.ai

  • 두 모형의 이름을 가린 채 응답을 제시하고 사용자의 선택을 모아 순위를 계산

Artificial Analysis

Artificial Analysis

  • 여러 지능 평가 결과와 함께 토큰 가격, 과업당 비용, 출력 속도, 첫 토큰 지연 시간, 문맥 길이를 제공

Epoch AI

Epoch AI

  • 실행한 평가와 외부에서 공개한 결과를 함께 모아 모형별·벤치마크별 성능 변화를 보여 줌
  • 개별 실행의 설정과 기록을 확인하며 장기 추세를 살피기 좋음

LiveBench

LiveBench

  • 최근 자료를 바탕으로 문제를 주기적으로 갱신하고 객관적인 정답으로 자동 채점
  • 추론, 코딩, 에이전트 코딩, 수학, 데이터 분석, 언어, 지시 이행을 나누어 볼 수 있어 오염과 LLM 심사 편향을 줄이려는 평가에 적합

Hugging Face Leaderboards

Hugging Face Leaderboards

  • 공개 가중치 언어 모형뿐 아니라 임베딩, 비전·언어, 음성 인식 등 다양한 분야의 커뮤니티 리더보드를 찾을 수 있음
  • 리더보드마다 운영 주체와 채점 방식이 다르므로 데이터셋, 실행 코드, 갱신일을 함께 확인해야 한다.

Scale Labs

Scale Labs

  • 에이전트, 전문 지식, 안전성 등 분야별 평가를 제공

OpenRouter Benchmarks

OpenRouter Benchmarks

  • 모형뿐 아니라 API 공급자, 검색 도구, 도구 사용량 등 실제 실행 설정을 함께 기록
  • 같은 과업에서 품질, 비용, 속도의 균형을 비교할 때 유용

평가 목적에 맞는 조합

  • 연구용 능력 추적: LiveBench, Epoch AI와 과업별 공식 리더보드
  • 공개 모형 탐색: Hugging Face의 분야별 리더보드와 원본 평가 코드
  • 제품용 모형 선택: Artificial Analysis·OpenRouter의 품질·비용·속도와 자체 업무 데이터 평가
  • 사용자 만족도 비교: Arena.ai 방식의 블라인드 쌍대 비교
  • 고위험 배포: 자동 지표, LLM 평가, 전문가 평가, 안전성 시험을 함께 적용
Previous
LLM 평가자