Mobile Device Benchmark Set 방법론

개요

Mobile Device Benchmark Set은 휴대폰에서 실행할 수 있을 만큼 작은 언어 모델의 지능을 측정하기 위해 현재 사용하는 다섯 가지 평가의 모음을 말합니다. Artificial Analysis 전반에서 사용하는 것과 동일한 독립적인 평가 방식을 적용합니다.

우리는 원본 전체 정밀도 가중치가 아니라 휴대폰이 실제 환경에서 실행하는 양자화 빌드를 평가합니다. 따라서 여기의 점수는 Artificial Analysis의 다른 곳에 있는 동일 모델의 점수와 다를 수 있습니다.

포함 기준

양자화 후 8K 컨텍스트의 KV 캐시를 포함해 8 GB 메모리에 들어가는 모델을 이론적으로 휴대폰에서 실행할 수 있을 만큼 작은 모델로 정의합니다. 모델은 가중치뿐 아니라 컨텍스트를 위한 메모리도 필요하므로 KV 캐시를 포함하며, 8K는 지시문과 도구 정의가 포함된 일상적인 온디바이스 작업에 필요한 토큰 수의 상한을 여유 있게 크게 잡은 값입니다.

결과 페이지에서는 자격을 갖추었지만 선택한 기기(선택한 양자화 기준)에서 제대로 실행되지 않은 모델을 다른 색상이나 패턴으로 표시하여, 해당 모델·양자화·추론 프레임워크·기기 조합의 실행이 어려울 수 있음을 나타냅니다.

평가 실행 방식

  • 현재 릴리스는 4비트(Q4_K_M) 이하의 GGUF 양자화를 사용하며 llama.cpp로 서비스합니다.
  • 모든 평가는 16K 토큰 컨텍스트 윈도우로 실행됩니다. 응답은 해당 윈도우와 모델 자체의 출력 토큰 한도 중 더 낮은 쪽으로 제한되며, 컨텍스트를 압축하거나 잘라내지 않습니다. 따라서 최종 답변을 내기 전에 토큰이 소진된 모델은 해당 시도에서 오답으로 표시됩니다. 이 컨텍스트 한도는 실제로는 4K 미만인 경우가 많은 휴대폰의 현실적인 컨텍스트 한도에 비하면 넉넉합니다. 또한 더 엄격한 제한에서의 모델 성능을 다른 관점에서 보여주기 위해 1분 시간 제한을 적용한 결과도 벤치마크 결과에 포함합니다. 64K 컨텍스트 제한 결과는 곧 공개될 예정입니다.
  • 모든 평가는 문항당 5회 반복하여 pass@1로 채점하며, 6,000개 문항을 단일 패스로 실행하는 AA-Omniscience만 예외입니다.
  • 추론 모드와 비추론 모드를 모두 지원하는 모델은 두 설정 모두에서 평가하며 별도의 변형으로 표시합니다. 초기에는 모델별 각 모드의 커버리지가 완전하지 않을 수 있습니다.

구성 평가

벤치마크 세트의 첫 번째 버전은 Artificial Analysis가 각각 독립적으로 측정하는 다섯 가지 평가로 구성됩니다.

  • BFCL. 소형 모델을 위해 선정한 640개 과제 부분집합에서의 도구 호출로, 세 가지 과제 범주에 동일한 가중치를 둡니다.
  • IFBench. 정확하고 검증 가능한 출력 제약이 있는 지시 이행.
  • AA-Omniscience. 사실 지식과 환각 저항성으로, 정확도와 비환각으로 균등하게 나뉩니다.
  • GPQA Diamond. 대학원 수준의 과학적 추론.
  • MATH-500. 수학 문제 풀이.

이 평가들은 소형 모델이 처리해야 할 지시 이행, 도구 호출, 지식 회상, 추론의 조합을 대표하도록 선정했습니다. 이를 단순 평균(동일 가중치)으로 결합하여 최종 지능 점수를 산출합니다.

소형 모델 및 모바일 기기 벤치마킹 방식을 계속 개선함에 따라 평가 구성은 향후 바뀔 것으로 예상합니다.

BFCL

Berkeley Function Calling Leaderboard(BFCL) v4는 모델이 도구를 얼마나 잘 호출하는지 측정합니다. 소형 모델에 의미가 있도록 선정한 640개 과제 부분집합을 실행하며, 각각 BFCL 점수의 3분의 1씩을 차지하는 세 범주에서 가져옵니다:

  • Multiple(200개 과제): 사용 가능한 여러 함수 중 올바른 것을 골라 정확한 인수로 호출합니다. 호출을 예상 구조와 대조하여 채점합니다.
  • Multi-turn base(200개 과제): 여러 차례의 도구 사용에 걸쳐 과제를 완료합니다. 호출 순서와 그 결과로 만들어진 최종 상태를 기준으로 채점합니다.
  • Irrelevance(240개 과제): 사용 가능한 도구 중 어느 것도 요청에 맞지 않음을 인식하고, 억지로 호출하는 대신 거절합니다.

공식 BFCL 설정과 다른 점:

  • 모든 과제는 BFCL 저자들이 작성한 non-live 분할에서 가져옵니다. 크라우드소싱으로 만든 live 분할은 벤치마크 세트의 향후 버전에 포함될 후보입니다.
  • 애플리케이션이 일반적으로 모델에 도구를 전달하는 방식이므로 네이티브 함수 호출(BFCL의 FC 모드)만 테스트합니다. API의 도구 인터페이스가 아니라 프롬프트로 도구를 전달하고 모델의 응답에서 호출을 파싱하는 BFCL의 프롬프팅 모드는 사용하지 않습니다.
  • 각 모델의 네이티브 도구 호출을 사용하며, 파싱은 모델의 채팅 템플릿을 바탕으로 llama.cpp가 수행합니다. 텍스트 내용에서 도구 호출을 복구하려고 시도하지 않으며, 런타임이 실행할 수 없는 도구 호출은 실제 애플리케이션에서와 마찬가지로 실패로 간주합니다.
  • 요청은 BFCL의 모델별 핸들러가 아니라 우리의 표준 제공자 스택을 통해 전달됩니다.

데이터셋: BFCL v4의 non-live 분할로, UC Berkeley에서 개발하며 Gorilla 저장소에서 관리됩니다.

IFBench

IFBench는 단어 수, 형식 규칙, 문장 조작과 같이 정확하고 검증 가능한 지시를 모델이 따를 수 있는지 테스트합니다. 지시를 안정적으로 따르는 능력은 사람들이 소형 모델에 요구하는 거의 모든 것의 기반이 되기 때문에 포함했습니다.

  • 데이터셋: 294개 프롬프트로 구성된 단일 턴 IFBench 세트(allenai/IFBench_test). 멀티턴 버전은 사용하지 않습니다.
  • 응답은 프롬프트의 모든 지시를 충족할 때만 정답으로 인정됩니다(프롬프트 단위 정확도).
  • 응답은 allenai/IFBench의 공식 코드를 loose 모드로 사용해 검사하며, 이 모드는 답변 주변의 추가 텍스트와 서식을 허용합니다.

AA-Omniscience

AA-Omniscience는 우리가 직접 만든 지식 및 환각 벤치마크로, 비즈니스, 법률, 건강, 소프트웨어 엔지니어링, 과학, 인문학을 아우르는 42개 주제의 6,000개 문항으로 구성됩니다. 정확한 지식에는 보상을, 확신에 찬 오답에는 벌점을 줍니다.

  • 공개 서브셋: ArtificialAnalysis/AA-Omniscience-Public.
  • 각 응답은 LLM 채점기가 정답, 오답, 부분 정답, 미시도 중 하나로 채점합니다.
  • 평균에 동일한 가중치의 두 구성 요소로 기여합니다. 정확도는 올바르게 답한 질문의 비율입니다. 비환각은 1에서 환각률을 뺀 값이며, 환각률은 올바르게 답하지 못한 질문 중 모델이 틀리게 답한 질문의 비율입니다.
  • 비환각을 포함한 것은 의도적입니다. 소형 모델이 생소한 개념에 대한 폭넓은 지식을 갖추리라 기대하지는 않지만, 정답을 모를 때 답하거나 행동하지 않음으로써 신뢰성을 보여줄 필요가 있습니다.
  • 채점 방식을 포함한 자세한 내용은 지능 지수 방법론의 AA-Omniscience 섹션에 있습니다.

GPQA Diamond

GPQA Diamond는 생물학, 물리학, 화학 객관식 문항으로 대학원 수준의 과학 추론을 테스트합니다.

  • 데이터셋: GPQA의 Diamond 부분집합으로, 각 4개 선택지를 가진 198개 문항이며 벤치마크 저자들이 전체 데이터셋에서 품질이 가장 높은 부분으로 선정했습니다.
  • 답변은 정규식으로 추출하여 pass@1로 채점하며, 주요 지능 지수와 동일한 객관식 프롬프트를 사용합니다(프롬프트 템플릿 보기).

MATH-500

MATH-500은 다양한 분야와 난이도에 걸친 고등학교 경시 수학 500문항 세트입니다.

  • 데이터셋: HuggingFaceH4/MATH-500.
  • 모델에 문제를 단계별로 풀고 최종 답을 상자 안에 넣도록 요청합니다.
  • 채점은 먼저 추출한 답을 기호적으로 확인하여 같은 답의 동등한 형태가 일치하도록 합니다. 그것으로 판정되지 않으면 LLM 동등성 검사기가 참조 답과 일치하는지 판단합니다.

휴대폰에서의 추론

속도, 지연 시간, 메모리 사용량을 포함한 휴대폰에서의 추론 성능은 Liquid AI와의 파트너십을 통해 기기에서 직접 측정하여 별도로 벤치마킹합니다. Liquid AI의 측정 플랫폼(및 결과 뷰어)은 Pipette라고 합니다.