음악 생성 벤치마킹 방법론

범위 및 배경

Artificial Analysis는 일반적으로 서버리스 API 엔드포인트를 통해 제공되는 음악 생성 모델을 벤치마킹합니다. 이 페이지에서는 Artificial Analysis Music Arena의 사용자 선호도 투표를 통해 모델 품질을 측정하는 방법론을 설명합니다.

음악 생성 역량은 다음 두 가지 모달리티를 다룹니다.

  • Instrumental: 보컬 없이 음악을 생성하는 모델입니다.
  • Vocals: 노래하거나 말하는 보컬 요소가 포함된 음악을 생성하는 모델입니다.

모든 모델과 제공업체에서 생성하는 모든 트랙에 표준 기본 설정을 적용하여 출력을 최대한 공정하게 비교할 수 있도록 합니다. 설정은 아래의 기본 생성 설정에 나와 있습니다.

품질 Elo

각 모델의 Elo 점수는 Artificial Analysis Music Arena의 사용자 투표에서 도출된 상대적 품질을 나타냅니다. Bradley-Terry 최대우도추정법으로 평점을 계산한 뒤, 읽기 쉽도록 Elo와 유사한 범위로 다시 조정합니다. Image Arena 및 Video Arena에도 동일한 방법론을 사용합니다. 각 평점과 함께 95% 신뢰 구간을 표시하며, 모델이 더 많은 표를 받을수록 구간이 좁아집니다.

Arena에서 사용자는 같은 모달리티에 속한 트랙끼리만 비교합니다. Elo는 모달리티별로 따로 표시되며 장르별로도 세분화됩니다.

Arena 투표

품질 Elo는 전적으로 블라인드 방식의 일대일 사용자 선호도 투표를 기반으로 합니다. 각 비교에서 사용자는 동일한 프롬프트와 모달리티로 생성된 트랙 두 개를 보고 모두 들은 뒤, 더 선호하는 트랙을 선택합니다.

  • 청취 요건: 사용자가 각 트랙을 최소 10초 이상 들은 뒤에만 투표할 수 있으므로, 첫인상이 아닌 전체 오디오 출력을 바탕으로 선호도를 판단하게 됩니다.
  • 블라인드: 투표가 완료될 때까지 모델 이름, 로고 및 식별할 수 있는 모든 정보를 숨깁니다.

오디오 정규화

트랙이 Arena에 들어가기 전에 모든 트랙의 음량과 제공 형식을 동일하게 정규화하여, 음량이나 파일 특성이 아닌 음악적 품질을 바탕으로 투표하도록 합니다.

  • 음량: 각 트랙에 한 번의 정적 게인 조정을 적용하여 통합 음량 -16 LUFS(ITU-R BS.1770)를 목표로 맞춥니다. 클리핑을 방지하기 위해 증폭은 -1 dBTP 트루 피크 상한으로 제한하므로 헤드룸이 부족한 트랙은 목표보다 약간 낮게 유지됩니다. 압축, 리미팅 또는 EQ는 적용하지 않아 각 트랙의 다이내믹스와 음색 균형을 보존합니다.
  • 제공 형식: 제공업체가 반환한 형식과 관계없이 모든 트랙을 44.1 kHz, 320 kbps MP3로 다시 인코딩하고 제공업체 메타데이터와 삽입된 아트워크를 제거합니다. 원래 채널 구성(모노 또는 스테레오)은 유지합니다.

리더보드

각 모달리티에 대해 글로벌 리더보드와 개인 리더보드를 제공합니다.

  • 글로벌 리더보드: 모든 사용자의 유효한 투표를 집계합니다. 모델은 최소 투표 수를 충족하면 표시됩니다.
  • 개인 리더보드: 사용자 한 명의 투표만으로 만든 순위입니다. 사용자가 최소 투표 수를 충족하면 활성화되며, 신뢰할 수 있는 순위를 만들기에 충분한 수의 투표를 완료할 때까지 신뢰도가 낮다는 경고가 표시됩니다.

두 리더보드 모두 장르별로 필터링할 수도 있습니다.

프롬프트 및 장르

프롬프트는 다양한 음악 스타일을 포괄하도록 엄선된 재현 가능한 세트에서 가져옵니다. 여기에 사용자가 제출한 프롬프트(25~200자)를 검토한 뒤 순환 목록에 추가해 보완합니다.

각 프롬프트에는 Pop, Hip-Hop / Rap, Electronic (EDM), Classical / Orchestral, Jazz & Blues 등의 장르 하나가 태그됩니다. 동일한 Bradley-Terry 방법을 사용하여 각 모달리티의 전체 순위와 함께 장르별 Elo 순위를 계산하고, 의미 있는 결과를 낼 만큼 장르별 투표가 충분히 쌓이면 표시합니다.

기본 생성 설정

달리 명시하지 않는 한 이 설정은 Instrumental 및 Vocals 벤치마크에 모두 적용됩니다.

설정
프롬프트당 트랙 수1
길이약 3분(또는 지원되는 가장 가까운 길이, 모델이 고정 길이 출력을 생성하는 경우 해당 길이 사용)
오디오 형식설정할 수 있는 경우 MP3, 그렇지 않으면 제공업체 기본값
샘플링 레이트설정할 수 있는 경우 44.1 kHz, 그렇지 않으면 제공업체 기본값
시드제공업체가 시드 매개변수를 제공하는 경우 42
가사모델이 프롬프트에서 생성(Vocals), Instrumental에는 해당 없음
보컬Instrumental에서는 끄고 Vocals에서는 켬

음악 모델마다 제공하는 매개변수가 매우 다릅니다. 제공업체가 기본값을 지원하지 않는 경우 지원되는 가장 가까운 값 또는 제공업체의 기본값을 사용합니다. Music Arena에서 사용하는 모든 생성 작업에는 모델별로 동일한 설정을 유지합니다.

Instrumental

Instrumental 모델은 보컬 없는 음악을 생성합니다. Instrumental 플래그 또는 보컬을 억제하는 스타일 및 네거티브 프롬프트 제어 기능 등을 통해 엔드포인트에서 반주 출력을 생성할 수 있는 경우에만 Instrumental 모달리티로 벤치마킹합니다. 엔드포인트에 반주와 보컬 생성을 구분하는 방법이 없으면 Vocals 모달리티로만 모델을 벤치마킹합니다.

Vocals

프롬프트를 받아 가사와 보컬을 자체적으로 생성할 수 있는 모델만 이 모달리티로 벤치마킹합니다. 가사를 제공하지 않으므로 이 벤치마크는 각 모델의 종단 간 작곡 역량을 반영합니다.

모델 및 제공업체 포함 기준

사용자가 음악 생성 모델을 선택하는 데 도움이 되도록 인기 있고 성능이 우수한 모델을 분석하고 비교하는 것이 목표입니다. 이에 따라 업계 중요도와 경쟁력 있는 성능을 검증해 신규 모델과 제공업체의 포함 여부를 평가합니다. 이 기준을 지속적으로 개선하고 있으며 의견이나 제안을 환영합니다. 모델 또는 제공업체를 제안하려면 문의 페이지를 통해 연락해 주세요.

독립성 선언

벤치마킹은 엄격한 독립성과 객관성을 바탕으로 수행됩니다. Artificial Analysis에 등재하거나 유리한 결과를 제공하는 대가로 어떠한 제공업체로부터도 보상을 받지 않습니다.