동영상 생성 벤치마킹 방법론
범위 및 배경
Artificial Analysis는 일반적으로 서버리스 API 엔드포인트를 통해 제공되는 동영상 생성 모델을 벤치마킹합니다. 이 페이지에서는 동영상 생성 모델의 품질, 속도, 가격을 측정하는 방법론을 설명합니다.
동영상 생성 기능은 다음 여섯 가지 모달리티를 다룹니다.
- 텍스트-동영상: 텍스트 프롬프트만으로 동영상을 생성하는 모델입니다.
- 이미지-동영상: 참조 이미지를 첫 프레임으로 사용하고, 지원되는 경우 함께 제공된 텍스트 프롬프트를 사용해 동영상을 생성하는 모델입니다.
- 동영상 편집: 입력 동영상과 텍스트 프롬프트를 바탕으로 동영상을 생성하는 모델입니다.
- 오디오 포함 텍스트-동영상: 동영상과 함께 동기화된 오디오를 생성하는 텍스트-동영상 모델입니다.
- 오디오 포함 이미지-동영상: 동영상과 함께 동기화된 오디오를 생성하는 이미지-동영상 모델입니다.
- 오디오 포함 동영상 편집: 동영상과 함께 동기화된 오디오를 생성하는 동영상 편집 모델입니다.
Video Arena에서는 모달리티마다 별도의 Elo 풀이 있으므로 무음 출력과 오디오 포함 출력을 직접 비교하지 않으며, 편집 결과와 생성 결과도 비교하지 않습니다.
모든 모델과 제공업체에서 생성하는 각 동영상에 표준 기본 설정을 적용합니다. 비교 가능성을 보장하기 위해 해상도, 프레임 속도, 길이, 화면 비율, 시드, 가이던스, 추론 단계 등 각 모델에 동일한 설정을 적용해 생성한 동영상을 사용합니다. 전체 기본 설정은 아래의 기본 생성 설정에 나와 있습니다.
엔드포인트 범위
포함되는 워크로드: 추론 벤치마킹은 텍스트-동영상 및 이미지-동영상 생성 엔드포인트를 대상으로 합니다.
공개 서버리스 엔드포인트만 포함: 벤치마킹은 현재 또는 향후 공개적으로 사용할 수 있는 실제 서버리스 엔드포인트를 대상으로 합니다. 데모 제품, 하드웨어 시연, 전용 또는 비공개 배포는 대상에서 제외됩니다.
표준 및 수정 엔드포인트
각 엔드포인트를 표준 또는 수정으로 분류합니다. 표준 엔드포인트는 네이티브 모델을 원래의 충실도로 제공하고 표준 입력 매개변수를 노출합니다. 수정 엔드포인트는 일반적으로 생성 속도를 높이거나 비용을 줄이기 위해 출력 충실도에 영향을 주는 방식으로 네이티브 모델을 변경한 것입니다.
수정 엔드포인트에는 Artificial Analysis에서 '수정' 레이블을 표시하며, 기본 리더보드 보기에서는 숨기되 표시를 선택한 사용자에게는 계속 보여 줄 수 있습니다. 기본 벤치마크의 공정성을 유지하기 위해 엔드포인트를 수정으로 분류할지와 단일 모델의 변형을 몇 개까지 표시할지는 당사가 결정합니다. 분류 지표에는 증류, 네이티브 모델 입력 매개변수의 일부만 노출하는 경우, 출력 품질의 유의미한 저하 등이 있습니다.
핵심 지표
다음 지표를 사용해 동영상 생성 모델의 품질, 성능, 가격을 추적합니다.
품질 Elo
각 모델의 Elo 점수는 Artificial Analysis Video Arena의 사용자 투표에서 산출한 상대적 품질을 나타냅니다. 아레나에서 사용자는 서로 다른 모델이 동일한 프롬프트로 생성한 동영상 두 개를 비교하고 더 선호하는 동영상을 선택합니다. 이러한 쌍대 투표를 Bradley-Terry 최대우도추정법으로 집계한 뒤 읽기 쉽도록 Elo와 유사한 범위로 재조정합니다. 평점은 매시간 다시 계산합니다.
아레나 대진에는 동일한 모달리티의 출력만 배정되므로 Elo는 각 모달리티(텍스트-동영상, 이미지-동영상, 동영상 편집, 오디오 포함 텍스트-동영상, 오디오 포함 이미지-동영상, 오디오 포함 동영상 편집)별로 따로 표시합니다.
동영상 분당 가격
기본 생성 설정으로 동영상 1분 분량을 생성할 때 제공업체가 책정한 가격(USD)입니다.
가격은 각 제공업체가 게시한 분당 요금에서 직접 가져옵니다.
생성 시간
기본 생성 설정으로 동영상 한 개를 생성하는 데 제공업체가 걸린 시간의 중앙값이며, 최근 14일을 기준으로 계산합니다.
생성 시간은 요청을 제공업체에 제출한 순간부터 대기열 시간, 추론, 동영상 인코딩을 거쳐 제공업체에서 완성된 동영상을 다운로드할 때까지 종단 간으로 측정합니다. 비동기 API(제출 → 폴링 → 다운로드)의 경우 세 단계를 모두 포함합니다.
이미지-동영상 모델의 생성 시간에는 참조 이미지를 제공업체에 업로드하는 데 필요한 시간도 포함됩니다. 참조 이미지 URL을 받는 제공업체에는 업로드 단계가 없으므로 생성 시간에 이미지 업로드가 포함되지 않습니다.
기본 생성 설정
별도 명시가 없는 한 이 설정은 텍스트-동영상 및 이미지-동영상 벤치마크에 모두 적용됩니다.
| 설정 | 값 |
|---|---|
| 해상도 | 1080p(또는 지원되는 가장 가까운 값) |
| 프레임 속도 | 24 FPS(또는 지원되는 가장 가까운 값) |
| 길이 | 10초(길이를 프레임 단위로 지정해야 하는 경우 이에 해당하는 프레임 수) |
| 화면 비율 | 16:9 가로형 |
| 시드 | 42(모델에서 시드 매개변수를 제공하는 경우) |
| 프롬프트 향상 | 모델 개발사가 권장하면 켜고, 그렇지 않으면 끔 |
| CFG/가이던스 | 제공업체 자체 API 기본값 또는 오픈 소스 저장소 기본값 |
| 추론 단계 | 제공업체 자체 API 기본값 또는 오픈 소스 저장소 기본값 |
제공업체가 정확한 기본값을 지원하지 않으면 지원되는 가장 가까운 값을 사용하며, 거리가 같으면 더 큰 값을 선택합니다. 예를 들어 24 FPS를 사용할 수 없으면 기본값과의 차이가 같은 18 FPS보다 30 FPS를 우선합니다. 오디오 포함 텍스트-동영상 및 오디오 포함 이미지-동영상 하위 모달리티는 오디오 출력을 활성화한 상태로 모델을 벤치마킹하며, 그 밖의 모든 기본값은 동일하게 적용합니다.
텍스트-동영상
텍스트-동영상 모델은 텍스트 프롬프트만 입력으로 받습니다. 프롬프트는 선별된 재현 가능한 프롬프트 세트에서 가져옵니다.
이미지-동영상
이미지-동영상 모델은 참조 이미지와, 지원되는 경우 함께 제공되는 텍스트 프롬프트를 입력으로 받습니다. 벤치마크에서 사용하는 참조 이미지는 다음 기준을 따릅니다.
- 형식: PNG(무손실)를 사용합니다. 손실 압축으로 인한 압축 아티팩트를 피하기 위해 JPG/JPEG는 사용하지 않습니다.
- 해상도: 1920×1080(16:9, 목표 동영상 해상도와 동일)입니다.
- 바이트 폴백: 제공업체가 URL을 받지 않거나 특정 크기 또는 형식을 요구하면 이미지를 다운로드하고 필요한 변환을 적용한 뒤 바이트를 직접 업로드합니다.
- 업로드 시간: 생성 전 단계로 이미지를 제공업체 플랫폼에 업로드해야 하는 경우 해당 업로드 시간을 생성 시간에 포함합니다.
생성 시간 테스트 방법론
주요 기술 세부 정보:
- 주기: 텍스트-동영상 테스트는 매일 임의의 시간에 한 번 실행합니다.
- 표본 크기: 대표 생성 시간은 최근 14일 동안 성공한 측정값의 중앙값입니다. 매일 실행하므로 텍스트-동영상 테스트에는 일반적으로 기간별 제공업체당 약 14개의 표본이 쌓입니다.
- 프롬프트 선택: 실행할 때마다 선별된 데이터베이스 풀에서 임의의 프롬프트 하나를 가져와 모든 활성 모델-제공업체 조합에 제출합니다.
- 시드: 모델에서 시드 매개변수를 제공하는 경우 고정 시드 42를 사용해 실행 간 출력이 재현되도록 합니다.
- 종단 간 측정: 생성 시간은 첫 API 호출부터 완성된 동영상 다운로드까지 종단 간으로 측정합니다. 비동기 API(제출, 폴링, 다운로드)를 사용하는 제공업체의 경우 대기열 대기, 추론, 다운로드를 포함합니다.
- API 모드: 측정된 대기열 대기 시간이 폴링 간격이 아니라 제공업체 측의 실제 대기 시간을 반영하도록 100밀리초마다 작업 상태를 폴링합니다.
- 범위: 현재 생성 시간은 무음 텍스트-동영상 및 이미지-동영상 모델에 대해서만 측정합니다. 동영상 편집과 세 가지 오디오 모달리티(오디오 포함 텍스트-동영상, 오디오 포함 이미지-동영상, 오디오 포함 동영상 편집)는 Video Arena(품질 Elo)에서 순위를 산정하지만 현재 지연 시간 벤치마킹은 하지 않습니다.
- 집계: 이상치를 제거하지 않은 성공 측정값의 원시 분포에서 중앙값, p05, p25, p75, p95를 계산합니다.
- 측정하지 않는 항목: 제공업체의 콜드 스타트 지연, 인증 핸드셰이크, 재시도 오버헤드, 클라이언트 워밍업은 측정하지 않습니다. 데이터 세트의 각 항목은 한 번만 수행한 측정값입니다.
- 인프라: us-central1의 Google Cloud Run에서 실행합니다.
- 새 엔드포인트: 공개 전에 벤치마킹한 엔드포인트를 포함해 새로 추가된 엔드포인트는 결과를 표시하기 전에 생성 시간 분포를 확보하도록 벤치마킹 주기를 조정할 수 있습니다. 게시 결과는 최근 14일의 측정값으로 계산하므로 새로 표시된 엔드포인트 수치는 초기 실행을 반영하며 측정값이 더 쌓이면 달라질 수 있습니다.
모델 및 제공업체 포함 기준
사용자가 적합한 모델을 선택하는 데 도움이 되도록 인기 있고 성능이 뛰어난 동영상 생성 모델을 분석하고 비교하는 것이 목표입니다. 이에 따라 업계 중요도와 경쟁력 있는 성능을 시험해 새 모델과 제공업체의 포함 여부를 평가합니다. 이 기준은 지속적으로 개선하며 의견이나 제안을 환영합니다. 모델 또는 제공업체를 제안하려면 문의 페이지로 연락해 주세요.
독립성 선언
벤치마킹은 엄격한 독립성과 객관성을 바탕으로 수행합니다. Artificial Analysis 목록에 게재하거나 유리한 결과를 내주는 대가로 어떠한 제공업체에서도 보상을 받지 않습니다.