동영상 생성 벤치마킹 방법론

범위 및 배경

Artificial Analysis는 일반적으로 서버리스 API 엔드포인트를 통해 제공되는 동영상 생성 모델을 벤치마킹합니다. 이 페이지에서는 동영상 생성 모델의 품질, 속도, 가격을 측정하는 방법론을 설명합니다.

동영상 생성 기능에 대해 다음 여섯 가지 벤치마크를 공개합니다.

  • AA-Video-T2V-Silent v2.0: 텍스트 프롬프트만으로 동영상을 생성하는 모델입니다.
  • AA-Video-I2V-Silent v1.0: 참조 이미지를 첫 프레임으로 사용하고, 지원되는 경우 함께 제공된 텍스트 프롬프트를 사용해 동영상을 생성하는 모델입니다.
  • AA-Video-Editing-Silent v1.0: 입력 동영상과 텍스트 프롬프트를 바탕으로 동영상을 생성하는 모델입니다.
  • AA-Video-T2V v2.0: 동영상과 함께 동기화된 오디오를 생성하는 텍스트-동영상 모델입니다.
  • AA-Video-I2V v1.0: 동영상과 함께 동기화된 오디오를 생성하는 이미지-동영상 모델입니다.
  • AA-Video-Editing v1.0: 동영상과 함께 동기화된 오디오를 생성하는 동영상 편집 모델입니다.

Video Arena에서는 벤치마크마다 별도의 Elo 풀이 있으므로 무음 출력과 오디오 포함 출력을 직접 비교하지 않으며, 편집 결과와 생성 결과도 비교하지 않습니다.

모든 모델과 제공업체에서 생성하는 각 동영상에 표준 기본 설정을 적용합니다. 비교 가능성을 보장하기 위해 해상도, 프레임 속도, 길이, 화면 비율, 시드, 가이던스, 추론 단계 등 각 모델에 동일한 설정을 적용해 생성한 동영상을 사용합니다. 전체 기본 설정은 아래의 기본 생성 설정에 나와 있습니다.

엔드포인트 범위

포함되는 워크로드: 추론 벤치마킹은 텍스트-동영상 및 이미지-동영상 생성 엔드포인트를 대상으로 합니다.

공개 서버리스 엔드포인트만 포함: 벤치마킹은 현재 또는 향후 공개적으로 사용할 수 있는 실제 서버리스 엔드포인트를 대상으로 합니다. 데모 제품, 하드웨어 시연, 전용 또는 비공개 배포는 대상에서 제외됩니다.

표준 및 수정 엔드포인트

각 엔드포인트를 표준 또는 수정으로 분류합니다. 표준 엔드포인트는 네이티브 모델을 원래의 충실도로 제공하고 표준 입력 매개변수를 노출합니다. 수정 엔드포인트는 일반적으로 생성 속도를 높이거나 비용을 줄이기 위해 출력 충실도에 영향을 주는 방식으로 네이티브 모델을 변경한 것입니다.

수정 엔드포인트에는 Artificial Analysis에서 '수정' 레이블을 표시하며, 기본 리더보드 보기에서는 숨기되 표시를 선택한 사용자에게는 계속 보여 줄 수 있습니다. 기본 벤치마크의 공정성을 유지하기 위해 엔드포인트를 수정으로 분류할지와 단일 모델의 변형을 몇 개까지 표시할지는 당사가 결정합니다. 분류 지표에는 증류, 네이티브 모델 입력 매개변수의 일부만 노출하는 경우, 출력 품질의 유의미한 저하 등이 있습니다.

핵심 지표

다음 지표를 사용해 동영상 생성 모델의 품질, 성능, 가격을 추적합니다.

품질 Elo

각 모델의 Elo 점수는 당사가 모집한 패널의 블라인드 투표와, 2026년 1월 1일 이전에 Artificial Analysis Video Arena에서 던져진 공개 투표에서 산출한 상대적 품질을 나타냅니다. 두 경우 모두 투표자는 서로 다른 모델이 동일한 프롬프트로 생성한 동영상 두 개를 비교하고 더 선호하는 동영상을 선택합니다. 이 날짜 이전의 공개 투표는 텍스트-동영상과 이미지-동영상에만 있으며, 현재는 이미지-동영상에만 반영됩니다. 텍스트-동영상 벤치마크는 v2.0에서 초기화되었습니다(아래 AA-Video-T2V v2.0 & AA-Video-T2V-Silent v2.0 참조). 동영상 편집과 오디오 포함 세 가지 모달리티는 첫 공개 투표가 그 이후에 들어왔으므로 점수는 패널 투표만으로 산출합니다. 이러한 쌍대 투표를 Bradley-Terry 최대우도추정법으로 집계한 뒤 읽기 쉽도록 Elo와 유사한 범위로 재조정합니다. 평점은 매시간 다시 계산합니다.

아레나 대진에는 동일한 모달리티의 출력만 배정되므로 Elo는 각 벤치마크(AA-Video-T2V-Silent v2.0, AA-Video-I2V-Silent v1.0, AA-Video-Editing-Silent v1.0, AA-Video-T2V v2.0, AA-Video-I2V v1.0, AA-Video-Editing v1.0)별로 따로 표시합니다.

리더보드

벤치마크마다 글로벌 리더보드 하나를 공개합니다. AA-Video-T2V v2.0과 AA-Video-T2V-Silent v2.0은 카테고리 리더보드도 공개합니다(아래 참조).

  • 글로벌 리더보드: 이 사이트에 공개되는 순위로, 위 규칙이 유지한 모든 투표를 집계합니다. 모델은 최소 투표 수를 받으면 표시됩니다.

동영상 분당 가격

기본 생성 설정으로 동영상 1분 분량을 생성할 때 제공업체가 책정한 가격(USD)입니다.

가격은 각 제공업체가 게시한 분당 요금에서 직접 가져옵니다.

생성 시간

기본 생성 설정으로 동영상 한 개를 생성하는 데 제공업체가 걸린 시간의 중앙값이며, 최근 3일을 기준으로 계산합니다.

생성 시간은 요청을 제공업체에 제출한 순간부터 대기열 시간, 추론, 동영상 인코딩을 거쳐 제공업체에서 완성된 동영상을 다운로드할 때까지 종단 간으로 측정합니다. 비동기 API(제출 → 폴링 → 다운로드)의 경우 세 단계를 모두 포함합니다.

이미지-동영상 모델의 생성 시간에는 참조 이미지를 제공업체에 업로드하는 데 필요한 시간도 포함됩니다. 참조 이미지 URL을 받는 제공업체에는 업로드 단계가 없으므로 생성 시간에 이미지 업로드가 포함되지 않습니다.

기본 생성 설정

별도 명시가 없는 한 이 설정은 텍스트-동영상 및 이미지-동영상 벤치마크에 모두 적용됩니다.

설정값
해상도1080p(또는 지원되는 가장 가까운 값)
프레임 속도24 FPS(또는 지원되는 가장 가까운 값)
길이10초(길이를 프레임 단위로 지정해야 하는 경우 이에 해당하는 프레임 수)
화면 비율16:9 가로형
시드42(모델에서 시드 매개변수를 제공하는 경우)
프롬프트 향상모델 개발사가 권장하면 켜고, 그렇지 않으면 끔
CFG/가이던스제공업체 자체 API 기본값 또는 오픈 소스 저장소 기본값
추론 단계제공업체 자체 API 기본값 또는 오픈 소스 저장소 기본값

제공업체가 정확한 기본값을 지원하지 않으면 지원되는 가장 가까운 값을 사용하며, 거리가 같으면 더 큰 값을 선택합니다. 예를 들어 24 FPS를 사용할 수 없으면 기본값과의 차이가 같은 18 FPS보다 30 FPS를 우선합니다. AA-Video-T2V v2.0 및 AA-Video-I2V v1.0은 오디오 출력을 활성화한 상태로 모델을 벤치마킹하며, 그 밖의 모든 기본값은 동일하게 적용합니다.

텍스트-동영상

텍스트-동영상 모델은 텍스트 프롬프트만 입력으로 받습니다. 프롬프트는 선별된 재현 가능한 프롬프트 세트에서 가져옵니다.

이미지-동영상

이미지-동영상 모델은 참조 이미지와, 지원되는 경우 함께 제공되는 텍스트 프롬프트를 입력으로 받습니다. 벤치마크에서 사용하는 참조 이미지는 다음 기준을 따릅니다.

  • 형식: PNG(무손실)를 사용합니다. 손실 압축으로 인한 압축 아티팩트를 피하기 위해 JPG/JPEG는 사용하지 않습니다.
  • 해상도: 1920×1080(16:9, 목표 동영상 해상도와 동일)입니다.
  • 바이트 폴백: 제공업체가 URL을 받지 않거나 특정 크기 또는 형식을 요구하면 이미지를 다운로드하고 필요한 변환을 적용한 뒤 바이트를 직접 업로드합니다.
  • 업로드 시간: 생성 전 단계로 이미지를 제공업체 플랫폼에 업로드해야 하는 경우 해당 업로드 시간을 생성 시간에 포함합니다.

AA-Video-T2V v2.0 & AA-Video-T2V-Silent v2.0

방법론 개요

텍스트-동영상 모델은 사용 사례 전반에서 역량이 저마다 다릅니다. 어떤 모델은 인물 연기와 립싱크에서, 다른 모델은 애니메이션, 화면 속 텍스트, UI 모션에서 앞설 수 있습니다. 스튜디오가 브랜드 필름에 쓰는 모델이 프로덕트 팀의 UI 모션 데모나 크리에이터의 소셜 클립에 쓰이는 모델과 같으리란 법은 없습니다.

당사의 방법론은 이러한 차이를 직접 측정합니다. 실제 사용 사례와 모델 역량으로 구성된 분류 체계 전반에서 인간 선호로 모델의 순위를 매겨, 전체적으로 가장 좋은 모델과 특정 작업에 가장 좋은 모델을 가려냅니다. 프롬프트 세트를 정기적으로 갱신하여 리더보드가 움직이는 프런티어를 계속 측정하게 합니다.

AA-Video-T2V v2.0은 오디오가 포함된 텍스트-동영상을 평가합니다. AA-Video-T2V-Silent v2.0은 오디오가 없는 텍스트-동영상을 평가합니다.

프롬프트 큐레이션 및 갱신

모델 역량이 진화함에 따라 프런티어를 따라가도록 정기적으로 갱신되는 선별된 프롬프트 세트를 운영합니다.

  • 프롬프트 분류 체계: 모든 프롬프트는 실제 사용 사례와 모델 역량이라는 두 축에 맞춰 작성되며 두 축 모두에 태그가 붙습니다. 각 프롬프트에는 시각적 스타일 태그도 붙습니다. 아레나에서는 사용 사례와 역량 전반에 걸쳐 프롬프트를 균등하게 샘플링합니다.
  • 프롬프트 세트: AA-Video-T2V v2.0은 프롬프트 1,000개를 사용합니다. AA-Video-T2V-Silent v2.0은 프롬프트 500개를 사용합니다.
  • 최신성: 프롬프트 세트는 정기적으로 갱신됩니다. 더 이상 모델 간 차이를 구별하지 못하거나 오늘날 사람들이 동영상 모델에 프롬프트하는 방식을 반영하지 못하는 프롬프트는 폐기합니다.

프롬프트 분류 체계

프롬프트 분류 체계는 두 축을 따라 구성되며, 시각적 스타일은 별도로 태그합니다.

사용 사례. 소비자와 기업이 텍스트-동영상 생성을 어떻게 도입하는지에 대한 분석과 신흥 사용 사례에 대한 관찰에 근거합니다. 사용 사례별 예시 작업:

  • Marketing & Advertising: 애니메이션 포스터, 로고 스팅, 브랜드 필름, 히어로 제품 광고, 출시 영상
  • Retail & E-commerce: 스튜디오 제품 촬영, 제품 데모, 의류·패션 움직임, 크리에이터 스타일 추천 후기, 의상 착용
  • Live-Action Film: 시네마틱 숏, 마이크로드라마 에피소드, 프리비주얼라이제이션
  • Animation & Gaming: 애니메이션 장면, 게임 트레일러, 애니메이션·게임용 프리비주얼라이제이션
  • Architecture & Real Estate: 외관 플라이스루, 실내 워크스루, 가상 스테이징
  • Productivity & Knowledge Work: 설명 영상, 교육·훈련 영상, 애니메이션 데이터 시각화, 시나리오 시뮬레이션
  • UI/UX & Motion Design: 키네틱 타이포그래피, 다양한 기기의 UI 모션 데모, 추상 모션 그래픽
  • Consumer: 셀피, 개인적인 순간, 일상 스톡 푸티지와 B롤
  • Social Media & Creator Content: 토킹 헤드, 팟캐스트 클립, ASMR·만족감 영상, 댄스, 브이로그, 트렌드 포맷
  • Frontier: 현 프런티어와 그 너머의 역량

역량. 주요 모델 연구소와의 지속적인 협업과 그들이 추구하는 역량에서 도출했으며, 학술 벤치마크에 근거합니다. 역량별 예시:

  • Physics: 역학, 열 효과, 물질 간 상호작용, 파괴와 변형, 광학, 인과 관계, 반사실적 물리
  • Complex Composition: 속성 결합, 공간 관계, 다중 개체 상호작용, 개수 세기, 시간적 순서
  • Human Anatomy: 걸음걸이와 이동, 정밀한 동작, 표정, 곡예 동작, 물체 잡기, 사람 간 상호작용
  • Lighting & Materials: 조명, 노출, 그림자, 색온도, 텍스처, 천, 머리카락과 털
  • Multi-Scene & Narrative: 다중 사건 스토리, 숏 전환, 몽타주, 숏 간 정체성 일관성
  • Camera Control: 클로즈업, 항공, POV, 로우 앵글 등의 숏 유형과 트래킹, 돌리, 오빗, 크레인, 크래시 줌, 휩 팬, 랙 포커스 등의 카메라 무빙
  • Text Rendering: 짧은 텍스트와 긴 텍스트, 2D 레이아웃, 비어휘적 문자열, 변형되는 표면 위의 텍스트
  • Spatio-Temporal Consistency: 공간적 일관성, 타임랩스, 가려짐과 재등장, 단일 숏 스토리
  • Audio Synchronization: 디제시스 효과음, 배경 음악과 스코어, 화면 안팎의 소리
  • Dialogue & Lip Sync: 단일·다중 화자 대화, 보이스오버와 화면 속 발화

스타일. 각 프롬프트에는 여덟 가지 시각적 스타일 중 하나의 태그도 붙습니다. Photorealistic, 3D Render/CGI, Cartoon and Anime, Flat Design, Hand-drawn/Illustration, Stop-Motion/Claymation, Lo-Fi, Mixed Styles입니다. 스타일은 균등하게 샘플링하지 않으며, 대부분의 프롬프트는 Photorealistic 스타일입니다.

프롬프트 작성

프롬프트는 단순한 요청을 잘 처리하는 프런티어 동영상 모델 간의 차이를 가려내도록 작성합니다. 프롬프트는 다음과 같이 작성됩니다:

  • 분류 체계의 완전한 커버리지를 위해, 모든 사용 사례·역량 조합에 균등하게 분포시키고, 각 역량에서 미묘한 움직임보다 큰 규모의 움직임, 상호작용하는 여러 피사체와 같은 높은 복잡도 하한을 둡니다.
  • 실제 제작 업무를 반영하기 위해, 모델 개발사의 프롬프트 가이드, 당사의 기존 프롬프트 세트, 업계 전반에서 관찰되는 워크플로에 근거합니다.
  • 소리를 염두에 두고 AA-Video-T2V v2.0용으로 작성합니다. 장면에 필요한 경우 프롬프트에 대사, 효과음, 앰비언스, 음악을 명시합니다.

모든 프롬프트는 아레나에 제공하기 전에 사람이 검토합니다.

프롬프트 폐기

아레나 투표에서 더 이상 모델 간 차이를 구별하지 못하는 것으로 나타나거나, 사람들이 동영상 모델에 프롬프트하는 방식을 더 이상 반영하지 못하는 프롬프트는 폐기합니다.

샘플링 방법론

각 매치업마다 사용 사례·역량 조합 전반에서 균등하게 샘플링한 뒤, 선택된 조합 안에서 프롬프트를 무작위로 뽑습니다.

모든 매치업은 같은 벤치마크 안에서 같은 프롬프트로 생성된 두 동영상을 짝지으므로, 오디오 포함 동영상이 무음 동영상과 짝지어지는 일은 없습니다. 좌우 위치는 무작위로 정해집니다.

재생 기준

모든 동영상은 다음과 같은 동일한 기준으로 평가자에게 제공됩니다:

  • 해상도: 생성된 그대로 최대 1080p입니다. 동영상은 업스케일하지 않습니다. 1080p를 생성할 수 없는 모델은 지원되는 최고 해상도로 제공하고, 1080p를 넘는 출력은 1080p로 다운스케일합니다.
  • 인코딩: 고품질 H.264이며, 비트레이트 최고치는 10 Mbps로 제한합니다.
  • 길이: 16:9 비율의 10초입니다. 10초를 생성할 수 없는 모델은 최대 길이로 제공합니다.
  • 오디오 레벨 조정: AA-Video-T2V v2.0에서는 각 동영상의 음량을 단일 고정 게인으로 -18 LUFS에 가깝게 맞춥니다. 모델의 믹스는 압축하거나 리마스터하지 않으며, 음량이 더 크다는 이유로 이기는 모델은 없습니다.

Elo 산출

투표 수집

모델 품질은 인간 선호로 측정합니다.

  • 블라인드 쌍대 투표: 평가자는 같은 프롬프트로 서로 다른 두 모델이 생성한 두 동영상을 모델 정체를 모른 채 보고 선호하는 쪽을 고릅니다. 두 동영상은 하나의 플레이어에서 전체 크기로 재생되며, 평가자는 둘 사이를 전환하며 봅니다.
  • 심사 힌트: 각 매치업에는 프롬프트의 사용 사례, 주 역량, 스타일에 연결된 짧은 힌트가 표시되어, 시험 중인 구체적 측면으로 주의를 이끕니다.
  • 최소 상호작용: 각 동영상이 최소 8초 이상 재생된 후에만 투표할 수 있습니다. AA-Video-T2V v2.0에서는 평가자에게 헤드폰을 사용해 소리도 함께 평가하도록 요청합니다.
  • 투표 품질: 두 리더보드 모두 당사가 모집한 패널의 투표만으로 순위를 매기며, 패널 참가자는 패널 제공업체가 심사하고 검증합니다. 각 세션의 매치업 중 약 5분의 1은 합의가 뚜렷한 정답이 있는 품질 검사입니다. 이 검사를 통과하지 못한 세션은 거부되고 해당 세션의 투표는 모두 제거되며, 품질 검사 투표는 평점에 반영하지 않습니다.

투표 필터링

AA-Video-T2V v2.0과 AA-Video-T2V-Silent v2.0은 새로운 리더보드입니다. 이번 갱신 이전에 던져진 텍스트-동영상 투표는 이전 프롬프트와 재생 기준으로 수집되었으므로, 모든 모델에 대해 모두 폐기합니다. 공개 Video Arena 투표는 이 평점에 반영하지 않습니다. Elo는 유지된 투표로 처음부터 다시 계산하며, 전체 리더보드와 모든 하위 카테고리 리더보드에서 Kling 3.0 1080p (Pro) = 1000에 고정됩니다.

리더보드

각 벤치마크마다 다음을 공개합니다:

  • 전체 리더보드: 유지된 모든 투표에 걸친 순위입니다. 모델은 최소 투표 수를 받으면 표시됩니다.
  • 카테고리 리더보드: 특정 사용 사례, 역량 또는 스타일 태그가 붙은 프롬프트로 범위를 한정해 같은 방식으로 계산하며, 해당 카테고리에 충분한 투표가 쌓이면 공개합니다.

생성 시간 테스트 방법론

주요 기술 세부 정보:

  • 주기: 텍스트-동영상 테스트는 2시간마다 각 시간 구간 내 임의의 시점에 실행합니다.
  • 표본 크기: 대표 생성 시간은 최근 3일 동안 성공한 측정값의 중앙값입니다. 2시간마다 측정하므로 텍스트-동영상 테스트에는 일반적으로 기간별 제공업체당 약 36개의 표본이 쌓입니다.
  • 프롬프트 선택: 실행할 때마다 선별된 데이터베이스 풀에서 임의의 프롬프트 하나를 가져와 모든 활성 모델-제공업체 조합에 제출합니다.
  • 시드: 모델에서 시드 매개변수를 제공하는 경우 고정 시드 42를 사용해 실행 간 출력이 재현되도록 합니다.
  • 종단 간 측정: 생성 시간은 첫 API 호출부터 완성된 동영상 다운로드까지 종단 간으로 측정합니다. 비동기 API(제출, 폴링, 다운로드)를 사용하는 제공업체의 경우 대기열 대기, 추론, 다운로드를 포함합니다.
  • API 모드: 측정된 대기열 대기 시간이 폴링 간격이 아니라 제공업체 측의 실제 대기 시간을 반영하도록 100밀리초마다 작업 상태를 폴링합니다.
  • 범위: 현재 생성 시간은 무음 텍스트-동영상 및 이미지-동영상 모델에 대해서만 측정합니다. AA-Video-Editing-Silent v1.0과 세 가지 오디오 벤치마크(AA-Video-T2V v2.0, AA-Video-I2V v1.0, AA-Video-Editing v1.0)는 Video Arena(품질 Elo)에서 순위를 산정하지만 현재 지연 시간 벤치마킹은 하지 않습니다.
  • 집계: 이상치를 제거하지 않은 성공 측정값의 원시 분포에서 중앙값, p05, p25, p75, p95를 계산합니다.
  • 측정하지 않는 항목: 제공업체의 콜드 스타트 지연, 인증 핸드셰이크, 재시도 오버헤드, 클라이언트 워밍업은 측정하지 않습니다. 데이터 세트의 각 항목은 한 번만 수행한 측정값입니다.
  • 인프라: us-central1의 Google Cloud Run에서 실행합니다.
  • 새 엔드포인트: 공개 전에 벤치마킹한 엔드포인트를 포함해 새로 추가된 엔드포인트는 결과를 표시하기 전에 생성 시간 분포를 확보하도록 벤치마킹 주기를 조정할 수 있습니다. 게시 결과는 최근 3일의 측정값으로 계산하므로 새로 표시된 엔드포인트 수치는 초기 실행을 반영하며 측정값이 더 쌓이면 달라질 수 있습니다.

모델 및 제공업체 포함 기준

사용자가 적합한 모델을 선택하는 데 도움이 되도록 인기 있고 성능이 뛰어난 동영상 생성 모델을 분석하고 비교하는 것이 목표입니다. 이에 따라 업계 중요도와 경쟁력 있는 성능을 시험해 새 모델과 제공업체의 포함 여부를 평가합니다. 이 기준은 지속적으로 개선하며 의견이나 제안을 환영합니다. 모델 또는 제공업체를 제안하려면 문의 페이지로 연락해 주세요.

독립성 선언

벤치마킹은 엄격한 독립성과 객관성을 바탕으로 수행합니다. Artificial Analysis 목록에 게재하거나 유리한 결과를 내주는 대가로 어떠한 제공업체에서도 보상을 받지 않습니다.