이미지 생성 벤치마킹 방법론

범위 및 배경

Artificial Analysis는 일반적으로 서버리스 API 엔드포인트를 통해 제공되는 이미지 생성 모델을 벤치마킹합니다. 이 페이지에서는 이미지 생성 모델의 품질, 속도, 가격을 측정하는 방법론을 설명합니다.

이미지 생성 기능은 다음 두 가지 모달리티를 다룹니다:

  • 텍스트-이미지 생성: 텍스트 프롬프트만으로 이미지를 생성하는 모델입니다.
  • 이미지 편집: 텍스트 프롬프트에 따라 참조 이미지를 수정하는 모델입니다.

엔드포인트 범위

대상 워크로드: 추론 벤치마킹은 텍스트-이미지 생성 엔드포인트를 대상으로 합니다.

공개 서버리스 엔드포인트만: 벤치마킹은 현재 또는 향후 일반에 공개되는 진정한 서버리스 엔드포인트를 대상으로 합니다. 데모 제품, 하드웨어 쇼케이스, 전용 또는 비공개 배포는 범위에서 제외됩니다.

표준 및 수정 엔드포인트

각 엔드포인트는 표준 입력 매개변수가 공개되고 네이티브 모델을 온전한 충실도로 제공하는 표준 또는 일반적으로 생성 속도를 높이거나 비용을 줄이기 위해 출력 충실도에 영향을 주는 방식으로 네이티브 모델을 변경한 수정으로 분류합니다.

수정 엔드포인트는 Artificial Analysis에서 수정으로 표시하며, 기본 리더보드 보기에서는 숨겨지고 표시를 선택한 사용자에게만 보일 수 있습니다. 기본 벤치마크의 공정성을 유지하기 위해 엔드포인트를 수정으로 분류할지와 단일 모델의 변형을 몇 개 등재할지는 당사의 재량으로 결정합니다. 판단 지표로는 지식 증류, 네이티브 모델 입력 매개변수의 일부만 공개하는 경우, 출력 품질이 현저히 저하된 경우 등이 있습니다.

기본 생성 설정

각 모델이 공개한 기본값을 사용해 이미지를 생성합니다. 자사 API의 경우 API 문서에 명시된 기본값을, 오픈 소스 모델의 경우 오픈 소스 저장소의 기본값을 사용합니다. 여기에는 추론 스텝, 가이던스 스케일, 기본 네거티브 프롬프트 동작이 포함됩니다. 모델 간 공정한 비교를 위해 다음과 같이 정규화합니다:

  • 각 모델이 지원하는 최고 해상도로 생성한 다음, Arena에 제공할 때 1024×1024로 축소합니다.
  • 프롬프트당 이미지 1개를 생성합니다.
  • 1:1 화면비를 사용합니다.
  • 시드 42를 사용합니다.

이미지 편집 모델의 경우 각 프롬프트를 엄선한 세트의 참조 이미지와 짝지어 사용합니다.

주요 지표

다음 지표를 사용해 이미지 생성 모델의 품질, 성능, 가격을 추적합니다.

품질 Elo

각 모델의 Elo 점수는 Image Arena의 사용자 투표에서 도출된 상대적 품질을 나타냅니다. Bradley-Terry 최대 가능도 추정법으로 평점을 계산한 뒤 가독성을 위해 Elo와 유사한 범위로 재조정합니다.

Arena 대결에서는 같은 모달리티의 출력끼리만 짝지으므로 각 모달리티의 점수를 독립적으로 계산합니다.

이미지 1,000개당 가격

제공업체의 이미지 한 개 생성 가격(USD)에 1,000을 곱한 값입니다.

각 제공업체가 공개한 이미지당 요금을 직접 사용합니다.

생성 시간

최근 14일 동안 제공업체가 이미지 한 개를 생성하는 데 걸린 시간의 중앙값입니다.

이미지는 배치 크기 1로 생성합니다. 이미지 응답 대신 URL이 제공되는 경우 생성 시간에 제공업체에서 이미지를 다운로드하는 시간도 포함됩니다. 생성이 완료되기 전에 URL이 발급될 수 있으므로 이를 포함해야 최종 사용자가 체감하는 지연 시간을 반영할 수 있습니다.

Text to Image

방법론 개요

텍스트-이미지 모델은 다양한 사용 사례 전반에서 역량이 저마다 다릅니다. 어떤 모델은 텍스트 렌더링에서, 다른 모델은 복잡한 레이아웃이나 사진처럼 사실적인 인물 표현에서 앞설 수 있습니다. 에이전시가 캠페인 크리에이티브에 쓰는 모델이 프로덕트 매니저의 UI 목업이나 게임 스튜디오의 컨셉 아트에 쓰이는 모델과 같으리란 법은 없습니다.

우리의 방법론은 이러한 차이를 직접 측정합니다. 실제 사용 사례와 모델 역량으로 구성된 구조화된 분류 체계 전반에서 인간 선호로 모델의 순위를 매겨, 전체적으로 가장 좋은 모델과 특정 작업에 가장 좋은 모델을 가려냅니다. 이 분류 체계는 분야가 나아갈 방향을 내다보며, 주요 연구소들이 적극적으로 추구하는 역량과 이미지 생성이 실제로 도입되고 있는 사용 사례를 포괄합니다. 프롬프트 세트는 매월 갱신하여 리더보드가 움직이는 프런티어를 계속 측정하게 합니다.

프롬프트 큐레이션 및 갱신

빠르게 진화하는 모델 역량의 프런티어를 따라가고 리더보드의 공정성과 정확성을 지키기 위해, 정기적으로 갱신되는 프롬프트 로테이션을 운영합니다.

  • 프롬프트 분류 체계: 모든 프롬프트는 실제 사용 사례와 모델 역량이라는 두 축의 분류 체계에 맞춰 작성되며 두 축 모두에 태그가 붙습니다. 아레나에서는 분류 체계 전반에 걸쳐 프롬프트를 균등하게 샘플링합니다.
  • 실사용자 데이터: 프롬프트는 최종 사용자가 실제로 프롬프트하는 방식을 반영하도록 작성되며, 익명화된 크라우드소싱 데이터와 사람이 큐레이션해 지속 갱신하는 프롬프트 코퍼스를 참고합니다.
  • 최신성: 프롬프트 세트는 매월 갱신됩니다. 모델 간 차이를 얼마나 잘 구별하는지, 오늘날 실사용자의 이미지 모델 프롬프트 방식을 얼마나 잘 반영하는지에 따라 프롬프트를 폐기합니다.

우리의 프롬프트 세트는 실사용자 데이터의 신호를 담으면서도 사용 사례와 역량 전반에 편향 없는 균등한 커버리지를 제공합니다.

프롬프트 분류 체계

프롬프트 분류 체계는 두 축을 따라 구성됩니다.

사용 사례. 소비자와 기업이 텍스트-이미지 생성을 어떻게 도입하는지에 대한 분석과 신흥 사용 사례에 대한 관찰에 근거합니다. 사용 사례별 예시 작업:

  • Marketing & Advertising: 광고 크리에이티브, 캠페인 비주얼, 포스터, 브랜드 이미지
  • Retail & E-commerce: 제품 사진, 모델 착용 의류, 패키지 목업
  • Live-Action Film: 시네마틱 장면, 필름 스틸, 스토리보드, 캐릭터 시트
  • Animation & Gaming: 게임 에셋, 컨셉 아트, 캐릭터 디자인, 만화
  • Architecture & Real Estate: 실내외 시각화, 평면도, 스테이징
  • Productivity & Knowledge Work: 다이어그램, 인포그래픽, 차트, 슬라이드
  • UI/UX Design: 앱·웹·차량·공간 표면의 UI 목업
  • Consumer: 책 표지, 스톡 이미지, 에디토리얼 일러스트
  • Social Media & Creator Content: 썸네일, 프로모션 카드, 채널·프로필 아트
  • Frontier: 현 프런티어와 그 너머의 역량

역량. 주요 모델 연구소와의 지속적인 협업과 그들이 추구하는 역량에서 도출했으며, 학술 벤치마크에 근거합니다. 역량별 예시:

  • Reasoning: 개체·수학·공간·논리 추론, 개념 혼합, 관용구 해석
  • Knowledge: 실제 랜드마크와 생물 종, 과학·상식 영역의 사실
  • Text Rendering: 긴 텍스트, 작은 글씨, 기호, 예술적 레터링
  • Layout: 플로우, 화살표, 블록, 시각적 위계, 멀티 패널 구성
  • Complex Compositions: 정확한 개수 세기, 공간 관계, 피사체 상호작용, 속성 결합
  • Lighting: 반사, 굴절, 그림자, 커스틱
  • Material: 표면 속성, 투명도, 표면하 산란, 텍스처 사실감
  • Physics: 중력, 지지, 충돌, 열·상태 변화
  • Human Anatomy: 손, 얼굴, 신체 비율, 역동적 자세와 움직임

프롬프트 작성

프롬프트는 엄격한 작성 기준을 따릅니다. 평이한 자연어, 네거티브 프롬프트 필드를 비운 단일 포지티브 프롬프트, 특정 모델 계열에 유리하지 않은 아키텍처 중립적 표현입니다. 작성 시점에 중복 여부를 선별해 다양한 실사용 시나리오를 포괄하도록 합니다. 프롬프트는 다음과 같이 작성됩니다:

  • 분류 체계의 완전한 커버리지를 위해, 모든 사용 사례·역량 조합에 균등하게 분포시킵니다. 각 프롬프트가 사용 사례·역량·스타일 태그를 지니므로, 모델의 전체 품질뿐 아니라 사용자마다 중요한 구체적 단면에서의 성능도 평가할 수 있습니다. 복잡한 레이아웃 위계를 갖춘 UI 디자인에 최적인 모델이 필요한 사용자도 있고, 사실적인 인물이 담긴 근사한 시네마틱 숏이 필요한 사용자도 있습니다.
  • 최종 사용자가 실제로 프롬프트하는 방식을 반영하기 위해, 크라우드소싱으로 수집한 실사용자의 익명화된 프롬프트와 사람이 큐레이션해 실시간 갱신하는 소비자 프롬프트 패턴 코퍼스를 참고합니다.

모든 프롬프트는:

  • 영어로 작성
  • 사람이 큐레이션

그 결과, 신호는 높고 노이즈는 낮으며, 오늘과 가까운 미래에 최종 사용자와 산업에 가장 유의미한 생성 과제로 모델을 평가하는 프롬프트 세트가 만들어집니다.

프롬프트 폐기

매월 다음 두 기준으로 폐기할 프롬프트를 선정합니다:

  • 판별력: 프롬프트가 여전히 모델 역량 차이에 대한 뚜렷한 신호를 내는지 봅니다. 각 투표에서 (전체 리더보드 기준) 더 높은 평가를 받은 모델을 우세로 표시합니다. 우세 모델의 승률이 통계적으로 우연과 구별되지 않는 프롬프트는 폐기 대상으로 표시됩니다.
  • 최신성/현실성: 벤치마크 프롬프트 세트를 우리의 최신 크라우드소싱 프롬프트와 사람이 큐레이션한 프롬프트 코퍼스를 포함한 라이브 프롬프트 코퍼스와 비교해, 더는 실제 프롬프트 관행을 반영하지 않는 프롬프트를 걸러냅니다.

폐기된 프롬프트는 더 이상 아레나의 투표 수집에 제공되지 않습니다. 월 단위 갱신 주기는 리더보드의 무결성도 지켜 줍니다. 순환하는 프롬프트 세트에는 과적합할 수 없습니다.

샘플링 방법론

프롬프트 세트의 각 프롬프트에는 사용 사례 태그 1개와 주 역량 태그 1개가 붙습니다. 모든 사용 사례·역량 조합에서 프롬프트를 균등하게 샘플링합니다.

모든 매치업은 동일한 프롬프트로 같은 모달리티 안에서 생성된 두 출력을 짝짓습니다. 좌우 위치는 무작위이며 모델 정체는 투표 후에만 공개됩니다. 새로 추가된 모델은 평점이 수렴할 때까지 일시적으로 더 자주 샘플링되고, 상대는 각 매치업의 정보 가치를 극대화하도록 선정됩니다. 모든 사용 사례와 역량은 전체 리더보드 평점에 동일한 가중치로 기여합니다.

Elo 산출

투표 수집

모델 품질은 인간 선호로 측정합니다.

  • 블라인드 쌍대 투표: 평가자는 같은 프롬프트로 서로 다른 두 모델이 생성한 두 출력을 모델 정체를 모른 채 보고 선호하는 쪽을 고릅니다.
  • 심사 힌트: 각 매치업에는 프롬프트의 사용 사례·역량·스타일 태그에 연결된 짧은 힌트가 표시되어, 복잡한 프롬프트에서 시험 중인 구체적 측면으로 주의를 이끕니다.
  • 최소 상호작용: 각 출력과 최소 시간 이상 상호작용해야 투표할 수 있습니다.
  • 투표 품질: 모든 투표는 평점 계산에 들어가기 전 봇 감지와 이상 필터링을 거칩니다.

투표 필터링

현재 방법론이 측정하는 바에 맞춰 투표를 필터링합니다. 현재 방법론 이전의 투표는 이전 세대 모델을 가려내기 위해 작성된 프롬프트에 던져진 것입니다. 현재 모델들은 그 프롬프트 다수를 포화시켜 거의 모두가 수용 가능한 결과를 내므로, 그런 투표는 역량 차이가 아니라 동전 던지기를 기록할 뿐입니다. 따라서 과거 투표에는 코호트 기반 필터를 적용합니다:

  • 현행 코호트: 공개적으로 접근 가능하고 최근 출시되었으며 우리 독자에게 가장 유의미한 모델. 현재 방법론 아래 수집된 투표만으로 순위가 매겨집니다.
  • 레거시 코호트: 그 외 모든 모델. 자신이 등장한 모든 투표로 순위가 매겨져 리더보드에서의 대표성을 유지합니다.
  • 규칙: 투표는 참여한 두 모델 모두가 해당 투표에 적격일 때에만 유지됩니다.

이 필터는 봇·스팸 배제를 포함한 표준 투표 품질 필터 이후에 적용됩니다. Elo는 유지된 전체 투표 집합에 대해 처음부터 다시 계산되며, 현행·레거시 코호트를 막론하고 모든 모델이 그 단일 계산에서 순위가 매겨집니다. 평점은 전체 리더보드의 경우 FLUX.1 [schnell] = 1000, 모든 하위 카테고리 리더보드의 경우 FLUX.2 [dev] = 1000에 고정됩니다.

생성 시간 테스트 방법론

주요 기술 세부 정보:

  • 실행 주기: 하루 4회 무작위 시점에 벤치마크를 실행합니다.
  • 샘플 크기: 주요 생성 시간은 최근 14일간 성공한 측정값의 중앙값이며, 일반적으로 기간당 각 모델-제공업체 조합에서 약 56개의 샘플을 사용합니다.
  • 포함 항목: 각 측정에서는 이미지 한 개에 대한 전체 요청 수명 주기를 측정합니다. API 요청, 제공업체 추론, 인라인 응답 본문 또는 URL에서 디스크로 다운로드하는 시간이 포함됩니다. 제공업체가 URL을 반환하는 경우 이미지가 완전히 기록되기 전에 URL이 먼저 발급되는 일이 많으므로, 실제 최종 사용자의 지연 시간을 반영하기 위해 바이트 다운로드 시간도 계산합니다.
  • 고유 프롬프트: 엄선한 프롬프트 풀에서 호출마다 새 프롬프트를 생성하므로 제공업체가 실행 간에 캐시된 응답을 반환할 수 없습니다.
  • 해상도: 1024×1024로 생성합니다. 모델이 지원하는 최소 해상도가 1024×1024보다 높으면 1024×1024에 가장 가까운 최소 지원 해상도를 사용합니다.
  • API 모드: 제공업체가 동기식 엔드포인트를 제공하면 이를 사용합니다. 비동기식 엔드포인트만 제공하는 업체에는 100밀리초마다 작업 상태를 폴링하여 측정된 대기열 대기 시간이 폴링 간격이 아니라 실제 제공업체 처리 시간을 반영하도록 합니다.
  • 집계: 이상치를 제거하지 않고 성공한 측정값의 원시 분포에서 중앙값, p05, p25, p75, p95를 계산합니다.
  • 비활성화하는 제공업체 기능: 생성 속도와 무관한 지연 시간 편차 요인을 제거하기 위해 API에서 지원하는 경우 워터마크와 안전 검사를 비활성화합니다.
  • 측정하지 않는 항목: 제공업체의 콜드 스타트 지연, 인증 핸드셰이크, 재시도 오버헤드, 클라이언트 워밍업은 측정하지 않습니다. 데이터 세트의 각 항목은 단 한 번의 일회성 측정값입니다.
  • 인프라: Google Cloud의 us-central1에서 실행합니다.
  • 신규 엔드포인트: 공개 전에 벤치마킹한 엔드포인트를 포함해 새로 추가된 엔드포인트는 결과를 등재하기 전에 생성 시간 분포를 확보할 수 있도록 벤치마킹 주기를 조정할 수 있습니다. 게시 결과는 최근 14일간의 측정값으로 계산하므로 새로 등재된 엔드포인트 수치는 초기 실행 결과를 반영하며, 측정값이 더 쌓이면 달라질 수 있습니다.

모델 및 제공업체 포함 기준

사용자가 이미지 생성 모델을 선택하는 데 도움을 주기 위해 인기 있고 성능이 뛰어난 모델을 분석하고 비교하는 것이 목표입니다. 따라서 업계 중요도와 경쟁력 있는 성능 기준을 적용해 신규 모델 및 제공업체의 포함 여부를 평가합니다. 이러한 기준을 지속적으로 개선하고 있으며 모든 의견과 제안을 환영합니다. 모델 또는 제공업체를 제안하려면 문의 페이지를 통해 연락해 주세요.

독립성 선언

벤치마킹은 엄격한 독립성과 객관성을 바탕으로 수행합니다. Artificial Analysis 등재 또는 유리한 결과를 대가로 어떤 제공업체로부터도 보상을 받지 않습니다.