이미지 생성 벤치마킹 방법론

범위 및 배경

Artificial Analysis는 일반적으로 서버리스 API 엔드포인트를 통해 제공되는 이미지 생성 모델을 벤치마킹합니다. 이 페이지에서는 이미지 생성 모델의 품질, 속도, 가격을 측정하는 방법론을 설명합니다.

이미지 생성 기능은 다음 두 가지 모달리티를 다룹니다:

  • 텍스트-이미지 생성: 텍스트 프롬프트만으로 이미지를 생성하는 모델입니다.
  • 이미지 편집: 텍스트 프롬프트에 따라 참조 이미지를 수정하는 모델입니다.

엔드포인트 범위

대상 워크로드: 추론 벤치마킹은 텍스트-이미지 생성 엔드포인트를 대상으로 합니다.

공개 서버리스 엔드포인트만: 벤치마킹은 현재 또는 향후 일반에 공개되는 진정한 서버리스 엔드포인트를 대상으로 합니다. 데모 제품, 하드웨어 쇼케이스, 전용 또는 비공개 배포는 범위에서 제외됩니다.

표준 및 수정 엔드포인트

각 엔드포인트는 표준 입력 매개변수가 공개되고 네이티브 모델을 온전한 충실도로 제공하는 표준 또는 일반적으로 생성 속도를 높이거나 비용을 줄이기 위해 출력 충실도에 영향을 주는 방식으로 네이티브 모델을 변경한 수정으로 분류합니다.

수정 엔드포인트는 Artificial Analysis에서 수정으로 표시하며, 기본 리더보드 보기에서는 숨겨지고 표시를 선택한 사용자에게만 보일 수 있습니다. 기본 벤치마크의 공정성을 유지하기 위해 엔드포인트를 수정으로 분류할지와 단일 모델의 변형을 몇 개 등재할지는 당사의 재량으로 결정합니다. 판단 지표로는 지식 증류, 네이티브 모델 입력 매개변수의 일부만 공개하는 경우, 출력 품질이 현저히 저하된 경우 등이 있습니다.

기본 생성 설정

각 모델이 공개한 기본값을 사용해 이미지를 생성합니다. 자사 API의 경우 API 문서에 명시된 기본값을, 오픈 소스 모델의 경우 오픈 소스 저장소의 기본값을 사용합니다. 여기에는 추론 스텝, 가이던스 스케일, 기본 네거티브 프롬프트 동작이 포함됩니다. 모델 간 공정한 비교를 위해 다음과 같이 정규화합니다:

  • 각 모델이 지원하는 최고 해상도로 생성한 다음, Arena에 제공할 때 1024×1024로 축소합니다.
  • 프롬프트당 이미지 1개를 생성합니다.
  • 1:1 화면비를 사용합니다.
  • 시드 42를 사용합니다.

이미지 편집 모델의 경우 각 프롬프트를 엄선한 세트의 참조 이미지와 짝지어 사용합니다.

주요 지표

다음 지표를 사용해 이미지 생성 모델의 품질, 성능, 가격을 추적합니다.

품질 Elo

각 모델의 Elo 점수는 Image Arena의 사용자 투표에서 도출된 상대적 품질을 나타냅니다. Bradley-Terry 최대 가능도 추정법으로 평점을 계산한 뒤 가독성을 위해 Elo와 유사한 범위로 재조정합니다.

Arena 대결에서는 같은 모달리티의 출력끼리만 짝지으므로 각 모달리티의 점수를 독립적으로 계산합니다.

이미지 1,000개당 가격

제공업체의 이미지 한 개 생성 가격(USD)에 1,000을 곱한 값입니다.

각 제공업체가 공개한 이미지당 요금을 직접 사용합니다.

생성 시간

최근 14일 동안 제공업체가 이미지 한 개를 생성하는 데 걸린 시간의 중앙값입니다.

이미지는 배치 크기 1로 생성합니다. 이미지 응답 대신 URL이 제공되는 경우 생성 시간에 제공업체에서 이미지를 다운로드하는 시간도 포함됩니다. 생성이 완료되기 전에 URL이 발급될 수 있으므로 이를 포함해야 최종 사용자가 체감하는 지연 시간을 반영할 수 있습니다.

생성 시간 테스트 방법론

주요 기술 세부 정보:

  • 실행 주기: 하루 4회 무작위 시점에 벤치마크를 실행합니다.
  • 샘플 크기: 주요 생성 시간은 최근 14일간 성공한 측정값의 중앙값이며, 일반적으로 기간당 각 모델-제공업체 조합에서 약 56개의 샘플을 사용합니다.
  • 포함 항목: 각 측정에서는 이미지 한 개에 대한 전체 요청 수명 주기를 측정합니다. API 요청, 제공업체 추론, 인라인 응답 본문 또는 URL에서 디스크로 다운로드하는 시간이 포함됩니다. 제공업체가 URL을 반환하는 경우 이미지가 완전히 기록되기 전에 URL이 먼저 발급되는 일이 많으므로, 실제 최종 사용자의 지연 시간을 반영하기 위해 바이트 다운로드 시간도 계산합니다.
  • 고유 프롬프트: 엄선한 프롬프트 풀에서 호출마다 새 프롬프트를 생성하므로 제공업체가 실행 간에 캐시된 응답을 반환할 수 없습니다.
  • 해상도: 1024×1024로 생성합니다. 모델이 지원하는 최소 해상도가 1024×1024보다 높으면 1024×1024에 가장 가까운 최소 지원 해상도를 사용합니다.
  • API 모드: 제공업체가 동기식 엔드포인트를 제공하면 이를 사용합니다. 비동기식 엔드포인트만 제공하는 업체에는 100밀리초마다 작업 상태를 폴링하여 측정된 대기열 대기 시간이 폴링 간격이 아니라 실제 제공업체 처리 시간을 반영하도록 합니다.
  • 집계: 이상치를 제거하지 않고 성공한 측정값의 원시 분포에서 중앙값, p05, p25, p75, p95를 계산합니다.
  • 비활성화하는 제공업체 기능: 생성 속도와 무관한 지연 시간 편차 요인을 제거하기 위해 API에서 지원하는 경우 워터마크와 안전 검사를 비활성화합니다.
  • 측정하지 않는 항목: 제공업체의 콜드 스타트 지연, 인증 핸드셰이크, 재시도 오버헤드, 클라이언트 워밍업은 측정하지 않습니다. 데이터 세트의 각 항목은 단 한 번의 일회성 측정값입니다.
  • 인프라: Google Cloud의 us-central1에서 실행합니다.
  • 신규 엔드포인트: 공개 전에 벤치마킹한 엔드포인트를 포함해 새로 추가된 엔드포인트는 결과를 등재하기 전에 생성 시간 분포를 확보할 수 있도록 벤치마킹 주기를 조정할 수 있습니다. 게시 결과는 최근 14일간의 측정값으로 계산하므로 새로 등재된 엔드포인트 수치는 초기 실행 결과를 반영하며, 측정값이 더 쌓이면 달라질 수 있습니다.

모델 및 제공업체 포함 기준

사용자가 이미지 생성 모델을 선택하는 데 도움을 주기 위해 인기 있고 성능이 뛰어난 모델을 분석하고 비교하는 것이 목표입니다. 따라서 업계 중요도와 경쟁력 있는 성능 기준을 적용해 신규 모델 및 제공업체의 포함 여부를 평가합니다. 이러한 기준을 지속적으로 개선하고 있으며 모든 의견과 제안을 환영합니다. 모델 또는 제공업체를 제안하려면 문의 페이지를 통해 연락해 주세요.

독립성 선언

벤치마킹은 엄격한 독립성과 객관성을 바탕으로 수행합니다. Artificial Analysis 등재 또는 유리한 결과를 대가로 어떤 제공업체로부터도 보상을 받지 않습니다.