图像生成基准测试方法论

范围与背景

Artificial Analysis 对通常以 Serverless(无服务器)API 接入点形式提供的图像生成模型进行基准测试。本页介绍用于衡量图像生成模型质量、速度和价格的方法论。

在图像生成能力方面,我们涵盖两种模态:

  • 文生图:仅根据文本提示词生成图像的模型。
  • 图像编辑:根据文本提示词修改参考图像的模型。

接入点覆盖范围

覆盖的工作负载:推理基准测试覆盖文生图接入点。

仅限公开 Serverless 接入点:基准测试覆盖已经或即将公开可用的真正 Serverless 接入点。演示产品、硬件展示以及专用或私有部署不在范围之内。

标准与修改版接入点

我们将每个接入点分类为标准——以完整保真度提供原生模型服务,并公开其标准输入参数——或修改版——相对于原生模型进行了影响输出保真度的改动,通常是为了提升生成速度或降低成本。

修改版接入点在 Artificial Analysis 上标注为“修改版”,并可能在排行榜默认视图中被隐藏,仅对选择显示的用户可见。为维护我们默认基准测试的公平性,我们保留对接入点是否归类为修改版的裁定权——判定指标包括蒸馏、原生模型输入参数的部分暴露或输出质量的实质性下降——以及对同一模型列出多少变体的裁定权。

默认生成设置

我们使用每个模型发布的默认参数生成图像。对于第一方 API,这意味着 API 文档中记载的默认值;对于开放权重模型,则采用开源仓库中的默认值。这涵盖推理步数、引导系数(guidance scale)以及任何默认的负向提示词行为。为实现模型之间的公平比较,我们进行以下标准化处理:

  • 我们以每个模型支持的最高分辨率生成图像,然后缩放至 1024×1024 以供竞技场使用。
  • 每条提示词生成 1 张图像。
  • 使用 1:1 宽高比。
  • 使用种子值 42。

对于图像编辑模型,每条提示词会搭配一张来自精选集的参考图像。

关键指标

我们使用以下指标追踪图像生成模型的质量、性能和价格。

质量 Elo

每个模型的 Elo 分数反映其相对质量,来源于用户在图像竞技场中的投票。我们使用 Bradley-Terry 最大似然估计计算评分,并将其重新缩放至类 Elo 区间以便于阅读。

每种模态独立评分,因为竞技场对局仅在同一模态的输出之间进行。

每 1,000 张图像价格

服务商每生成一张图像的价格(美元),乘以 1,000。

价格直接取自各服务商公布的按图计费费率。

生成时间

服务商生成单张图像所需时间的中位数,基于过去 14 天的数据计算。

图像以批量大小 1 生成。生成时间包括在服务商返回 URL 而非图像响应时从该 URL 下载图像的耗时。这反映了终端用户的实际延迟,因为 URL 可能在生成完成之前即被返回。

Text to Image

方法论概述

文生图模型在广泛的用例上能力各不相同。有的模型可能在文字渲染上领先,有的则擅长复杂版式或照片级真实的人物。广告公司做营销创意用的模型,未必是产品经理做 UI 原型或游戏工作室做概念设计所用的模型。

我们的方法论直接衡量这种差异。我们基于一套由真实用例与模型能力构成的结构化分类体系,按人类偏好对模型排名,找出整体最好的模型以及最适合特定工作的模型。这套分类体系旨在预判领域的走向,覆盖领先实验室正在积极攻关的能力,以及图像生成获得真实应用的用例。我们的提示词集每月更新,使排行榜能持续测量不断前移的前沿。

提示词的策划与更新

我们维护一套定期轮换更新的提示词,以跟上快速演进的模型能力前沿,并保证排行榜的公平与准确。

  • 提示词分类体系:每条提示词都依照真实用例与模型能力两条轴线的分类体系撰写,并同时打上两类标签。竞技场中的提示词在整个分类体系上均匀抽样。
  • 真实用户数据:提示词的写法反映最终用户的真实提示习惯,参考了匿名众包数据,以及一套由人工策划、持续更新的提示词语料库。
  • 时效性:提示词集每月更新。是否退役取决于提示词区分模型的能力,以及它对当下真实用户提示习惯的反映程度。

我们的提示词集既承载真实用户数据的信号,又对用例与能力提供无偏、均匀的覆盖。

提示词分类体系

我们沿两条轴线构建提示词分类体系。

用例。这些用例基于我们对消费者与企业采用文生图的分析,以及对新兴用例的观察。各用例的示例任务包括:

  • Marketing & Advertising:广告创意、营销视觉、海报、品牌形象
  • Retail & E-commerce:产品图、模特着装、包装样机
  • Live-Action Film:电影场景、剧照、分镜、角色设定表
  • Animation & Gaming:游戏素材、概念设计、角色设计、漫画
  • Architecture & Real Estate:室内外可视化、平面图、布景
  • Productivity & Knowledge Work:图表、信息图、幻灯片
  • UI/UX Design:覆盖应用、网页、车载与空间界面的 UI 原型
  • Consumer:书籍封面、图库图片、社论插画
  • Social Media & Creator Content:视频封面、推广卡片、频道与主页视觉
  • Frontier:当前前沿及其之外的能力

能力。这些模型能力来自我们与领先实验室的持续合作及其正在攻关的方向,并以学术基准为依托。各能力的示例包括:

  • Reasoning:实体、数学、空间与逻辑推理,概念混合,习语理解
  • Knowledge:真实地标、物种,以及科学与常识领域的事实
  • Text Rendering:长文本、小字、符号、艺术字
  • Layout:流程、箭头、区块、视觉层级、多格构图
  • Complex Compositions:精确计数、空间关系、主体互动、属性绑定
  • Lighting:反射、折射、阴影、焦散
  • Material:表面属性、透明度、次表面散射、纹理真实感
  • Physics:重力、支撑、碰撞、热与物态变化
  • Human Anatomy:手部、面部、身体比例、动态姿势与动作

提示词编写

提示词遵循严格的编写标准:朴素的自然语言、单条正向提示且负向提示字段留空、措辞对架构中立而不偏向任何模型家族。提示词在编写时即做去重筛查,确保覆盖多样的真实使用场景。提示词的编写目标是:

  • 完整覆盖分类体系,在每个用例与能力组合上均匀分布。由于每条提示词都带有用例、能力与风格标签,我们不仅能评估模型整体质量,还能评估对每个用户真正重要的具体切面上的表现。有人需要最擅长复杂版式层级的 UI 设计模型,有人则需要带真实人物的震撼电影级画面。
  • 反映最终用户的真实提示方式,参考来自真实用户的众包匿名提示词,以及一套人工策划、实时更新的消费者提示模式语料库。

所有提示词均为:

  • 英文
  • 人工策划

由此得到高信号、低噪声的提示词集,以最终用户和行业当下及不久将来最相关的生成任务来评估模型。

提示词退役

每月我们按以下两条标准挑选要退役的提示词:

  • 区分度:提示词是否仍能对模型能力差异给出清晰信号。对每张投票,我们把(按全局排行榜)评分更高的模型记为热门。热门胜率在统计上与随机无异的提示词将被标记退役。
  • 时效/真实性:我们将基准提示词集与实时语料库对比,包括我们最新的众包提示词与人工策划语料库,滤除已不再反映真实提示习惯的提示词。

退役提示词不再在竞技场中用于收集投票。每月更新的节奏也保护了排行榜的公正性:不断轮换的提示词集无法被过拟合。

抽样方法

提示词集中的每条提示词都带有 1 个用例标签和 1 个主要能力标签。我们在每个用例与能力组合上均匀抽样。

每场对决都由同一条提示词在同一模态下生成的两个结果配对。左右位置随机,模型身份在投票后才揭晓。新加入的模型会临时提高抽样频率直至其评分收敛,对手的抽取以最大化每场对决的信息价值为准。每个用例与能力对排行榜总评分的贡献权重相同。

Elo 计算

投票收集

模型质量以人类偏好来衡量。

  • 盲测两两投票:评审者看到同一条提示词由两个不同模型生成的两个结果(不显示模型身份),选出更喜欢的一个。
  • 评判提示:每场对决展示与该提示词的用例、能力、风格标签绑定的简短提示,在复杂提示词上把注意力引向受测的具体方面。
  • 最短交互门槛:只有与每个结果达到最低交互时长后才能投票。
  • 投票质量:所有投票在进入评分计算前都会经过机器人检测与异常过滤。

投票过滤

我们按当前方法论所测量的内容过滤投票。早于当前方法论的投票,是在为区分上一代模型而写的提示词上投出的。当前模型已使其中许多提示词饱和——几乎所有模型都能给出可接受的结果——因此这类投票记录的是抛硬币,而非能力差异。因此我们对历史投票应用基于同组的过滤:

  • 当前组:公开可用、新近发布且与我们受众最相关的模型。仅用当前方法论下收集的投票排名。
  • 历史组:其余所有模型。以其出现过的全部投票排名,保留其在排行榜上的呈现。
  • 规则:一张投票被保留,当且仅当参与的两个模型都对它符合条件。

该过滤在标准投票质量过滤(包括机器人与刷票排除)之后应用。Elo 在整个保留投票集上从零重新计算,排行榜上的每个模型——无论当前组还是历史组——都在这一次计算中排名。评分以 FLUX.1 [schnell] = 1000 作为整体排行榜的锚点,以 FLUX.2 [dev] = 1000 作为所有子类别排行榜的锚点。

生成时间测试方法论

关键技术细节:

  • 测试频率:基准测试每天在随机时间运行 4 次。
  • 样本量:发布的生成时间为过去 14 天内成功测量值的中位数,每个托管模型在每个窗口期内通常约有 56 个样本。
  • 包含内容:每次测量计时覆盖单张图像的完整请求生命周期,包括 API 请求、服务商推理以及内联响应体或 URL 下载至磁盘的过程。当服务商返回 URL 时,该 URL 往往在图像完全写入之前即被返回,因此下载这些字节的时间会被计入,以反映终端用户的真实延迟。
  • 唯一提示词:每次调用都从精选池中生成新的提示词,以防止服务商在多次运行间返回缓存结果。
  • 分辨率:我们以 1024×1024 分辨率生成。如果模型支持的最低分辨率高于 1024×1024,则使用最接近 1024×1024 的最小支持分辨率。
  • API 模式:当服务商提供同步接入点时,我们优先使用同步接入点。对于仅支持异步的服务商,我们每 100 毫秒轮询一次任务状态,以确保测得的队列等待时间反映服务商的实际耗时,而非轮询间隔。
  • 聚合方式:中位数、p05、p25、p75 和 p95 均根据成功测量值的原始分布计算,不进行离群值裁剪。
  • 已禁用的服务商功能:在 API 支持的情况下,会禁用水印和安全检查,以排除与生成速度无关的延迟波动来源。
  • 未测量内容:服务商冷启动延迟、身份验证握手、重试开销以及任何客户端预热。数据集中的每条记录均为单次一次性测量。
  • 基础设施:运行于 Google Cloud us-central1 区域。
  • 新接入点:对于新增的接入点(包括在公开可用之前即已纳入基准测试的接入点),我们可能会调整测试频率以在结果上线前建立生成时间的分布。已发布的结果基于过去 14 天的测量数据计算,因此新上线接入点的数据反映的是初始运行结果,随着更多测量数据的积累,数值可能会发生变化。

模型与服务商收录标准

我们的目标是分析和比较热门且高性能的图像生成模型,帮助用户做出选择。为此,我们根据行业重要性和竞争力表现评估是否收录新的模型与服务商。我们持续优化这些标准,欢迎反馈和建议。如需推荐模型或服务商,请通过联系页面与我们联系。

独立性声明

基准测试以严格的独立性和客观性进行。Artificial Analysis 不接受任何服务商为获得上榜或有利结果而提供的报酬。