图像生成基准测试方法论
范围与背景
Artificial Analysis 对通常以 Serverless(无服务器)API 接入点形式提供的图像生成模型进行基准测试。本页介绍用于衡量图像生成模型质量、速度和价格的方法论。
在图像生成能力方面,我们涵盖两种模态:
- 文生图:仅根据文本提示词生成图像的模型。
- 图像编辑:根据文本提示词修改参考图像的模型。
接入点覆盖范围
覆盖的工作负载:推理基准测试覆盖文生图接入点。
仅限公开 Serverless 接入点:基准测试覆盖已经或即将公开可用的真正 Serverless 接入点。演示产品、硬件展示以及专用或私有部署不在范围之内。
标准与修改版接入点
我们将每个接入点分类为标准——以完整保真度提供原生模型服务,并公开其标准输入参数——或修改版——相对于原生模型进行了影响输出保真度的改动,通常是为了提升生成速度或降低成本。
修改版接入点在 Artificial Analysis 上标注为“修改版”,并可能在排行榜默认视图中被隐藏,仅对选择显示的用户可见。为维护我们默认基准测试的公平性,我们保留对接入点是否归类为修改版的裁定权——判定指标包括蒸馏、原生模型输入参数的部分暴露或输出质量的实质性下降——以及对同一模型列出多少变体的裁定权。
默认生成设置
我们使用每个模型发布的默认参数生成图像。对于第一方 API,这意味着 API 文档中记载的默认值;对于开放权重模型,则采用开源仓库中的默认值。这涵盖推理步数、引导系数(guidance scale)以及任何默认的负向提示词行为。为实现模型之间的公平比较,我们进行以下标准化处理:
- 我们以每个模型支持的最高分辨率生成图像,然后缩放至 1024×1024 以供竞技场使用。
- 每条提示词生成 1 张图像。
- 使用 1:1 宽高比。
- 使用种子值 42。
对于图像编辑模型,每条提示词会搭配一张来自精选集的参考图像。
关键指标
我们使用以下指标追踪图像生成模型的质量、性能和价格。
质量 Elo
每个模型的 Elo 分数反映其相对质量,来源于用户在图像竞技场中的投票。我们使用 Bradley-Terry 最大似然估计计算评分,并将其重新缩放至类 Elo 区间以便于阅读。
每种模态独立评分,因为竞技场对局仅在同一模态的输出之间进行。
每 1,000 张图像价格
服务商每生成一张图像的价格(美元),乘以 1,000。
价格直接取自各服务商公布的按图计费费率。
生成时间
服务商生成单张图像所需时间的中位数,基于过去 14 天的数据计算。
图像以批量大小 1 生成。生成时间包括在服务商返回 URL 而非图像响应时从该 URL 下载图像的耗时。这反映了终端用户的实际延迟,因为 URL 可能在生成完成之前即被返回。
生成时间测试方法论
关键技术细节:
- 测试频率:基准测试每天在随机时间运行 4 次。
- 样本量:发布的生成时间为过去 14 天内成功测量值的中位数,每个托管模型在每个窗口期内通常约有 56 个样本。
- 包含内容:每次测量计时覆盖单张图像的完整请求生命周期,包括 API 请求、服务商推理以及内联响应体或 URL 下载至磁盘的过程。当服务商返回 URL 时,该 URL 往往在图像完全写入之前即被返回,因此下载这些字节的时间会被计入,以反映终端用户的真实延迟。
- 唯一提示词:每次调用都从精选池中生成新的提示词,以防止服务商在多次运行间返回缓存结果。
- 分辨率:我们以 1024×1024 分辨率生成。如果模型支持的最低分辨率高于 1024×1024,则使用最接近 1024×1024 的最小支持分辨率。
- API 模式:当服务商提供同步接入点时,我们优先使用同步接入点。对于仅支持异步的服务商,我们每 100 毫秒轮询一次任务状态,以确保测得的队列等待时间反映服务商的实际耗时,而非轮询间隔。
- 聚合方式:中位数、p05、p25、p75 和 p95 均根据成功测量值的原始分布计算,不进行离群值裁剪。
- 已禁用的服务商功能:在 API 支持的情况下,会禁用水印和安全检查,以排除与生成速度无关的延迟波动来源。
- 未测量内容:服务商冷启动延迟、身份验证握手、重试开销以及任何客户端预热。数据集中的每条记录均为单次一次性测量。
- 基础设施:运行于 Google Cloud us-central1 区域。
- 新接入点:对于新增的接入点(包括在公开可用之前即已纳入基准测试的接入点),我们可能会调整测试频率以在结果上线前建立生成时间的分布。已发布的结果基于过去 14 天的测量数据计算,因此新上线接入点的数据反映的是初始运行结果,随着更多测量数据的积累,数值可能会发生变化。
模型与服务商收录标准
我们的目标是分析和比较热门且高性能的图像生成模型,帮助用户做出选择。为此,我们根据行业重要性和竞争力表现评估是否收录新的模型与服务商。我们持续优化这些标准,欢迎反馈和建议。如需推荐模型或服务商,请通过联系页面与我们联系。
独立性声明
基准测试以严格的独立性和客观性进行。Artificial Analysis 不接受任何服务商为获得上榜或有利结果而提供的报酬。