Phi-4 Multimodal Instruct 智能、性能与价格分析
Phi-4 Multimodal Instruct 的智能水平低于平均水平,但价格很有竞争力;比较对象为其他规模相近的开放权重非推理模型。 该模型支持文本、图像和语音输入,可输出文本,上下文窗口为 128k 个 token,知识截止至 2024年6月。
Phi-4 Multimodal Instruct 在 Artificial Analysis Intelligence Index 上的得分为 6,在同类模型中低于平均水平(中位数:6)。
Phi-4 Multimodal Instruct 每 100 万输入 token 的价格为 $0.00(很有竞争力,中位数:$0.03),每 100 万输出 token 的价格为 $0.00(很有竞争力,中位数:$0.14)。
| 推理 | 否 此页面展示该模型的非推理版本。 可能还存在推理版本。 |
|---|---|
| 输入模态 | 支持:文本、图像和语音 |
| 输出模态 | 支持:文本 |
| 知识截止日期 | 2024年6月1日 |
| 上下文窗口 | 128k 约 192 页 A4 纸(12 号 Arial 字体) |
| 总参数量 | 5.6B |
| 许可证 | MIT |
| 模型权重 | Hugging Face |
指标与同类别模型进行比较:
- 非推理模型 → 仅与其他非推理模型比较
- 推理模型 → 同时与推理和非推理模型比较
- 开放权重模型 → 仅与规模类别相同的其他开放权重模型比较:
- 微型:≤4B 个参数
- 小型:4B–40B 个参数
- 中型:40B–150B 个参数
- 大型:>150B 个参数
- 专有模型 → 与价格区间相同的专有模型和开放权重模型比较,采用输入/输出价格 3:1 的混合比例:
- 每 100 万 token <$0.15
- 每 100 万 token $0.15–$1
- 每 100 万 token >$1
智能Updated
Artificial Analysis Intelligence Index
Artificial Analysis Intelligence Index:开放权重与专有模型
Intelligence Evaluations
Agentic knowledge work, (Elo-500)/2000
Agentic real-world work tasks, (Elo-500)/2000
Agentic SaaS workflows
Agentic coding & terminal use
Coding
Reasoning & knowledge
Professional document reasoning, All-pass
Physics reasoning
Knowledge
1 - hallucination rate
Long context reasoning
Legal agentic work, criterion pass rate
Agentic business operations
Agentic scientific research workflows in a terminal
Quantitative analysis on spreadsheets & documents
Kubernetes incident root-cause analysis
Visual reasoning
Medical long context reasoning
开放性指数
Artificial Analysis 开放性指数:得分
Intelligence Index 比较
Intelligence Index 与每项任务的成本
成本
每项 Intelligence Index 任务的成本
运行 Artificial Analysis Intelligence Index 的成本
价格:缓存命中、输入和输出
上下文窗口
上下文窗口
模型规模(仅开放权重模型)
模型规模:总参数量与活跃参数量
常见问题
关于 Phi-4 Multimodal Instruct 的常见问题
Phi-4 Multimodal Instruct 发布于 2025年2月26日。
Phi-4 Multimodal Instruct 由 Microsoft 开发。
Phi-4 Multimodal Instruct 在 Artificial Analysis Intelligence Index 上的估算得分为 6,在其他规模相近的开放权重非推理模型中低于平均水平(中位数:6)。
否,Phi-4 Multimodal Instruct 不是推理模型。它不进行扩展的思维链推理,而是直接作答。
Phi-4 Multimodal Instruct 支持文本、图像和语音输入。
Phi-4 Multimodal Instruct 支持文本输出。
是,Phi-4 Multimodal Instruct 支持图像输入,可以分析、描述图像并回答有关图像的问题。
是,Phi-4 Multimodal Instruct 是多模态模型,可以处理文本、图像和语音输入并生成文本输出。
Phi-4 Multimodal Instruct 的上下文窗口为 130k 个 token。这决定了模型在单次请求中可以处理多少文本和对话历史。
是,Phi-4 Multimodal Instruct 是开放权重模型,其模型权重已公开,可供下载并自行托管。
Phi-4 Multimodal Instruct 有 5.6B 参数。
Phi-4 Multimodal Instruct 基于 MIT 许可证发布,该许可证允许商业使用。 查看许可证
Phi-4 Multimodal Instruct 在 Artificial Analysis Intelligence Index 上的得分为 6。这项综合基准测试评估模型的推理、知识、数学和编程能力。
Phi-4 Multimodal Instruct 的知识截止日期为 2024年6月,模型训练数据包含截至该日期的信息。
是,可通过 1 家服务商的 API 使用 Phi-4 Multimodal Instruct。 比较 API 服务商
可通过 1 家 API 服务商使用 Phi-4 Multimodal Instruct。 比较服务商