DeepInfra:模型智能、性能与价格

本分析旨在帮助你根据使用场景,选择 DeepInfra 提供的最佳模型。
最智能
UpdatedIntelligence Index
共 107 个模型
速度最快
输出速度
共 107 个模型
价格最低
每 100 万 token 的混合价格
共 107 个模型
DeepInfra 提供 107 个模型,每个模型的智能、性能和价格特征各不相同。 下方对比了各模型的关键指标。
- 智能方面,DeepInfra 上表现最好的模型是 MiMo-V2.6-Pro(46)、GLM-5.3 (max)(45)和GLM-5.3-Flash(42)。
- 输出速度方面,最快的模型是 Nemotron 3.5 Lightning (NVFP4)(305 t/s)、Granite 4.2 3B(220 t/s)和gpt-oss-120b (high) (Turbo)(210 t/s)。 各模型之间的速度差异显著,最快与最慢相差 97%。
- 延迟方面,Qwen3 30B (non-reasoning) (FP8)(0.57 秒)、Qwen3 Coder 480B (Turbo, FP4)(0.69 秒)和Qwen3.5 35B A3B (non-reasoning) FP8(0.70 秒) 的首个答案 Token 延迟最低。
- 价格方面,Llama 3.1 8B (Turbo, FP8)($0.02)、Llama 3.1 8B($0.02)和Granite 4.2 3B($0.02) 每 100 万 token 的混合价格最低。
- 上下文窗口方面,GLM-5.2 (max) (FP4)(1M)、DeepSeek V4 Pro (max) (FP4)(1M)和DeepSeek V4 Flash (high) (FP4)(1M) 支持 DeepInfra 上最大的上下文窗口。
智能评测
Artificial Analysis Intelligence Index
Intelligence Evaluations
Agentic knowledge work, (Elo-500)/2000
Agentic real-world work tasks, (Elo-500)/2000
Agentic SaaS workflows
Agentic coding & terminal use
Coding
Reasoning & knowledge
Professional document reasoning, All-pass
Physics reasoning
Knowledge
1 - hallucination rate
Long context reasoning
Legal agentic work, criterion pass rate
Agentic business operations
Agentic scientific research workflows in a terminal
Quantitative analysis on spreadsheets & documents
Kubernetes incident root-cause analysis
Visual reasoning
Medical long context reasoning
Intelligence Index 与价格
上下文窗口
上下文窗口
价格
Intelligence Index 与价格
性能摘要
输出速度与价格
速度
按输出速度(每秒 token 数)衡量
输出速度
延迟
按首 Token 延迟(秒)衡量
延迟: 首个答案 Token 延迟
缓存行为
缓存命中率
每任务成本与缓存命中率
端到端响应时间
Seconds to output 500 tokens, calculated based on time to first token, 'thinking' time for reasoning models, and output speed
端到端响应时间与价格
进一步分析 | |||||||||||
|---|---|---|---|---|---|---|---|---|---|---|---|
MiMo-V2.6-Pro | 1M | 开放 | 46 | $0.96 | 27 | 1.79 | 94.65 | 74.29 | |||
GLM-5.3 (max) | 1.05M | 开放 | 45 | $0.97 | 66 | 1.09 | 39.00 | 30.33 | |||
GLM-5.3-Flash | 1M | 开放 | 42 | $0.34 | 31 | 1.20 | 81.19 | 63.99 | |||
Qwen3.8 2.4T A95B | 262k | 开放 | 40 | $2.89 | 99 | 1.21 | 26.52 | 20.25 | |||
DeepSeek V4.1 Flash (max) | 1M | 开放 | 39 | $0.44 | 93 | 0.81 | 27.72 | 21.53 | |||
MiMo-V2.6-Flash | 1M | 开放 | 38 | $0.42 | 54 | 1.35 | 47.77 | 37.13 | |||
DeepSeek V4 Pro 0813 (max) | 1M | 开放 | 36 | $1.00 | 54 | 1.13 | 47.43 | 37.04 | |||
DeepSeek V4 Flash Vision (max) | 1M | 专有 | 35 | $0.51 | 134 | 0.91 | 19.53 | 14.90 | |||
DeepSeek V4 Flash 0731 (max) | 1M | 开放 | 34 | $0.09 | 55 | 0.82 | 46.05 | 36.18 | |||
GLM-5.2 (max) (FP4) | 1.05M | 开放 | 34 | $0.37 | 75 | 1.17 | 34.40 | 26.58 | |||
Qwen3.8 27B (xhigh) | 262k | 开放 | 34 | $0.52 | 37 | 1.09 | 69.35 | 54.61 | |||
DeepSeek V4 Pro (max) (FP4) | 1.05M | 开放 | 30 | $1.19 | 69 | 1.02 | 71.45 | 63.21 | |||
DeepSeek V4 Pro (high) (FP4) | 65.5k | 开放 | 30* | -- | 71 | 1.38 | 36.38 | 27.97 | |||
MiniMax-M3 | 524k | 开放 | 29 | $0.44 | 24 | 0.95 | 103.37 | 81.94 | |||
GLM-5 (FP4) | 203k | 开放 | 28* | -- | 71 | 1.27 | 51.94 | 43.64 | |||
Kimi K2.6 (FP4) | 262k | 开放 | 27 | $0.51 | 17 | 2.11 | 291.96 | 260.58 | |||
GLM-5.1 (FP4) | 203k | 开放 | 26 | $0.58 | 63 | 1.62 | 69.69 | 60.14 | |||
MiMo-V2.5-Pro | 65.5k | 开放 | 26 | $0.28 | 33 | 1.40 | 76.11 | 59.77 | |||
Kimi K2.7 Code | 262k | 开放 | 26 | $0.39 | 45 | 1.45 | 62.36 | 49.75 | |||
Inkling Small | 524k | 开放 | 26 | -- | 143 | 0.91 | 18.44 | 14.03 | |||
Hy3 (FP8) | 262k | 开放 | 25 | $0.07 | 54 | 1.04 | 47.27 | 36.99 | |||
MiMo-V2.5 | 262k | 开放 | 25* | -- | 52 | 1.32 | 49.80 | 38.79 | |||
Inkling (xhigh) (FP8) | 131k | 开放 | 25 | -- | 136 | 0.59 | 19.00 | 14.73 | |||
DeepSeek V4 Flash (high) (FP4) | 1.05M | 开放 | 24 | $0.08 | 31 | 1.74 | 57.50 | 39.74 | |||
GLM-5.1 (non-reasoning) (FP4) | 203k | 开放 | 24* | -- | 53 | 1.73 | 11.16 | -- | |||
DeepSeek V4 Flash (max) (FP4) | 1.05M | 开放 | 24 | $0.07 | 32 | 1.95 | 191.68 | 174.21 | |||
Kimi K2.6 (non-reasoning) (FP4) | 262k | 开放 | 24* | -- | 16 | 1.73 | 32.68 | -- | |||
Kimi K2.5 | 262k | 开放 | 23* | -- | 33 | 1.56 | 106.70 | 89.98 | |||
Nemotron 3 Ultra | 262k | 开放 | 23 | $0.39 | 78 | 1.45 | 36.90 | 29.06 | |||
Nemotron 3 Ultra BF16 | 262k | 开放 | 23 | $0.99 | 88 | 1.40 | 32.91 | 25.83 | |||
Qwen3.5 27B (FP8) | 262k | 开放 | 23* | -- | 69 | 1.14 | 37.18 | 28.83 | |||
MiniMax-M2.5 (FP8) | 197k | 开放 | 23* | -- | 25 | 0.95 | 100.62 | 79.73 | |||
GLM-4.7 (FP4) | 203k | 开放 | 22* | -- | 14 | 1.86 | 182.39 | 144.42 | |||
GLM-5 (non-reasoning) (FP8) | 203k | 开放 | 22* | -- | 67 | 1.20 | 8.62 | -- | |||
DeepSeek V3.2 (FP4) | 164k | 开放 | 21* | -- | 20 | 1.57 | 125.67 | 99.27 | |||
Qwen3.5 397B A17B (non-reasoning) (FP8) | 262k | 开放 | 21* | -- | 45 | 1.20 | 12.20 | -- | |||
Qwen3.6 27B FP8 | 262k | 开放 | 21 | $0.37 | 64 | 1.07 | 98.09 | 89.16 | |||
Ling 3.0 Flash | 131k | 开放 | 20 | $0.02 | 56 | 0.63 | 45.59 | 35.97 | |||
Qwen3.6 27B (non-reasoning) FP8 | 262k | 开放 | 20* | -- | 59 | 1.01 | 9.52 | -- | |||
Step 3.7 Flash | 256k | 开放 | 19* | -- | 42 | 1.33 | 60.76 | 47.54 | |||
Qwen3.5 27B (non-reasoning) FP8 | 262k | 开放 | 19* | -- | 73 | 1.10 | 7.97 | -- | |||
Qwen3.5 35B A3B (FP8) | 262k | 开放 | 19* | -- | 128 | 0.60 | 20.14 | 15.63 | |||
GLM-4.6 (FP4) | 203k | 开放 | 19* | -- | 26 | 1.56 | 97.68 | 76.90 | |||
Qwen3.5 397B A17B (FP8) | 262k | 开放 | 18 | -- | 44 | 1.07 | 84.22 | 71.87 | |||
MiMo-V2.5-Pro (non-reasoning) | 65.5k | 开放 | 18* | -- | 25 | 1.37 | 21.29 | -- | |||
Qwen3.6 35B A3B (FP8) | 262k | 开放 | 18 | $0.14 | 150 | 0.76 | 39.94 | 35.85 | |||
Qwen3.5 122B A10B (non-reasoning) (FP4) | 262k | 开放 | 18* | -- | 44 | 1.27 | 12.66 | -- | |||
Muse Glimmer (high) | 131k | 开放 | 17 | $0.05 | 131 | 1.57 | 20.68 | 15.29 | |||
GLM-4.7 (non-reasoning) (FP4) | 203k | 开放 | 17* | -- | 15 | 1.67 | 34.34 | -- | |||
Gemma 4 26B A4B (FP8) | 262k | 开放 | 17* | -- | 30 | 0.79 | 83.92 | 66.50 | |||
DeepSeek V3.2 (non-reasoning) | 164k | 开放 | 16* | -- | 26 | 1.39 | 20.53 | -- | |||
Qwen3.5 122B A10B (FP4) | 262k | 开放 | 16 | $0.24 | 44 | 1.11 | 57.35 | 44.99 | |||
Qwen3.6 35B A3B (non-reasoning) (FP8) | 262k | 开放 | 15* | -- | 155 | 0.74 | 3.95 | -- | |||
Qwen3.5 35B A3B (non-reasoning) FP8 | 262k | 开放 | 15* | -- | 110 | 0.62 | 5.17 | -- | |||
GLM-4.7-Flash | 203k | 开放 | 15* | -- | 26 | 1.31 | 96.49 | 76.14 | |||
Granite 4.2 30B | 131k | 开放 | 15* | -- | 76 | 0.88 | 33.72 | 26.28 | |||
Gemma 4 31B | 262k | 开放 | 15 | $0.15 | 15 | 2.55 | 149.68 | 114.22 | |||
DeepSeek V3.1 Terminus (non-reasoning) (FP4) | 164k | 开放 | 14* | -- | 52 | 1.03 | 10.70 | -- | |||
Gemma 4 31B (non-reasoning) (FP8) | 262k | 开放 | 14* | -- | 14 | 1.89 | 37.37 | -- | |||
DeepSeek V3.1 (non-reasoning) (FP4) | 164k | 开放 | 14* | -- | 8 | 1.72 | 62.54 | -- | |||
Gemma 4 26B A4B (non-reasoning) (FP8) | 262k | 开放 | 13* | -- | 23 | 0.83 | 22.64 | -- | |||
Qwen3.5 4B (FP8) | 262k | 开放 | 13* | -- | 16 | 0.84 | 157.33 | 125.19 | |||
DeepSeek R1 0528 | 164k | 开放 | 13* | -- | 25 | 0.92 | 99.21 | 78.64 | |||
Nemotron 3.5 Lightning (NVFP4) | 262k | 开放 | 13 | $0.09 | 294 | 0.48 | 8.99 | 6.80 | |||
Nemotron 3 Super | 262k | 开放 | 13 | $0.48 | 72 | 8.39 | 43.20 | 27.85 | |||
Qwen3 235B A22B 2507 (FP8) | 262k | 开放 | 13 | -- | 148 | 0.78 | 17.64 | 13.49 | |||
Qwen3 235B 2507 (FP8) | 262k | 开放 | 12* | -- | 12 | 3.82 | 46.95 | -- | |||
Qwen3 Coder 480B (Turbo, FP4) | 262k | 开放 | 12* | -- | 114 | 0.69 | 5.09 | -- | |||
gpt-oss-120b (high) (Turbo) | 131k | 开放 | 12 | $0.11 | 222 | 0.88 | 12.13 | 9.00 | |||
gpt-oss-120b (high) | 131k | 开放 | 12 | $0.03 | 59 | 0.61 | 43.33 | 34.18 | |||
Granite 4.2 8B | 131k | 开放 | 11 | $0.02 | 46 | 1.00 | 55.53 | 43.62 | |||
Qwen3.5 4B (non-reasoning) FP8 | 262k | 开放 | 11* | -- | 16 | 0.97 | 32.58 | -- | |||
gpt-oss-120b (low) | 131k | 开放 | 10* | -- | 59 | 0.62 | 42.71 | 33.67 | |||
Llama 4 Maverick (FP8) | 1.05M | 开放 | 10* | -- | 34 | 0.86 | 15.36 | -- | |||
DeepSeek V3 0324 (FP4) | 164k | 开放 | 10 | $0.02 | 105 | 0.73 | 5.51 | -- | |||
Qwen3 Next 80B A3B | 262k | 开放 | 10* | -- | 166 | 0.73 | 3.73 | -- | |||
Granite 4.2 3B | 131k | 开放 | 9 | $0.01 | 217 | 0.53 | 12.06 | 9.23 | |||
gpt-oss-20b (high) | 131k | 开放 | 9 | $0.01 | 120 | 0.55 | 21.40 | 16.68 | |||
Gemma 4 E4B | 131k | 开放 | 9* | -- | 38 | 1.19 | 66.31 | 52.09 | |||
Nemotron 3 Nano | 262k | 开放 | 9 | $0.02 | 19 | 70.53 | 204.38 | 107.07 | |||
Qwen3 32B (FP8) | 41k | 开放 | 9* | -- | 25 | 1.55 | 102.77 | 80.98 | |||
DeepSeek V3 (Dec) | 164k | 开放 | 8 | $0.02 | 19 | 1.90 | 28.18 | -- | |||
Mistral Small 3.2 (FP8) | 128k | 开放 | 8* | -- | 38 | 1.07 | 14.05 | -- | |||
Qwen3 14B (FP8) | 32.8k | 开放 | 8* | -- | 24 | 1.10 | 106.28 | 84.15 | |||
Llama 4 Scout | 131k | 开放 | 8* | -- | 27 | 0.88 | 19.31 | -- | |||
DeepSeek R1 Distill Llama 70B | 131k | 开放 | 8* | -- | -- | -- | -- | -- | |||
Qwen2.5 72B | 32.8k | 开放 | 8* | -- | 26 | 2.46 | 22.06 | -- | |||
Llama 3.3 70B (Turbo, FP8) | 131k | 开放 | 8* | -- | 15 | 2.07 | 34.87 | -- | |||
Qwen3 30B (FP8) | 41k | 开放 | 8* | -- | 155 | 0.56 | 16.69 | 12.90 | |||
Gemma 4 E4B (non-reasoning) | 131k | 开放 | 7* | -- | 31 | 0.91 | 16.87 | -- | |||
NVIDIA Nemotron Nano 9B V2 | 131k | 开放 | 7* | -- | 20 | 37.05 | 162.93 | 100.71 | |||
Qwen3 32B (non-reasoning) (FP8) | 41k | 开放 | 7* | -- | 25 | 1.33 | 21.15 | -- | |||
Mistral Small 3.1 | 128k | 开放 | 7 | $0.02 | 37 | 1.02 | 14.53 | -- | |||
Llama 3.1 8B (Turbo, FP8) | 131k | 开放 | 7* | -- | 29 | 1.04 | 18.20 | -- | |||
Llama 3.1 8B | 131k | 开放 | 7* | -- | 29 | 0.88 | 17.91 | -- | |||
Nemotron 3 Nano (non-reasoning) | 262k | 开放 | 7* | -- | 23 | 1.44 | 23.37 | -- | |||
NVIDIA Nemotron Nano 9B V2 (non-reasoning) | 131k | 开放 | 7* | -- | 21 | 47.34 | 71.29 | -- | |||
Qwen3 14B (non-reasoning) (FP8) | 41k | 开放 | 7* | -- | 23 | 1.07 | 22.55 | -- | |||
Mistral Small 3 | 32.8k | 开放 | 7* | -- | 48 | 1.02 | 11.50 | -- | |||
Qwen3 30B (non-reasoning) (FP8) | 41k | 开放 | 7* | -- | 128 | 0.56 | 4.48 | -- | |||
Llama 3.1 70B | 131k | 开放 | 7* | -- | 42 | 1.85 | 13.87 | -- | |||
Llama 3.1 70B (Turbo, FP8) | 131k | 开放 | 7* | -- | 40 | 1.93 | 14.34 | -- | |||
Hermes 3 - Llama-3.1 70B | 131k | 开放 | 6* | -- | 31 | 2.20 | 18.29 | -- | |||
Phi-4 | 16.4k | 开放 | 6* | -- | 76 | 0.97 | 7.55 | -- | |||
Llama 3.2 11B (Vision) | 131k | 开放 | 5* | -- | 15 | 2.77 | 35.21 | -- | |||
Gemma 3 27B | 131k | 开放 | 5 | $0.16 | 18 | 1.35 | 28.69 | -- | |||
Gemma 3 4B | 131k | 开放 | 5* | -- | 38 | 1.10 | 14.37 | -- | |||
Llama 3 8B | 8.19k | 开放 | 5* | -- | -- | -- | -- | -- | |||
Gemma 3 12B | 131k | 开放 | 4 | $0.13 | 55 | 1.05 | 10.15 | -- | |||
关键定义
常见问题
关于 DeepInfra 的常见问题
DeepInfra 提供我们跟踪的 107 个模型:MiMo-V2.6-Pro、GLM-5.3 (max)、GLM-5.3-Flash、Qwen3.8 2.4T A95B、DeepSeek V4.1 Flash (max)、MiMo-V2.6-Flash、DeepSeek V4 Pro 0813 (max)、DeepSeek V4 Flash Vision (max)、DeepSeek V4 Flash 0731 (max)、GLM-5.2 (max) (FP4)、Qwen3.8 27B (xhigh)、DeepSeek V4 Pro (max) (FP4)、DeepSeek V4 Pro (high) (FP4)、MiniMax-M3、GLM-5 (FP4)、Kimi K2.6 (FP4)、GLM-5.1 (FP4)、MiMo-V2.5-Pro、Kimi K2.7 Code、Inkling Small、Hy3 (FP8)、MiMo-V2.5、Inkling (xhigh) (FP8)、DeepSeek V4 Flash (high) (FP4)、GLM-5.1 (non-reasoning) (FP4)、DeepSeek V4 Flash (max) (FP4)、Kimi K2.6 (non-reasoning) (FP4)、Kimi K2.5、Nemotron 3 Ultra、Nemotron 3 Ultra BF16、Qwen3.5 27B (FP8)、MiniMax-M2.5 (FP8)、GLM-4.7 (FP4)、GLM-5 (non-reasoning) (FP8)、DeepSeek V3.2 (FP4)、Qwen3.5 397B A17B (non-reasoning) (FP8)、Qwen3.6 27B FP8、Ling 3.0 Flash、Qwen3.6 27B (non-reasoning) FP8、Step 3.7 Flash、Qwen3.5 27B (non-reasoning) FP8、Qwen3.5 35B A3B (FP8)、GLM-4.6 (FP4)、Qwen3.5 397B A17B (FP8)、MiMo-V2.5-Pro (non-reasoning)、Qwen3.6 35B A3B (FP8)、Qwen3.5 122B A10B (non-reasoning) (FP4)、Muse Glimmer (high)、GLM-4.7 (non-reasoning) (FP4)、Gemma 4 26B A4B (FP8)、DeepSeek V3.2 (non-reasoning)、Qwen3.5 122B A10B (FP4)、Qwen3.6 35B A3B (non-reasoning) (FP8)、Qwen3.5 35B A3B (non-reasoning) FP8、GLM-4.7-Flash、Granite 4.2 30B、Gemma 4 31B、DeepSeek V3.1 Terminus (non-reasoning) (FP4)、Gemma 4 31B (non-reasoning) (FP8)、DeepSeek V3.1 (non-reasoning) (FP4)、Gemma 4 26B A4B (non-reasoning) (FP8)、Qwen3.5 4B (FP8)、DeepSeek R1 0528、Nemotron 3.5 Lightning (NVFP4)、Nemotron 3 Super、Qwen3 235B A22B 2507 (FP8)、Qwen3 235B 2507 (FP8)、Qwen3 Coder 480B (Turbo, FP4)、gpt-oss-120b (high) (Turbo)、gpt-oss-120b (high)、Granite 4.2 8B、Qwen3.5 4B (non-reasoning) FP8、gpt-oss-120b (low)、Llama 4 Maverick (FP8)、DeepSeek V3 0324 (FP4)、Qwen3 Next 80B A3B、Granite 4.2 3B、gpt-oss-20b (high)、Gemma 4 E4B、Nemotron 3 Nano、Qwen3 32B (FP8)、DeepSeek V3 (Dec)、Mistral Small 3.2 (FP8)、Qwen3 14B (FP8)、Llama 4 Scout、Qwen2.5 72B、Llama 3.3 70B (Turbo, FP8)、Qwen3 30B (FP8)、Gemma 4 E4B (non-reasoning)、NVIDIA Nemotron Nano 9B V2、Qwen3 32B (non-reasoning) (FP8)、Mistral Small 3.1、Llama 3.1 8B (Turbo, FP8)、Llama 3.1 8B、Nemotron 3 Nano (non-reasoning)、NVIDIA Nemotron Nano 9B V2 (non-reasoning)、Qwen3 14B (non-reasoning) (FP8)、Mistral Small 3、Qwen3 30B (non-reasoning) (FP8)、Llama 3.1 70B、Llama 3.1 70B (Turbo, FP8)、Hermes 3 - Llama-3.1 70B、Phi-4、Llama 3.2 11B (Vision)、Gemma 3 27B、Gemma 3 4B和Gemma 3 12B。
DeepInfra 上最智能的模型是 MiMo-V2.6-Pro,Intelligence Index 得分为 46。
按输出速度计算,DeepInfra 上最快的模型是 Nemotron 3.5 Lightning (NVFP4),速度为每秒 305.3 个 token。
DeepInfra 上首个答案 Token 延迟最低的模型是 Qwen3 30B (non-reasoning) (FP8),延迟为 0.57 秒。延迟越低,初始响应越快。
按混合价格计算,DeepInfra 上最实惠的模型是 Llama 3.1 8B (Turbo, FP8),每 100 万 token 的价格为 $0.02(缓存命中/输入/输出比例为 7:2:1)。
DeepInfra 上各模型价格最多相差 52 倍,从最实惠的 Llama 3.1 8B (Turbo, FP8)(每 100 万 token $0.02)到最昂贵的 Qwen3.8 2.4T A95B(每 100 万 token $1.14)。
是,DeepInfra 提供兼容 OpenAI 的 API,可以轻松从 OpenAI 切换,或继续使用现有的 OpenAI SDK 集成。
是,DeepInfra 上全部 107 个模型均支持用于结构化输出的 JSON 模式。
DeepInfra 上 107 个模型中,有 104 个支持函数调用(工具使用)。
是,DeepInfra 提供 62 个推理模型:MiMo-V2.6-Pro、GLM-5.3 (max)、GLM-5.3-Flash、Qwen3.8 2.4T A95B、DeepSeek V4.1 Flash (max)、MiMo-V2.6-Flash、DeepSeek V4 Pro 0813 (max)、DeepSeek V4 Flash Vision (max)、DeepSeek V4 Flash 0731 (max)、GLM-5.2 (max) (FP4)、Qwen3.8 27B (xhigh)、DeepSeek V4 Pro (max) (FP4)、DeepSeek V4 Pro (high) (FP4)、MiniMax-M3、GLM-5 (FP4)、Kimi K2.6 (FP4)、GLM-5.1 (FP4)、MiMo-V2.5-Pro、Kimi K2.7 Code、Inkling Small、Hy3 (FP8)、MiMo-V2.5、Inkling (xhigh) (FP8)、DeepSeek V4 Flash (high) (FP4)、DeepSeek V4 Flash (max) (FP4)、Kimi K2.5、Nemotron 3 Ultra、Nemotron 3 Ultra BF16、Qwen3.5 27B (FP8)、MiniMax-M2.5 (FP8)、GLM-4.7 (FP4)、DeepSeek V3.2 (FP4)、Qwen3.6 27B FP8、Ling 3.0 Flash、Step 3.7 Flash、Qwen3.5 35B A3B (FP8)、GLM-4.6 (FP4)、Qwen3.5 397B A17B (FP8)、Qwen3.6 35B A3B (FP8)、Muse Glimmer (high)、Gemma 4 26B A4B (FP8)、Qwen3.5 122B A10B (FP4)、GLM-4.7-Flash、Granite 4.2 30B、Gemma 4 31B、Qwen3.5 4B (FP8)、DeepSeek R1 0528、Nemotron 3.5 Lightning (NVFP4)、Nemotron 3 Super、Qwen3 235B A22B 2507 (FP8)、gpt-oss-120b (high) (Turbo)、gpt-oss-120b (high)、Granite 4.2 8B、gpt-oss-120b (low)、Granite 4.2 3B、gpt-oss-20b (high)、Gemma 4 E4B、Nemotron 3 Nano、Qwen3 32B (FP8)、Qwen3 14B (FP8)、Qwen3 30B (FP8)和NVIDIA Nemotron Nano 9B V2。推理模型会先进行扩展思考来解决复杂问题,再给出答案。
是,DeepInfra 上 107 个模型中有 106 个是开放权重模型:MiMo-V2.6-Pro、GLM-5.3 (max)、GLM-5.3-Flash、Qwen3.8 2.4T A95B、DeepSeek V4.1 Flash (max)、MiMo-V2.6-Flash、DeepSeek V4 Pro 0813 (max)、DeepSeek V4 Flash 0731 (max)、GLM-5.2 (max) (FP4)、Qwen3.8 27B (xhigh)、DeepSeek V4 Pro (max) (FP4)、DeepSeek V4 Pro (high) (FP4)、MiniMax-M3、GLM-5 (FP4)、Kimi K2.6 (FP4)、GLM-5.1 (FP4)、MiMo-V2.5-Pro、Kimi K2.7 Code、Inkling Small、Hy3 (FP8)、MiMo-V2.5、Inkling (xhigh) (FP8)、DeepSeek V4 Flash (high) (FP4)、GLM-5.1 (non-reasoning) (FP4)、DeepSeek V4 Flash (max) (FP4)、Kimi K2.6 (non-reasoning) (FP4)、Kimi K2.5、Nemotron 3 Ultra、Nemotron 3 Ultra BF16、Qwen3.5 27B (FP8)、MiniMax-M2.5 (FP8)、GLM-4.7 (FP4)、GLM-5 (non-reasoning) (FP8)、DeepSeek V3.2 (FP4)、Qwen3.5 397B A17B (non-reasoning) (FP8)、Qwen3.6 27B FP8、Ling 3.0 Flash、Qwen3.6 27B (non-reasoning) FP8、Step 3.7 Flash、Qwen3.5 27B (non-reasoning) FP8、Qwen3.5 35B A3B (FP8)、GLM-4.6 (FP4)、Qwen3.5 397B A17B (FP8)、MiMo-V2.5-Pro (non-reasoning)、Qwen3.6 35B A3B (FP8)、Qwen3.5 122B A10B (non-reasoning) (FP4)、Muse Glimmer (high)、GLM-4.7 (non-reasoning) (FP4)、Gemma 4 26B A4B (FP8)、DeepSeek V3.2 (non-reasoning)、Qwen3.5 122B A10B (FP4)、Qwen3.6 35B A3B (non-reasoning) (FP8)、Qwen3.5 35B A3B (non-reasoning) FP8、GLM-4.7-Flash、Granite 4.2 30B、Gemma 4 31B、DeepSeek V3.1 Terminus (non-reasoning) (FP4)、Gemma 4 31B (non-reasoning) (FP8)、DeepSeek V3.1 (non-reasoning) (FP4)、Gemma 4 26B A4B (non-reasoning) (FP8)、Qwen3.5 4B (FP8)、DeepSeek R1 0528、Nemotron 3.5 Lightning (NVFP4)、Nemotron 3 Super、Qwen3 235B A22B 2507 (FP8)、Qwen3 235B 2507 (FP8)、Qwen3 Coder 480B (Turbo, FP4)、gpt-oss-120b (high) (Turbo)、gpt-oss-120b (high)、Granite 4.2 8B、Qwen3.5 4B (non-reasoning) FP8、gpt-oss-120b (low)、Llama 4 Maverick (FP8)、DeepSeek V3 0324 (FP4)、Qwen3 Next 80B A3B、Granite 4.2 3B、gpt-oss-20b (high)、Gemma 4 E4B、Nemotron 3 Nano、Qwen3 32B (FP8)、DeepSeek V3 (Dec)、Mistral Small 3.2 (FP8)、Qwen3 14B (FP8)、Llama 4 Scout、Qwen2.5 72B、Llama 3.3 70B (Turbo, FP8)、Qwen3 30B (FP8)、Gemma 4 E4B (non-reasoning)、NVIDIA Nemotron Nano 9B V2、Qwen3 32B (non-reasoning) (FP8)、Mistral Small 3.1、Llama 3.1 8B (Turbo, FP8)、Llama 3.1 8B、Nemotron 3 Nano (non-reasoning)、NVIDIA Nemotron Nano 9B V2 (non-reasoning)、Qwen3 14B (non-reasoning) (FP8)、Mistral Small 3、Qwen3 30B (non-reasoning) (FP8)、Llama 3.1 70B、Llama 3.1 70B (Turbo, FP8)、Hermes 3 - Llama-3.1 70B、Phi-4、Llama 3.2 11B (Vision)、Gemma 3 27B、Gemma 3 4B和Gemma 3 12B。
会。服务商性能可能因基础设施变化、负载均衡和更新而随时间波动。我们持续对所有服务商进行基准测试,并在“随时间变化”图表中展示历史性能趋势。
选择 DeepInfra 上的模型时,请考虑:智能(适合质量敏感型任务)、输出速度(适合吞吐量密集型任务)、延迟(适合需要快速首次响应的交互式应用)、价格(适合成本敏感型工作负载),以及上下文窗口大小、JSON 模式或函数调用支持等功能。