D
DeepInfra
AGGREGATEDINFERENCE
N/A
Uptime
N/A
Rating
30-Day Uptime
96.7%2026-07-212026-08-19
Inference Latency
Mistral: Mistral Nemo328ms TTFT · 27 TPS
Meta: Llama 3.1 8B Instruct521ms TTFT · 21 TPS
OpenAI: gpt-oss-20b359ms TTFT · 80 TPS
OpenAI: gpt-oss-120b337ms TTFT · 42 TPS
OpenAI: gpt-oss-120b (exacto)500ms TTFT · 64 TPS
Sao10K: Llama 3 8B Lunaris137ms TTFT · 76 TPS
NVIDIA: Nemotron Nano 9B V2244ms TTFT · 119 TPS
NVIDIA: Nemotron 3 Nano 30B A3B267ms TTFT · 111 TPS
Google: Gemma 3 12B379ms TTFT · 23 TPS
Mistral: Mistral Small 3210ms TTFT · 39 TPS
Google: Gemma 3 4B837ms TTFT · 15 TPS
Ling-3.0-flash1104ms TTFT · 31 TPS
Z.ai: GLM 4.7 Flash363ms TTFT · 53 TPS
Microsoft: Phi 4324ms TTFT · 67 TPS
Google: Gemma 4 26B A4B 467ms TTFT · 19 TPS
Mistral: Mistral Small 3.2 24B425ms TTFT · 28 TPS
NVIDIA: Nemotron 3.5 Lightning333ms TTFT · 115 TPS
DeepSeek: DeepSeek V4 Flash 0731916ms TTFT · 30 TPS
Google: Gemma 3 27B637ms TTFT · 17 TPS
Qwen: Qwen3 32B227ms TTFT · 39 TPS
Inference Models
| Model | Input $/M | Output $/M | TTFT | TPS |
|---|---|---|---|---|
| Mistral: Mistral Nemo | $0.02 | $0.03 | 328ms | 27 |
| Meta: Llama 3.1 8B Instruct | $0.02 | $0.04 | 521ms | 21 |
| OpenAI: gpt-oss-20b | $0.03 | $0.14 | 359ms | 80 |
| OpenAI: gpt-oss-120b | $0.04 | $0.17 | 337ms | 42 |
| OpenAI: gpt-oss-120b (exacto) | $0.04 | $0.19 | 500ms | 64 |
| Sao10K: Llama 3 8B Lunaris | $0.04 | $0.05 | 137ms | 76 |
| NVIDIA: Nemotron Nano 9B V2 | $0.04 | $0.16 | 244ms | 119 |
| NVIDIA: Nemotron 3 Nano 30B A3B | $0.05 | $0.20 | 267ms | 111 |
| Google: Gemma 3 12B | $0.05 | $0.15 | 379ms | 23 |
| Mistral: Mistral Small 3 | $0.05 | $0.08 | 210ms | 39 |
| Google: Gemma 3 4B | $0.05 | $0.10 | 837ms | 15 |
| Ling-3.0-flash | $0.06 | $0.18 | 1104ms | 31 |
| Z.ai: GLM 4.7 Flash | $0.06 | $0.40 | 363ms | 53 |
| Microsoft: Phi 4 | $0.07 | $0.14 | 324ms | 67 |
| Google: Gemma 4 26B A4B | $0.07 | $0.34 | 467ms | 19 |
| Mistral: Mistral Small 3.2 24B | $0.08 | $0.20 | 425ms | 28 |
| NVIDIA: Nemotron 3.5 Lightning | $0.08 | $0.20 | 333ms | 115 |
| DeepSeek: DeepSeek V4 Flash 0731 | $0.08 | $0.18 | 916ms | 30 |
| Google: Gemma 3 27B | $0.08 | $0.16 | 637ms | 17 |
| Qwen: Qwen3 32B | $0.08 | $0.28 | 227ms | 39 |
| NVIDIA: Nemotron 3 Super | $0.09 | $0.40 | 1434ms | 62 |
| Qwen: Qwen3 235B A22B Instruct 2507 | $0.09 | $0.55 | 444ms | 17 |
| DeepSeek: DeepSeek V4 Flash 0423 | $0.09 | $0.18 | 677ms | 41 |
| Google: Gemma 4 31B | $0.09 | $0.34 | 453ms | 37 |
| Qwen: Qwen3 Next 80B A3B Instruct | $0.09 | $1.10 | 402ms | 57 |
| Meta: Llama 3.3 70B Instruct | $0.10 | $0.32 | 515ms | 15 |
| Qwen: Qwen3.6 35B A3B | $0.10 | $0.95 | 699ms | 19 |
| Meta: Llama 4 Scout | $0.10 | $0.30 | 222ms | 11 |
| Qwen: Qwen3.5-9B | $0.10 | $0.15 | 557ms | 39 |
| Qwen: Qwen3 14B | $0.12 | $0.24 | 411ms | 39 |
| Qwen: Qwen3 30B A3B | $0.12 | $0.50 | 247ms | 69 |
| Google: Gemma 4 31B | $0.13 | $0.38 | 5959ms | 0 |
| Qwen: Qwen3.5-35B-A3B | $0.14 | $1.00 | 348ms | 77 |
| Tencent: Hy3 | $0.14 | $0.58 | 402ms | 57 |
| OpenAI: gpt-oss-120b | $0.15 | $0.60 | 409ms | 139 |
| Qwen: Qwen3 VL 30B A3B Instruct | $0.15 | $0.60 | 301ms | 25 |
| Meta: Llama Guard 4 12B | $0.18 | $0.18 | 527ms | 4 |
| NVIDIA: Nemotron Nano 12B 2 VL | $0.20 | $0.60 | 458ms | 48 |
| Qwen: Qwen2.5 VL 32B Instruct | $0.20 | $0.60 | 617ms | 26 |
| Qwen: Qwen3 VL 235B A22B Instruct | $0.20 | $0.88 | 1110ms | 13 |
| AllenAI: Olmo 3.1 32B Instruct | $0.20 | $0.60 | 586ms | 37 |
| StepFun: Step 3.7 Flash | $0.20 | $1.15 | 184ms | 113 |
| Meta: Llama 4 Maverick | $0.20 | $0.80 | 452ms | 31 |
| DeepSeek: DeepSeek V3.1 Terminus (exacto) | $0.21 | $0.79 | 1372ms | 18 |
| Qwen: Qwen3 235B A22B Thinking 2507 | $0.23 | $2.30 | 470ms | 37 |
| DeepSeek: DeepSeek V3 0324 | $0.24 | $0.90 | 4076ms | 6 |
| MiniMax: MiniMax M2.7 | $0.25 | $1.00 | 470ms | 32 |
| DeepSeek: DeepSeek V3.1 | $0.25 | $0.95 | 1433ms | 5 |
| Qwen: Qwen3.5-27B | $0.26 | $2.60 | 561ms | 35 |
| DeepSeek: DeepSeek V3.2 | $0.26 | $0.38 | 3207ms | 8 |
| Google: Gemma 4 31B | $0.27 | $0.76 | 4900ms | 16 |
| MiniMax: MiniMax M3 | $0.28 | $1.10 | 1332ms | 32 |
| Qwen: Qwen3.5-122B-A10B | $0.29 | $2.40 | 564ms | 50 |
| Meta: Muse Glimmer 30B | $0.30 | $1.20 | 427ms | 157 |
| Qwen: Qwen3 Coder 480B A35B | $0.30 | $1.00 | 688ms | 63 |
| DeepSeek: DeepSeek V3 | $0.32 | $0.89 | 414ms | 25 |
| Qwen: Qwen3.6 27B | $0.32 | $3.20 | 531ms | 33 |
| Meta: Llama 3.2 11B Vision Instruct | $0.35 | $0.35 | 580ms | 43 |
| Qwen2.5 72B Instruct | $0.36 | $0.40 | 286ms | 39 |
| MiniMax: MiniMax M2.7 | $0.38 | $1.70 | 5726ms | 28 |
| Meta: Llama 3.1 70B Instruct | $0.40 | $0.40 | 233ms | 19 |
| MythoMax 13B | $0.40 | $0.40 | 268ms | 47 |
| NVIDIA: Llama 3.3 Nemotron Super 49B V1.5 | $0.40 | $0.40 | 142ms | 32 |
| Xiaomi: MiMo-V2.5 | $0.40 | $2.00 | 567ms | 24 |
| Z.ai: GLM 4.7 | $0.40 | $1.75 | 887ms | 29 |
| MoonshotAI: Kimi K2.5 | $0.45 | $2.25 | 678ms | 69 |
| Thinking Machines: Inkling Small | $0.45 | $1.20 | 367ms | 184 |
| Qwen: Qwen3.5 397B A17B | $0.45 | $3.00 | 256ms | 37 |
| Z.ai: GLM 4.6 | $0.50 | $2.00 | 466ms | 24 |
| DeepSeek: R1 0528 | $0.50 | $2.15 | 671ms | 24 |
| NVIDIA: Nemotron 3 Ultra | $0.50 | $2.20 | 2529ms | 53 |
| Mistral: Mixtral 8x7B Instruct | $0.54 | $0.54 | — | — |
| Z.ai: GLM 5 | $0.60 | $2.08 | 713ms | 33 |
| MoonshotAI: Kimi K2.7 Code | $0.68 | $3.40 | 687ms | 48 |
| Nous: Hermes 3 70B Instruct | $0.70 | $0.70 | 347ms | 23 |
| MoonshotAI: Kimi K2.6 | $0.75 | $3.50 | 985ms | 21 |
| Z.ai: GLM 5.2 | $0.75 | $2.40 | 1349ms | 38 |
| Sao10K: Llama 3.1 Euryale 70B v2.2 | $0.85 | $0.85 | 207ms | 48 |
| Thinking Machines: Inkling | $0.95 | $4.05 | 499ms | 56 |
| Nous: Hermes 3 405B Instruct | $1.00 | $1.00 | 285ms | 22 |
| Xiaomi: MiMo-V2.5-Pro | $1.00 | $3.00 | 670ms | 82 |
| Z.ai: GLM 5.1 | $1.05 | $3.50 | 1001ms | 50 |
| NVIDIA: Llama 3.1 Nemotron 70B Instruct | $1.20 | $1.20 | — | — |
| DeepSeek: DeepSeek V4 Pro 0423 | $1.30 | $2.60 | 899ms | 19 |
| Qwen: Qwen3.8 2.4T A95B | $2.00 | $6.00 | 1508ms | 61 |
| MoonshotAI: Kimi K3 | $2.85 | $14.25 | 828ms | 12 |
Community Reviews
4.5★★★★★(2 reviews)
clouduser42
★★★★★2025-06-15
Reliable service, great API documentation.
mlresearcher
★★★★☆2025-06-10
Good performance but support could be faster.