LIVE
Models: —+Providers: —+Cheapest H100: $2.49/hrUpdated: 01:10 PMModels: —+Providers: —+Cheapest H100: $2.49/hrUpdated: 01:10 PM
Marketplace
Providers Models
N

Nebius

AGGREGATEDINFERENCE
N/A
Uptime
N/A
Rating

30-Day Uptime

100%
2026-07-212026-08-19

Inference Latency

Google: Gemma 2 9B266ms TTFT · 36 TPS
Qwen: Qwen2.5 Coder 7B Instruct238ms TTFT · 96 TPS
Google: Gemma 3 27B513ms TTFT · 19 TPS
Qwen: Qwen3 32B659ms TTFT · 22 TPS
Qwen: Qwen3 30B A3B Instruct 2507351ms TTFT · 45 TPS
Meta: Llama 3.3 70B Instruct1362ms TTFT · 8 TPS
Nous: Hermes 4 70B264ms TTFT · 64 TPS
OpenAI: gpt-oss-120b330ms TTFT · 174 TPS
Qwen: Qwen3 Next 80B A3B Thinking320ms TTFT · 99 TPS
Qwen: Qwen3 235B A22B Instruct 2507652ms TTFT · 29 TPS
Qwen: Qwen2.5 VL 72B Instruct809ms TTFT · 24 TPS
NVIDIA: Llama 3.1 Nemotron Ultra 253B v1320ms TTFT · 38 TPS
Nous: Hermes 4 405B509ms TTFT · 31 TPS
Z.ai: GLM 5.1543ms TTFT · 32 TPS

Inference Models

ModelInput $/MOutput $/MTTFTTPS
Google: Gemma 2 9B$0.03$0.09266ms36
Qwen: Qwen2.5 Coder 7B Instruct$0.03$0.09238ms96
Google: Gemma 3 27B$0.10$0.30513ms19
Qwen: Qwen3 32B$0.10$0.30659ms22
Qwen: Qwen3 30B A3B Instruct 2507$0.10$0.30351ms45
Meta: Llama 3.3 70B Instruct$0.13$0.401362ms8
Nous: Hermes 4 70B$0.13$0.40264ms64
OpenAI: gpt-oss-120b$0.15$0.60330ms174
Qwen: Qwen3 Next 80B A3B Thinking$0.15$1.20320ms99
Prime Intellect: INTELLECT-3$0.20$1.10
Qwen: Qwen3 235B A22B Instruct 2507$0.20$0.60652ms29
Qwen: Qwen2.5 VL 72B Instruct$0.25$0.75809ms24
NVIDIA: Nemotron 3 Super$0.30$0.90
NVIDIA: Llama 3.1 Nemotron Ultra 253B v1$0.60$1.80320ms38
Nous: Hermes 4 405B$1.00$3.00509ms31
Z.ai: GLM 5.1$1.40$4.40543ms32

Community Reviews

4.5★★★★★(2 reviews)
clouduser42
★★★★★2025-06-15

Reliable service, great API documentation.

mlresearcher
★★★★2025-06-10

Good performance but support could be faster.

Nebius — Provider Scorecard — NexusGPU | NexusGPU