LIVE
Models: —+Providers: —+Cheapest H100: $2.49/hrUpdated: 01:10 PMModels: —+Providers: —+Cheapest H100: $2.49/hrUpdated: 01:10 PM
Marketplace
Providers Models
V

Venice

AGGREGATEDINFERENCE
N/A
Uptime
N/A
Rating

30-Day Uptime

96.7%
2026-07-212026-08-19

Inference Latency

Venice: Uncensored (free)420ms TTFT · 104 TPS
Z.ai: GLM 4.7 Flash577ms TTFT · 45 TPS
Mistral: Mistral Small 3.2 24B595ms TTFT · 26 TPS
Qwen: Qwen3.6 35B A3B710ms TTFT · 127 TPS
NVIDIA: Nemotron 3.5 Lightning484ms TTFT · 5 TPS
Qwen: Qwen3.5-9B754ms TTFT · 117 TPS
Google: Gemma 4 31B1090ms TTFT · 32 TPS
Google: Gemma 4 26B A4B 1007ms TTFT · 21 TPS
DeepSeek: DeepSeek V4 Flash 04231522ms TTFT · 27 TPS
Qwen: Qwen3 235B A22B Instruct 2507626ms TTFT · 16 TPS
DeepSeek: DeepSeek V4 Flash 0731929ms TTFT · 56 TPS
Mistral: Mistral Small 4643ms TTFT · 70 TPS
Venice: Uncensored648ms TTFT · 40 TPS
Qwen: Qwen3 VL 235B A22B Instruct1363ms TTFT · 22 TPS
MiniMax: MiniMax M2.5912ms TTFT · 71 TPS
MiniMax: MiniMax M31589ms TTFT · 95 TPS
Qwen: Qwen3.5-35B-A3B736ms TTFT · 170 TPS
Qwen: Qwen3.6 27B563ms TTFT · 47 TPS
DeepSeek: DeepSeek V3.21325ms TTFT · 11 TPS
Qwen: Qwen3 Coder 480B A35B1425ms TTFT · 23 TPS

Inference Models

ModelInput $/MOutput $/MTTFTTPS
Qwen: Qwen3 4B (free)$0.00$0.00
Venice: Uncensored (free)$0.00$0.00420ms104
Qwen: Qwen3 Coder 480B A35B (free)$0.00$0.00
Meta: Llama 3.3 70B Instruct (free)$0.00$0.00
Qwen: Qwen3 Next 80B A3B Instruct (free)$0.00$0.00
Nous: Hermes 3 405B Instruct (free)$0.00$0.00
Meta: Llama 3.2 3B Instruct (free)$0.00$0.00
Mistral: Mistral Small 3.1 24B (free)$0.00$0.00
Z.ai: GLM 4.7 Flash$0.06$0.40577ms45
Mistral: Mistral Small 3.2 24B$0.09$0.25595ms26
Qwen: Qwen3.6 35B A3B$0.10$0.95710ms127
NVIDIA: Nemotron 3.5 Lightning$0.10$0.25484ms5
Qwen: Qwen3.5-9B$0.10$0.15754ms117
Google: Gemma 4 31B$0.12$0.361090ms32
Google: Gemma 4 26B A4B $0.13$0.401007ms21
DeepSeek: DeepSeek V4 Flash 0423$0.14$0.281522ms27
Qwen: Qwen3 235B A22B Instruct 2507$0.15$0.75626ms16
DeepSeek: DeepSeek V4 Flash 0731$0.18$0.35929ms56
Mistral: Mistral Small 4$0.19$0.75643ms70
Venice: Uncensored$0.20$0.90648ms40
Qwen: Qwen3 VL 235B A22B Instruct$0.21$1.901363ms22
MiniMax: MiniMax M2.5$0.27$0.95912ms71
MiniMax: MiniMax M3$0.30$1.201589ms95
Qwen: Qwen3.5-35B-A3B$0.31$1.25736ms170
Qwen: Qwen3.6 27B$0.33$3.25563ms47
DeepSeek: DeepSeek V3.2$0.33$0.481325ms11
Qwen: Qwen3 Coder 480B A35B$0.35$1.501425ms23
Z.ai: GLM 4.6$0.43$1.751015ms25
Qwen: Qwen3 235B A22B Thinking 2507$0.45$3.50696ms33
Qwen: Qwen3.8 27B$0.45$3.20744ms86
MoonshotAI: Kimi K2.5$0.53$3.331643ms47
Z.ai: GLM 4.7$0.55$2.651218ms26
NVIDIA: Nemotron 3 Ultra$0.63$3.132054ms48
Qwen: Qwen3.5 397B A17B$0.75$4.501408ms43
MoonshotAI: Kimi K2.7 Code$0.75$3.50975ms40
MoonshotAI: Kimi K2.6$0.75$3.501032ms21
Z.ai: GLM 5$1.00$3.2013380ms18
Z.ai: GLM 5.2$1.40$4.402555ms21
Z.ai: GLM 5.1$1.54$4.841309ms50
DeepSeek: DeepSeek V4 Pro 0423$1.65$3.302036ms41
Qwen: Qwen3.8 2.4T A95B$2.50$7.501429ms116

Community Reviews

4.5★★★★★(2 reviews)
clouduser42
★★★★★2025-06-15

Reliable service, great API documentation.

mlresearcher
★★★★2025-06-10

Good performance but support could be faster.