D
DeepInfra
deepinfra
· 80 models · synced never
Fast, cheap inference for open-weight models.
| Model | Type | Input $/MTok | Output $/MTok | Context | Upstream ID |
|---|---|---|---|---|---|
| Mistral Nemo mistralai | LLM | $0.019 | $0.03 | 131K | mistralai/mistral-nemo |
| Llama 3.1 8B Instruct meta-llama | LLM | $0.02 | $0.04 | 131K | meta-llama/llama-3.1-8b-instruct |
| gpt-oss-20b (batch) openai | LLM | $0.03 | $0.14 | 131K | openai/gpt-oss-20b |
| Llama 3 8B Lunaris sao10k | LLM | $0.04 | $0.05 | 8K | sao10k/l3-lunaris-8b |
| Gemma 3 12B google | LLM | $0.05 | $0.15 | 131K | google/gemma-3-12b-it |
| Gemma 3 4B google | LLM | $0.05 | $0.1 | 131K | google/gemma-3-4b-it |
| Mistral Small 3 mistralai | LLM | $0.05 | $0.08 | 33K | mistralai/mistral-small-24b-instruct-2501 |
| Nemotron 3 Nano 30B A3B nvidia | LLM | $0.05 | $0.2 | 262K | nvidia/nemotron-3-nano-30b-a3b |
| DeepSeek V4 Flash 0731 deepseek | LLM | $0.06 | $0.18 | 1.0M | deepseek/deepseek-v4-flash-0731 |
| Granite 4.2 8B ibm-granite | LLM | $0.06 | $0.25 | 131K | ibm-granite/granite-4.2-8b |
| Ling 3.0 Flash inclusionai | LLM | $0.06 | $0.18 | 131K | inclusionai/ling-3.0-flash |
| Ling 3.0 Flash Fin (free) inclusionai | LLM | $0.06 | $0.18 | 262K | inclusionai/ling-3.0-flash-fin |
| Ling 3.0 Flash VL inclusionai | LLM | $0.06 | $0.18 | 131K | inclusionai/ling-3.0-flash-vl |
| Gemma 4 26B A4B (free) google | LLM | $0.07 | $0.34 | 262K | google/gemma-4-26b-a4b-it |
| Phi 4 microsoft | LLM | $0.07 | $0.14 | 16K | microsoft/phi-4 |
| GLM 5.3 Flash (batch) z-ai | LLM | $0.075 | $0.25 | 1.0M | z-ai/glm-5.3-flash |
| Mistral Small 3.2 24B mistralai | LLM | $0.075 | $0.2 | 128K | mistralai/mistral-small-3.2-24b-instruct |
| Gemma 3 27B google | LLM | $0.08 | $0.16 | 131K | google/gemma-3-27b-it |
| Nemotron 3.5 Lightning (free) nvidia | LLM | $0.08 | $0.2 | 262K | nvidia/nemotron-3.5-lightning |
| Qwen3 32B qwen | LLM | $0.08 | $0.28 | 41K | qwen/qwen3-32b |
| Nemotron 3 Super (free) nvidia | LLM | $0.085 | $0.4 | 262K | nvidia/nemotron-3-super-120b-a12b |
| DeepSeek V4 Flash 0423 deepseek | LLM | $0.09 | $0.18 | 1.0M | deepseek/deepseek-v4-flash |
| Qwen3 235B A22B Instruct 2507 qwen | LLM | $0.09 | $0.55 | 262K | qwen/qwen3-235b-a22b-2507 |
| Qwen3 Next 80B A3B Instruct qwen | LLM | $0.09 | $1.10 | 262K | qwen/qwen3-next-80b-a3b-instruct |
| Llama 3.3 70B Instruct meta-llama | LLM | $0.1 | $0.32 | 131K | meta-llama/llama-3.3-70b-instruct |
| Llama 4 Scout meta-llama | LLM | $0.1 | $0.3 | 328K | meta-llama/llama-4-scout |
| Qwen3.5-9B qwen | LLM | $0.1 | $0.15 | 262K | qwen/qwen3.5-9b |
| Qwen3.6 35B A3B qwen | LLM | $0.1 | $0.95 | 262K | qwen/qwen3.6-35b-a3b |
| Qwen3 14B qwen | LLM | $0.12 | $0.24 | 41K | qwen/qwen3-14b |
| Qwen3 30B A3B qwen | LLM | $0.12 | $0.5 | 41K | qwen/qwen3-30b-a3b |
| Hy3 tencent | LLM | $0.13 | $0.53 | 262K | tencent/hy3 |
| MiMo-V2.5 xiaomi | STT | $0.133 | $0.266 | 262K | xiaomi/mimo-v2.5 |
| DeepSeek V4.1 Flash (batch) deepseek | LLM | $0.14 | $0.42 | 1.0M | deepseek/deepseek-v4.1-flash |
| MiMo-V2.6-Flash xiaomi | STT | $0.14 | $0.28 | 1.0M | xiaomi/mimo-v2.6-flash |
| Qwen3.5-35B-A3B qwen | LLM | $0.14 | $1.00 | 262K | qwen/qwen3.5-35b-a3b |
| Qwen3 VL 30B A3B Instruct qwen | LLM | $0.15 | $0.6 | 262K | qwen/qwen3-vl-30b-a3b-instruct |
| Qwen3.8 27B (free) qwen | LLM | $0.15 | $1.88 | 262K | qwen/qwen3.8-27b |
| Step 3.7 Flash stepfun | LLM | $0.16 | $0.92 | 262K | stepfun/step-3.7-flash |
| Llama Guard 4 12B meta-llama | LLM | $0.18 | $0.18 | 164K | meta-llama/llama-guard-4-12b |
| Llama 4 Maverick meta-llama | LLM | $0.2 | $0.8 | 1.0M | meta-llama/llama-4-maverick |
| Nemotron 3.5 Content Safety (free) nvidia | LLM | $0.2 | $0.2 | 131K | nvidia/nemotron-3.5-content-safety |
| Qwen3 VL 235B A22B Instruct qwen | LLM | $0.2 | $0.88 | 262K | qwen/qwen3-vl-235b-a22b-instruct |
| gpt-oss-120b (batch) openai | LLM | $0.2 | $0.95 | 131K | openai/gpt-oss-120b |
| DeepSeek V4 Flash Vision Exp deepseek | LLM | $0.2156 | $0.6468 | 1.0M | deepseek/deepseek-v4-flash-vision-exp |
| DeepSeek V3 0324 deepseek | LLM | $0.24 | $0.9 | 164K | deepseek/deepseek-chat-v3-0324 |
| DeepSeek V3.1 deepseek | LLM | $0.25 | $0.95 | 164K | deepseek/deepseek-chat-v3.1 |
| DeepSeek V3.2 deepseek | LLM | $0.26 | $0.38 | 164K | deepseek/deepseek-v3.2 |
| Qwen3.5-27B qwen | LLM | $0.26 | $2.60 | 262K | qwen/qwen3.5-27b |
| Gemma 4 31B (free) google | LLM | $0.27 | $0.76 | 131K | google/gemma-4-31b-it |
| MiniMax M3 minimax | LLM | $0.28 | $1.10 | 524K | minimax/minimax-m3 |
| Qwen3.5-122B-A10B qwen | LLM | $0.29 | $2.40 | 262K | qwen/qwen3.5-122b-a10b |
| Muse Glimmer 30B meta | LLM | $0.3 | $1.20 | 131K | meta/muse-glimmer-30b |
| Qwen3 Coder 480B A35B qwen | LLM | $0.3 | $1.00 | 262K | qwen/qwen3-coder |
| DeepSeek V3 deepseek | LLM | $0.32 | $0.89 | 164K | deepseek/deepseek-chat |
| Qwen3.6 27B qwen | LLM | $0.32 | $3.20 | 262K | qwen/qwen3.6-27b |
| Qwen2.5 72B Instruct qwen | LLM | $0.36 | $0.4 | 33K | qwen/qwen-2.5-72b-instruct |
| MiniMax M2.7 minimax | LLM | $0.38 | $1.70 | 197K | minimax/minimax-m2.7 |
| MiMo-V2.5-Pro xiaomi | LLM | $0.39 | $1.17 | 1.0M | xiaomi/mimo-v2.5-pro |
| GLM 4.7 z-ai | LLM | $0.4 | $1.75 | 203K | z-ai/glm-4.7 |
| Llama 3.1 70B Instruct meta-llama | LLM | $0.4 | $0.4 | 131K | meta-llama/llama-3.1-70b-instruct |
| MythoMax 13B gryphe | LLM | $0.4 | $0.4 | 4K | gryphe/mythomax-l2-13b |
| MiMo-V2.6-Pro xiaomi | STT | $0.435 | $0.87 | 1.0M | xiaomi/mimo-v2.6-pro |
| Inkling Small (free) thinkingmachines | STT | $0.45 | $1.20 | 524K | thinkingmachines/inkling-small |
| Qwen3.5 397B A17B qwen | LLM | $0.45 | $3.00 | 262K | qwen/qwen3.5-397b-a17b |
| GLM 4.6 z-ai | LLM | $0.5 | $2.00 | 203K | z-ai/glm-4.6 |
| Nemotron 3 Ultra (free) nvidia | LLM | $0.5 | $2.20 | 262K | nvidia/nemotron-3-ultra-550b-a55b |
| R1 0528 deepseek | LLM | $0.5 | $2.15 | 164K | deepseek/deepseek-r1-0528 |
| GLM 5.2 (free) z-ai | LLM | $0.5625 | $1.80 | 1.0M | z-ai/glm-5.2 |
| GLM 5.3 (batch) z-ai | LLM | $0.5625 | $2.50 | 1.0M | z-ai/glm-5.3 |
| Kimi K2.7 Code moonshotai | LLM | $0.68 | $3.40 | 262K | moonshotai/kimi-k2.7-code |
| Hermes 3 70B Instruct nousresearch | LLM | $0.7 | $0.7 | 131K | nousresearch/hermes-3-llama-3.1-70b |
| Kimi K2.6 moonshotai | LLM | $0.75 | $3.50 | 262K | moonshotai/kimi-k2.6 |
| Llama 3.1 Euryale 70B v2.2 sao10k | LLM | $0.85 | $0.85 | 131K | sao10k/l3.1-euryale-70b |
| Inkling (free) thinkingmachines | STT | $0.95 | $4.05 | 524K | thinkingmachines/inkling |
| Hermes 3 405B Instruct nousresearch | LLM | $1.00 | $1.00 | 131K | nousresearch/hermes-3-llama-3.1-405b |
| GLM 5.1 z-ai | LLM | $1.05 | $3.50 | 203K | z-ai/glm-5.1 |
| DeepSeek V4 Pro 0423 deepseek | LLM | $1.30 | $2.60 | 1.0M | deepseek/deepseek-v4-pro |
| DeepSeek V4 Pro 0813 deepseek | LLM | $1.30 | $2.60 | 1.0M | deepseek/deepseek-v4-pro-0813 |
| Qwen3.8 2.4T A95B qwen | LLM | $2.00 | $6.00 | 262K | qwen/qwen3.8-2.4t-a95b |
| Kimi K3 (batch) moonshotai | LLM | $2.85 | $14.25 | 1.0M | moonshotai/kimi-k3 |