Kimi API Providers
Who serves Kimi, at what price and speed.
Kimi is Moonshot AI's family of open-weight mixture-of-experts models, from Kimi K2 (1 trillion total parameters, 32 billion active) to K2.5, K2.6, the K2.7 Code variant and K3.
inference.net served 28% of the 2.22T Kimi tokens that went through a large public LLM router over Oct 3 to Oct 9, 2026. Moonshot AI's own API served 15%; 33 providers list the family.
Who serves Kimi tokens
| Provider | Tokens, 7d | Share |
|---|---|---|
| inference.net | 571B | 27.7% |
| Moonshot AI (lab) | 312B | 15.2% |
| Together | 186B | 9.0% |
| Fireworks | 143B | 7.0% |
| Relace | 126B | 6.1% |
| Parasail | 122B | 5.9% |
| Modal | 111B | 5.4% |
| Wafer | 91B | 4.4% |
| Morph | 65B | 3.1% |
| Sail Research | 52B | 2.5% |
| Inceptron | 50B | 2.4% |
| Alibaba Cloud Int. | 46B | 2.2% |
| Amazon Bedrock | 35B | 1.7% |
| Phala | 32B | 1.5% |
| Baseten | 20B | 1.0% |
| 16 others | 96B | 4.7% |
All Kimi models combined, Oct 3 to Oct 9, 2026.
Kimi K3: prices and speed by provider
Output prices run from $9.90 to $22.50 per million tokens across 20 providers, median $14.90.
| Provider | Share | Input $/M | Output $/M | Cache read $/M | Tokens/s | Latency | Uptime 3d | Context |
|---|---|---|---|---|---|---|---|---|
| inference.net | 29.7% | $0.64 | $13.50 | $0.28 | 67 | 0.84s | 100.0% | 1.05M |
| Moonshot AI | 15.0% | $3.00 | $15.00 | $0.30 | 21 | 4.67s | 100.0% | 1.05M |
| Together | 9.7% | $2.70 | $13.50 | $0.27 | 49 | 1.07s | 92.5% | 1.05M |
| Fireworks | 7.5% | $3.00 | $15.00 | $0.30 | 38 | 1.21s | 100.0% | 1.05M |
| Relace | 6.6% | $2.00 | $14.00 | $0.30 | 64 | 1.65s | 100.0% | 1.05M |
| Parasail | 6.3% | $2.60 | $13.00 | $0.26 | 64 | 1.46s | 99.5% | 1.05M |
| Modal | 5.8% | $3.00 | $15.00 | $0.30 | 56 | 1.33s | 100.0% | 1.05M |
| Wafer | 4.8% | $2.80 | $14.00 | $0.30 | 53 | 0.74s | 98.3% | 1.05M |
| Morph | 3.4% | $0.408 | $14.90 | $0.29 | 45 | 1.47s | 99.7% | 1.05M |
| Sail Research | 2.7% | $0.84 | $13.50 | $0.30 | 39 | 2.72s | 98.9% | 1.05M |
| Alibaba Cloud Int. | 2.4% | $3.45 | $17.25 | $0.345 | 36 | 2.62s | 100.0% | 1.05M |
| Amazon Bedrock | 1.8% | $3.00 | $15.00 | $0.30 | 63 | 1.65s | 98.7% | 1.05M |
| Phala | 1.7% | $2.55 | $12.75 | $0.255 | 47 | 1.99s | 99.8% | 1.05M |
| Baseten | 1.0% | $3.00 | $15.00 | $0.30 | 27 | 10.99s | 100.0% | 1.05M |
| Makora | 0.9% | $1.53 | $12.75 | $0.204 | 47 | 1.61s | 98.7% | 1.05M |
| Decart | 0.6% | $1.98 | $9.90 | $0.198 | 33 | 1.07s | 97.4% | 1.05M |
| DigitalOcean | 0.2% | $2.55 | $12.95 | $0.255 | 42 | 1.65s | 100.0% | 1.05M |
| AkashML | <0.1% | $1.20 | $14.00 | $1.20 | 63 | 0.80s | 98.9% | 1.05M |
| Chutes | <0.1% | $3.00 | $15.00 | $0.30 | 34 | 2.19s | 87.5% | 1.05M |
| DeepInfra | - | $2.85 | $14.25 | $0.285 | 50 | 1.75s | 98.7% | 1.05M |
List prices as of October 9, 2026, cheapest endpoint per provider. Tokens/s and latency are medians over 30 minutes.
Kimi K2.6: prices and speed by provider
Output prices run from $2.40 to $4.60 per million tokens across 17 providers, median $3.50.
| Provider | Share | Input $/M | Output $/M | Cache read $/M | Tokens/s | Latency | Uptime 3d | Context |
|---|---|---|---|---|---|---|---|---|
| Inceptron | 29.5% | $0.465 | $2.45 | $0.087 | 66 | 0.77s | 99.8% | 262K |
| Moonshot AI | 19.0% | $0.95 | $4.00 | $0.16 | 32 | 2.48s | 99.9% | 262K |
| Chutes | 14.2% | $0.50 | $2.85 | $0.05 | 43 | 2.25s | 99.7% | 262K |
| Baidu Qianfan | 11.7% | $0.95 | $4.00 | $0.16 | 44 | 1.45s | 100.0% | 262K |
| CoreWeave | 7.2% | $0.65 | $3.41 | $0.15 | 64 | 0.55s | 99.8% | 262K |
| StreamLake | 4.9% | $0.599 | $2.52 | $0.101 | 36 | 2.07s | 96.5% | 256K |
| Crusoe | 4.3% | $0.70 | $3.50 | $0.35 | 54 | 0.65s | 97.0% | 262K |
| AtlasCloud | 1.0% | $0.95 | $4.00 | $0.16 | 56 | 1.63s | 99.0% | 262K |
| Cloudflare | 0.2% | $0.95 | $4.00 | $0.16 | 30 | 1.67s | 98.9% | 262K |
| DigitalOcean | - | $0.57 | $2.40 | $0.114 | 47 | 0.95s | 98.2% | 262K |
| SiliconFlow | - | $0.77 | $3.40 | $0.14 | 26 | 1.61s | 100.0% | 262K |
| NovitaAI | - | $0.80 | $3.40 | $0.16 | 34 | 1.43s | 99.8% | 262K |
| DeepInfra | - | $0.75 | $3.50 | $0.15 | 13 | 5.76s | 95.9% | 262K |
| Venice | - | $0.75 | $3.50 | $0.16 | 12 | 3.73s | 90.4% | 256K |
| Parasail | - | $0.75 | $3.50 | $0.16 | 59 | 1.18s | 100.0% | 262K |
| GMICloud | - | $0.855 | $3.60 | $0.144 | - | - | - | 262K |
| Phala | - | $1.09 | $4.60 | $0.37 | 33 | 2.35s | 99.8% | 262K |
List prices as of October 9, 2026, cheapest endpoint per provider. Tokens/s and latency are medians over 30 minutes.
All Kimi models
| Model | Tokens, 7d | Providers | Output $/M | Context | Released |
|---|---|---|---|---|---|
| Kimi K3 | 1.97T | 20 | $9.90 to $22.50 | 1.05M | 2026-07-16 |
| Kimi K2.6 | 145B | 17 | $2.40 to $4.60 | 262K | 2026-04-20 |
| Kimi K2.7 Code | 48B | 11 | $3.00 to $8.00 | 262K | 2026-06-12 |
| Kimi K2.5 | 42B | 5 | $2.50 to $3.33 | 262K | 2026-01-27 |
| Kimi K2 0905 | 8B | 1 | $2.50 | 262K | 2025-09-04 |
| Kimi K2 Thinking | 2B | 2 | $2.50 | 262K | 2025-11-06 |
| Kimi K2 0711 | 2B | 1 | $2.30 | 131K | 2025-07-11 |
Finance your GPUs
Serving Kimi on your own GPUs? Tell us the cluster, the models you serve and the contracts behind them, and we will share it with partner funders that fit.
Prefer email? hello@amcompute.com