gpt-oss API Providers

Who serves gpt-oss, at what price and speed.

gpt-oss is OpenAI's open-weight model line (gpt-oss-120b and gpt-oss-20b). OpenAI does not serve it through its own API, so every token comes from third-party providers.

Groq served 20% of the 733B gpt-oss tokens that went through a large public LLM router over Oct 3 to Oct 9, 2026. 22 providers list the family.

Who serves gpt-oss tokens

ProviderTokens, 7dShare
Groq127B20.3%
CoreWeave123B19.6%
DeepInfra92B14.7%
AkashML58B9.2%
DekaLLM35B5.6%
Cerebras35B5.6%
Darkbloom33B5.3%
Amazon Bedrock30B4.8%
Parasail30B4.8%
Crusoe25B4.0%
Baseten13B2.1%
Mancer9B1.5%
Together6B1.0%
SambaNova4B0.7%
Nebius Token Factory4B0.6%
3 others1B0.2%

All gpt-oss models combined, Oct 3 to Oct 9, 2026.

gpt-oss-120b: prices and speed by provider

Output prices run from $0.15 to $0.95 per million tokens across 21 providers, median $0.55.

ProviderShareInput $/MOutput $/MCache read $/MTokens/sLatencyUptime 3dContext
DeepInfra22.0%$0.037$0.17–730.27s98.5%131K
Groq20.1%$0.15$0.60$0.0753420.19s100.0%131K
CoreWeave15.0%$0.03$0.17$0.03420.36s99.8%131K
AkashML11.9%$0.03$0.187$0.03910.62s99.9%131K
Cerebras8.4%$0.35$0.75$0.354520.80s100.0%131K
DekaLLM6.4%$0.03$0.18$0.03400.72s99.9%131K
Crusoe6.0%$0.05$0.25$0.052200.27s96.1%131K
Baseten3.2%$0.10$0.50$0.101840.32s100.0%128K
Mancer2.2%$0.05$0.25–460.71s98.8%131K
Together1.4%$0.15$0.60–1890.27s91.7%131K
Amazon Bedrock1.4%$0.15$0.60–1450.42s100.0%131K
SambaNova1.0%$0.14$0.95–3520.89s99.8%131K
Nebius Token Factory0.8%$0.15$0.60–2730.31s98.1%131K
MARA0.2%$0.15$0.75–2100.93s97.4%131K
Venice-$0.03$0.15$0.03132.11s100.0%128K
NovitaAI-$0.05$0.25–1580.75s99.6%131K
Google Vertex-$0.09$0.36–1960.27s13.3%131K
DigitalOcean-$0.06$0.42$0.012580.91s100.0%128K
SiliconFlow-$0.15$0.60$0.075141.56s77.1%131K
Phala-$0.15$0.60–1281.06s99.4%131K
Parasail-$0.10$0.75$0.0551290.45s100.0%131K

List prices as of October 9, 2026, cheapest endpoint per provider. Tokens/s and latency are medians over 30 minutes.

gpt-oss-20b: prices and speed by provider

Output prices run from $0.09 to $0.30 per million tokens across 10 providers, median $0.15.

ProviderShareInput $/MOutput $/MCache read $/MTokens/sLatencyUptime 3dContext
CoreWeave29.3%$0.03$0.13$0.031280.15s100.0%131K
Groq19.6%$0.075$0.30$0.0373620.34s83.1%131K
Darkbloom16.4%$0.018$0.09$0.0090233.96s100.0%131K
Parasail14.7%$0.03$0.15$0.02651.51s99.9%131K
Amazon Bedrock12.0%$0.07$0.15–-0.40s100.0%131K
DekaLLM4.0%$0.029$0.14$0.029201.42s99.5%131K
AkashML3.8%$0.02$0.10–321.00s99.9%131K
DeepInfra-$0.03$0.14–1220.26s99.7%131K
SiliconFlow-$0.04$0.18–481.17s86.9%131K
Google Vertex-$0.07$0.25–2580.44s99.0%131K

List prices as of October 9, 2026, cheapest endpoint per provider. Tokens/s and latency are medians over 30 minutes.

All gpt-oss models

ModelTokens, 7dProvidersOutput $/MContextReleased
gpt-oss-120b484B21$0.15 to $0.95131K2025-08-05
gpt-oss-20b247B10$0.09 to $0.30131K2025-08-05
gpt-oss-safeguard-20b3B1$0.30131K2025-10-29

Finance your GPUs

Serving gpt-oss on your own GPUs? Tell us the cluster, the models you serve and the contracts behind them, and we will share it with partner funders that fit.

Prefer email? hello@amcompute.com