LLM Broker

Uma chave compatível com OpenAI para cada modelo: pontuações de benchmark medidas e preços ao vivo, cada solicitação roteada para a oferta mais barata que atende aos seus critérios.

Servidor MCP hospedado

npx add-mcp 'https://api.llm-broker.net/api/v1/broker/mcp'

Instala no Claude Code, Codex, Cursor e outros

Documentação

DeepSeek V4.1 Flash OpenInference 0.004 / 3.12 ▲ DeepSeek V4.1 Flash Relace 0.002 / 2.40 ▲ DeepSeek V4.1 Flash InferenceNet 0.021 / 0.40 ▼ Mimo V2.6 Flash Io Net 0.13 / 0.27 ▼ DeepSeek V4.1 Flash Wafer 0.050 / 0.60 ▲ DeepSeek V4.1 Flash Morph 0.025 / 0.38 ▼ DeepSeek V4.1 Flash Alibaba 0.15 / 0.60 ▼ Mimo V2.6 Flash InferenceNet 0.11 / 0.28 Mimo V2.6 Pro GMICloud 0.44 / 0.87 ▲ Mimo V2.6 Flash GMICloud 0.14 / 0.28 ▲ DeepSeek V4.1 Flash Venice 0.30 / 1.20 ▼ DeepSeek V4.1 Flash Baidu 0.30 / 1.20 ▲ DeepSeek V4.1 Flash StreamLake 0.14 / 0.56 ▼ DeepSeek V4.1 Flash DeepSeek 0.15 / 0.60 ▼ DeepSeek V4.1 Flash Novita 0.24 / 0.96 ▼ DeepSeek V4.1 Flash Fireworks 0.30 / 1.20 ▲ DeepSeek V4.1 Flash Makora 0.20 / 0.99 ▼ DeepSeek V4.1 Flash Ionstream 0.10 / 1.15 DeepSeek V4.1 Flash DigitalOcean 0.18 / 0.72 ▼ DeepSeek V4.1 Flash AtlasCloud 0.14 / 0.56 ▲ DeepSeek V4.1 Flash BaseTen 0.30 / 1.20 Mimo V2.6 Flash DeepInfra 0.14 / 0.28 DeepSeek V4.1 Flash Phala 0.21 / 0.84 ▼ Ling 3.0 Flash VL DeepInfra 0.060 / 0.18 DeepSeek V4 Flash 0731 DeepInfra 0.060 / 0.18 DeepSeek V4.1 Flash Decart 0.090 / 0.18 GPT 6 Luna OpenAI 0.050 / 0.25 GLM 5.3 Flash Novita 0.15 / 0.50 Mimo V2.6 Pro DeepInfra 0.43 / 0.87 Minimax M3 DeepInfra 0.28 / 1.10 Mimo V2.5 Pro Novita 0.52 / 1.04 Inkling Small DeepInfra 0.45 / 1.20 Qwen3.8 27b Novita 0.42 / 3.00 DeepSeek V4 Pro DeepInfra 1.30 / 2.60 DeepSeek V4 Pro 0813 DeepInfra 1.30 / 2.60 Kimi K2.6 Novita 0.80 / 3.40 Gemini 3.7 Flash DeepInfra 0.75 / 3.75 Kimi K2.7 Code Novita 0.95 / 4.00 Inkling DeepInfra 0.95 / 4.05 Qwen3.7 Max Novita 1.25 / 3.75 GLM 5.1 Novita 1.38 / 4.40 GLM 5.2 Novita 1.40 / 4.40 GLM 5.3 Novita 1.40 / 4.40 GPT 5.6 Sol OpenAI 1.00 / 5.00 GPT 6.1 Sol OpenAI 1.00 / 5.00 GPT 6 Sol OpenAI 1.00 / 5.00 DeepSeek V4.1 Flash OpenInference 0.004 / 3.12 ▲ DeepSeek V4.1 Flash Relace 0.002 / 2.40 ▲ DeepSeek V4.1 Flash InferenceNet 0.021 / 0.40 ▼ Mimo V2.6 Flash Io Net 0.13 / 0.27 ▼ DeepSeek V4.1 Flash Wafer 0.050 / 0.60 ▲ DeepSeek V4.1 Flash Morph 0.025 / 0.38 ▼ DeepSeek V4.1 Flash Alibaba 0.15 / 0.60 ▼ Mimo V2.6 Flash InferenceNet 0.11 / 0.28 Mimo V2.6 Pro GMICloud 0.44 / 0.87 ▲ Mimo V2.6 Flash GMICloud 0.14 / 0.28 ▲ DeepSeek V4.1 Flash Venice 0.30 / 1.20 ▼ DeepSeek V4.1 Flash Baidu 0.30 / 1.20 ▲ DeepSeek V4.1 Flash StreamLake 0.14 / 0.56 ▼ DeepSeek V4.1 Flash DeepSeek 0.15 / 0.60 ▼ DeepSeek V4.1 Flash Novita 0.24 / 0.96 ▼ DeepSeek V4.1 Flash Fireworks 0.30 / 1.20 ▲ DeepSeek V4.1 Flash Makora 0.20 / 0.99 ▼ DeepSeek V4.1 Flash Ionstream 0.10 / 1.15 DeepSeek V4.1 Flash DigitalOcean 0.18 / 0.72 ▼ DeepSeek V4.1 Flash AtlasCloud 0.14 / 0.56 ▲ DeepSeek V4.1 Flash BaseTen 0.30 / 1.20 Mimo V2.6 Flash DeepInfra 0.14 / 0.28 DeepSeek V4.1 Flash Phala 0.21 / 0.84 ▼ Ling 3.0 Flash VL DeepInfra 0.060 / 0.18 DeepSeek V4 Flash 0731 DeepInfra 0.060 / 0.18 DeepSeek V4.1 Flash Decart 0.090 / 0.18 GPT 6 Luna OpenAI 0.050 / 0.25 GLM 5.3 Flash Novita 0.15 / 0.50 Mimo V2.6 Pro DeepInfra 0.43 / 0.87 Minimax M3 DeepInfra 0.28 / 1.10 Mimo V2.5 Pro Novita 0.52 / 1.04 Inkling Small DeepInfra 0.45 / 1.20 Qwen3.8 27b Novita 0.42 / 3.00 DeepSeek V4 Pro DeepInfra 1.30 / 2.60 DeepSeek V4 Pro 0813 DeepInfra 1.30 / 2.60 Kimi K2.6 Novita 0.80 / 3.40 Gemini 3.7 Flash DeepInfra 0.75 / 3.75 Kimi K2.7 Code Novita 0.95 / 4.00 Inkling DeepInfra 0.95 / 4.05 Qwen3.7 Max Novita 1.25 / 3.75 GLM 5.1 Novita 1.38 / 4.40 GLM 5.2 Novita 1.40 / 4.40 GLM 5.3 Novita 1.40 / 4.40 GPT 5.6 Sol OpenAI 1.00 / 5.00 GPT 6.1 Sol OpenAI 1.00 / 5.00 GPT 6 Sol OpenAI 1.00 / 5.00

O melhor desempenho pelo melhor preço, automaticamente.

Você diz uma vez o que precisa: desempenho ou modelo, família de modelos, localização, velocidade, capacidades, preço. Garantimos que sua chave de API receba exatamente isso — hoje e a cada nova geração de modelos, sem que você precise ajustar nada. LLM, imagens, saída de voz e transcrição com uma única chave; preços comparados ao vivo, desempenho medido por nós, conta e faturamento também via API.

38 modelos em comparação

39 plataformas

0.18 USD por milhão de saída, a partir de

Você define os critérios. Nós os mantemos atualizados.

Defina uma vez o que importa — sua chave de API recebe exatamente isso, decidido novamente a cada solicitação. Todos os campos fazem parte da mesma API compatível com OpenAI.

Desempenho ou modelo

O melhor modelo medido para cada caso de uso, um nível (solid, strong, top), um desempenho mínimo próprio — por exemplo, 0.80 em programação — ou um nome de modelo fixo. Caso contrário, escolhemos o mais barato que atenda a isso.

category + level | min_score · model

Família de modelos

Por exemplo, claude, qwen3 ou deepseek/deepseek-v4. Quando uma nova geração aparece, ela já está incluída assim que chega ao mercado — com min_score, assim que a medimos.

family

Localização

Suíça, UE, EUA ou Ásia: apenas provedores com local de execução registrado por nós (eu inclui ch).

region

Velocidade

Ordenar pela taxa de transferência medida, quando o tempo de resposta importa.

sort: "speed"

Capacidades

Ferramentas, saída estruturada, raciocínio, entrada de imagem, contexto mínimo — cada provedor escolhido deve ser capaz disso.

capabilities · min_context

Preço

O mais barato primeiro, melhor pontuação por franco ou um preço máximo rígido por milhão de tokens.

sort: "price" | "value" · max_price

Integre uma vez. Nunca mais atualize.

Quem constrói uma plataforma ou ferramenta escolhe um modelo hoje — e atualiza amanhã quando um melhor ou mais barato aparece. Aqui você define seus requisitos, não um modelo. A interface permanece a mesma; a seleção por trás é refeita continuamente por nós.

  • Novas gerações de modelos entram sem alteração de código.
  • Se um provedor cair, o próximo que atende suas regras assume.
  • Reduções de preço no mercado chegam automaticamente até você.
  • Se nada atender suas regras, dizemos claramente (409) — sem desvio oculto.
{"model": "james-direct",
 "routing": {"family": "deepseek", "category": "coding", "min_score": 0.8,
             "sort": "value", "region": "eu", "capabilities": ["tools"]},
 "messages": [{"role": "user", "content": "…"}]}

Preços de mercado

Preços de tabela das plataformas em USD por 1 milhão de tokens (taxa do dia, sem nosso acréscimo), verificados a cada 15 minutos. As barras tornam preço e ritmo comparáveis; índice = Artificial-Analysis via OpenRouter (pré-seleção, só garantimos o que medimos nós mesmos). Local de execução: registrado por nós — caso contrário, "global" (depende do provedor).

Mapa de desempenho

Cada ponto é um modelo: à esquerda barato, acima forte. A linha brilhante é a fronteira de eficiência — nenhum outro modelo é ao mesmo tempo mais barato e melhor. Tamanho da bolha = janela de contexto.

↖ forte & barato 0 20 40 60 0.1 1 10 100 USD por milhão de tokens de saída (logarítmico) → Índice de raciocínio ↑ GPT 6.1 Sol GPT 5.6 Sol Mimo V2.6 Pro GLM 5.3 Flash GLM 5.3 Flash DeepSeek V4.1 Flash DeepSeek V4.1 Flash DeepSeek V4 Flash 0731 Claude Opus 5.5 Claude Sonnet 5.5 Claude Fable 5.1 Claude Opus 5 Gemini 3.7 Flash

Fronteira de eficiência anthropicopenaideepseekz-aimoonshotaiqwenxiaomigoogle

Faixa de preço por plataforma

O mesmo modelo custa valores diferentes em cada plataforma. O ponto brilhante é o mais barato — é para lá que roteamos.

0.1110100

GPT 6 Astra

×2.2 · −55 %

GPT 6.1 Sol

×2.2 · −55 %

GPT 6 Sol

×2.2 · −55 %

GPT 5.6 Sol

×4.4 · −77 %

Grok 4.6

×1.1 · −9 %

Kimi K3

×1.1 · −5 %

DeepSeek V4.1 Flash

×17.3 · −94 %

GPT 6 Luna

×2.2 · −55 %

Mimo V2.6 Flash

×1.3 · −24 %

DeepSeek V4 Pro 0813

×1.5 · −34 %

DeepSeek V4 Flash 0731

×7.3 · −86 %

DeepSeek V4 Pro

×1.2 · −19 %

Movimento de preços

Menor preço de saída (USD por 1 milhão de tokens) em todas as plataformas — velas por intervalo, vermelho = mais caro, turquesa = mais barato.

Vela = 4 h · desde 29.09.26 01:32 · 234 alterações de preço

0.180 ▼ 70.0 % 0.208 0.329 0.451 0.573 29.09.26 00:00 01.10.26 08:00 03.10.26 20:00 0.180

Custo-Benefício

Pontos de índice por USD de preço de saída · Movimento de preço nos últimos 30 dias.

1. D DeepSeek V4.1 Flash deepseek 219.1 P/USD novo

2. D DeepSeek V4 Flash 0731 deepseek 190.3 P/USD novo

3. O GPT 6 Luna openai 152.1 P/USD novo

4. I Ling 3.0 Flash VL inclusionai 136.5 P/USD novo

5. X Mimo V2.6 Flash xiaomi 135.6 P/USD novo

6. Z GLM 5.3 Flash z-ai 83.7 P/USD novo

7. X Mimo V2.6 Pro xiaomi 53.2 P/USD novo

8. M Minimax M3 minimax 26.6 P/USD novo

9. X Mimo V2.5 Pro xiaomi 24.9 P/USD novo

10. T Inkling Small thinkingmachines 21.4 P/USD novo

ModeloRaciocínioCódigoPreço entrada/saídaVelocidadeLocalHistóricoPlataformaContexto
Claude Opus 5.5 anthropic58HumanEval+ 93 %4.00 20.00159 tok/s Uptime 100 %globalAmazon Bedrock · 6 ▾ - Amazon Bedrock: 4.00 / 20.00 - Azure: 4.00 / 20.00 - Google: 4.00 / 20.00 - Claude Platform on AWS: 4.00 / 20.00 - Anthropic: 4.00 / 20.00 - DeepInfra: 4.00 / 20.001 M
Claude Sonnet 5.5 anthropic56HumanEval+ 94 %2.00 10.00110 tok/s Uptime 100 %globalGoogle · 6 ▾ - Google: 2.00 / 10.00 - Amazon Bedrock: 2.00 / 10.00 - Azure: 2.00 / 10.00 - Anthropic: 2.00 / 10.00 - Claude Platform on AWS: 2.00 / 10.00 - DeepInfra: 2.00 / 10.001 M
Claude Fable 5.1 anthropic538210.00 50.0057 tok/s Uptime 100 %globalnovoAmazon Bedrock · 4 ▾ - Amazon Bedrock: 10.00 / 50.00 - Google: 10.00 / 50.00 - Azure: 10.00 / 50.00 - Anthropic: 10.00 / 50.001 M
GPT 6 Astra openai53775.00 25.00122 tok/s Uptime 100 %globalnovoOpenAI · 3 ▾ - OpenAI: 5.00 / 25.00 - Azure: 10.00 / 50.00 - Amazon Bedrock: 11.00 / 55.001 M
GPT 6.1 Sol openai52HumanEval+ 95 %1.00 5.0087 tok/s Uptime 100 %globalnovoOpenAI · 3 ▾ - OpenAI: 1.00 / 5.00 - Azure: 2.00 / 10.00 - Amazon Bedrock: 2.20 / 11.001 M
Claude Opus 5 anthropic51785.00 25.00188 tok/s Uptime 100 %globalnovoClaude Platform on AWS · 6 ▾ - Claude Platform on AWS: 5.00 / 25.00 - Azure: 5.00 / 25.00 - Google: 5.00 / 25.00 - Anthropic: 5.00 / 25.00 - Amazon Bedrock: 5.00 / 25.00 - DeepInfra: 5.00 / 25.001 M
Claude Fable 5 anthropic507710.00 50.00–globalnovoDeepInfra · 1 ▾ - DeepInfra: 10.00 / 50.001 M
GPT 6 Sol openai481.00 5.0082 tok/s Uptime 100 %globalnovoOpenAI · 3 ▾ - OpenAI: 1.00 / 5.00 - Azure: 2.00 / 10.00 - Amazon Bedrock: 2.20 / 11.001 M
GPT 5.6 Sol openai47771.00 5.00140 tok/s Uptime 100 %globalnovoOpenAI · 3 ▾ - OpenAI: 1.00 / 5.00 - Azure: 4.00 / 20.00 - Amazon Bedrock: 4.40 / 22.001 M
Grok 4.7 x-ai462.00 6.0078 tok/s Uptime 100 %globalnovoxAI · 1 ▾ - xAI: 2.00 / 6.00500 k
Mimo V2.6 Pro xiaomi460.43 0.8730 tok/s Uptime 100 %globalDeepInfra · 4 ▾ - DeepInfra: 0.43 / 0.87 - GMICloud: 0.44 / 0.87 - Xiaomi: 0.44 / 0.87 - Novita: 0.44 / 0.871 M
GLM 5.3 z-ai45751.40 4.4058 tok/s medidoglobalnovoNovita · 1 ▾ - Novita: 1.40 / 4.401 M
Grok 4.6 x-ai44772.00 6.0095 tok/s Uptime 100 %globalnovoxAI · 2 ▾ - xAI: 2.00 / 6.00 - Amazon Bedrock: 2.20 / 6.60500 k
Kimi K3 moonshotai44762.85 14.2525 tok/s medidoglobalnovoDeepInfra · 2 ▾ - DeepInfra: 2.85 / 14.25 - Novita: 3.00 / 15.001 M
GLM 5.3 Flash z-ai42720.15 0.5063 tok/s medidoglobalnovoNovita · 1 ▾ - Novita: 0.15 / 0.501 M
Claude Opus 4.8 anthropic42745.00 25.00–globalnovoDeepInfra · 1 ▾ - DeepInfra: 5.00 / 25.001 M
Qwen3.8 2.4t A95b qwen40722.00 6.0032 tok/s medidoglobalnovoDeepInfra · 2 ▾ - DeepInfra: 2.00 / 6.00 - Novita: 2.00 / 6.001 M
DeepSeek V4.1 Flash deepseek40HumanEval+ 89 %0.090 0.18225 tok/s Uptime 100 %globalDecart · 29 ▾ - Decart: 0.090 / 0.18 - Morph: 0.025 / 0.38 - InferenceNet: 0.021 / 0.40 - Sail Research: 0.080 / 0.40 - DekaLLM: 0.12 / 0.40 - DeepInfra: 0.14 / 0.42 - Wafer: 0.050 / 0.60 - StreamLake: 0.14 / 0.56 - AtlasCloud: 0.14 / 0.56 - DeepSeek: 0.15 / 0.60 - Alibaba: 0.15 / 0.60 - CoreWeave: 0.20 / 0.65 - DigitalOcean: 0.18 / 0.72 - GMICloud: 0.18 / 0.72 - NextBit: 0.21 / 0.84 - Phala: 0.21 / 0.84 - Makora: 0.20 / 0.99 - Novita: 0.24 / 0.96 - Ionstream: 0.10 / 1.15 - Baidu: 0.30 / 1.20 - SiliconFlow: 0.30 / 1.20 - Parasail: 0.30 / 1.20 - Venice: 0.30 / 1.20 - BaseTen: 0.30 / 1.20 - Modal: 0.30 / 1.20 - Fireworks: 0.30 / 1.20 - Together: 0.30 / 1.20 - Relace: 0.002 / 2.40 - OpenInference: 0.004 / 3.121 M
Gemini 3.7 Flash google39760.75 3.751 tok/s medidoglobalnovoDeepInfra · 1 ▾ - DeepInfra: 0.75 / 3.751 M
Claude Sonnet 5 anthropic38723.00 15.0065 tok/s medidoglobalnovoDeepInfra · 1 ▾ - DeepInfra: 3.00 / 15.001 M
GPT 6 Luna openai380.050 0.25123 tok/s Uptime 100 %globalnovoOpenAI · 3 ▾ - OpenAI: 0.050 / 0.25 - Azure: 0.10 / 0.50 - Amazon Bedrock: 0.11 / 0.551 M
Mimo V2.6 Flash xiaomi380.11 0.28101 tok/s Uptime 100 %globalInferenceNet · 8 ▾ - InferenceNet: 0.11 / 0.28 - Darkbloom: 0.12 / 0.28 - Io Net: 0.13 / 0.27 - GMICloud: 0.14 / 0.28 - DeepInfra: 0.14 / 0.28 - Xiaomi: 0.14 / 0.28 - Novita: 0.14 / 0.28 - Venice: 0.18 / 0.351 M
DeepSeek V4 Pro 0813 deepseek36691.30 2.6069 tok/s medidoglobalnovoDeepInfra · 2 ▾ - DeepInfra: 1.30 / 2.60 - Novita: 1.32 / 3.961 M
DeepSeek V4 Flash 0731 deepseek34690.060 0.1844 tok/s medidoglobalnovoDeepInfra · 2 ▾ - DeepInfra: 0.060 / 0.18 - Novita: 0.44 / 1.321 M
Qwen3.8 27b qwen34680.42 3.00–globalnovoNovita · 1 ▾ - Novita: 0.42 / 3.001 M
GLM 5.2 z-ai34691.40 4.40–globalnovoNovita · 1 ▾ - Novita: 1.40 / 4.401 M
Gemini 3.5 Flash google33701.50 9.00–globalnovoDeepInfra · 1 ▾ - DeepInfra: 1.50 / 9.001 M
DeepSeek V4 Pro deepseek30591.30 2.60–globalnovoDeepInfra · 2 ▾ - DeepInfra: 1.30 / 2.60 - Novita: 1.60 / 3.201 M
Claude Sonnet 4.6 anthropic30633.00 15.00–globalnovoDeepInfra · 1 ▾ - DeepInfra: 3.00 / 15.001 M
Qwen3.7 Max qwen30661.25 3.75–globalnovoNovita · 2 ▾ - Novita: 1.25 / 3.75 - DeepInfra: 2.50 / 7.501 M
Minimax M3 minimax29590.28 1.10–globalnovoDeepInfra · 1 ▾ - DeepInfra: 0.28 / 1.10524 k
Kimi K2.6 moonshotai27620.80 3.40–globalnovoNovita · 2 ▾ - Novita: 0.80 / 3.40 - DeepInfra: 0.75 / 3.50262 k
GLM 5.1 z-ai26561.38 4.40–globalnovoNovita · 1 ▾ - Novita: 1.38 / 4.40204 k
Mimo V2.5 Pro xiaomi26600.52 1.04–globalnovoNovita · 1 ▾ - Novita: 0.52 / 1.041 M
Kimi K2.7 Code moonshotai26610.95 4.00–globalnovoNovita · 1 ▾ - Novita: 0.95 / 4.00262 k
Inkling Small thinkingmachines26530.45 1.20–globalnovoDeepInfra · 1 ▾ - DeepInfra: 0.45 / 1.20524 k
Inkling thinkingmachines25520.95 4.05–globalnovoDeepInfra · 1 ▾ - DeepInfra: 0.95 / 4.05524 k
Ling 3.0 Flash VL inclusionai25570.060 0.18–globalnovoDeepInfra · 2 ▾ - DeepInfra: 0.060 / 0.18 - Novita: 0.075 / 0.22262 k

Imagem e Fala — a mesma chave

Não apenas LLM: imagens, saída de fala e transcrição do mercado, com a mesma API compatível com OpenAI e a mesma cobrança. Você informa um ID de mercado, nós escolhemos o provedor mais barato. Preços em USD, incluindo nossa margem, ao vivo em /api/v1/broker/models?type=….

Ein Lichtstrahl malt ein leuchtendes Berglandschaftsbild über einem Schreibtisch

Geração de imagens

Do rascunho rápido à qualidade de impressão: FLUX, Qwen-Image, Seedream e mais — ou iris, nosso próprio modelo de imagem.

  • iris 0.0079 USD por imagem
  • stabilityai/sdxl-turbo 0.00026 USD por imagem
  • black-forest-labs/FLUX-1-schnell 0.00065 USD por imagem
  • PrunaAI/p-image 0.0065 USD por imagem
  • black-forest-labs/FLUX-1-dev 0.0117 USD por imagem
  • black-forest-labs/FLUX-2-dev 0.013 USD por imagem
curl https://llm-broker.net/api/v1/images/generations \
  -H "Authorization: Bearer $BROKER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"black-forest-labs/FLUX-1-schnell","prompt":"a lighthouse at dawn","size":"1024x1024"}'

Leuchtende Schallwellen fliessen aus einem Studiomikrofon

Saída de fala

Texto para fala em muitas vozes e idiomas — Kokoro, Qwen3-TTS, Chatterbox e mais — ou quill com vozes clonadas.

  • quill 0.121 USD por 1 000 caracteres
  • hexgrad/Kokoro-82M 0.000806 USD por 1 000 caracteres
  • ResembleAI/chatterbox-turbo 0.0013 USD por 1 000 caracteres
  • ResembleAI/chatterbox-multilingual 0.0013 USD por 1 000 caracteres
  • Audio8/Audio8-TTS-Preview-0.6b 0.0065 USD por 1 000 caracteres
  • sesame/csm-1b 0.0091 USD por 1 000 caracteres
curl https://llm-broker.net/api/v1/audio/speech \
  -H "Authorization: Bearer $BROKER_API_KEY" \
  -H "Content-Type: application/json" \
  -d '{"model":"hexgrad/Kokoro-82M","input":"Hello from LLM Broker","voice":"af_bella"}' -o hello.mp3

Lichtspuren fliessen über ein nächtliches Stadtraster zu einem hellen Zentrum

Transcrição

Fala para texto: Whisper, Qwen3-ASR, Voxtral e mais — cobrado pela duração que o provedor mede.

  • quill 0,0121 USD por minuto
  • nvidia/Nemotron-3.5-ASR-Streaming-Multilingual-0.6b 0,00026 USD por minuto
  • openai/whisper-large-v3-turbo 0,00026 USD por minuto
  • Qwen/Qwen3-ASR-0.6B 0,00026 USD por minuto
  • Qwen/Qwen3-ASR-1.7B 0,000586 USD por minuto
  • openai/whisper-large-v3 0,000586 USD por minuto
curl https://llm-broker.net/api/v1/audio/transcriptions \
  -H "Authorization: Bearer $BROKER_API_KEY" \
  -F model=openai/whisper-large-v3-turbo -F [email protected]

Um prompt — seu assistente de IA configura tudo

Copie o prompt no Claude Code, Cursor, Codex, OpenCode ou qualquer outro assistente de codificação. Ele lê nossa documentação, abre a conta via API, armazena a chave com segurança, integra a API e a testa com um smoke test. Você só confirma o pagamento.

Eine gläserne Roboterhand setzt einen leuchtenden Schlüssel in ein Schloss

Claude Code: cole o prompt na sessão · Cursor/Windsurf: no chat do agente · OpenCode: opencode run "…" · Codex: codex "…"

Richte in diesem Projekt den LLM Broker ein (https://llm-broker.net) — eine OpenAI-kompatible API für LLM, Bilder,
Sprachausgabe und Transkription mit einem Schlüssel. Arbeite selbstständig; frag mich nur, wenn eine Zahlung
bestätigt oder ein Geheimnis eingegeben werden muss.

1. Lies zuerst die Beschreibungen, nicht raten:
   - https://llm-broker.net/llms.txt (Einstieg für Agenten)
   - https://llm-broker.net/api/openapi (alle Endpunkte und Schemata)
   - https://astrioncore.wiki/api und https://astrioncore.wiki/api#konto (Konto und Bezahlung per API)
2. Schlüssel: Ist BROKER_API_KEY (beginnt mit ast_sk_) nicht gesetzt, eröffne ein Konto per API:
   POST https://llm-broker.net/api/v1/broker/accounts
   {"billing": "topup", "amount": 25, "currency": "USD"}   (Leistung wählt jede Anfrage per "routing")
   Zeig mir die checkout_url (die Karte wird einmal bei Stripe eingegeben) und frag danach status_url ab,
   bis 200 kommt. Der api_key erscheint GENAU EINMAL: sofort in .env als BROKER_API_KEY speichern,
   .env in .gitignore, nie ins Log oder in einen Commit. base_url steht in derselben Antwort.
3. Einbinden: OpenAI-SDK der Projektsprache mit base_url und BROKER_API_KEY. Modelle findest du unter
   GET /api/v1/broker/models?type=chat|image|speech|transcription (ohne Schlüssel lesbar).
   - LLM: POST /api/v1/chat/completions, model "james-direct" mit "routing" (category, level|min_score, sort,
     region, family, capabilities, max_price) oder direkt eine Markt-ID wie "deepseek/deepseek-v4.1-flash".
   - Bilder: POST /api/v1/images/generations, Sprache: POST /api/v1/audio/speech,
     Transkription: POST /api/v1/audio/transcriptions — jeweils mit einer Markt-ID der passenden type.
4. Lege eine kleine Client-Schicht an (Konfiguration aus der Umgebung, keine festen Modellnamen im Code —
   lieber routing), schreibe einen Rauchtest mit einem kurzen Chat-Aufruf und führe ihn aus.
5. Abrechnung: GET /api/v1/broker/billing zeigt Guthaben und Verbrauch; Aufladen oder Monatsrahmen ändern
   mit PATCH /api/v1/broker/billing, Karte mit POST|DELETE /api/v1/broker/card.
   Fehler: 402 insufficient_balance (aufladen), 409 no_matching_offer (routing lockern),
   404 model_not_found (Marktliste prüfen), 429 rate_limited (später erneut).
Fasse am Ende zusammen, was eingerichtet ist und wo der Schlüssel liegt.
Set up LLM Broker in this project (https://llm-broker.net) — one OpenAI-compatible API for LLMs, images, speech
and transcription with a single key. Work on your own; only ask me when a payment must be confirmed or a secret
must be entered.

1. Read the descriptions first, don't guess:
   - https://llm-broker.net/llms.txt (entry point for agents)
   - https://llm-broker.net/api/openapi (all endpoints and schemas)
   - https://astrioncore.wiki/api and https://astrioncore.wiki/api#konto (account and billing via API)
2. Key: if BROKER_API_KEY (starts with ast_sk_) is not set, open an account via the API:
   POST https://llm-broker.net/api/v1/broker/accounts
   {"billing": "topup", "amount": 25, "currency": "USD"}   (every request picks its level via "routing")
   Show me the checkout_url (the card is entered once at Stripe), then poll status_url until it returns 200.
   The api_key is shown EXACTLY ONCE: store it right away in .env as BROKER_API_KEY, add .env to .gitignore,
   never log or commit it. base_url is in the same response.
3. Integrate: the OpenAI SDK of the project's language with base_url and BROKER_API_KEY. Models are listed at
   GET /api/v1/broker/models?type=chat|image|speech|transcription (no key needed).
   - LLM: POST /api/v1/chat/completions, model "james-direct" with "routing" (category, level|min_score, sort,
     region, family, capabilities, max_price) or a market id such as "deepseek/deepseek-v4.1-flash".
   - Images: POST /api/v1/images/generations, speech: POST /api/v1/audio/speech,
     transcription: POST /api/v1/audio/transcriptions — each with a market id of the matching type.
4. Add a small client layer (configuration from the environment, no hard-coded model names — prefer routing),
   write a smoke test with one short chat call and run it.
5. Billing: GET /api/v1/broker/billing shows balance and spend; top up or change the monthly limit with
   PATCH /api/v1/broker/billing, the card with POST|DELETE /api/v1/broker/card.
   Errors: 402 insufficient_balance (top up), 409 no_matching_offer (relax routing),
   404 model_not_found (check the market list), 429 rate_limited (retry later).
Finish with a summary of what is set up and where the key is stored.

Desempenho por solicitação

Você escolhe a cada solicitação o quão forte o modelo precisa ser — via routing na mesma API compatível com OpenAI. Um nível é uma pontuação mínima em NOSSAS medições por caso de uso, best o modelo com maior pontuação medida; um limite próprio define "min_score": 0.85. O preço é o preço atual ao cliente (na moeda escolhida por 1 milhão de tokens de entrada/saída, incluindo nossa margem) do modelo mais barato que atende ao nível — válido para taylor, james-direct e qualquer ID de mercado.

Programação medido com HumanEval+ "category": "coding"

Sólido ≥ 70 %

0,05 / 0,22

21 modelos atendem

"level": "solid"

Forte ≥ 80 %

0,05 / 0,22

19 modelos atendem

"level": "strong"

Topo ≥ 88 %

0,07 / 0,23

17 modelos atendem

"level": "top"

Melhor pontuação máxima

1,29 / 6,50

1 modelo atende

"level": "best"

Raciocínio e conhecimento medido com MMLU-Pro + GPQA Diamond "category": "reasoning"

Sólido ≥ 55 %

0,05 / 0,22

16 modelos atendem

"level": "solid"

Forte ≥ 65 %

0,07 / 0,23

15 modelos atendem

"level": "strong"

Topo ≥ 75 %

0,07 / 0,23

11 modelos atendem

"level": "top"

Melhor pontuação máxima

1,29 / 6,50

1 modelo atende

"level": "best"

Matemática medido com MATH "category": "math"

Sólido ≥ 60 %

0,05 / 0,22

17 modelos atendem

"level": "solid"

Forte ≥ 75 %

0,05 / 0,22

17 modelos atendem

"level": "strong"

Topo ≥ 85 %

0,07 / 0,23

12 modelos atendem

"level": "top"

Melhor pontuação máxima

5,20 / 26,00

1 modelo atende

"level": "best"

Seguir instruções medido com IFEval "category": "instruction_following"

Sólido ≥ 75 %

0,05 / 0,22

19 modelos atendem

"level": "solid"

Forte ≥ 82 %

0,07 / 0,23

15 modelos atendem

"level": "strong"

Topo ≥ 88 %

0,16 / 0,52

9 modelos atendem

"level": "top"

Melhor pontuação máxima

2,60 / 7,80

1 modelo atende

"level": "best"

Obter chave

Cadastre o cartão uma vez e pronto. O número do cartão só a Stripe vê — nós nunca.

Registrar e pagar — tudo via API

Um programa ou agente abre a conta, obtém a chave e gerencia a cobrança sozinho. Dinheiro antes da chave: sem saldo grátis, a chave só é criada após o pagamento.

1 · CONTA

Abrir conta

Escolha a cobrança — um nível é opcional, cada solicitação o escolhe via routing. A resposta informa checkout_url e status_url.

curl -X POST https://llm-broker.net/api/v1/broker/accounts \
  -H "Content-Type: application/json" \
  -d '{"billing":"topup",
       "amount":25}'

2 · CARTÃO

Pagar uma vez

O cartão é inserido uma única vez na Stripe — por você ou por um agente com navegador. Nunca vemos o número do cartão.

3 · CHAVE

Obter chave

202 até o pagamento, depois api_key (ast_sk_…) e base_url — exatamente uma vez.

curl https://llm-broker.net/api/v1/broker/accounts/$SESSION_ID

4 · FATURAMENTO

Gerenciar você mesmo

Leia saldo e consumo, recarregue ou altere o limite mensal, troque ou remova o cartão.

GET|PATCH /api/v1/broker/billing
POST|DELETE /api/v1/broker/card

Depois disso, tudo funciona sem humanos: recarga com o cartão salvo, faturamento mensal, cancelamento. Apenas a primeira inserção do cartão hoje exige um navegador na Stripe. Detalhes: Wiki: Conta e pagamento via API.

Qual modelo recebo com taylor?

Sem nível, o mais capaz; com nível (por solicitação ou como padrão da chave) o mais barato entre todos que o atingem em nossas medições. A tabela acima mostra o mercado; qual modelo responde a uma solicitação individual é decidido pelo preço no momento da solicitação. Se você quiser o mais forte em vez do mais barato: "routing": {"category": "…", "level": "best"} — válido para taylor, james-direct e qualquer ID de mercado.

O que significa "medido"?

Testamos cada modelo nós mesmos com benchmarks abertos (amostras, mesmas configurações) e medimos regularmente de novo — todos sem modo de raciocínio, para que os valores sejam comparáveis; modelos de raciocínio com o raciocínio ativado geralmente se saem melhor em tarefas difíceis. Você pode controlar isso por solicitação com reasoning_effort (por exemplo, "none"). Os índices de terceiros servem apenas para pré-seleção.

E se nenhum atender ao nível?

Então a API responde com level_unavailable e não cobra nada — nunca um modelo mais fraco em silêncio.

Também existem modelos de imagem e fala?

Sim: geração de imagens, saída de fala e transcrição do mercado com a mesma chave — ID de mercado em /api/v1/broker/models?type=image|speech|transcription, além de nossos próprios modelos iris e quill.

Como é a cobrança?

Por consumo ao preço do dia — tokens, imagens, caracteres ou minutos —, exclusivamente por cartão de crédito: recarga automática ou mensal posterior. Sem assinatura, sem saldo inicial.