LLM Broker
One OpenAI-compatible key for every model: measured benchmark scores and live prices, each request routed to the cheapest offer that meets your criteria.
Hosted MCP Server
npx add-mcp 'https://api.llm-broker.net/api/v1/broker/mcp'Installs into Claude Code, Codex, Cursor and more
Documentation
DeepSeek V4.1 Flash OpenInference 0.004 / 3.12 ▲ DeepSeek V4.1 Flash Relace 0.002 / 2.40 ▲ DeepSeek V4.1 Flash InferenceNet 0.021 / 0.40 ▼ Mimo V2.6 Flash Io Net 0.13 / 0.27 ▼ DeepSeek V4.1 Flash Wafer 0.050 / 0.60 ▲ DeepSeek V4.1 Flash Morph 0.025 / 0.38 ▼ DeepSeek V4.1 Flash Alibaba 0.15 / 0.60 ▼ Mimo V2.6 Flash InferenceNet 0.11 / 0.28 Mimo V2.6 Pro GMICloud 0.44 / 0.87 ▲ Mimo V2.6 Flash GMICloud 0.14 / 0.28 ▲ DeepSeek V4.1 Flash Venice 0.30 / 1.20 ▼ DeepSeek V4.1 Flash Baidu 0.30 / 1.20 ▲ DeepSeek V4.1 Flash StreamLake 0.14 / 0.56 ▼ DeepSeek V4.1 Flash DeepSeek 0.15 / 0.60 ▼ DeepSeek V4.1 Flash Novita 0.24 / 0.96 ▼ DeepSeek V4.1 Flash Fireworks 0.30 / 1.20 ▲ DeepSeek V4.1 Flash Makora 0.20 / 0.99 ▼ DeepSeek V4.1 Flash Ionstream 0.10 / 1.15 DeepSeek V4.1 Flash DigitalOcean 0.18 / 0.72 ▼ DeepSeek V4.1 Flash AtlasCloud 0.14 / 0.56 ▲ DeepSeek V4.1 Flash BaseTen 0.30 / 1.20 Mimo V2.6 Flash DeepInfra 0.14 / 0.28 DeepSeek V4.1 Flash Phala 0.21 / 0.84 ▼ Ling 3.0 Flash VL DeepInfra 0.060 / 0.18 DeepSeek V4 Flash 0731 DeepInfra 0.060 / 0.18 DeepSeek V4.1 Flash Decart 0.090 / 0.18 GPT 6 Luna OpenAI 0.050 / 0.25 GLM 5.3 Flash Novita 0.15 / 0.50 Mimo V2.6 Pro DeepInfra 0.43 / 0.87 Minimax M3 DeepInfra 0.28 / 1.10 Mimo V2.5 Pro Novita 0.52 / 1.04 Inkling Small DeepInfra 0.45 / 1.20 Qwen3.8 27b Novita 0.42 / 3.00 DeepSeek V4 Pro DeepInfra 1.30 / 2.60 DeepSeek V4 Pro 0813 DeepInfra 1.30 / 2.60 Kimi K2.6 Novita 0.80 / 3.40 Gemini 3.7 Flash DeepInfra 0.75 / 3.75 Kimi K2.7 Code Novita 0.95 / 4.00 Inkling DeepInfra 0.95 / 4.05 Qwen3.7 Max Novita 1.25 / 3.75 GLM 5.1 Novita 1.38 / 4.40 GLM 5.2 Novita 1.40 / 4.40 GLM 5.3 Novita 1.40 / 4.40 GPT 5.6 Sol OpenAI 1.00 / 5.00 GPT 6.1 Sol OpenAI 1.00 / 5.00 GPT 6 Sol OpenAI 1.00 / 5.00 DeepSeek V4.1 Flash OpenInference 0.004 / 3.12 ▲ DeepSeek V4.1 Flash Relace 0.002 / 2.40 ▲ DeepSeek V4.1 Flash InferenceNet 0.021 / 0.40 ▼ Mimo V2.6 Flash Io Net 0.13 / 0.27 ▼ DeepSeek V4.1 Flash Wafer 0.050 / 0.60 ▲ DeepSeek V4.1 Flash Morph 0.025 / 0.38 ▼ DeepSeek V4.1 Flash Alibaba 0.15 / 0.60 ▼ Mimo V2.6 Flash InferenceNet 0.11 / 0.28 Mimo V2.6 Pro GMICloud 0.44 / 0.87 ▲ Mimo V2.6 Flash GMICloud 0.14 / 0.28 ▲ DeepSeek V4.1 Flash Venice 0.30 / 1.20 ▼ DeepSeek V4.1 Flash Baidu 0.30 / 1.20 ▲ DeepSeek V4.1 Flash StreamLake 0.14 / 0.56 ▼ DeepSeek V4.1 Flash DeepSeek 0.15 / 0.60 ▼ DeepSeek V4.1 Flash Novita 0.24 / 0.96 ▼ DeepSeek V4.1 Flash Fireworks 0.30 / 1.20 ▲ DeepSeek V4.1 Flash Makora 0.20 / 0.99 ▼ DeepSeek V4.1 Flash Ionstream 0.10 / 1.15 DeepSeek V4.1 Flash DigitalOcean 0.18 / 0.72 ▼ DeepSeek V4.1 Flash AtlasCloud 0.14 / 0.56 ▲ DeepSeek V4.1 Flash BaseTen 0.30 / 1.20 Mimo V2.6 Flash DeepInfra 0.14 / 0.28 DeepSeek V4.1 Flash Phala 0.21 / 0.84 ▼ Ling 3.0 Flash VL DeepInfra 0.060 / 0.18 DeepSeek V4 Flash 0731 DeepInfra 0.060 / 0.18 DeepSeek V4.1 Flash Decart 0.090 / 0.18 GPT 6 Luna OpenAI 0.050 / 0.25 GLM 5.3 Flash Novita 0.15 / 0.50 Mimo V2.6 Pro DeepInfra 0.43 / 0.87 Minimax M3 DeepInfra 0.28 / 1.10 Mimo V2.5 Pro Novita 0.52 / 1.04 Inkling Small DeepInfra 0.45 / 1.20 Qwen3.8 27b Novita 0.42 / 3.00 DeepSeek V4 Pro DeepInfra 1.30 / 2.60 DeepSeek V4 Pro 0813 DeepInfra 1.30 / 2.60 Kimi K2.6 Novita 0.80 / 3.40 Gemini 3.7 Flash DeepInfra 0.75 / 3.75 Kimi K2.7 Code Novita 0.95 / 4.00 Inkling DeepInfra 0.95 / 4.05 Qwen3.7 Max Novita 1.25 / 3.75 GLM 5.1 Novita 1.38 / 4.40 GLM 5.2 Novita 1.40 / 4.40 GLM 5.3 Novita 1.40 / 4.40 GPT 5.6 Sol OpenAI 1.00 / 5.00 GPT 6.1 Sol OpenAI 1.00 / 5.00 GPT 6 Sol OpenAI 1.00 / 5.00
Die beste Leistung zum besten Preis, automatisch.
Du sagst einmal, was du brauchst: Leistung oder Modell, Modellfamilie, Standort, Geschwindigkeit, Fähigkeiten, Preis. Wir sorgen dafür, dass dein API-Schlüssel genau das bekommt — heute und bei jeder neuen Modellgeneration, ohne dass du etwas anpasst. LLM, Bilder, Sprachausgabe und Transkription mit einem Schlüssel; Preise live verglichen, Leistung selbst gemessen, Konto und Abrechnung auch per API.
38 Modelle im Vergleich
39 Plattformen
0.18 USD je Mio. Ausgabe, ab
Du nennst die Kriterien. Wir halten sie aktuell.
Einmal festlegen, was zählt — dein API-Schlüssel bekommt genau das, bei jeder Anfrage neu entschieden. Alle Felder sind Teil derselben OpenAI-kompatiblen API.
Leistung oder Modell
Das beste gemessene Modell je Einsatzzweck, eine Stufe (solid, strong, top), eine eigene Mindestleistung — etwa 0.80 im Programmieren — oder ein fester Modellname. Sonst nehmen wir den günstigsten, der das erfüllt.
category + level | min_score · model
Modellfamilie
Zum Beispiel claude, qwen3 oder deepseek/deepseek-v4. Erscheint eine neue Generation, ist sie dabei, sobald sie am Markt ist — mit min_score, sobald wir sie gemessen haben.
family
Standort
Schweiz, EU, USA oder Asien: nur Anbieter mit von uns erfasstem Ausführungsort (eu schliesst ch ein).
region
Geschwindigkeit
Nach gemessenem Durchsatz ordnen, wenn die Antwortzeit zählt.
sort: "speed"
Fähigkeiten
Werkzeuge, strukturierte Ausgabe, Reasoning, Bildeingabe, Mindestkontext — jeder gewählte Anbieter muss es können.
capabilities · min_context
Preis
Günstigster zuerst, beste Punktzahl je Franken oder ein harter Höchstpreis je Million Token.
sort: "price" | "value" · max_price
Einmal einbauen. Nie wieder nachziehen.
Wer eine Plattform oder ein Werkzeug baut, legt sich heute auf ein Modell fest — und zieht morgen nach, wenn ein besseres oder günstigeres erscheint. Hier legst du dich auf deine Anforderungen fest, nicht auf ein Modell. Die Schnittstelle bleibt gleich; die Auswahl dahinter treffen wir laufend neu.
- Neue Modellgenerationen kommen an, ohne Code-Änderung.
- Fällt ein Anbieter aus, übernimmt der nächste, der deine Regeln erfüllt.
- Preissenkungen am Markt landen automatisch bei dir.
- Erfüllt nichts deine Regeln, sagen wir es klar (409) — kein heimliches Ausweichen.
{"model": "james-direct",
"routing": {"family": "deepseek", "category": "coding", "min_score": 0.8,
"sort": "value", "region": "eu", "capabilities": ["tools"]},
"messages": [{"role": "user", "content": "…"}]}
Marktpreise
Listenpreise der Plattformen in USD je 1 Million Token (Tageskurs, ohne unseren Aufschlag), geprüft alle 15 Minuten. Balken machen Preis und Tempo vergleichbar; Index = Artificial-Analysis über OpenRouter (Vorauswahl, zugesagt wird nur, was wir selbst messen). Ausführungsort: von uns erfasst — sonst „global“ (anbieterabhängig).
Leistungskarte
Jeder Punkt ein Modell: links günstig, oben stark. Die leuchtende Linie ist die Effizienzgrenze — kein anderes Modell ist zugleich billiger und besser. Blasengrösse = Kontextfenster.
↖ stark & günstig 0 20 40 60 0.1 1 10 100 USD je Mio. Ausgabe-Token (logarithmisch) → Index Denken ↑ GPT 6.1 Sol GPT 5.6 Sol Mimo V2.6 Pro GLM 5.3 Flash GLM 5.3 Flash DeepSeek V4.1 Flash DeepSeek V4.1 Flash DeepSeek V4 Flash 0731 Claude Opus 5.5 Claude Sonnet 5.5 Claude Fable 5.1 Claude Opus 5 Gemini 3.7 Flash
Effizienzgrenze anthropicopenaideepseekz-aimoonshotaiqwenxiaomigoogle
Preisspanne je Plattform
Dasselbe Modell kostet je Plattform verschieden viel. Der leuchtende Punkt ist der günstigste — dorthin routen wir.
0.1110100
GPT 6 Astra
×2.2 · −55 %
GPT 6.1 Sol
×2.2 · −55 %
GPT 6 Sol
×2.2 · −55 %
GPT 5.6 Sol
×4.4 · −77 %
Grok 4.6
×1.1 · −9 %
Kimi K3
×1.1 · −5 %
DeepSeek V4.1 Flash
×17.3 · −94 %
GPT 6 Luna
×2.2 · −55 %
Mimo V2.6 Flash
×1.3 · −24 %
DeepSeek V4 Pro 0813
×1.5 · −34 %
DeepSeek V4 Flash 0731
×7.3 · −86 %
DeepSeek V4 Pro
×1.2 · −19 %
Preisbewegung
Günstigster Ausgabepreis (USD je 1 Mio. Token) über alle Plattformen — Kerzen je Intervall, rot = teurer, türkis = günstiger.
Kerze = 4 h · seit 29.09.26 01:32 · 234 Preisänderungen
0.180 ▼ 70.0 %
0.208 0.329 0.451 0.573 29.09.26 00:00 01.10.26 08:00 03.10.26 20:00 0.180
Preis-Leistung
Index-Punkte je USD Ausgabepreis · Preisbewegung der letzten 30 Tage.
1. D DeepSeek V4.1 Flash deepseek 219.1 P/USD neu
2. D DeepSeek V4 Flash 0731 deepseek 190.3 P/USD neu
3. O GPT 6 Luna openai 152.1 P/USD neu
4. I Ling 3.0 Flash VL inclusionai 136.5 P/USD neu
5. X Mimo V2.6 Flash xiaomi 135.6 P/USD neu
6. Z GLM 5.3 Flash z-ai 83.7 P/USD neu
7. X Mimo V2.6 Pro xiaomi 53.2 P/USD neu
8. M Minimax M3 minimax 26.6 P/USD neu
9. X Mimo V2.5 Pro xiaomi 24.9 P/USD neu
10. T Inkling Small thinkingmachines 21.4 P/USD neu
| Modell | Denken | Code | Preis ein/aus | Tempo | Ort | Verlauf | Plattform | Kontext |
|---|---|---|---|---|---|---|---|---|
| Claude Opus 5.5 anthropic | 58 | HumanEval+ 93 % | 4.00 20.00 | 159 tok/s Uptime 100 % | global | Amazon Bedrock · 6 ▾ - Amazon Bedrock: 4.00 / 20.00 - Azure: 4.00 / 20.00 - Google: 4.00 / 20.00 - Claude Platform on AWS: 4.00 / 20.00 - Anthropic: 4.00 / 20.00 - DeepInfra: 4.00 / 20.00 | 1 M | |
| Claude Sonnet 5.5 anthropic | 56 | HumanEval+ 94 % | 2.00 10.00 | 110 tok/s Uptime 100 % | global | Google · 6 ▾ - Google: 2.00 / 10.00 - Amazon Bedrock: 2.00 / 10.00 - Azure: 2.00 / 10.00 - Anthropic: 2.00 / 10.00 - Claude Platform on AWS: 2.00 / 10.00 - DeepInfra: 2.00 / 10.00 | 1 M | |
| Claude Fable 5.1 anthropic | 53 | 82 | 10.00 50.00 | 57 tok/s Uptime 100 % | global | neu | Amazon Bedrock · 4 ▾ - Amazon Bedrock: 10.00 / 50.00 - Google: 10.00 / 50.00 - Azure: 10.00 / 50.00 - Anthropic: 10.00 / 50.00 | 1 M |
| GPT 6 Astra openai | 53 | 77 | 5.00 25.00 | 122 tok/s Uptime 100 % | global | neu | OpenAI · 3 ▾ - OpenAI: 5.00 / 25.00 - Azure: 10.00 / 50.00 - Amazon Bedrock: 11.00 / 55.00 | 1 M |
| GPT 6.1 Sol openai | 52 | HumanEval+ 95 % | 1.00 5.00 | 87 tok/s Uptime 100 % | global | neu | OpenAI · 3 ▾ - OpenAI: 1.00 / 5.00 - Azure: 2.00 / 10.00 - Amazon Bedrock: 2.20 / 11.00 | 1 M |
| Claude Opus 5 anthropic | 51 | 78 | 5.00 25.00 | 188 tok/s Uptime 100 % | global | neu | Claude Platform on AWS · 6 ▾ - Claude Platform on AWS: 5.00 / 25.00 - Azure: 5.00 / 25.00 - Google: 5.00 / 25.00 - Anthropic: 5.00 / 25.00 - Amazon Bedrock: 5.00 / 25.00 - DeepInfra: 5.00 / 25.00 | 1 M |
| Claude Fable 5 anthropic | 50 | 77 | 10.00 50.00 | – | global | neu | DeepInfra · 1 ▾ - DeepInfra: 10.00 / 50.00 | 1 M |
| GPT 6 Sol openai | 48 | 1.00 5.00 | 82 tok/s Uptime 100 % | global | neu | OpenAI · 3 ▾ - OpenAI: 1.00 / 5.00 - Azure: 2.00 / 10.00 - Amazon Bedrock: 2.20 / 11.00 | 1 M | |
| GPT 5.6 Sol openai | 47 | 77 | 1.00 5.00 | 140 tok/s Uptime 100 % | global | neu | OpenAI · 3 ▾ - OpenAI: 1.00 / 5.00 - Azure: 4.00 / 20.00 - Amazon Bedrock: 4.40 / 22.00 | 1 M |
| Grok 4.7 x-ai | 46 | 2.00 6.00 | 78 tok/s Uptime 100 % | global | neu | xAI · 1 ▾ - xAI: 2.00 / 6.00 | 500 k | |
| Mimo V2.6 Pro xiaomi | 46 | 0.43 0.87 | 30 tok/s Uptime 100 % | global | DeepInfra · 4 ▾ - DeepInfra: 0.43 / 0.87 - GMICloud: 0.44 / 0.87 - Xiaomi: 0.44 / 0.87 - Novita: 0.44 / 0.87 | 1 M | ||
| GLM 5.3 z-ai | 45 | 75 | 1.40 4.40 | 58 tok/s gemessen | global | neu | Novita · 1 ▾ - Novita: 1.40 / 4.40 | 1 M |
| Grok 4.6 x-ai | 44 | 77 | 2.00 6.00 | 95 tok/s Uptime 100 % | global | neu | xAI · 2 ▾ - xAI: 2.00 / 6.00 - Amazon Bedrock: 2.20 / 6.60 | 500 k |
| Kimi K3 moonshotai | 44 | 76 | 2.85 14.25 | 25 tok/s gemessen | global | neu | DeepInfra · 2 ▾ - DeepInfra: 2.85 / 14.25 - Novita: 3.00 / 15.00 | 1 M |
| GLM 5.3 Flash z-ai | 42 | 72 | 0.15 0.50 | 63 tok/s gemessen | global | neu | Novita · 1 ▾ - Novita: 0.15 / 0.50 | 1 M |
| Claude Opus 4.8 anthropic | 42 | 74 | 5.00 25.00 | – | global | neu | DeepInfra · 1 ▾ - DeepInfra: 5.00 / 25.00 | 1 M |
| Qwen3.8 2.4t A95b qwen | 40 | 72 | 2.00 6.00 | 32 tok/s gemessen | global | neu | DeepInfra · 2 ▾ - DeepInfra: 2.00 / 6.00 - Novita: 2.00 / 6.00 | 1 M |
| DeepSeek V4.1 Flash deepseek | 40 | HumanEval+ 89 % | 0.090 0.18 | 225 tok/s Uptime 100 % | global | Decart · 29 ▾ - Decart: 0.090 / 0.18 - Morph: 0.025 / 0.38 - InferenceNet: 0.021 / 0.40 - Sail Research: 0.080 / 0.40 - DekaLLM: 0.12 / 0.40 - DeepInfra: 0.14 / 0.42 - Wafer: 0.050 / 0.60 - StreamLake: 0.14 / 0.56 - AtlasCloud: 0.14 / 0.56 - DeepSeek: 0.15 / 0.60 - Alibaba: 0.15 / 0.60 - CoreWeave: 0.20 / 0.65 - DigitalOcean: 0.18 / 0.72 - GMICloud: 0.18 / 0.72 - NextBit: 0.21 / 0.84 - Phala: 0.21 / 0.84 - Makora: 0.20 / 0.99 - Novita: 0.24 / 0.96 - Ionstream: 0.10 / 1.15 - Baidu: 0.30 / 1.20 - SiliconFlow: 0.30 / 1.20 - Parasail: 0.30 / 1.20 - Venice: 0.30 / 1.20 - BaseTen: 0.30 / 1.20 - Modal: 0.30 / 1.20 - Fireworks: 0.30 / 1.20 - Together: 0.30 / 1.20 - Relace: 0.002 / 2.40 - OpenInference: 0.004 / 3.12 | 1 M | |
| Gemini 3.7 Flash google | 39 | 76 | 0.75 3.75 | 1 tok/s gemessen | global | neu | DeepInfra · 1 ▾ - DeepInfra: 0.75 / 3.75 | 1 M |
| Claude Sonnet 5 anthropic | 38 | 72 | 3.00 15.00 | 65 tok/s gemessen | global | neu | DeepInfra · 1 ▾ - DeepInfra: 3.00 / 15.00 | 1 M |
| GPT 6 Luna openai | 38 | 0.050 0.25 | 123 tok/s Uptime 100 % | global | neu | OpenAI · 3 ▾ - OpenAI: 0.050 / 0.25 - Azure: 0.10 / 0.50 - Amazon Bedrock: 0.11 / 0.55 | 1 M | |
| Mimo V2.6 Flash xiaomi | 38 | 0.11 0.28 | 101 tok/s Uptime 100 % | global | InferenceNet · 8 ▾ - InferenceNet: 0.11 / 0.28 - Darkbloom: 0.12 / 0.28 - Io Net: 0.13 / 0.27 - GMICloud: 0.14 / 0.28 - DeepInfra: 0.14 / 0.28 - Xiaomi: 0.14 / 0.28 - Novita: 0.14 / 0.28 - Venice: 0.18 / 0.35 | 1 M | ||
| DeepSeek V4 Pro 0813 deepseek | 36 | 69 | 1.30 2.60 | 69 tok/s gemessen | global | neu | DeepInfra · 2 ▾ - DeepInfra: 1.30 / 2.60 - Novita: 1.32 / 3.96 | 1 M |
| DeepSeek V4 Flash 0731 deepseek | 34 | 69 | 0.060 0.18 | 44 tok/s gemessen | global | neu | DeepInfra · 2 ▾ - DeepInfra: 0.060 / 0.18 - Novita: 0.44 / 1.32 | 1 M |
| Qwen3.8 27b qwen | 34 | 68 | 0.42 3.00 | – | global | neu | Novita · 1 ▾ - Novita: 0.42 / 3.00 | 1 M |
| GLM 5.2 z-ai | 34 | 69 | 1.40 4.40 | – | global | neu | Novita · 1 ▾ - Novita: 1.40 / 4.40 | 1 M |
| Gemini 3.5 Flash google | 33 | 70 | 1.50 9.00 | – | global | neu | DeepInfra · 1 ▾ - DeepInfra: 1.50 / 9.00 | 1 M |
| DeepSeek V4 Pro deepseek | 30 | 59 | 1.30 2.60 | – | global | neu | DeepInfra · 2 ▾ - DeepInfra: 1.30 / 2.60 - Novita: 1.60 / 3.20 | 1 M |
| Claude Sonnet 4.6 anthropic | 30 | 63 | 3.00 15.00 | – | global | neu | DeepInfra · 1 ▾ - DeepInfra: 3.00 / 15.00 | 1 M |
| Qwen3.7 Max qwen | 30 | 66 | 1.25 3.75 | – | global | neu | Novita · 2 ▾ - Novita: 1.25 / 3.75 - DeepInfra: 2.50 / 7.50 | 1 M |
| Minimax M3 minimax | 29 | 59 | 0.28 1.10 | – | global | neu | DeepInfra · 1 ▾ - DeepInfra: 0.28 / 1.10 | 524 k |
| Kimi K2.6 moonshotai | 27 | 62 | 0.80 3.40 | – | global | neu | Novita · 2 ▾ - Novita: 0.80 / 3.40 - DeepInfra: 0.75 / 3.50 | 262 k |
| GLM 5.1 z-ai | 26 | 56 | 1.38 4.40 | – | global | neu | Novita · 1 ▾ - Novita: 1.38 / 4.40 | 204 k |
| Mimo V2.5 Pro xiaomi | 26 | 60 | 0.52 1.04 | – | global | neu | Novita · 1 ▾ - Novita: 0.52 / 1.04 | 1 M |
| Kimi K2.7 Code moonshotai | 26 | 61 | 0.95 4.00 | – | global | neu | Novita · 1 ▾ - Novita: 0.95 / 4.00 | 262 k |
| Inkling Small thinkingmachines | 26 | 53 | 0.45 1.20 | – | global | neu | DeepInfra · 1 ▾ - DeepInfra: 0.45 / 1.20 | 524 k |
| Inkling thinkingmachines | 25 | 52 | 0.95 4.05 | – | global | neu | DeepInfra · 1 ▾ - DeepInfra: 0.95 / 4.05 | 524 k |
| Ling 3.0 Flash VL inclusionai | 25 | 57 | 0.060 0.18 | – | global | neu | DeepInfra · 2 ▾ - DeepInfra: 0.060 / 0.18 - Novita: 0.075 / 0.22 | 262 k |
Bild & Sprache — derselbe Schlüssel
Nicht nur LLM: Bilder, Sprachausgabe und Transkription vom Markt, mit derselben OpenAI-kompatiblen API und derselben Abrechnung. Du nennst eine Markt-ID, wir nehmen den günstigsten Anbieter. Preise in USD, inklusive unserer Marge, live aus /api/v1/broker/models?type=….

Bilder erzeugen
Vom schnellen Entwurf bis zur Druckqualität: FLUX, Qwen-Image, Seedream und mehr — oder iris, unser eigenes Bildmodell.
iris0.0079 USD je Bildstabilityai/sdxl-turbo0.00026 USD je Bildblack-forest-labs/FLUX-1-schnell0.00065 USD je BildPrunaAI/p-image0.0065 USD je Bildblack-forest-labs/FLUX-1-dev0.0117 USD je Bildblack-forest-labs/FLUX-2-dev0.013 USD je Bild
curl https://llm-broker.net/api/v1/images/generations \
-H "Authorization: Bearer $BROKER_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"black-forest-labs/FLUX-1-schnell","prompt":"a lighthouse at dawn","size":"1024x1024"}'

Sprachausgabe
Text zu Sprache in vielen Stimmen und Sprachen — Kokoro, Qwen3-TTS, Chatterbox und mehr — oder quill mit Klonstimmen.
quill0.121 USD je 1 000 Zeichenhexgrad/Kokoro-82M0.000806 USD je 1 000 ZeichenResembleAI/chatterbox-turbo0.0013 USD je 1 000 ZeichenResembleAI/chatterbox-multilingual0.0013 USD je 1 000 ZeichenAudio8/Audio8-TTS-Preview-0.6b0.0065 USD je 1 000 Zeichensesame/csm-1b0.0091 USD je 1 000 Zeichen
curl https://llm-broker.net/api/v1/audio/speech \
-H "Authorization: Bearer $BROKER_API_KEY" \
-H "Content-Type: application/json" \
-d '{"model":"hexgrad/Kokoro-82M","input":"Hello from LLM Broker","voice":"af_bella"}' -o hello.mp3

Transkription
Sprache zu Text: Whisper, Qwen3-ASR, Voxtral und mehr — abgerechnet nach der Dauer, die der Anbieter misst.
quill0.0121 USD je Minutenvidia/Nemotron-3.5-ASR-Streaming-Multilingual-0.6b0.00026 USD je Minuteopenai/whisper-large-v3-turbo0.00026 USD je MinuteQwen/Qwen3-ASR-0.6B0.00026 USD je MinuteQwen/Qwen3-ASR-1.7B0.000586 USD je Minuteopenai/whisper-large-v30.000586 USD je Minute
curl https://llm-broker.net/api/v1/audio/transcriptions \
-H "Authorization: Bearer $BROKER_API_KEY" \
-F model=openai/whisper-large-v3-turbo -F [email protected]
Ein Prompt — dein KI-Assistent richtet alles ein
Kopiere den Prompt in Claude Code, Cursor, Codex, OpenCode oder jeden anderen Coding-Assistenten. Er liest unsere Doku, eröffnet das Konto per API, legt den Schlüssel sicher ab, bindet die API ein und prüft sie mit einem Rauchtest. Du bestätigst nur die Zahlung.

- llms.txt — Einstieg für Agenten https://llm-broker.net/llms.txt
- OpenAPI (maschinenlesbar) https://llm-broker.net/api/openapi
- API-Doku im Browser https://llm-broker.net/api/docs
- Wiki: API https://astrioncore.wiki/api
- Wiki: Konto & Bezahlung per API https://astrioncore.wiki/api#konto
- Marktliste (ohne Schlüssel) https://llm-broker.net/api/v1/broker/models
Claude Code: Prompt in die Sitzung einfügen · Cursor/Windsurf: in den Agent-Chat · OpenCode: opencode run "…" · Codex: codex "…"
Richte in diesem Projekt den LLM Broker ein (https://llm-broker.net) — eine OpenAI-kompatible API für LLM, Bilder,
Sprachausgabe und Transkription mit einem Schlüssel. Arbeite selbstständig; frag mich nur, wenn eine Zahlung
bestätigt oder ein Geheimnis eingegeben werden muss.
1. Lies zuerst die Beschreibungen, nicht raten:
- https://llm-broker.net/llms.txt (Einstieg für Agenten)
- https://llm-broker.net/api/openapi (alle Endpunkte und Schemata)
- https://astrioncore.wiki/api und https://astrioncore.wiki/api#konto (Konto und Bezahlung per API)
2. Schlüssel: Ist BROKER_API_KEY (beginnt mit ast_sk_) nicht gesetzt, eröffne ein Konto per API:
POST https://llm-broker.net/api/v1/broker/accounts
{"billing": "topup", "amount": 25, "currency": "USD"} (Leistung wählt jede Anfrage per "routing")
Zeig mir die checkout_url (die Karte wird einmal bei Stripe eingegeben) und frag danach status_url ab,
bis 200 kommt. Der api_key erscheint GENAU EINMAL: sofort in .env als BROKER_API_KEY speichern,
.env in .gitignore, nie ins Log oder in einen Commit. base_url steht in derselben Antwort.
3. Einbinden: OpenAI-SDK der Projektsprache mit base_url und BROKER_API_KEY. Modelle findest du unter
GET /api/v1/broker/models?type=chat|image|speech|transcription (ohne Schlüssel lesbar).
- LLM: POST /api/v1/chat/completions, model "james-direct" mit "routing" (category, level|min_score, sort,
region, family, capabilities, max_price) oder direkt eine Markt-ID wie "deepseek/deepseek-v4.1-flash".
- Bilder: POST /api/v1/images/generations, Sprache: POST /api/v1/audio/speech,
Transkription: POST /api/v1/audio/transcriptions — jeweils mit einer Markt-ID der passenden type.
4. Lege eine kleine Client-Schicht an (Konfiguration aus der Umgebung, keine festen Modellnamen im Code —
lieber routing), schreibe einen Rauchtest mit einem kurzen Chat-Aufruf und führe ihn aus.
5. Abrechnung: GET /api/v1/broker/billing zeigt Guthaben und Verbrauch; Aufladen oder Monatsrahmen ändern
mit PATCH /api/v1/broker/billing, Karte mit POST|DELETE /api/v1/broker/card.
Fehler: 402 insufficient_balance (aufladen), 409 no_matching_offer (routing lockern),
404 model_not_found (Marktliste prüfen), 429 rate_limited (später erneut).
Fasse am Ende zusammen, was eingerichtet ist und wo der Schlüssel liegt.
Set up LLM Broker in this project (https://llm-broker.net) — one OpenAI-compatible API for LLMs, images, speech
and transcription with a single key. Work on your own; only ask me when a payment must be confirmed or a secret
must be entered.
1. Read the descriptions first, don't guess:
- https://llm-broker.net/llms.txt (entry point for agents)
- https://llm-broker.net/api/openapi (all endpoints and schemas)
- https://astrioncore.wiki/api and https://astrioncore.wiki/api#konto (account and billing via API)
2. Key: if BROKER_API_KEY (starts with ast_sk_) is not set, open an account via the API:
POST https://llm-broker.net/api/v1/broker/accounts
{"billing": "topup", "amount": 25, "currency": "USD"} (every request picks its level via "routing")
Show me the checkout_url (the card is entered once at Stripe), then poll status_url until it returns 200.
The api_key is shown EXACTLY ONCE: store it right away in .env as BROKER_API_KEY, add .env to .gitignore,
never log or commit it. base_url is in the same response.
3. Integrate: the OpenAI SDK of the project's language with base_url and BROKER_API_KEY. Models are listed at
GET /api/v1/broker/models?type=chat|image|speech|transcription (no key needed).
- LLM: POST /api/v1/chat/completions, model "james-direct" with "routing" (category, level|min_score, sort,
region, family, capabilities, max_price) or a market id such as "deepseek/deepseek-v4.1-flash".
- Images: POST /api/v1/images/generations, speech: POST /api/v1/audio/speech,
transcription: POST /api/v1/audio/transcriptions — each with a market id of the matching type.
4. Add a small client layer (configuration from the environment, no hard-coded model names — prefer routing),
write a smoke test with one short chat call and run it.
5. Billing: GET /api/v1/broker/billing shows balance and spend; top up or change the monthly limit with
PATCH /api/v1/broker/billing, the card with POST|DELETE /api/v1/broker/card.
Errors: 402 insufficient_balance (top up), 409 no_matching_offer (relax routing),
404 model_not_found (check the market list), 429 rate_limited (retry later).
Finish with a summary of what is set up and where the key is stored.
Leistung je Anfrage
Du wählst bei jeder Anfrage selbst, wie stark das Modell sein muss — über routing in derselben OpenAI-kompatiblen API. Eine Stufe ist eine Mindestpunktzahl in UNSEREN Messungen je Einsatzzweck, best das höchst gemessene Modell; eine eigene Schwelle setzt "min_score": 0.85. Der Preis ist der heutige Kundenpreis (in der gewählten Währung je 1 Mio. Token ein/aus, inkl. unserer Marge) des günstigsten Modells, das die Stufe erfüllt — gilt für taylor, james-direct und jede Markt-ID.
Programmieren gemessen mit HumanEval+ "category": "coding"
Solide ≥ 70 %
0.05 / 0.22
21 Modelle erfüllen
"level": "solid"
Stark ≥ 80 %
0.05 / 0.22
19 Modelle erfüllen
"level": "strong"
Spitze ≥ 88 %
0.07 / 0.23
17 Modelle erfüllen
"level": "top"
Beste höchste Punktzahl
1.29 / 6.50
1 Modell erfüllt
"level": "best"
Denken & Wissen gemessen mit MMLU-Pro + GPQA Diamond "category": "reasoning"
Solide ≥ 55 %
0.05 / 0.22
16 Modelle erfüllen
"level": "solid"
Stark ≥ 65 %
0.07 / 0.23
15 Modelle erfüllen
"level": "strong"
Spitze ≥ 75 %
0.07 / 0.23
11 Modelle erfüllen
"level": "top"
Beste höchste Punktzahl
1.29 / 6.50
1 Modell erfüllt
"level": "best"
Mathematik gemessen mit MATH "category": "math"
Solide ≥ 60 %
0.05 / 0.22
17 Modelle erfüllen
"level": "solid"
Stark ≥ 75 %
0.05 / 0.22
17 Modelle erfüllen
"level": "strong"
Spitze ≥ 85 %
0.07 / 0.23
12 Modelle erfüllen
"level": "top"
Beste höchste Punktzahl
5.20 / 26.00
1 Modell erfüllt
"level": "best"
Anweisungen befolgen gemessen mit IFEval "category": "instruction_following"
Solide ≥ 75 %
0.05 / 0.22
19 Modelle erfüllen
"level": "solid"
Stark ≥ 82 %
0.07 / 0.23
15 Modelle erfüllen
"level": "strong"
Spitze ≥ 88 %
0.16 / 0.52
9 Modelle erfüllen
"level": "top"
Beste höchste Punktzahl
2.60 / 7.80
1 Modell erfüllt
"level": "best"
Schlüssel holen
Einmal Karte hinterlegen, dann läuft es. Die Kartennummer sieht nur Stripe — wir nie.
Registrieren und bezahlen — alles per API
Ein Programm oder Agent eröffnet das Konto, holt den Schlüssel und verwaltet die Abrechnung selbst. Geld vor Schlüssel: kein Gratisguthaben, der Schlüssel entsteht erst nach der Zahlung.
1 · KONTO
Konto eröffnen
Abrechnung wählen — eine Stufe ist optional, jede Anfrage wählt sie per routing. Die Antwort nennt checkout_url und status_url.
curl -X POST https://llm-broker.net/api/v1/broker/accounts \
-H "Content-Type: application/json" \
-d '{"billing":"topup",
"amount":25}'
2 · KARTE
Einmal bezahlen
Die Karte wird einmal bei Stripe eingegeben — von dir oder einem Agenten mit Browser. Wir sehen die Kartennummer nie.
3 · SCHLÜSSEL
Schlüssel abholen
202 bis zur Zahlung, dann api_key (ast_sk_…) und base_url — genau einmal.
curl https://llm-broker.net/api/v1/broker/accounts/$SESSION_ID
4 · ABRECHNUNG
Selbst verwalten
Guthaben und Verbrauch lesen, Aufladen oder Monatsrahmen ändern, Karte wechseln oder entfernen.
GET|PATCH /api/v1/broker/billing
POST|DELETE /api/v1/broker/card
Danach läuft alles ohne Menschen: Aufladen mit der gespeicherten Karte, Monatsabrechnung, Kündigung. Nur die allererste Karteneingabe braucht heute einen Browser bei Stripe. Details: Wiki: Konto & Bezahlung per API.
Welches Modell bekomme ich mit taylor?
Ohne Stufe das leistungsfähigste; mit Stufe (je Anfrage oder als Vorgabe des Schlüssels) das gerade günstigste unter allen, die sie in unseren Messungen erreichen. Die Tabelle oben zeigt den Markt; welches Modell eine einzelne Anfrage beantwortet, entscheidet der Preis im Moment der Anfrage. Willst du statt des günstigsten das stärkste: "routing": {"category": "…", "level": "best"} — gilt für taylor, james-direct und jede Markt-ID.
Was heisst „gemessen“?
Wir prüfen jedes Modell selbst mit offenen Benchmarks (Stichproben, gleiche Einstellungen) und messen regelmässig neu — alle ohne Denkmodus, damit die Werte vergleichbar sind; Denk-Modelle schneiden mit eingeschaltetem Denken bei schweren Aufgaben oft besser ab. Steuern kannst du das je Anfrage mit reasoning_effort (z. B. "none"). Die Indizes Dritter dienen nur der Vorauswahl.
Und wenn keines die Stufe erfüllt?
Dann antwortet die API mit level_unavailable und belastet nichts — nie still ein schwächeres Modell.
Gibt es auch Bild- und Sprachmodelle?
Ja: Bilderzeugung, Sprachausgabe und Transkription vom Markt mit demselben Schlüssel — Markt-ID unter /api/v1/broker/models?type=image|speech|transcription, dazu unsere eigenen Modelle iris und quill.
Wie wird abgerechnet?
Nach Verbrauch zum Tagespreis — Token, Bilder, Zeichen oder Minuten —, ausschliesslich per Kreditkarte: automatisch aufladen oder monatlich im Nachhinein. Kein Abo, kein Startguthaben.