Führen Sie offene Sprachmodelle auf Ihrem eigenen dedizierten EU-GPU-Server aus – vollständig privat, ohne Datenweitergabe. Jedes Modell wird auf echter Hardware getestet, sodass wir Ihnen die GPU mit dem besten Preis-Leistungs-Verhältnis sowie der gemessenen Geschwindigkeit zeigen.
| Modell | Kontext | Parallel-T/S | Einzelne Tokens/Sekunde | Stündlich | Monatlich | Konfiguration |
|---|---|---|---|---|---|---|
| Llama 3.3 70B Perfect on sparbox.m2 | 14,745 | 72 | 9 | €0.73/h | €420.00/mo | sparbox.m2 |
| Qwen3 30B Perfect on ranger.s1 More context, higher speed on infinityai.s1 | 29,491 | 170 | 21 | €0.38/h | €215.00/mo | ranger.s1 |
| 131,072 +344% | 185 +9% | 24 | €0.59/h | €335.00/mo | infinityai.s1 | |
| Qwen3.6 27B (AWQ) Perfect on infinityai.s1 | 65,536 | 103 | 14 | €0.59/h | €335.00/mo | infinityai.s1 |
| Qwen3.6 35B Perfect on infinityai.s1 | 95,550 | 111 | 15 | €0.59/h | €335.00/mo | infinityai.s1 |
| DeepSeek R1 0528 Qwen3 8B Perfect on infinityai.s1 | 85,995 | 592 | 75 | €0.59/h | €335.00/mo | infinityai.s1 |
| Gemma 4 31B (QAT) Perfect on infinityai.s1 | 16,384 | 146 | 19 | €0.59/h | €335.00/mo | infinityai.s1 |
| Gemma 4 E2B Perfect on infinityai.s1 | 131,072 | 1,105 | 153 | €0.59/h | €335.00/mo | infinityai.s1 |
| Gemma 4 E4B Perfect on infinityai.s1 | 106,167 | 684 | 93 | €0.59/h | €335.00/mo | infinityai.s1 |
| Granite 4.1 8B Perfect on infinityai.s1 | 77,395 | 530 | 69 | €0.59/h | €335.00/mo | infinityai.s1 |
| Llama 3.1 8B Perfect on ranger.s1 More context, higher speed on sparbox.m2 | 26,541 | 378 | 51 | €0.38/h | €215.00/mo | ranger.s1 |
| 106,167 +300% | 601 +59% | 84 | €0.73/h | €420.00/mo | sparbox.m2 | |
| Phi 4 Perfect on infinityai.s1 | 16,384 | 337 | 44 | €0.59/h | €335.00/mo | infinityai.s1 |
| Phi 4 multimodal instruct Perfect on infinityai.s1 | 117,964 | 947 | 130 | €0.59/h | €335.00/mo | infinityai.s1 |
| Ministral 3 14B Perfect on infinityai.s1 | 21,497 | 605 | 79 | €0.59/h | €335.00/mo | infinityai.s1 |
| Ministral 3 3B Perfect on ranger.s1 More context, higher speed on infinityai.s1 | 19,347 | 1,221 | 165 | €0.38/h | €215.00/mo | ranger.s1 |
| 85,995 +344% | 1,605 +31% | 215 | €0.59/h | €335.00/mo | infinityai.s1 | |
| Mistral 7B Perfect on infinityai.s1 | 32,768 | 622 | 81 | €0.59/h | €335.00/mo | infinityai.s1 |
| GPT oss 20B Perfect on infinityai.s1 | 131,072 | 701 | 196 | €0.59/h | €335.00/mo | infinityai.s1 |
| Ornith 1.0 9B Perfect on ranger.s1 | 47,774 | 155 | 68 | €0.38/h | €215.00/mo | ranger.s1 |
| Qwen3 Coder 30B (AWQ) Perfect on ranger.s1 More context, higher speed on infinityai.s1 | 29,491 | 864 | 169 | €0.38/h | €215.00/mo | ranger.s1 |
| 131,072 +344% | 908 | 149 | €0.59/h | €335.00/mo | infinityai.s1 | |
| Qwen3 VL 32B (AWQ) Perfect on infinityai.s1 | 32,768 | 408 | 55 | €0.59/h | €335.00/mo | infinityai.s1 |
| Qwen2.5 32B Perfect on infinityai.s1 | 32,768 | 419 | 56 | €0.59/h | €335.00/mo | infinityai.s1 |
| Qwen2.5 7B Perfect on ranger.s1 | 32,768 | 393 | 51 | €0.38/h | €215.00/mo | ranger.s1 |
| Qwen3 14B Perfect on infinityai.s1 | 29,491 | 335 | 43 | €0.59/h | €335.00/mo | infinityai.s1 |
| Qwen3 32B Perfect on sparbox.m2 | 21,497 | 291 | 41 | €0.73/h | €420.00/mo | sparbox.m2 |
| Qwen3 4B Perfect on ranger.s1 | 40,960 | 623 | 84 | €0.38/h | €215.00/mo | ranger.s1 |
| Qwen3 4B (2507) Perfect on ranger.s1 More context, higher speed on infinityai.s1 | 65,536 | 622 | 83 | €0.38/h | €215.00/mo | ranger.s1 |
| 131,072 +100% | 868 +40% | 116 | €0.59/h | €335.00/mo | infinityai.s1 | |
| Qwen3 8B Perfect on infinityai.s1 | 40,960 | 569 | 74 | €0.59/h | €335.00/mo | infinityai.s1 |
| Qwen3 Coder 30B (FP8) Perfect on sparbox.m2 | 32,768 | 776 | 148 | €0.73/h | €420.00/mo | sparbox.m2 |
| Qwen3 VL 32B (FP8) Perfect on sparbox.m2 | 13,270 | 288 | 40 | €0.73/h | €420.00/mo | sparbox.m2 |
| Qwen3 VL 4B Perfect on ranger.s1 | 47,774 | 252 | 63 | €0.38/h | €215.00/mo | ranger.s1 |
| Qwen3.5 9B Perfect on ranger.s1 More context, higher speed on sparbox.m2 | 21,497 | 283 | 46 | €0.38/h | €215.00/mo | ranger.s1 |
| 95,550 +344% | 388 +37% | 79 | €0.73/h | €420.00/mo | sparbox.m2 | |
| Qwen3.6 27B (FP8) Perfect on sparbox.m2 | 32,768 | 242 | 46 | €0.73/h | €420.00/mo | sparbox.m2 |
| Gemma 4 31B (FP8) Perfect on sparbox.m2 | 8,192 | 117 | 42 | €0.73/h | €420.00/mo | sparbox.m2 |
| GLM 4.6V Flash Perfect on infinityai.s1 | 106,167 | 482 | 60 | €0.59/h | €335.00/mo | infinityai.s1 |
Kontext = maximal nutzbare Kontextfenstergröße. Parallel/Einzeln = Tokens/Sekunde. Die Preise spiegeln das beste Preis-Leistungs-Verhältnis pro Modell mit der besten GPU wider. Die Kosten sind im Voraus zu entrichten; Sie behalten vollen Root-Zugriff.
Trooper.AI stellt Ihnen einen verwalteten GPU-Server mit vorinstalliertem vLLM bereit, der jeden offenen Large-Language-Modell über eine schnelle, OpenAI-kompatible API bedienen kann. Statt Stunden damit zu verbringen, eine GPU auszuwählen, CUDA-Treiber zu installieren oder vLLM zu kompilieren sowie Launch-Flags anzupassen, wählen Sie einfach ein Modell oben aus und klicken auf Starten. Innerhalb weniger Minuten erhalten Sie einen dedizierten, in der EU gehosteten GPU-Server mit bereits laufendem vLLM – inklusive der exakt von uns für dieses Modell optimierten Konfiguration wie Kontextlänge, Parallelität und Commandline-Argumente.
vLLM ist der branchenübliche Hochleistungs-Inference-Engine für hohe Durchsatzraten, doch die Produktionsbereitschaft erfordert präzise Abstimmung: Kompatibilität von Treibern und CUDA-Versionen sowie die Auswahl von --max-num-batched-tokens, --max-num-seqs und des passenden Kontextfensters für Ihren GPU-Arbeitsspeicher (VRAM). Zudem muss sichergestellt werden, dass das Modell korrekt lädt. Unser verwalteter GPU-Server mit vorinstalliertem vLLM übernimmt diese Arbeit für Sie. Jede auf dieser Seite vorgestellte Konfiguration basiert direkt auf automatisierten Benchmark-Messungen auf echter Hardware – Ihr bereitgestellter Server verhält sich somit exakt wie im Testlauf, ohne Umwege oder Fehlversuche.
Jeder Server läuft auf Bare-Metal-GPUs in nach ISO/IEC 27001 zertifizierten, datenschutzkonformen deutschen Rechenzentren gemäß DSGVO. Sie erhalten vollen Root-SSH-Zugriff, eine persistente Maschine sowie einen privaten Endpunkt – Ihre Prompts und Daten verlassen niemals Ihren Server. Da es sich um einen vollständigen GPU-Server (keine Shared-Inference-Umgebung) handelt, können Sie zusätzlich KI-Software installieren, Modelle feinabstimmen oder Bild- und Audiomodelle neben Ihrem Sprachmodell betreiben.
Für jedes Modell zeigen wir Ihnen die GPU mit dem besten Preis-Leistungs-Verhältnis, inklusive ehrlicher stündlicher und monatlicher Preise. Sie können sich vor der Bereitstellung reale Antwortbeispiele pro Modell über Antwortqualität anzeigen ansehen, sodass Sie sowohl Geschwindigkeit als auch die Qualität der Antworten kennen, für die Sie zahlen. Bezahlen Sie stundenweise zum Experimentieren oder monatlich für den Produktiveinsatz – ein verwalteter GPU-Server mit vorkonfiguriertem vLLM, der sich Ihren Anforderungen anpasst.