Privatausführung von LLMs

Führen Sie offene Sprachmodelle auf Ihrem eigenen dedizierten EU-GPU-Server aus – vollständig privat, ohne Datenweitergabe. Jedes Modell wird auf echter Hardware getestet, sodass wir Ihnen die GPU mit dem besten Preis-Leistungs-Verhältnis sowie der gemessenen Geschwindigkeit zeigen.

ModellKontextParallel-T/SEinzelne Tokens/SekundeStündlichMonatlichKonfiguration
Llama 3.3 70B
Perfect on sparbox.m2
14,745729€0.73/h
€420.00/mo
sparbox.m2
Qwen3 30B
Perfect on ranger.s1
More context, higher speed on infinityai.s1
29,49117021€0.38/h
€215.00/mo
ranger.s1
131,072
+344%
185
+9%
24€0.59/h
€335.00/mo
infinityai.s1
Qwen3.6 27B (AWQ)
Perfect on infinityai.s1
65,53610314€0.59/h
€335.00/mo
infinityai.s1
Qwen3.6 35B
Perfect on infinityai.s1
95,55011115€0.59/h
€335.00/mo
infinityai.s1
DeepSeek R1 0528 Qwen3 8B
Perfect on infinityai.s1
85,99559275€0.59/h
€335.00/mo
infinityai.s1
Gemma 4 31B (QAT)
Perfect on infinityai.s1
16,38414619€0.59/h
€335.00/mo
infinityai.s1
Gemma 4 E2B
Perfect on infinityai.s1
131,0721,105153€0.59/h
€335.00/mo
infinityai.s1
Gemma 4 E4B
Perfect on infinityai.s1
106,16768493€0.59/h
€335.00/mo
infinityai.s1
Granite 4.1 8B
Perfect on infinityai.s1
77,39553069€0.59/h
€335.00/mo
infinityai.s1
Llama 3.1 8B
Perfect on ranger.s1
More context, higher speed on sparbox.m2
26,54137851€0.38/h
€215.00/mo
ranger.s1
106,167
+300%
601
+59%
84€0.73/h
€420.00/mo
sparbox.m2
Phi 4
Perfect on infinityai.s1
16,38433744€0.59/h
€335.00/mo
infinityai.s1
Phi 4 multimodal instruct
Perfect on infinityai.s1
117,964947130€0.59/h
€335.00/mo
infinityai.s1
Ministral 3 14B
Perfect on infinityai.s1
21,49760579€0.59/h
€335.00/mo
infinityai.s1
Ministral 3 3B
Perfect on ranger.s1
More context, higher speed on infinityai.s1
19,3471,221165€0.38/h
€215.00/mo
ranger.s1
85,995
+344%
1,605
+31%
215€0.59/h
€335.00/mo
infinityai.s1
Mistral 7B
Perfect on infinityai.s1
32,76862281€0.59/h
€335.00/mo
infinityai.s1
GPT oss 20B
Perfect on infinityai.s1
131,072701196€0.59/h
€335.00/mo
infinityai.s1
Ornith 1.0 9B
Perfect on ranger.s1
47,77415568€0.38/h
€215.00/mo
ranger.s1
Qwen3 Coder 30B (AWQ)
Perfect on ranger.s1
More context, higher speed on infinityai.s1
29,491864169€0.38/h
€215.00/mo
ranger.s1
131,072
+344%
908149€0.59/h
€335.00/mo
infinityai.s1
Qwen3 VL 32B (AWQ)
Perfect on infinityai.s1
32,76840855€0.59/h
€335.00/mo
infinityai.s1
Qwen2.5 32B
Perfect on infinityai.s1
32,76841956€0.59/h
€335.00/mo
infinityai.s1
Qwen2.5 7B
Perfect on ranger.s1
32,76839351€0.38/h
€215.00/mo
ranger.s1
Qwen3 14B
Perfect on infinityai.s1
29,49133543€0.59/h
€335.00/mo
infinityai.s1
Qwen3 32B
Perfect on sparbox.m2
21,49729141€0.73/h
€420.00/mo
sparbox.m2
Qwen3 4B
Perfect on ranger.s1
40,96062384€0.38/h
€215.00/mo
ranger.s1
Qwen3 4B (2507)
Perfect on ranger.s1
More context, higher speed on infinityai.s1
65,53662283€0.38/h
€215.00/mo
ranger.s1
131,072
+100%
868
+40%
116€0.59/h
€335.00/mo
infinityai.s1
Qwen3 8B
Perfect on infinityai.s1
40,96056974€0.59/h
€335.00/mo
infinityai.s1
Qwen3 Coder 30B (FP8)
Perfect on sparbox.m2
32,768776148€0.73/h
€420.00/mo
sparbox.m2
Qwen3 VL 32B (FP8)
Perfect on sparbox.m2
13,27028840€0.73/h
€420.00/mo
sparbox.m2
Qwen3 VL 4B
Perfect on ranger.s1
47,77425263€0.38/h
€215.00/mo
ranger.s1
Qwen3.5 9B
Perfect on ranger.s1
More context, higher speed on sparbox.m2
21,49728346€0.38/h
€215.00/mo
ranger.s1
95,550
+344%
388
+37%
79€0.73/h
€420.00/mo
sparbox.m2
Qwen3.6 27B (FP8)
Perfect on sparbox.m2
32,76824246€0.73/h
€420.00/mo
sparbox.m2
Gemma 4 31B (FP8)
Perfect on sparbox.m2
8,19211742€0.73/h
€420.00/mo
sparbox.m2
GLM 4.6V Flash
Perfect on infinityai.s1
106,16748260€0.59/h
€335.00/mo
infinityai.s1

Kontext = maximal nutzbare Kontextfenstergröße. Parallel/Einzeln = Tokens/Sekunde. Die Preise spiegeln das beste Preis-Leistungs-Verhältnis pro Modell mit der besten GPU wider. Die Kosten sind im Voraus zu entrichten; Sie behalten vollen Root-Zugriff.

Verwalteter GPU-Server mit vorinstalliertem vLLM

Trooper.AI stellt Ihnen einen verwalteten GPU-Server mit vorinstalliertem vLLM bereit, der jeden offenen Large-Language-Modell über eine schnelle, OpenAI-kompatible API bedienen kann. Statt Stunden damit zu verbringen, eine GPU auszuwählen, CUDA-Treiber zu installieren oder vLLM zu kompilieren sowie Launch-Flags anzupassen, wählen Sie einfach ein Modell oben aus und klicken auf Starten. Innerhalb weniger Minuten erhalten Sie einen dedizierten, in der EU gehosteten GPU-Server mit bereits laufendem vLLM – inklusive der exakt von uns für dieses Modell optimierten Konfiguration wie Kontextlänge, Parallelität und Commandline-Argumente.

Warum ein vorkonfigurierter vLLM-Server?

vLLM ist der branchenübliche Hochleistungs-Inference-Engine für hohe Durchsatzraten, doch die Produktionsbereitschaft erfordert präzise Abstimmung: Kompatibilität von Treibern und CUDA-Versionen sowie die Auswahl von --max-num-batched-tokens, --max-num-seqs und des passenden Kontextfensters für Ihren GPU-Arbeitsspeicher (VRAM). Zudem muss sichergestellt werden, dass das Modell korrekt lädt. Unser verwalteter GPU-Server mit vorinstalliertem vLLM übernimmt diese Arbeit für Sie. Jede auf dieser Seite vorgestellte Konfiguration basiert direkt auf automatisierten Benchmark-Messungen auf echter Hardware – Ihr bereitgestellter Server verhält sich somit exakt wie im Testlauf, ohne Umwege oder Fehlversuche.

Exklusiv für Sie – EU-beherbergt und Ihr Eigentum

Jeder Server läuft auf Bare-Metal-GPUs in nach ISO/IEC 27001 zertifizierten, datenschutzkonformen deutschen Rechenzentren gemäß DSGVO. Sie erhalten vollen Root-SSH-Zugriff, eine persistente Maschine sowie einen privaten Endpunkt – Ihre Prompts und Daten verlassen niemals Ihren Server. Da es sich um einen vollständigen GPU-Server (keine Shared-Inference-Umgebung) handelt, können Sie zusätzlich KI-Software installieren, Modelle feinabstimmen oder Bild- und Audiomodelle neben Ihrem Sprachmodell betreiben.

Transparente Preis-Leistung

Für jedes Modell zeigen wir Ihnen die GPU mit dem besten Preis-Leistungs-Verhältnis, inklusive ehrlicher stündlicher und monatlicher Preise. Sie können sich vor der Bereitstellung reale Antwortbeispiele pro Modell über Antwortqualität anzeigen ansehen, sodass Sie sowohl Geschwindigkeit als auch die Qualität der Antworten kennen, für die Sie zahlen. Bezahlen Sie stundenweise zum Experimentieren oder monatlich für den Produktiveinsatz – ein verwalteter GPU-Server mit vorkonfiguriertem vLLM, der sich Ihren Anforderungen anpasst.