Trooper.AI poskytuje plne automatizovaný šablónu nasadenia vLLM, ktorá nainštaluje, nakonfiguruje a spustí server pre inferenciu kompatibilný s OpenAI na vašom GPU serveri pomocou systemd.
Cieľ:
Šablóna automaticky:
Vášmi kontrolovanými sú len malý počet verejných parametrov.
Porozumenie počtu GPU: vLLM pracuje s viacerými GPU, ale vyžaduje, aby počet GPU rovnomerne delil počet pozornostných hlavičiek modelu. Napríklad u modelu ako je Gemma so 32 pozornostnými hlavičkami môže použiť 1, 2, 4 alebo 8 GPU – ale nie 3.
Dôležitá bezpečnostná poznámka k obrázkům na obrazovke: Servery zobrazované na snímkoch slúžia len demonštrácii a sú chránené pomocou Trooper.AI Sieťovej ohnenej steny (Network-Level Firewall), ktorá je zahŕnutá vo všetkých objednávkach GPU Serverov. Podrobnejšie informácie nájdete podľa odkazu: 🛡️ Trooper.AI prispôsobiteľná Hardvérová ohnená stenica
Tento šablóna nasadí hotový k použitiu vLLM inferenčný server na vašom inštancii Trooper.AI. Nainštaluje vyžadovaný runtime, nakonfiguruje API bod a pripraví model pre žiadosti kompatibilné s OpenAI.
Níže je krátky popis každého nastavenia.
Voliteľné pokročilé argumenty predané priamo do príkazu na spustenie vLLM servera
Použite toto ak potrebujete povoliť ďalšie funkcie ako:
Príklad:
--tensor-parallel-size 2
Nechte prázdne, ak presne vieťe, ktoré vlajky chcete použiť.
Vaše prístupový token pre HuggingFace.
To je vyžadované ak model:
Pre verejnú modelu môže byť toto pole nevyplnené.
Token si môžete vygenerovať tu:
https://huggingface.co/settings/tokens
Token sa používa len počas stiahnutia modelu.
Definuje maximálne okno kontextu, ktoré má podporovať server.
To priamo ovplyvňuje využitie VRAM.
Typické hodnoty:
| is_gated: Zda je chránený prístup vyžadujúci overenie identít alebo je stiahnutý z súkromnej repozitárie. U verejných modelov môže zostávať prazdné. Token si môžete vygenerovať tu: https://huggingface.co/settings/tokens. Token sa využije len pri stiahnutí modelu. max_tokens: Určuje maximálny rozmer kontextového okna, ktoré server má podporovať. Priamo ovplyvňuje výpočetnú náročnosť VRAM. Typické hodnoty: - Malé modely: 4096 - Stredné modely: 8192 - Modely s dlhším kontextom: 16384+ Vysšie hodnoty významne navyšujú spotrebovanie pamäti. Ak Vám na serveri nedostatočne zbýva VRAM, znížte túto hodnotu. modelname: Identifikátor modelu Hugging Face, ktorý má naložiť vLLM. Príklad: mistralai/Ministral-3-14B-Instruct-2512 Ďalšie kompatibilné príklady: Qwen/Qwen2.5-14B-Instruct google/gemma google/gemma-3-12b-it meta-llama/Meta-Llama-3-8B-Instruct | Odporúčaný |
|---|---|
| malé modely | 4096 |
| stredné modely | 8192 |
| modely s dlhou kontextovou oknom | 16384+ |
Vyššie hodnoty výrazne zvyšujú spotrebu pamäte. Ak váš server vyčerpá VRAM, znížte túto hodnotu.
Identifikátor modelu z Hugging Face, ktorý má naťahovať vLLM.
Príklad:
mistralai/Ministral-3-14B-Instruct-2512
Iné kompatibilné príklady:
Qwen/Qwen2.5-14B-Instruct
google/gemma-3-12b-it
meta-llama/Meta-Llama-3-8B-Instruct
... and many more
Uistite sa, že model je podporovaný vo vLLM a zmestí sa do vašej grafickej karty.
Toto je váš klúč autentifikácie API
Všetky požiadavky na server vLLM musia obsahovať tento token v hlavičke:
Authorization: Bearer YOUR_TOKEN
To chrání váš server pred neoprávneným prístupom.
Príklad žiadosti:
curl https://your-server/v1/chat/completions \
-H "Authorization: Bearer YOUR_TOKEN"
Použite silný náhodný reťazec.
Vo vLLM môžete využívať širokú škálu veľkých jazykových modelov z HuggingFace. Uistite sa, že je dostatočne dostupná VRAM pamäť, pretože výkon závisí od toho, či máte na dispozícii dostačujúcu voľnú GPU VRAM pamäť pre ubytovanie modelu a veľkosť kontextu, násobené počtom súčasne pripojených používateľov.
Trooper.AI automaticky vyberie optimálnu presnosť pre architektúru GPU.
Výpočet VRAM: Váha modelu + ~25 % kvóty pre KV-Cache bufferník.
VRAM môže byť zdieľaný medzi viacerými GPU cez Tensor Parallelism (--tensor-parallel-size N).
| Model | Parametre | Presnosť | Min. celk. VRAM | Konfigurácia GPU | GPU |
|---|---|---|---|---|---|
| Qwen/Qwen3-4B | 4B | BF16 | ~8 GB | 1× NVIDIA Tesla V100 (16 GB) / RTX 4070 Ti Super | 1 |
| Qwen/Qwen3-8B | 8B | BF16 | ~20 GB | 1× RTX 3090 / RTX 4090 (24 GB) | 1 |
| mistralai/Ministral-3-14B-Instruct-2512 | 14B | FP8 | ~29 GB | 1× RTX 4080 Pro 32GB alebo 1× A100 40GB | 1 |
| Qwen/Qwen3-32B | 32B | FP8 | ~40 GB | 1× NVIDIA A100 40 GB alebo 2× RTX 4090 (2× po 24 GB) | 1–2 |
| meta-llama/Llama-3.1-8B-Instruct | 8B | FP8 | ~20 GB | 1× RTX 3090 / RTX 4090 (24 GB) | 1 |
| meta-llama/Llama-3.1-70B-Instruct | 70B | FP8 | ~90 GB | 1× NVIDIA RTX Pro 6000 Blackwell (96 GB) alebo 2× A100 (2×40 GB) | 1–2 |
Poznámka: FP8 sa používa na architektúrach Ada/Hopper (séria RTX 40, A100, H100) pre maximálny prienik. \
Trooper.AI automaticky vyberie optimálnu presnosť pre vašu grafickú kartu.
Konfigurácie s viacerými GPU používajú Tensor Parallelism – pamäť VRAM sa lineárne rozširuje medzi GPU.
Tieto parametre sa dajú nastaviť cez prostredia pred spustením inštalátora.
| Premenná | Popis |
|---|---|
TOKEN |
Kľúč API pre autentifikáciu |
modelname |
Cesta k modelu HuggingFace |
hf_token |
Hugging Face token (pre chránené modely) |
commandline_args |
Voliteľné dodatočné argumenty príkazového riadku vLLM |
Naš šablóna obsahuje výkonnostný benchmark, ktorý vám pomôže optimalizovať váš GPU server pre viacagentové použitie. Použite ho na testovanie a porovnávanie modelov, typov GPU a parametrov s cieľom maximalizovať prienik (throughput) a počet súčasne prispievajúcich užívateľov.
Ako funguje benchmark?
Benchmark spúšťa viacero agéntov súčasne, pričom každý interaguje s endpointom vLLM serveru na rôznej tématickej oblasti. Týmto sa zabráni cachovaniu a otestujú sa skutočné výkonnostné parametre. Môžete sledovať prienik jednotlivých agéntov, celkový prienik a porovnať náklady pre tokenizované služby ako napríklad GPT-5 mini. Často je vLLM server od Trooper.AI 2–4-krát lacnejší než veľké tokenové inferenciaálne služby, pričom udržia vašu prácu s LLM v soukromí!
Zistí architektúru GPU (Volta, Ampere, Ada, Hopper, Blackwell)
Zistí veľkosť VRAM
Automaticky vyberie optimálnu presnosť:
Používá FP16 KV cache pre stabilitu
Nastavenia:
Nainštaluje vLLM s podporou CUDA
Vytvorí službu systemd:
vllm-server.service
Spustí trvalý OpenAI-služobne kompatibilný API server na bezpečnom HTTPS koncovej bode.
Nebudú potrebné ručné nastavovanie.
Základná URL:
http://YOUR_SERVER:PORT/v1
Koniečky:
/v1/models/v1/completions/v1/chat/completionsHlavička autentifikácie:
Authorization: Bearer YOUR_TOKEN_FROM_CONFIG
from openai import OpenAI
client = OpenAI(
api_key="YOUR_API_KEY",
base_url="https://YOUR_SERVER_ENDPOINT.apps.trooper.ai/v1"
)
resp = client.chat.completions.create(
model="Qwen/Qwen3-14B",
messages=[
{"role": "user", "content": "Hello, what is vLLM?"}
],
max_tokens=200
)
print(resp.choices[0].message.content)
import OpenAI from "openai";
const client = new OpenAI({
apiKey: "YOUR_API_KEY",
baseURL: "https://YOUR_SERVER_ENDPOINT.apps.trooper.ai/v1"
});
const completion = await client.chat.completions.create({
model: "Qwen/Qwen3-14B",
messages: [
{ role: "user", content: "Hello from Node.js" }
],
max_tokens: 200
});
console.log(completion.choices[0].message.content);
<?php
$ch = curl_init("https://YOUR_SERVER_ENDPOINT.apps.trooper.ai/v1/chat/completions");
$data = [
"model" => "Qwen/Qwen3-14B",
"messages" => [
["role" => "user", "content" => "Hello from PHP"]
],
"max_tokens" => 200
];
curl_setopt_array($ch, [
CURLOPT_POST => true,
CURLOPT_RETURNTRANSFER => true,
CURLOPT_HTTPHEADER => [
"Authorization: Bearer YOUR_API_KEY",
"Content-Type: application/json"
],
CURLOPT_POSTFIELDS => json_encode($data)
]);
$response = curl_exec($ch);
curl_close($ch);
echo $response;
resp = client.chat.completions.create(
model="Qwen/Qwen3-14B",
messages=[{"role":"user","content":"Explain transformers"}],
stream=True
)
for chunk in resp:
if chunk.choices[0].delta.content:
print(chunk.choices[0].delta.content, end="", flush=True)
const stream = await client.chat.completions.create({
model: "Qwen/Qwen3-14B",
messages: [{ role: "user", content: "Explain transformers" }],
stream: true
});
for await (const chunk of stream) {
process.stdout.write(chunk.choices[0].delta?.content || "");
}
Serveri Trooper.AI pre vLLM sú navrhnuté na:
Trooper.AI používa:
To sa vyhýba:
Aby sa dalo zhruba predstaviť ekonomiku vlastného hostovania, nasledujúci porovnanie odhaduje náklady na spustenie modelu Ministral-3-14B-Instruct-2512 na GPU servri Trooper.AI oproti použitiu API GPT-5 mini pre rovnaký pracovný zatiaženie.
Odhad je založený na reálnom benchmark testovaní popísanom v tomto článku a extrapolovaný na jednu hodinu nepretržitého výkonu inferencie.
| Platfoma | Hodnota za hodinu |
|---|---|
| API GPT-5 mini | ~$3.12 |
| Ministral-3-14B na GPU serveri Trooper.AI | €0.51 (~$0.54) |
Táto odhad je založený na skutočnom benchmark testu v tomto článku s použitím Ministral-3-14B-Instruct-2512 na GPU serveri Trooper.AI.
| Metrika | Hodnota |
|---|---|
| Spracované celkové tokeny | 307,028 |
| Čas behu | 153 sekúnd |
| Prúd | ~2006 tokenov/s |
| Predpokladané tokény/hodina | ~7,22 miliónov tokenov |
Zloženie tokenov v benchmarke:
| Typ tokenu | Tokény |
|---|---|
| Vstupné tokény | 275,186 |
| Výstupné tokény | 31,842 |
Škáľovanie tohoto pomera na ~7,22 M tokénov/hodinu a aplikácia ceníkovania GPT-5 mini:
vyústi v odhadované ~€3,12 za hodinu pre rovnaké pracovné zatiaženie.
Server Ministral-3 na Trooper.AI namesto toho běží za fixné €0.51/hod (~$0.54), bez ohľadu na objem tokénov, čo umožňuje spracovanie miliónov tokénov za hodinu s predvídateľnými nákladmi.
Na základe pozorovaného prietoku možno odhadnúť náklad na prevádzku systému na celú hodinu.
| Metrika | Hodnota |
|---|---|
| Tokeny za hodinu | ~7,221,543 |
| náklady modelu GPT-5 mini | $3.12 |
| Náklady na Trooper.AI server | €0.51 (~$0.54) |
Spracovanie rovnakého pracovného zatiaženia za hodinu by ešte bolo:
≈ 5,8× lacnejšie na Trooper.AI
Samostatné hostovanie LLM sa ekonomicky vyplácajú v prípade:
Príklady zahŕňajú:
V tomto benchmarku:
| Metrika | Výsledok |
|---|---|
| Model | Ministral-3-14B |
| Náklady na server | €0.51/hour |
| Zpracované tokeny | 307k |
| Čas behu | 153 sekúnd |
| Zníženie nákladov | 82.8% |
| Nákladová výhoda | 5,8× lacnejšie ako GPT-5 mini |
Pre pracovné zátěže s vysokým prierezom prútokovosti môže spustenie modelov ako Ministral-3 na serveroch Trooper.AI s GPU dramaticky znížiť náklady na inferenciu zároveň odstraňujúc limitáciu rýchlosti API.
Šablóna Trooper.AI pre vLLM vám poskytuje:
Vyberáte len model a API kľúč.
Všetko ostatné je automaticky optimalizované.
Pomocou dashbordu môžete ľahko detekovať problémy pri štarte a vyriešiť ich. Není dostatočne veľký VRAM? Prejdite na vyšší balíček za minúty cez dashbord. Ľudovo řečeno, znížte veľkosť okna tokenov pre optimalizáciu využitia VRAM-u. Zoznamy logov si jednoducho overujte v reálnom čase pomocou dashbordu:
Na použitie Ministralu 3 potrebujete normálne Transformers 4.x a toto sa dá ľahko prinútiť pomocou zaškrtnutia „Ministral 3 Fix“ v nastavení šablóny. Poznámka: vLLM je odborný nástroj a musíte vedieť, ako optimalizovať a vyriešiť problémy, ale pomážeme tak dobre, ako len ide.
Najprv zapnite opravu pre Ministral 3:
Druhé, použiť tieto parametre pre maximálne využitie funkcií modelu:
--async-scheduling --tokenizer_mode mistral --config_format mistral --load_format mistral --enable-auto-tool-choice --tool-call-parser mistral --limit-mm-per-prompt='{"image":{"count":4,"width":768,"height":768}}'
Následne sa spustí Ministral 3 na vašom serveri – ak sú všetky ostatné parametre prispôsobené veľkosti vašej VRAM.
Pre NVIDIU Nemotron 3 Nano potrebujete najmenej verziu vLLM 0.18.1 (aktualizáciu z 2025-03-30). Môžete konfigurovať parsovač a limit tokénov tak, aby ste mohli použiť https://docs.vllm.ai/en/latest/features/reasoning_outputs/#online-serving
Pozerajte: toto sníži throughput približne o -30 %!thinking_token_budget. Viac informácií nájdete tu:
Upravte argumenty príkazového riadka na niečo podobné tomu:
--async-scheduling
--reasoning-parser-plugin /home/trooperai/vllm-server/nano_v3_reasoning_parser.py
--reasoning-parser nano_v3
--reasoning-config '{"think_start_str": "<think>", "think_end_str": " - I have to give the solution based on the thinking directly now:</think>"}'
Stiahnuť parser z:
wget -O - https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16/resolve/main/nano_v3_reasoning_parser.py
Alternatívne môžete použiť nastavenie nemotron_3_parser na ON. To za vás toto vykoná. Uistite sa tiež, že aktivujete nightly developer build!
Takto získáte väčšiu kontrolu nad funkciou rozumového procesu modelu Nemotron 3 Nano.
Pre pokročilé nastavenie, podporu pre viacero GPU alebo prispôsobené predvolby kontaktujte podporu Trooper.AI.