Server kompatibilný s OpenAI na platforme vLLM

Trooper.AI poskytuje plne automatizovaný šablónu nasadenia vLLM, ktorá nainštaluje, nakonfiguruje a spustí server pre inferenciu kompatibilný s OpenAI na vašom GPU serveri pomocou systemd.

Status Dashboard for vLLM on Trooper.AI
Panel stavu pre vLLM na Trooper.AI

Cieľ:

Šablóna automaticky:

Vášmi kontrolovanými sú len malý počet verejných parametrov.

Porozumenie počtu GPU: vLLM pracuje s viacerými GPU, ale vyžaduje, aby počet GPU rovnomerne delil počet pozornostných hlavičiek modelu. Napríklad u modelu ako je Gemma so 32 pozornostnými hlavičkami môže použiť 1, 2, 4 alebo 8 GPU – ale nie 3.


Dôležitá bezpečnostná poznámka k obrázkům na obrazovke: Servery zobrazované na snímkoch slúžia len demonštrácii a sú chránené pomocou Trooper.AI Sieťovej ohnenej steny (Network-Level Firewall), ktorá je zahŕnutá vo všetkých objednávkach GPU Serverov. Podrobnejšie informácie nájdete podľa odkazu: 🛡️ Trooper.AI prispôsobiteľná Hardvérová ohnená stenica


Nastavenia šablóny pre vLLM

Tento šablóna nasadí hotový k použitiu vLLM inferenčný server na vašom inštancii Trooper.AI. Nainštaluje vyžadovaný runtime, nakonfiguruje API bod a pripraví model pre žiadosti kompatibilné s OpenAI.

Níže je krátky popis každého nastavenia.

Basic settings to get startet with vLLM
Základné nastavenia pre spustenie s vLLM

commandline_args

Voliteľné pokročilé argumenty predané priamo do príkazu na spustenie vLLM servera

Použite toto ak potrebujete povoliť ďalšie funkcie ako:

  • tenzorové paralelizovanie
  • kvantizácia
  • volanie nástrojov
  • pridané nastavenia tokenizátora
  • špekulatívne dekódovanie

Príklad:

Kód
--tensor-parallel-size 2

Nechte prázdne, ak presne vieťe, ktoré vlajky chcete použiť.

hf_token

Vaše prístupový token pre HuggingFace.

To je vyžadované ak model:

  • je zabezpečené prístupom
  • vyžaduje overenie totožnosti
  • ale je stiahnuté z soukromého repozitára

Pre verejnú modelu môže byť toto pole nevyplnené.

Token si môžete vygenerovať tu:

Kód
https://huggingface.co/settings/tokens

Token sa používa len počas stiahnutia modelu.

max_tokens

Definuje maximálne okno kontextu, ktoré má podporovať server.

To priamo ovplyvňuje využitie VRAM.

Typické hodnoty:

is_gated: Zda je chránený prístup vyžadujúci overenie identít alebo je stiahnutý z súkromnej repozitárie. U verejných modelov môže zostávať prazdné. Token si môžete vygenerovať tu: https://huggingface.co/settings/tokens. Token sa využije len pri stiahnutí modelu. max_tokens: Určuje maximálny rozmer kontextového okna, ktoré server má podporovať. Priamo ovplyvňuje výpočetnú náročnosť VRAM. Typické hodnoty: - Malé modely: 4096 - Stredné modely: 8192 - Modely s dlhším kontextom: 16384+ Vysšie hodnoty významne navyšujú spotrebovanie pamäti. Ak Vám na serveri nedostatočne zbýva VRAM, znížte túto hodnotu. modelname: Identifikátor modelu Hugging Face, ktorý má naložiť vLLM. Príklad: mistralai/Ministral-3-14B-Instruct-2512 Ďalšie kompatibilné príklady: Qwen/Qwen2.5-14B-Instruct google/gemma google/gemma-3-12b-it meta-llama/Meta-Llama-3-8B-Instruct Odporúčaný
malé modely 4096
stredné modely 8192
modely s dlhou kontextovou oknom 16384+

Vyššie hodnoty výrazne zvyšujú spotrebu pamäte. Ak váš server vyčerpá VRAM, znížte túto hodnotu.

názov_modelu

Identifikátor modelu z Hugging Face, ktorý má naťahovať vLLM.

Príklad:

Kód
mistralai/Ministral-3-14B-Instruct-2512

Iné kompatibilné príklady:

Kód
Qwen/Qwen2.5-14B-Instruct
google/gemma-3-12b-it
meta-llama/Meta-Llama-3-8B-Instruct
... and many more

Uistite sa, že model je podporovaný vo vLLM a zmestí sa do vašej grafickej karty.

prístupový kľúč

Toto je váš klúč autentifikácie API

Všetky požiadavky na server vLLM musia obsahovať tento token v hlavičke:

Kód
Authorization: Bearer YOUR_TOKEN

To chrání váš server pred neoprávneným prístupom.

Príklad žiadosti:

Kód
curl https://your-server/v1/chat/completions \
  -H "Authorization: Bearer YOUR_TOKEN"

Použite silný náhodný reťazec.


Veľkosť modelu a požiadavky na GPU

Vo vLLM môžete využívať širokú škálu veľkých jazykových modelov z HuggingFace. Uistite sa, že je dostatočne dostupná VRAM pamäť, pretože výkon závisí od toho, či máte na dispozícii dostačujúcu voľnú GPU VRAM pamäť pre ubytovanie modelu a veľkosť kontextu, násobené počtom súčasne pripojených používateľov.

Trooper.AI automaticky vyberie optimálnu presnosť pre architektúru GPU.

Výpočet VRAM: Váha modelu + ~25 % kvóty pre KV-Cache bufferník.
VRAM môže byť zdieľaný medzi viacerými GPU cez Tensor Parallelism (--tensor-parallel-size N).

Model Parametre Presnosť Min. celk. VRAM Konfigurácia GPU GPU
Qwen/Qwen3-4B 4B BF16 ~8 GB 1× NVIDIA Tesla V100 (16 GB) / RTX 4070 Ti Super 1
Qwen/Qwen3-8B 8B BF16 ~20 GB 1× RTX 3090 / RTX 4090 (24 GB) 1
mistralai/Ministral-3-14B-Instruct-2512 14B FP8 ~29 GB 1× RTX 4080 Pro 32GB alebo 1× A100 40GB 1
Qwen/Qwen3-32B 32B FP8 ~40 GB 1× NVIDIA A100 40 GB alebo 2× RTX 4090 (2× po 24 GB) 1–2
meta-llama/Llama-3.1-8B-Instruct 8B FP8 ~20 GB 1× RTX 3090 / RTX 4090 (24 GB) 1
meta-llama/Llama-3.1-70B-Instruct 70B FP8 ~90 GB 1× NVIDIA RTX Pro 6000 Blackwell (96 GB) alebo 2× A100 (2×40 GB) 1–2

Poznámka: FP8 sa používa na architektúrach Ada/Hopper (séria RTX 40, A100, H100) pre maximálny prienik. \ Trooper.AI automaticky vyberie optimálnu presnosť pre vašu grafickú kartu.
Konfigurácie s viacerými GPU používajú Tensor Parallelism – pamäť VRAM sa lineárne rozširuje medzi GPU.


Veľmí parametre

Tieto parametre sa dajú nastaviť cez prostredia pred spustením inštalátora.

Premenná Popis
TOKEN Kľúč API pre autentifikáciu
modelname Cesta k modelu HuggingFace
hf_token Hugging Face token (pre chránené modely)
commandline_args Voliteľné dodatočné argumenty príkazového riadku vLLM

Automatizované vyhodnocovanie pre nastavenie parametrov

Status Dashboard for vLLM on Trooper.AI
Panel stavu pre vLLM na Trooper.AI

Naš šablóna obsahuje výkonnostný benchmark, ktorý vám pomôže optimalizovať váš GPU server pre viacagentové použitie. Použite ho na testovanie a porovnávanie modelov, typov GPU a parametrov s cieľom maximalizovať prienik (throughput) a počet súčasne prispievajúcich užívateľov.

Ako funguje benchmark?

Benchmark spúšťa viacero agéntov súčasne, pričom každý interaguje s endpointom vLLM serveru na rôznej tématickej oblasti. Týmto sa zabráni cachovaniu a otestujú sa skutočné výkonnostné parametre. Môžete sledovať prienik jednotlivých agéntov, celkový prienik a porovnať náklady pre tokenizované služby ako napríklad GPT-5 mini. Často je vLLM server od Trooper.AI 2–4-krát lacnejší než veľké tokenové inferenciaálne služby, pričom udržia vašu prácu s LLM v soukromí!


Čo šablóna robí

Startup of your vLLM server
Spustenie vašho vLLM serveru

  1. Zistí architektúru GPU (Volta, Ampere, Ada, Hopper, Blackwell)

  2. Zistí veľkosť VRAM

  3. Automaticky vyberie optimálnu presnosť:

    • FP8 > BF16 > FP16
  4. Používá FP16 KV cache pre stabilitu

  5. Nastavenia:

    • maximálne súčasné sekvencie
    • veľkosť zbalených tokénov
    • využitie pamäte
  6. Nainštaluje vLLM s podporou CUDA

  7. Vytvorí službu systemd:

    Kód
    vllm-server.service
    
  8. Spustí trvalý OpenAI-služobne kompatibilný API server na bezpečnom HTTPS koncovej bode.

Nebudú potrebné ručné nastavovanie.


API koncové body

Základná URL:

Kód
http://YOUR_SERVER:PORT/v1

Koniečky:

  • /v1/models
  • /v1/completions
  • /v1/chat/completions

Hlavička autentifikácie:

Kód
Authorization: Bearer YOUR_TOKEN_FROM_CONFIG

Príklad klienta v Pythone

python
from openai import OpenAI

client = OpenAI(
    api_key="YOUR_API_KEY",
    base_url="https://YOUR_SERVER_ENDPOINT.apps.trooper.ai/v1"
)

resp = client.chat.completions.create(
    model="Qwen/Qwen3-14B",
    messages=[
        {"role": "user", "content": "Hello, what is vLLM?"}
    ],
    max_tokens=200
)

print(resp.choices[0].message.content)

Príklad klienta pre Node.js

JavaScript
import OpenAI from "openai";

const client = new OpenAI({
  apiKey: "YOUR_API_KEY",
  baseURL: "https://YOUR_SERVER_ENDPOINT.apps.trooper.ai/v1"
});

const completion = await client.chat.completions.create({
  model: "Qwen/Qwen3-14B",
  messages: [
    { role: "user", content: "Hello from Node.js" }
  ],
  max_tokens: 200
});

console.log(completion.choices[0].message.content);

Príklad klienta pre PHP

PHP
<?php

$ch = curl_init("https://YOUR_SERVER_ENDPOINT.apps.trooper.ai/v1/chat/completions");

$data = [
  "model" => "Qwen/Qwen3-14B",
  "messages" => [
    ["role" => "user", "content" => "Hello from PHP"]
  ],
  "max_tokens" => 200
];

curl_setopt_array($ch, [
  CURLOPT_POST => true,
  CURLOPT_RETURNTRANSFER => true,
  CURLOPT_HTTPHEADER => [
    "Authorization: Bearer YOUR_API_KEY",
    "Content-Type: application/json"
  ],
  CURLOPT_POSTFIELDS => json_encode($data)
]);

$response = curl_exec($ch);
curl_close($ch);

echo $response;

Príklad prúdenia

Streamovanie v Pythone

python
resp = client.chat.completions.create(
    model="Qwen/Qwen3-14B",
    messages=[{"role":"user","content":"Explain transformers"}],
    stream=True
)

for chunk in resp:
    if chunk.choices[0].delta.content:
        print(chunk.choices[0].delta.content, end="", flush=True)

Streamovanie s Node.js

JavaScript
const stream = await client.chat.completions.create({
  model: "Qwen/Qwen3-14B",
  messages: [{ role: "user", content: "Explain transformers" }],
  stream: true
});

for await (const chunk of stream) {
  process.stdout.write(chunk.choices[0].delta?.content || "");
}

Prípady použitia

Serveri Trooper.AI pre vLLM sú navrhnuté na:

  • AI backendové služby pre SaaS
  • chyboboty
  • Kódové asistenty
  • systémy RAG
  • Server pre viacnásobné vyvodzovanie inferencie
  • Vysokoprúchodová batčová inferencia
  • prostredia pre prenájom GPU

Filozofia výkonnosti

Trooper.AI používa:

  • Automatické nastavenie architektúry
  • Automatická výber presnosti
  • batčovanie s ohľadom na dostupnú VRÁM
  • Stabilná konfigurácia KV cache

To sa vyhýba:

  • nesprávna konfigurácia GPU
  • Chyby presnosti
  • fragmentácia VRAM
  • nestabilita kontextu

Porovnanie nákladov: Ministral-3 na Trooper.AI oproti GPT-5 mini

Jeopardy-Game-Benchmark
benchmark hry Jeopardy

Aby sa dalo zhruba predstaviť ekonomiku vlastného hostovania, nasledujúci porovnanie odhaduje náklady na spustenie modelu Ministral-3-14B-Instruct-2512 na GPU servri Trooper.AI oproti použitiu API GPT-5 mini pre rovnaký pracovný zatiaženie.

Odhad je založený na reálnom benchmark testovaní popísanom v tomto článku a extrapolovaný na jednu hodinu nepretržitého výkonu inferencie.

Hodnota nákladov pri meranej produktivite

Platfoma Hodnota za hodinu
API GPT-5 mini ~$3.12
Ministral-3-14B na GPU serveri Trooper.AI €0.51 (~$0.54)

Ak sa toto vypočítalo

Táto odhad je založený na skutočnom benchmark testu v tomto článku s použitím Ministral-3-14B-Instruct-2512 na GPU serveri Trooper.AI.

Metrika Hodnota
Spracované celkové tokeny 307,028
Čas behu 153 sekúnd
Prúd ~2006 tokenov/s
Predpokladané tokény/hodina ~7,22 miliónov tokenov

Zloženie tokenov v benchmarke:

Typ tokenu Tokény
Vstupné tokény 275,186
Výstupné tokény 31,842

Škáľovanie tohoto pomera na ~7,22 M tokénov/hodinu a aplikácia ceníkovania GPT-5 mini:

  • $0,25 za 1 milión vstupných tokénov
  • $2,00 za 1 milión výstupných tokenov

vyústi v odhadované ~€3,12 za hodinu pre rovnaké pracovné zatiaženie.

Server Ministral-3 na Trooper.AI namesto toho běží za fixné €0.51/hod (~$0.54), bez ohľadu na objem tokénov, čo umožňuje spracovanie miliónov tokénov za hodinu s predvídateľnými nákladmi.

Projekcia nákladov dlhodobého pracovného zatíženia

Na základe pozorovaného prietoku možno odhadnúť náklad na prevádzku systému na celú hodinu.

Metrika Hodnota
Tokeny za hodinu ~7,221,543
náklady modelu GPT-5 mini $3.12
Náklady na Trooper.AI server €0.51 (~$0.54)

Hodnota úspor za hodinu

Spracovanie rovnakého pracovného zatiaženia za hodinu by ešte bolo:

≈ 5,8× lacnejšie na Trooper.AI

Keď sa self-hosting stáva výrazne lacnejším

Samostatné hostovanie LLM sa ekonomicky vyplácajú v prípade:

  • práce obsahujú veľa malých požiadaviek
  • paralelná inferencia je vyžadovaná
  • aplikácie generujú milióny tokenov za hodinu
  • práce spracúvajú sa nepretržite

Príklady zahŕňajú:

  • umelá inteligencia v hrách
  • agentské systémy
  • automatizačné pipeline
  • chatrové aplikácie s veľkým počtom používateľov

Zhrnutie

V tomto benchmarku:

Metrika Výsledok
Model Ministral-3-14B
Náklady na server €0.51/hour
Zpracované tokeny 307k
Čas behu 153 sekúnd
Zníženie nákladov 82.8%
Nákladová výhoda 5,8× lacnejšie ako GPT-5 mini

Pre pracovné zátěže s vysokým prierezom prútokovosti môže spustenie modelov ako Ministral-3 na serveroch Trooper.AI s GPU dramaticky znížiť náklady na inferenciu zároveň odstraňujúc limitáciu rýchlosti API.


Prečo potrebujete šablónu vLLM

Šablóna Trooper.AI pre vLLM vám poskytuje:

  • API kompatibilná s OpenAI
  • Automatická optimalizácia GPU
  • Výchozí nastavenia bezpečné pre produkciu
  • Minimálna konfigurácia
  • Maximálny prienik

Vyberáte len model a API kľúč.

Všetko ostatné je automaticky optimalizované.


Řešení problémov

Pomocou dashbordu môžete ľahko detekovať problémy pri štarte a vyriešiť ich. Není dostatočne veľký VRAM? Prejdite na vyšší balíček za minúty cez dashbord. Ľudovo řečeno, znížte veľkosť okna tokenov pre optimalizáciu využitia VRAM-u. Zoznamy logov si jednoducho overujte v reálnom čase pomocou dashbordu:

Crashed and how to fix it
Zrútenie a ako ho opraviť

Ministral 3

Na použitie Ministralu 3 potrebujete normálne Transformers 4.x a toto sa dá ľahko prinútiť pomocou zaškrtnutia „Ministral 3 Fix“ v nastavení šablóny. Poznámka: vLLM je odborný nástroj a musíte vedieť, ako optimalizovať a vyriešiť problémy, ale pomážeme tak dobre, ako len ide.

Najprv zapnite opravu pre Ministral 3:

Ministral 3 Fix Checkbox turn on!
Zaškrtnite políčko Ministral 3 Fix!

Druhé, použiť tieto parametre pre maximálne využitie funkcií modelu:

Command Args for Ministral 3 vLLM
Príkazové argumenty pre Ministral 3 vo vLLM

bash
--async-scheduling --tokenizer_mode mistral --config_format mistral --load_format mistral --enable-auto-tool-choice --tool-call-parser mistral --limit-mm-per-prompt='{"image":{"count":4,"width":768,"height":768}}'

Následne sa spustí Ministral 3 na vašom serveri – ak sú všetky ostatné parametre prispôsobené veľkosti vašej VRAM.

Nemotron 3 Nano s rozpočtom na tokény

Pre NVIDIU Nemotron 3 Nano potrebujete najmenej verziu vLLM 0.18.1 (aktualizáciu z 2025-03-30). Môžete konfigurovať parsovač a limit tokénov tak, aby ste mohli použiť thinking_token_budget. Viac informácií nájdete tu: https://docs.vllm.ai/en/latest/features/reasoning_outputs/#online-serving Pozerajte: toto sníži throughput približne o -30 %!

Upravte argumenty príkazového riadka na niečo podobné tomu:

bash
  --async-scheduling 
  --reasoning-parser-plugin /home/trooperai/vllm-server/nano_v3_reasoning_parser.py  
  --reasoning-parser nano_v3 
  --reasoning-config '{"think_start_str": "<think>", "think_end_str": " - I have to give the solution based on the thinking directly now:</think>"}'

Stiahnuť parser z:

bash
wget -O - https://huggingface.co/nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16/resolve/main/nano_v3_reasoning_parser.py

Alternatívne môžete použiť nastavenie nemotron_3_parser na ON. To za vás toto vykoná. Uistite sa tiež, že aktivujete nightly developer build!

Takto získáte väčšiu kontrolu nad funkciou rozumového procesu modelu Nemotron 3 Nano.


Podpora

Pre pokročilé nastavenie, podporu pre viacero GPU alebo prispôsobené predvolby kontaktujte podporu Trooper.AI.