🎬 Tréning videí LoRA cez WAN

⚠️ Vo vývoji
Tento nastavenie je stále experimentálne.
Použite ho ako inšpiráciu pre generovanie videí na základe WAN (T2V/I2V/V2V/S2V), namiesto hotového prístupu.

Ak by ste chceli prispieť k našej WAN Video Training experimentu, kontaktujte nás tu: Kontakty na podporu.

Objednať GPU server pre WAN Video


🧩 1. Nastavenie prostredia

Vytvorte čisté prostredie Python pomocou Conda (odporúčaný spôsob) alebo venv:

bash
# 1) Conda / Virtual Environment
conda create -n wan22 python=3.10 -y
conda activate wan22

# 2) Install PyTorch (CUDA 12.x Build)
pip install --upgrade torch torchvision torchaudio --index-url https://download.pytorch.org/whl/cu121
pip install xformers accelerate transformers datasets peft bitsandbytes==0.43.3 safetensors einops
pip install opencv-python pillow tqdm

# 3) Clone Trainer
git clone https://github.com/Wan-Video/DiffSynth-Studio.git
cd DiffSynth-Studio
pip install -r requirements.txt || true
cd ..

💡 Tip: Na grafických kartách NVIDIA A100, vždy používajte presnosť BF16 pre stabilný a efektívny tréning.


🧠 2. Nastavenie modelu

Umístiť vaše váhy modelu WAN 2.2 (podľa úlohy: T2V, I2V, V2V, S2V) spolu s súbormi VAE a textového kodéra do očekávaných adresárov trénera – alebo ich zadajte manuálne cez --model_name_or_path

Príklady:

bash
--model_name_or_path Wan-AI/Wan2.2-T2V-A14B   # Text-to-Video
--model_name_or_path Wan-AI/Wan2.2-I2V-A14B   # Image-to-Video

🎬 3. Príprava dátového súboru

WAN požaduje súbor vo forme JSONL datasetu s jedným záznamom na každý videoklip.

Príklad formátu:

json
{"video": "/data/myset/clip_0001.mp4", "prompt": "a cozy coffee shop scene at golden hour", "fps": 24, "seconds": 4, "resolution": "1280x720"}
{"video": "/data/myset/clip_0002.mp4", "prompt": "rainy neon city street, cinematic", "fps": 24, "seconds": 4, "resolution": "1280x720"}

📘 Poznámky:

  • Pre Text-to-Video (T2V) môžete použiť státy snímky, rámy alebo dummy videá. Vyžaduje sa prompt a špecifikácie cieľových parametrov (fps, sekundy, rozlíšenie).

  • Uložte vaše dataset(s) ako:

    • /data/wan22/train.jsonl
    • /data/wan22/val.jsonl

⚙️ 4. accelerate Konfigurácia

Inicializovať raz:

bash
accelerate config default

Ďalej definovať ručne v ~/.cache/huggingface/accelerate/default_config.yaml:

yaml
compute_environment: LOCAL_MACHINE
distributed_type: NO
mixed_precision: bf16
num_processes: 1
gpu_ids: "0"
dynamo_backend: NO

👉 Pre tréning na viaceroch GPU nastav:

yaml
distributed_type: MULTI_GPU

🚀 5. Úpravy s LoRou (príklad pre A100 40GB)

🧩 Text-to-videá (720p, 4 s, BF16)

bash
conda activate wan22
cd DiffSynth-Studio

accelerate launch \
  train_wan_lora.py \
  --model_name_or_path "Wan-AI/Wan2.2-T2V-A14B" \
  --output_dir /data/wan22_lora_out \
  --dataset_json /data/wan22/train.jsonl \
  --resolution 720 --fps 24 --clip_seconds 4 \
  --train_batch_size 1 \
  --gradient_accumulation_steps 8 \
  --max_train_steps 20000 \
  --learning_rate 1e-4 --warmup_steps 500 \
  --lora_rank 64 --lora_alpha 64 \
  --use_bf16 --enable_xformers --gradient_checkpointing \
  --checkpointing_steps 1000 \
  --validation_json /data/wan22/val.jsonl --validation_steps 2000

🖼 Obrazok-na-video (O2V)

Zmeniť len model:

bash
--model_name_or_path "Wan-AI/Wan2.2-I2V-A14B"

🔧 6. Doporučené úpravy pre A100

Situácia Doporučená úprava
Veľmi dostatok VRAM Zvýšiť --train_batch_size na 2 alebo použiť --lora_rank 96–128
Malý dostupný VRAM Zvýšiť --gradient_accumulation_steps to 12–16
LoRAs pre charakter/styl 6k–12k krokov, rank 32–64
Presnosť Vždy preferujte BF16 pred FP16
Optimalizácia Zapnúť --gradient_checkpointing + --enable_xformers

💾 7. Obnoviť tréning / Kontrolné body

bash
accelerate launch train_wan_lora.py \
  ... (same parameters) \
  --resume_from_checkpoint "/data/wan22_lora_out/checkpoint-10000"

🧠 8. Inferencia / Testovanie

Veľká väčšina pracovných prúdov WAN (CLI, ComfyUI, atď.) podporuje priamo načítanie adapterov LoRA.

Príklad pre príkazový riadok:

bash
python infer_wan.py \
  --model_name_or_path "Wan-AI/Wan2.2-T2V-A14B" \
  --lora_path "/data/wan22_lora_out" \
  --prompt "cozy coffee shop at golden hour, bokeh" \
  --negative_prompt "distorted faces, artifacts" \
  --resolution 720 --fps 24 --seconds 4 \
  --output /data/wan22/samples/test001.mp4 \
  --use_bf16 --enable_xformers

💡 ComfyUI: Použiť WAN Loader → pripojiť LoRA(s) → vygenerovať svoje testovacie videá.


🧮 9. Tréning na viaceroch GPU (stejný hostiteľ)

Využite viacero GPU (napr. 2× A100 40GB) pre rýchlejšie doterazovanie.

bash
accelerate config  # set distributed_type=MULTI_GPU, num_processes=2
accelerate launch \
  --multi_gpu \
  train_wan_lora.py \
  ... (same parameters) \
  --train_batch_size 1 --gradient_accumulation_steps 8

Pre konfigúrace s viac ako 4 GPU zabezpečte --seq_parallel ak je podporované – výrazne znížiť výpočetnú náročnosť VRAM.


⚡ 10. Referencia hyperparametrov

Typ LR Rang Alfa Kroky Partia Akumulácia gradientov Poznámky
Všeobecné 1e-4 64 64 10k–20k 1 8–12 Vyvážený základný prípad
Postava 1e-4 64–128 64 8k–12k 1 8 Vhodné pre krátke 2–4 sekundové klipy
Štýl 1e-4 32–64 64 6k–10k 1 8–12 Širší štýlistický rozsah
Hodnotenie každých 1–2 tisíc Test 2–4 fixných + 2 reálnych promptov

🧾 Zhrnutie

Tréning WAN s LoRou umožňuje:

  • Rýchla prispôsobivosť modelov generácie videí WAN 2.2
  • Styl, téma a konzistencia postáv vo výstupoch
  • Účinné jemné ladenie pomocou LoRA a xFormerov s minimálnym spotrebovaním VRAM

Odporúčaná konfigurácia:

  • ⚙️ CUDA 12.x
  • 🧠 NVIDIA A100 (40 GB)
  • 💡 presnosť BF16
  • 🧩 xFormers + kontrolný bod gradientu

🏁 Príklad prebiehu pracovného postupu

Text
Environment  →  Model Setup  →  Dataset Prep  →  LoRA Fine-tune  →  Inference

🎥 Trénuj chytrejšie. Generuj rýchlejšie. WAN silnejší.