Ekonomika prostoje: proč nevytížená karta bolí víc než pomalá karta

Letadlo, které stojí na ranveji, nikoho nevozí a přesto spaluje leasing. Přesně tak vypadá GPU cluster, který 60 % dne nedělá nic.
Nvidia H100 v cloudu vyjde na 55 až 90 Kč za hodinu podle poskytovatele a regionu. Když si firma pronajme osm karet na měsíční trénink modelu a reálně je využívá na 35 % kapacity — což je podle interních dat několika evropských MLOps týmů běžný průměr — platí za vzduch desítky tisíc korun denně. A nikdo si toho nevšimne, dokud nepřijde faktura za elektřinu k tomu navrch. GPU management přestal být IT detail. Je to finanční a čím dál víc i regulatorní problém.
Ekonomika prostoje: proč nevytížená karta bolí víc než pomalá karta
Firmy tradičně řeší výkon — kolik tokenů za sekundu, jak rychle se dotrénuje model. Skoro nikdo neřeší utilizaci v čase. Přitom GPU cluster má fixní náklad (leasing, energie na chlazení, amortizace) bez ohledu na to, jestli počítá nebo čeká na data z fronty.
Typický scénář: firma koupí server s 8× H100 za zhruba 6-7 milionů korun, aby mohla fine-tunovat interní model jednou týdně na dva dny. Zbylých pět dní karty buď leží ladem, nebo běží na jednotky procent výkonu při inference s nízkým provozem. Návratnost investice se tím natahuje z 18 měsíců na 4 roky.
Cloudové GPU (AWS, Lambda Labs, RunPod, CoreWeave) tenhle problém řeší jinak — platíte jen za to, co běží. Ale i tady je past: spousta týmů si instanci nechá běžet přes noc, protože „zítra to zase budeme potřebovat", a rozpočet na infrastrukturu jim tiše naroste o 20 %. RunPod účtuje H100 od cca 1,99 $/hod (asi 47 Kč), Lambda Labs podobně. Za měsíc zapomenuté instance to je klidně 34 000 Kč vyhozených bez jediného promptu.
Řešení není složité: autoscaling s timeoutem (shutdown po 10 minutách nečinnosti), spot instance pro netriviální dávkové úlohy a monitoring, který umí říct, kdy karta skutečně počítá a kdy jen hřeje serverovnu.
Jak měřit vytížení, než začnete škrtat rozpočet
Základ je `nvidia-smi`, ale ten vám ukáže jen okamžitý stav. Pro reálné rozhodování potřebujete časovou řadu. NVIDIA DCGM (Data Center GPU Manager) exportuje metriky do Prometheu, odtud do Grafany — během hodiny máte dashboard s utilizací, teplotou, spotřebou ve wattech a memory bandwidth pro každou kartu zvlášť.
Klíčová metrika není GPU utilization v procentech, ale SM occupancy a memory throughput dohromady — karta může hlásit 90 % vytížení a přitom čekat na data z disku, takže reálně nepočítá nic. `dcgm-exporter` + `nvidia-smi dmon -s pucvmet` vám dá dostatek dat na to, abyste za týden viděli, jestli je problém v datovém pipeline nebo v modelu samotném.
Pro menší týmy bez DevOps kapacity existuje jednodušší cesta: `gpustat` (pip install gpustat) jako lehký CLI monitor, nebo Weights & Biases System Metrics, které to hlídají automaticky při každém trénovacím běhu zdarma do určitého limitu. Kdo chce nulové náklady, spustí Ollama s vestavěným `ollama ps`, které ukáže, které modely drží VRAM a jak dlouho.
Bez měření nevíte, co optimalizovat. A bez propojení téhle metriky s cenou elektřiny optimalizujete naslepo.
Spotová cena elektřiny jako druhý rozměr GPU plánování
Tohle je bod, který většina IT týmů úplně ignoruje: cena elektřiny na denním trhu OTE se v Česku běžně pohybuje mezi 1 a 4 Kč/kWh, ale v hodinách přebytku fotovoltaiky dokáže spadnout k nule nebo i do záporných hodnot. GPU cluster s výkonem 3 kW (8× H100 plus chlazení) při rozdílu 3 Kč/kWh mezi špičkou a údolím ušetří jen na energii přes 200 Kč za osmihodinový trénovací běh, když ho posunete z odpoledne na noc.
Pro firmy, které řeší energetiku komplexněji, dává smysl propojit plánování výpočetních úloh přímo se spotovými daty. Na spotová cena elektřiny – denní trh najdete aktuální hodinové ceny, které se dají napojit přes API na scheduler tréninkových jobů — jednoduchý cron skript, který spustí batch inference nebo fine-tuning v okně nejlevnějších čtyř hodin dne. U firem s vlastní FVE a bateriovým úložištěm je efekt ještě výraznější, protože GPU cluster se dá napájet přebytkem, který by se jinak prodával pod cenou nebo vůbec.
Tohle je přesně oblast, kde se energetické poradenství potkává s IT provozem. Energetické poradenství SES dnes běžně řeší nejen výrobní linky a chlazení skladů, ale i serverovny s AI zátěží — protože z pohledu distribuční soustavy je GPU cluster jen další flexibilní odběr, který se dá zapojit do řízení výkonové rovnováhy.
Legislativa, která na GPU farmy dopadá, ať chcete nebo ne
Kategorie tohoto článku není náhoda. EU AI Act, platný od srpna 2024 s postupným náběhem povinností do roku 2027, ukládá provozovatelům AI systémů s vysokým rizikem mimo jiné dokumentovat spotřebu výpočetních zdrojů a energetickou náročnost trénování. Zatím se to týká hlavně velkých modelů, ale trend je jasný — Brusel chce vědět, kolik energie AI reálně spotřebuje, podobně jako to řeší u datacenter obecně přes Energy Efficiency Directive.
K tomu se přidává CSRD (Corporate Sustainability Reporting Directive) — firmy nad určitou velikostí musí reportovat uhlíkovou stopu, a GPU cluster běžící 24/7 na síti se špinavým mixem se v tom reportu neschová. Efektivnější plánování zátěže podle spotové ceny a podílu obnovitelných zdrojů v síti tak není jen otázka nákladů, ale i compliance.
V Česku k tomu přistupuje novela energetického zákona umožňující sdílení elektřiny mezi odběrnými místy od roku 2024 — firma s FVE na jedné budově může přebytky posílat přímo na serverovnu s GPU v jiné budově, bez prodeje do sítě a zpětného nákupu se ztrátou. Princip si můžete prostudovat na sdílení elektřiny nebo přímo v sekci pro firmy.
Praktický návod: jak GPU management skutečně zlevnit
Konkrétní kroky, které fungují v praxi:
Zaprvé, nasaďte lokální inferenci přes Ollama pro interní use case, kde nepotřebujete GPT-4 třídu modelu. Llama 3.1 8B nebo Mistral 7B v kvantizaci Q4 běží slušně i na jedné RTX 4090 (cca 45 000 Kč) a pro chatboty, sumarizaci dokumentů nebo interní vyhledávání to bohatě stačí. Nulové API poplatky, data zůstávají ve firmě.
Zadruhé, pro doladění na vlastní data nepoužívejte full fine-tuning. LoRA (Low-Rank Adaptation) sníží nároky na paměť a čas o řád — model 7B doladíte na jediné 24GB kartě za pár hodin místo multi-GPU clusteru na týden. Knihovny PEFT a bitsandbytes od Hugging Face (https://huggingface.co) to mají hotové jako balíček, stačí `pip install peft bitsandbytes transformers`.
Zatřetí, pro dávkové úlohy (batch inference, embeddingy pro RAG) používejte spot instance s automatickým checkpointováním — pokud vám poskytovatel kartu odebere, job se restartuje odtud, kde skončil, a vy platíte třetinovou cenu oproti on-demand.
Začtvrté, monitorujte a škrtejte nemilosrdně. Instance, která běží přes noc bez joblistu, je stejný odpad jako rozsvícené světlo v prázdné kanceláři.
K tématu necenzurovaných open-weight modelů — na Hugging Face najdete varianty bez RLHF cenzury (např. dolphin fine-tuny na Mistralu), které jsou legální ke stažení a použití pro výzkum i komerčně dle licence. Otázka není legalita, ale odpovědnost provozovatele za výstup, což je přesně to, co řeší zmíněný AI Act.
Kde končí IT a začíná energetika
GPU cluster, spotová cena elektřiny a bateriové úložiště jsou dnes tři části jedné rovnice. Firmy, které to propojí, neplatí za nevytížený hardware ani za drahé hodiny na síti. Kdo chce vidět, jak to vypadá v praxi u výrobců i odběratelů, najde konkrétní čísla na reference a projekty SES nebo si spočítá vlastní scénář přes ceník.
Podobně o propojení AI zátěže a chytré sítě píše ElectricShare.cz, a přehled o virtuálních elektrárnách a optimalizérech najdete na SmartEnergyShare.cz.
Predikce na příští dva roky: firmy, které dnes GPU cluster provozují bez ohledu na spotovou cenu, budou za rok platit citelně víc — nejen kvůli elektřině, ale kvůli reportovací povinnosti, kterou jim nikdo nedovolí ignorovat. Kdo propojí IT infrastrukturu s energetickým poradenstvím teď, ušetří na obou frontách zároveň. Zbytek bude dohánět audit, který nikdo nechce vidět.
Chcete vědět, kolik reálně stojí váš nevytížený hardware v korunách za měsíc? Registrace na energetické platformě SES trvá pět minut a první konzultace ukáže víc, než čekáte.
Zdroje
- OTE – Operátor trhu s elektřinou, denní trh
- ERÚ – Energetický regulační úřad
- oEnergetice.cz
- IEA – Electricity 2026, data centres and AI
- Hugging Face – open models a nástroje
Obchodujete s batteriovými úložišti nebo hledáte partnera pro flexibilitu a day trading elektřiny? SmartEnergyShare nabízí kompletní řešení pro BESS projekty od 50 do 250 kW — obchodování flexibility, SVR služby a IoT monitoring. Zjistěte víc →
Další články na toto téma najdete na: SmartEnergyShare.cz Firma platila 4,2 milionu za elektřinu. Poradce jí ukázal... Vice o run ai