Proč je Gradio najednou zajímavější než další hezké demo

NADPIS: Za 25 000 Kč si postavíte vlastní AI laboratoř. Gradio z ní udělá klikací aplikaci za hodinu
Mac mini s M4 má maximální příkon 155 W. To je méně než slušná herní grafika v zátěži. Přesto na něm dnes spustíte lokální jazykový model, vyrobíte vyhledávání nad vlastními dokumenty a celé to zabalíte do webové aplikace. Bez Kubernetes. Bez poradce s hodinovkou jako právník. Bez toho, aby interní data odletěla do cizího cloudu a už se nikdy nevrátila.
Proč je Gradio najednou zajímavější než další hezké demo
Gradio dlouho působilo jako nástroj pro rychlé ukázky modelů. Jeden vstup, jeden výstup, pár řádků Pythonu a hotovo. Jenže nový směr je praktičtější. `gr.Workflow` dělá z AI aplikace graf. Uzly, porty, propojení, mezivýsledky. V praxi to znamená, že neřešíte jen „chatbot odpověděl špatně“. Vidíte, kde se to rozbilo. Špatný dotaz do vyhledávání. Slabý embedding. Příliš dlouhý kontext. Model, který si vymyslel paragraf.
Téma „Wire It, Run It, Deploy It“ sedí přesně. Nejdřív workflow poskládáte. Pak ho spustíte lokálně. Nakonec ho vystavíte jako aplikaci nebo API. Gradio umí běžet na notebooku, pracovním desktopu, serveru i na Hugging Face Spaces. Základ je směšně krátký:
```python import gradio as gr
gr.Workflow().launch() ```
Tohle samo o sobě nevydělá ani korunu. Ale otevře plátno, kde můžete propojit model z [Hugging Face](https://huggingface.co), vlastní Python funkci, dataset a výstupní komponentu. Pro energetickou firmu to může být pipeline: načti data z měření, najdi relevantní smlouvy, shrň riziko podle AI Actu a GDPR, navrhni odpověď zákazníkovi. Pro obec: seber spotřebu budov, spoj ji s vývojem cen, připrav podklady pro komunitní energetiku. Kdo řeší sdílení elektřiny, může začít u konkrétního popisu služby na sdílení elektřiny a technickou logiku workflow napojit na měření, smlouvy a fakturaci.
Kategorie „Legislativa“ tu není omylem. AI workflow není jen hračka pro vývojáře. Jakmile zpracovává smlouvy, osobní údaje, měření spotřeby nebo doporučení pro obchodování s elektřinou, vstupuje do hry GDPR, kyberbezpečnost, auditovatelnost a evropský AI Act. A najednou je velmi užitečné vidět každý krok pipeline. Černá krabička je fajn do marketingu. U právního sporu je to drahá legrace.
Lokální hardware: Apple, Linux a účet za elektřinu
Apple nové desktopy tlačí jako stroje pro Apple Intelligence a profesionální práci. Z technických specifikací je ale pro AI vývojáře důležitější něco jiného: sjednocená paměť. Mac mini s M4 začíná na 16 GB RAM, M4 Pro může mít 48 GB. Mac Studio s M4 Max jde podle konfigurace až na 128 GB, varianta s M3 Ultra až na 256 GB sjednocené paměti. Paměťová propustnost se u Mac Studia dostává na 546 GB/s u M4 Max a 819 GB/s u M3 Ultra. To jsou čísla, která začínají dávat smysl pro lokální inferenci větších modelů.
Cena? Mac mini M4 v Česku typicky startuje kolem 17 až 20 tisíc Kč podle konfigurace a obchodu. Rozumnější AI konfigurace s 24 GB RAM a větším SSD se snadno dostane přes 25 tisíc Kč. Mac Studio je jiná liga. Tam se bavíme o částkách, které v menší firmě projdou spíš jako investice než jako „nový počítač pro kolegu“. Výhoda je ticho, nízký odběr a jednoduchost. Nevýhoda je horší kompatibilita některých CUDA nástrojů. NVIDIA ekosystém má pořád náskok, zvlášť při trénování.
Alternativa je Linuxová pracovní stanice s RTX 4070 Ti Super, RTX 4080 Super nebo bazarovou RTX 3090 s 24 GB VRAM. Tady dostanete CUDA, PyTorch bez akrobacie a lepší podporu pro trénování LoRA adaptérů. Spotřeba ale vystřelí. Celá sestava v zátěži může brát 450 až 700 W. Když běží osm hodin denně, už to není akademická položka. U firem, které sledují spotové ceny, dává smysl plánovat dávkové trénování na levnější hodiny. Praktický přehled cen najdete třeba přes spotové ceny elektřiny. Kdo má fotovoltaiku a baterii, může AI výpočty posouvat do doby přebytků. Zní to jako detail. Pak přijde faktura.
Mac je výborný pro lokální prototypy, RAG, menší modely, embeddingy a inference přes Ollama nebo MLX. Linux s NVIDIA kartou je pořád lepší pro těžší finetuning. Cloud se vyplatí, když potřebujete krátkodobě velký výkon. Jen pozor na data. U smluv, měření domácností nebo interních obchodních strategií není otázka „kolik stojí GPU hodina“ jediná podstatná otázka.
Praktický základ: Ollama, Hugging Face, Gradio a první workflow
Nejrychlejší cesta vede přes Python virtuální prostředí. Na Macu nebo Linuxu stačí:
```bash python -m venv .venv source .venv/bin/activate pip install gradio sentence-transformers transformers accelerate ```
Pro lokální modely je pohodlná Ollama:
```bash ollama pull granite3.3:8b ollama run granite3.3:8b ```
Až budou konkrétní kvantované varianty Granite 4.2 dostupné ve vaší oblíbené distribuci, princip zůstane stejný. IBM u Granite 4.2 popisuje tři velikosti: 3B, 8B a 30B parametrů, licenci Apache 2.0, nativní režim „thinking“ a kontext 128 tisíc tokenů, u 30B s rozšířením až na 512 tisíc tokenů. To je přesně kategorie modelů, které dávají smysl pro firemní asistenty. Ne proto, že by byly kouzelné. Protože licence dovoluje komerční použití a dokumentace mluví o transparentnosti.
Jednoduchá Gradio aplikace nad lokálním API může vypadat takto:
```python import gradio as gr import requests
def odpovez(dotaz): r = requests.post( "http://localhost:11434/api/generate", json={"model": "granite3.3:8b", "prompt": dotaz, "stream": False}, timeout=120, ) return r.json()["response"]
gr.Interface( fn=odpovez, inputs=gr.Textbox(label="Dotaz"), outputs=gr.Markdown(label="Odpověď"), ).launch() ```
Tohle je minimum. Skutečný workflow ale přidá vyhledávání v dokumentech, kontrolu zdrojů, logování a jasné oddělení systémových instrukcí od vstupu uživatele. Pro energetiku to může znamenat databázi smluv, provozní data z elektroměrů, dokumenty ERÚ a interní metodiky. Napojení na IoT monitoring je typický příklad: data z měření nejsou jen graf v dashboardu. Mohou být vstupem pro predikci spotřeby, detekci anomálií nebo přípravu podkladů pro sdílení elektřiny.
Gradio má jednu podceňovanou výhodu. Není to jen webové okno. Každá aplikace může mít API. Vývojář tedy postaví workflow pro lidi a zároveň endpoint pro další systémy. To se hodí, když má AI nejdřív pomáhat operátorovi a později se má stát součástí automatizace. Rozumné pořadí. Nejdřív člověk ve smyčce. Teprve potom větší autonomie.
Multi-vector embeddingy: když obyčejné RAG začne kulhat
Klasické RAG vyhledávání často funguje tak, že dokument převedete na jeden vektor. Dotaz také. Pak hledáte nejbližší sousedy. Pro mnoho věcí to stačí. Jenže právní texty, technické normy a energetické smlouvy jsou zákeřné. Jeden odstavec může obsahovat výjimku, definici, datum účinnosti i sankci. Jeden vektor to někdy splácne do průměru. A průměr je v právu nebezpečný sport.
Multi-vector modely ve stylu ColBERT pracují jemněji. Neudělají z celého textu jednu tečku v prostoru. Reprezentují více tokenů nebo částí textu a při vyhledávání používají pozdní interakci, typicky přes MaxSim. Sentence Transformers dnes mají pro multi-vector encoder vlastní dokumentaci a trénovací postupy. Výhoda je přesnější vyhledávání pro doménový jazyk. Nevýhoda je větší index a náročnější inference.
Praktický scénář: máte 5 000 smluv o výkupu, sdílení a flexibilitě. K tomu rozhodnutí regulátora, provozní pravidla, ceníky a obchodní podmínky. Uživatel se zeptá: „Může domácnost s FVE sdílet přebytky do odběrného místa rodičů a jak se řeší odpovědnost za odchylku?“ Jednovektorový embedding najde obecný článek. Multi-vector model má větší šanci trefit odstavec, kde je přesná podmínka.
Finetuning nemusí být obří projekt. Začněte se stovkami až tisíci dvojic dotaz-dokument. Vytáhněte reálné otázky ze zákaznické podpory, anonymizujte je, přidejte ručně potvrzený relevantní úryvek. Pak trénujte doménový embedding model. LoRA se hodí hlavně u jazykových modelů, ale princip je stejný: neměnit všechno, upravit jen tolik, aby model pochopil váš slovník. „SVR“, „flexibilita“, „odběrné místo“, „EAN“, „agregace“ a „komunitní energetika“ nejsou pro obecný model vždy samozřejmé.
U energetických projektů se vyplatí číst i mimo čistě AI bublinu. Dobré praktické kontexty k virtuálním elektrárnám a optimalizérům najdete na smartenergyshare.cz, širší pohled na chytré sítě a AI v energetice zase na smartenergyshare.info. AI bez domény je jen drahý našeptávač. Doména bez AI je často Excel s bolestí zad.
Legislativa: AI Act, GDPR a proč logy nejsou nudné
Evropský AI Act posouvá debatu od „model umí hezky psát“ k otázce, kdo za systém odpovídá. U běžného interního asistenta nemusíte hned panikařit. U nástrojů, které rozhodují o přístupu ke službám, vyhodnocují riziko zákazníka nebo automaticky doporučují obchodní kroky, už je potřeba přemýšlet ostřeji. Ne právnickou mlhou. Konkrétně.
První pravidlo: oddělte model od rozhodnutí. AI může připravit návrh. Člověk schválí. Gradio workflow to umí udělat civilizovaně. Jeden uzel načte data. Druhý vyhledá zdroje. Třetí vygeneruje návrh. Čtvrtý zobrazí citované pasáže. Pátý uloží schválení. Když přijde audit, máte stopu. Ne jen větu „to řekla umělá inteligence“, což je asi tak užitečné jako účtenka vytištěná na vodě.
Druhé pravidlo: osobní údaje držte pod kontrolou. Měření spotřeby domácnosti může prozradit víc, než se zdá. Kdy jsou lidé doma. Kdy topí. Kdy nabíjejí elektromobil. Kdy je objekt prázdný. Pokud data posíláte do cloudu, musíte řešit právní základ, zpracovatele, lokalitu dat a dobu uchování. Lokální inference na Macu nebo vlastním serveru nevyřeší všechno, ale snižuje plochu problému. Pro domácnosti a malé výrobce se hodí začít u srozumitelného modelu služby, třeba přes řešení pro domácnosti nebo řešení pro výrobce FVE.
Třetí pravidlo: logujte vstupy, výstupy, verze modelů a zdroje. Ne donekonečna. Ne bezhlavě. Ale tak, aby šlo rekonstruovat, proč systém doporučil konkrétní krok. U modelů z Hugging Face si ukládejte přesné ID modelu, hash revize a konfiguraci. U vlastního finetuningu také datasetovou verzi. Když vyměníte embedding model, může se změnit vyhledávání. Když se změní vyhledávání, změní se odpověď. A když se změní odpověď v právním nebo energetickém procesu, někdo se zeptá proč.
Nasazení: lokálně, na Spaces, nebo za firewallem
Gradio workflow můžete nasadit třemi rozumnými způsoby. Lokálně pro vývojáře. Na interním serveru pro firmu. Na Hugging Face Spaces pro veřejnou ukázku nebo neprodukční prototyp. Příkaz `gradio deploy` je lákavý, protože je jednoduchý. Jenže jednoduchost nesmí porazit bezpečnost. Pokud aplikace pracuje s veřejnými modely a ukázkovými daty, Spaces jsou skvělé. Pokud zpracovává smlouvy zákazníků, měření odběrných míst nebo obchodní strategii, dejte ji za firemní přihlášení a audit.
Produkční varianta může vypadat takto: Gradio běží jako interní web. Model servíruje Ollama, vLLM nebo Text Generation Inference. Dokumenty jsou v PostgreSQL s rozšířením pgvector, Qdrantu nebo Weaviate. Citlivé soubory zůstávají v interním úložišti. Workflow má endpointy pro napojení na další systémy. Přístup je přes SSO. Logy jdou do centrálního monitoringu. Ano, zní to méně romanticky než „AI agent sám řídí firmu“. Zato to přežije první bezpečnostní schůzku.
Náklady jsou překvapivě škálovatelné. Pro jednotlivce: Mac mini nebo notebook, Ollama, Gradio, open-source model. Pro malou firmu: jedna pracovní stanice s RTX 4090 nebo Mac Studio, interní Git, vektorová databáze. Pro větší provoz: server s více GPU, fronty úloh, oddělené prostředí pro test a produkci. V energetice se navíc vyplatí sledovat cenu provozu. Kdo kombinuje AI výpočty s bateriovým úložištěm, může číst i BESS Global Blog, protože baterie už dávno nejsou jen téma pro solární nadšence.
A kde do toho zapadá Smart Energy Share? Přesně v místech, kde se data, legislativa a provoz potkávají. Sdílení, flexibilita, měření, spotové ceny, zákaznické dotazy. AI workflow nemá nahradit energetika ani právníka. Má jim sebrat rutinu, najít relevantní pasáže a ukázat, na čem odpověď stojí. To je méně sexy než autonomní agent. A mnohem použitelnější.
Co bych stavěl jako první
Nezačínal bych chatbotem „na všechno“. To je drahý způsob, jak vyrobit zmatené okno s textem. Začal bych úzkým workflow: dotaz zákazníka, vyhledání v dokumentech, návrh odpovědi, citace zdrojů, schválení člověkem. Jeden proces. Jedna metrika. Třeba snížení času odpovědi z 20 minut na 5 minut. Nebo snížení počtu chyb při vysvětlování sdílení elektřiny.
Druhý dobrý projekt je interní legislativní asistent. Vstupem jsou dokumenty ERÚ, smluvní šablony, metodiky, obchodní podmínky a veřejné zdroje. Výstupem není „právní rada“. Výstupem je rešerše s odkazy na konkrétní odstavce. To je důležitý rozdíl. Model má hledat, shrnovat a upozorňovat na rozpory. Rozhodnutí zůstává na člověku.
Třetí projekt je technický dohled nad daty z měření. Workflow může detekovat anomálie, vysvětlit je lidskou řečí a nabídnout další krok. Náhlý propad výroby FVE. Podezřelý profil spotřeby. Chybějící data z elektroměru. Špatně spárované odběrné místo. Tady se AI potkává s provozem, ne s prezentací pro konferenci.
Kontroverzní předpověď? Do dvou let nebude hlavní otázka, jestli firma používá AI. Bude to otázka, jestli dokáže doložit, jak její AI došla k výsledku. Kdo dnes postaví workflow s logy, verzemi modelů, citacemi a lidským schválením, nebude za dva roky panicky přepisovat půlku systému kvůli auditu. Kdo dnes připojí interní data k náhodnému chatbotu, bude mít možná rychlé demo. A pak velmi dlouhé vysvětlování.
Zdroje
- Gradio: Workflows
- Hugging Face: Granite 4.2 LLMs: How They’re Built
- Sentence Transformers: Training Multi-Vector Encoder Models
- ERÚ
- IEA: Electricity
Obchodujete s batteriovými úložišti nebo hledáte partnera pro flexibilitu a day trading elektřiny? SmartEnergyShare nabízí kompletní řešení pro BESS projekty od 50 do 250 kW — obchodování flexibility, SVR služby a IoT monitoring. Zjistěte víc →
Další články na toto téma najdete na: SmartEnergyShare.cz AWS prodává AI bloky za miliony. Tady je, jak trénovat vl... Vice o deploy local