streaming: audio po 500ms blocích, výstup =

Protokol z porady pěti lidí. Sedm tisíc slov přepisu. A ani jediná zmínka o tom, kdo co vlastně řekl. Zní povědomě? Přepisovače typu Whisper text sáhnou výborně, ale řečníky splácnou do jedné hromady. NVIDIA na to teď odpověděla modelem Sortformer z rodiny Nemotron, který umí rozdělit řeč na mluvčí v reálném čase. A stát se to děje právě teď, kdy Toyota přinutila své zaměstnance trénovat humanoidní roboty, Meta čelila závažné zranitelnosti svého asistenta Muse a OpenAI s Anthropicem slibují "více za méně peněz". Společný jmenovatel? Strojů, které poslouchají, přibývá. A potřebujeme vědět, kdo mluvil.
Kdo to řekl? Problém, který váš přepisovač stále neřeší
Automatický převod řeči na text (ASR) je dnes vyřešený problém. Whisper, Parakeet či Canary přepíšou hodinu nahrávky za pár minut. Otázka "kdo mluvil kdy" — odborně diarizace — je ale jiná liga. Model vidí zvukovou vlnu, ne lidi. Musí rozeznat, že v minutě 14:32 začal mluvit někdo jiný, přiřadit mu štítek "Speaker 2" a držet ho v tom do konce porady.
Proč je to těžké? V přirozené konverzaci se lidé překřikují zhruba v 10–20 % času. Hlasově se podobní kolegové od sebe odliší hůř než od cizince. A u reálného času přibývá požadavek, aby model rozhodoval ze zlomků zvuku, aniž by viděl budoucnost. Klasické řešení — shlukování mluvčích po skončení nahrávky — pro livestream, meeting assistant nebo call centrum nestačí. Metrikou je DER (Diarization Error Rate), tedy procento času, kdy model přiřadil řeč špatnému řečníkovi. Dobré systémy se na čistých nahrávkách vejdou pod 5 %, v pračavém open-space to bývá klidně trojnásobek.
Nemotron a Sortformer: NVIDIA vsadila na řazení řečníků
NVIDIA dodává diarizační modely v open-source toolkitu NeMo (Apache 2.0 na GitHubu) a publikuje je na Hugging Face. Klíčový model se jmenuje Sortformer. Místo tradičního postupu "nejprve oddělit řečníky, pak přepisovat" použije transformer, který přímo z audia predikuje aktivitu jednotlivých mluvčích snímek po snímku. Trik je v "třídění": model řečníky konzistentně řadí podle pořadí, v jakém se ozvali poprvé. Tím odpadá známý problém permutace štítků, který trápí starší přístupy.
Zajímavější je streamingová varianta, například model diar_streaming_sortformer_4spk-v1. Zpracovává audio po blocích s kontextovou cache a latenci drží řádově pod jednou sekundou. Limit čtyř mluvčích zní skromně, ale pro meeting, podcast či customersupport hovor to pokrývá naprostou většinu reálných scénářů. Model je veřejně ke stažení a licence dovoluje komerční nasazení — přečtěte si kartu modelu, podmínky se u NVIDIA občas mění.
Diarizace se pak slepí s přepisem. Zde NVIDIA nasazuje modely Parakeet, konkrétně verze 0.6B v3 pokrývá 25 evropských jazyků, češtinu včetně. Podle benchmarků Open ASR Leaderboard na Hugging Face patří Parakeet k nejrychlejším modelům vůbec — na serverovém GPU mluví o desítkáchnásobku reálného času. Celou sadu NVIDIA zahrnuje pod značku Nemotron, pod kterou dnes schová jak velké jazykové modely, tak speech modely. Jde o jasnou strategii: dát vědce a vývojáře zadarmo modely, prodávat pak podnikovou platformu Riva a NIM kontejnery.
Chcete ušetřit na energiích?
Zjistěte, kolik můžete ušetřit sdílením elektřiny z FVE nebo optimalizací bateriového úložiště.
Spočítat úsporu →Návod: vlastní přepisovač schůzí za jedno odpoledne
Co budete potřebovat. GPU s aspoň 12 GB VRAM — RTX 3060 stačí na single-stream v FP16, pro pohodlný běh více streamů sáhněte po RTX 4090 (24 GB). Linux nebo WSL2, Docker, hodně čtvrt hodiny trpělivosti.
Nejrychlejší cesta vede přes oficiální kontejner z NGC:
```bash docker pull nvcr.io/nvidia/nemo:latest docker run --gpus all -it --rm nvcr.io/nvidia/nemo:latest ```
Nebo klasicky přes pip:
```bash pip install "nemo_toolkit[asr]" ```
Koster řešení pak vypadá zjednodušeně takto — upozorňuji, že API se mezi verzemi NeMo mění, aktuální ukázky najdete v dokumentaci:
```python from nemo.collections.asr.models import SortformerDiarizer
diar_model = SortformerDiarizer.from_pretrained( "nvidia/diar_streaming_sortformer_4spk-v1" ) # [čas_start, čas_konec, ID_řečníka] ```
Výstup diarizace (segmenty řečníků s časovými razítky) protnete s přepisem od Parakeetu nebo Whisperu a dostanete soubor typu: `14:32:10 — Speaker 2: "Nesouhlasím s rozpočtem."` Export do JSON nebo SRT je už otázka dvaceti řádků Pythonu. Před diarizací nezapomeňte na detekci řeči (VAD) — model od Silero je malý, rychlý a zadarmo.
Bonus na závěr: na stejné GPU nechte běžet Ollama s modelem Llama 3.1 8B, kterému přepis pošlete k vyhodnocení. "Co si domluvil tým?" — a máte minute-ready protokol s přiřazením úkolů. Celý setup zvládne člověk s praxí za dvě až čtyři hodiny.
Peníze: lokální GPU versus cloud a API
Počítejme. Lokální stroj s RTX 4090 vyjde na 40–50 tisíc Kč, kancelářská RTX 3060 na zhruba 9 tisíc Kč. Spotřeba pod zátěží: 3060 kolem 170 W, 4090 až 450 W. Při české ceně elektřiny kolem 8 Kč/kWh vás hodina nepřetržitého nasazení 4090 stojí zhruba 3,5 Kč. Tisíc hodin přepisu ročně = chladné 3 500 Kč za energii. To je cena jednoho dražšího telefonu.
Cloud je pružnější. Pronájem H100 na platformách jako RunPod nebo Vast.ai se pohybuje kolem 2–3 USD za hodinu. API služby si účtují za minutu: Whisper API OpenAI má 0,006 USD/min (zhruba 8,5 Kč za hodinu zv
Chcete sdílet elektřinu, optimalizovat náklady nebo začít s obchodováním energie? SmartEnergyShare je platforma pro sdílení energie z FVE, správu bateriových úložišť a chytré řízení spotřeby. Registrace zdarma →
Další články na toto téma najdete na: Share-Electric.cz NVIDIA Cosmos 3: Robot se poprvé naučil chápat fyzický sv... Vice o welcome nvidia