Krátka odpoveď: Slovenčina sa v hlasovej AI delí na dve rôzne úlohy a každá je inde. Hovorenie je vyriešené, slovenčinu podporujú bežné modely na syntézu reči. Porozumenie vyriešené nie je: ten istý model dosahuje na čítanom slovenskom prejave chybovosť 9,2 percenta a na reálnejších nahrávkach 20,8 percenta, teda každé piate slovo zle. Rozdiel medzi najlepším a najhorším bežne používaným modelom je na slovenčine viac ako štvornásobný. Preto agent, ktorý v angličtine funguje bezchybne, môže po slovensky pôsobiť ako pokazený.
Toto je najčastejšia otázka, ktorú na prvom hovore dostávame: hovorí to naozaj po slovensky, alebo to bude znieť ako navigácia z roku 2010? Odpoveď je konkrétnejšia než áno alebo nie, tak sme ju rozpísali aj s číslami.
Dve úlohy, ktoré sa často miešajú do jednej
Keď povieme, že agent vie po slovensky, sú za tým tri rôzne technológie a každá môže zlyhať samostatne.
| Úloha | Čo robí | Stav v slovenčine |
|---|---|---|
| Rozpoznávanie reči | prevádza to, čo volajúci povedal, na text | najslabší článok, veľké rozdiely medzi modelmi |
| Jazykový model | rozhodne, čo agent odpovie | dobrý, ale skloňovanie a čísla treba ošetriť pravidlami |
| Syntéza reči | vysloví odpoveď nahlas | vyriešené, znie prirodzene |
Väčšina ľudí posudzuje agenta podľa toho, ako znie, teda podľa poslednej úlohy. Pritom o kvalite hovoru rozhoduje prvá. Agent s krásnym hlasom, ktorý zle počuje, je horší než agent s priemerným hlasom, ktorý rozumie.
Hovorenie: tu je slovenčina vybavená
ElevenLabs, ktorý je v tejto kategórii referenčný dodávateľ, uvádza slovenčinu v modeli Multilingual v2 s 29 jazykmi aj v modeli Flash v2.5, ktorý pokrýva 32 jazykov a má latenciu okolo 75 milisekúnd. To je z hľadiska hovoru zanedbateľný čas.
Prakticky to znamená, že prirodzene znejúci slovenský hlas dnes nie je konkurenčná výhoda ani prekážka. Je to dostupná komodita. Ak vám niekto tvrdí, že jeho prevaha je v tom, že jeho agent hovorí po slovensky, hovorí o niečom, čo má k dispozícii každý.
Rozumenie: tu sa to láme
V septembri 2025 vyšla štúdia, ktorá postavila slovenský rečový korpus z 2 806 hodín parlamentných záznamov a odmerala na ňom bežne používané modely. Sú to najlepšie verejné čísla o slovenčine, aké poznáme, a stoja za pozretie.
Chybovosť sa udáva ako WER, teda podiel zle prepísaných slov. WER 20 percent znamená, že v každej vete o desiatich slovách sú dve slová zle.
Z toho grafu vyplývajú tri veci, ktoré majú priamy dopad na to, ako bude váš agent fungovať.
Voľba modelu rozhoduje viac než čokoľvek iné. Medzi Whisper Small a Large-v3 je na tej istej slovenčine rozdiel z 58,4 na 20,8 percenta. Lacnejšia zostava teda nie je o niečo horšia, je nepoužiteľná. Ak dodávateľ šetrí práve tu, spoznáte to na prvom reálnom hovore.
Ten istý model dá veľmi rôzne čísla podľa toho, čo počúva. Large-v3 má na čítanom prejave zo sady FLEURS 9,2 percenta, na sade Common Voice 20,8 percenta. Čítaný text v tichu je iná úloha než človek, ktorý hovorí z auta. Preto sú ukážkové nahrávky v ideálnych podmienkach také nespoľahlivé meradlo.
Doladenie na slovenských dátach pomáha zásadne. Po doladení klesol Large-v3 na 11,6 a 5,5 percenta a Whisper Small sa priblížil pôvodnému výkonu Large-v3. Slovenčina teda nie je pre modely nezvládnuteľná, len sa jej treba venovať.
Doplniť treba, že špecializované modely sú dnes na slovenčine ďalej než všeobecný Whisper: ElevenLabs radí slovenčinu vo svojom modeli Scribe v2 do najvyššieho pásma presnosti s chybovosťou do 5 percent, pričom verzia pre reálny čas má latenciu okolo 150 milisekúnd. To je stav, pri ktorom sa telefonovanie po slovensky správa normálne.
Čo sa v slovenskom hovore kazí najčastejšie
Toto už nie sú čísla zo štúdie, ale to, čo vidíme v prepisoch produkčných hovorov. Poradie je podľa toho, ako často to zákazník zaregistruje.
- Skloňovanie mien. Model meno správne prepíše, ale potom povie dobre, pán Kováčová alebo objednám vás, pani Kováč. Chyba trvá pol sekundy a dôveru zhodí okamžite.
- Čísla a sumy. Telefónne čísla, ceny a dátumy sú miesto, kde model najľahšie skĺzne do anglického spôsobu čítania alebo číslicu vysloví po skupinách, ktoré Slovák nepoužíva.
- Adresy. Kombinácia názvu ulice, čísla domu a mesta je pre prepis najťažšia veta v celom hovore. Ak agent objednáva obhliadku alebo výjazd, práve tu sa rozhoduje o použiteľnosti.
- Miešanie slovenčiny a češtiny. Bez výslovného pravidla model občas poskladá vetu z oboch jazykov. Čech si to nevšimne, Slovák áno.
- Diakritika a hovorová reč. Rýchla reč, nárečové tvary a skracovanie zvyšujú chybovosť. Nie natoľko, aby hovor nefungoval, ale natoľko, aby sa oplatilo testovať na reálnych ľuďoch, nie na kolegoch.
Dobrá správa je, že prvé štyri body sa riešia pravidlami v nastavení agenta, nie výmenou technológie. Zlá správa je, že ich niekto musí napísať, otestovať a po stovkách hovorov doladiť. Toto je práca, ktorú v cenníku platformy nekúpite.
Latencia: čo sme reálne namerali
Priemer od konca vety volajúceho po prvé slovo agenta je na našich produkčných hovoroch v slovenčine približne 950 milisekúnd. Je to pod hranicou jednej sekundy, ktorú človek vníma ako prirodzenú pauzu v rozhovore, a rozklad celého okruhu na štyri kroky rozoberáme v článku Ako funguje AI hlasový agent v slovenčine.
Zámerne netvrdíme, že slovenčina je pomalšia než angličtina. Nemáme na to meranie tej istej zostavy v oboch jazykoch, takže by to bol odhad vydávaný za dáta.
Trojminútový test, ktorý odhalí viac než hodinová prezentácia
Vypýtajte si testovací hovor a povedzte v ňom presne toto:
- Svoje priezvisko. Sledujte, či ho agent zopakuje správne a či ho neskôr správne vyskloňuje.
- Adresu s číslom domu. Napríklad Hviezdoslavova 14, Prešov.
- Dátum a čas. Napríklad v utorok o pol štvrtej.
- Telefónne číslo naraz, bez pauzy. Tak, ako ho hovoria zákazníci.
- Otázku mimo témy. Napríklad či máte otvorené na Vianoce. Agent má povedať, že to nevie, nie si to vymyslieť.
- Prepnutie do češtiny uprostred hovoru. Ak obsluhujete aj český trh.
Potom si vyžiadajte prepis hovoru. Ak vám ho dodávateľ nevie dať, je to samostatná informácia.
Čo si z toho odniesť
Otázka vie to po slovensky je zle položená, pretože odpoveď je vždy áno. Lepšia otázka je aký model použijete na rozpoznávanie reči a ako ste ošetrili skloňovanie mien a čítanie čísel. Dodávateľ, ktorý na to vie odpovedať konkrétne, sa slovenčine venoval. Dodávateľ, ktorý odpovie, že používa najmodernejšiu AI, sa jej nevenoval.
Súvisiace články
- Ako funguje AI hlasový agent v slovenčine: čo sa deje počas 950 milisekúnd
- Zahraničné AI platformy verzus agent na mieru
- AI Act a hlasový agent: čo pre firmy platí od 2. augusta 2026
Zdroje
- A 2800-Hour Slovak Speech Corpus from Parliamentary Data (arXiv 2509.19270, 23. 9. 2025): korpus 2 806 hodín slovenskej reči a 60 miliónov slov prepisov, namerané chybovosti Whisper Small, Medium, Large-v3-Turbo a Large-v3 na sadách Common Voice 21 a FLEURS, pred doladením aj po ňom.
- ElevenLabs: Text to Speech: slovenčina v modeloch Multilingual v2 (29 jazykov) a Flash v2.5 (32 jazykov, latencia okolo 75 ms).
- ElevenLabs: Speech to Text: Scribe v2 s viac ako 90 jazykmi, slovenčina v pásme presnosti s chybovosťou do 5 percent, verzia pre reálny čas s latenciou okolo 150 ms.