Přeskočit na obsah Přejít na navigaci

Používáme soubory cookies

Soubory cookies využíváme k analýze návštěvnosti, zapamatování preferencí a zlepšování použitelnosti webu. Souhlas udělíte kliknutím na tlačítko "Souhlasím".

Nastavení Souhlasím

Souhlas můžete také odmítnout.

Open Science centrum

UWebASR – Speech to Text

Automatické rozpoznávání řeči

Od diktafonu k článku na jeden klik!

Ve výzkumech zejména v oblasti sociálních a humanitních věd jsou často využívány nahrávky mluvené řeči např. z hloubkových rozhovorů nebo diskusí v rámci fokusních skupin. Pro další zpracování těchto dat může být užitečný nástroj, který je schopen velice jednoduše převést mluvenou řeč na text přímo v prohlížeči počítače bez nutnosti instalace nové aplikace.

UWebASR byl vyvinut speciálně pro vědecké a nekomerční účely, poradí si se záznamy různé kvality i délky a zvládá také rozpoznávání historické řeči. Tyto aspekty z něj dělají nástroj aplikovatelný na širokou škálu výzkumných oblastí v sociálních a humanitních vědách.

Na vývoji se podílela Katedra Kybernetiky a Výzkumné centrum NTIS na Fakultě Aplikovaných věd Západočeské Univerzity v Plzni jako součást výzkumné infrastruktury LINDAT/CLARIAH-CZ.

 

Používání nástroje

Používání nástroje je velmi intuitivní, nejprve je potřeba zvolit jazyk a rozpoznávací model. Nástroj má v předvolbě zvolenou češtinu, dostupné jsou i další jazyky: angličtině, slovenština, němčina a další. Nástroj je vybaven instrukcemi ohledně zvolení vhodného modelu pro rozpoznání jazyka.

Následně je potřeba nahrát záznam, který má být konvertován. Nástroj podporuje běžně využívané formáty: MP3 i MP4 a další. Nástroj následně sám začne pracovat s nahraným záznamem, do několika minut se v prohlížeči objeví přepsaný text s barevným označením míry přesnosti na škále 0 až 1, je tak možné okamžitě zkontrolovat části, které byly pro nástroj hůře rozpoznatelné. Výsledný text je možné stáhnout v otevřeném formátu .txt a dále s ním pracovat v jakémkoliv jiném nástroji.

Je možné využít také samostatný UWebASR Skill pro agentní AI.

Ochrana osobních dat

Pro všechny uvedené modely rozpoznávání platí přísná pravidla ochrany osobních údajů. Modely uchovávají pouze anonymní statistiky jednotlivých relací. Zvukové nahrávky a generované přepisy jsou zpracovávány výhradně za běhu v systémové paměti a po ukončení relace jsou okamžitě smazány a nejsou nijak archivovány nebo využívány za jiným účelem.

Základní platforma běží výhradně na fyzických serverech umístěných v datovém centru Fakulty aplikovaných věd (Technická 8, Plzeň, Česká republika). Zvuk, přepisy a další rozpoznávací data nejsou sdíleny mimo tuto infrastrukturu.

Pro další informace nebo dotazy je na webu platformy uvedena kontaktní osoba: Jan Švec (honzas@fav.zcu.cz).

Nástroj a další informace o něm jsou dostupné na odkazu: UWebASR