Přeskočit na obsah Přejít na navigaci

Používáme soubory cookies

Soubory cookies využíváme k analýze návštěvnosti, zapamatování preferencí a zlepšování použitelnosti webu. Souhlas udělíte kliknutím na tlačítko "Souhlasím".

Nastavení Souhlasím

Souhlas můžete také odmítnout.

Open Science centrum

Čištění dat obecně

Čištění výzkumných dat: vysvětlení a postup

Výzkumná data mohou zahrnovat mnoho různých typů informací, například pozorování, měření, odpovědi z dotazníků, textové popisy, záznamy z přístrojů, obrázky nebo kategorizace. Výzkumníci mohou data sbírat a zaznamenávat různými způsoby. Mohou používat odlišné názvy, zkratky, formáty dat, desetinné oddělovače, jazyky, měrné jednotky nebo kódy pro chybějící hodnoty.

Tyto rozdíly se mohou snadno hromadit, zejména pokud data sbírá více lidí, pocházejí z různých lokalit nebo výzkum probíhá po mnoho let.

Čištění dat je proces identifikace a řešení těchto problémů. Může zahrnovat například kontrolu a odstranění duplicit, řešení neúplně vyplněných polí, sjednocení názvů, kategorií, jednotek a dat, změnu struktury tabulek nebo vyjasnění kódů pro chybějící hodnoty. Cílem je zajistit, aby bylo možné data správně používat, interpretovat, sdílet, uchovávat a opětovně využívat.

Zlaté pravidlo: Původní (raw) data nikdy neměňte. Každý krok čištění, transformaci nebo překódování zdokumentujte v záznamu o čištění dat (cleaning log), souboru README, skriptu nebo jiným vhodným způsobem.

 

Proč je čištění dat důležité?

I malé nekonzistence mohou později způsobit značné nejasnosti: dvě pole se stejným významem, ale odlišným názvem; rozdílný desetinný oddělovač; nesprávný symbol / znaménko; překlep; nejednoznačný symbol pro chybějící hodnotu mohou výrazně zkomplikovat analýzu a interpretaci dat a vést k chybám při prezentaci výsledků. Včasné čištění a uspořádání dat umožňuje odhalit potenciální problémy a nedorozumění při analýze, interpretaci a prezentaci výsledků. Jde o důležitý krok, který zvyšuje srozumitelnost dat a jejich hodnotu pro analýzu, sdílení, dlouhodobé uchovávání a opětovné využití.

Zároveň ostatním umožňuje pochopit, jak data vznikla a jaké úpravy byly provedeny při vytváření jejich finální podoby.

 

Hlavní kroky čištění dat

Proces obvykle zahrnuje šest kroků:

KrokHlavní účelCo udělatPříklad
1. Zkontrolujte raw (původní) data Porozumět datovému souboru před provedením jakýchkoli změn a identifikovat zjevné chyby nebo nekonzistence. Zkontrolujte názvy sloupců, jednotky, data, kategorie, číselné rozsahy, chybějící hodnoty, duplicity a vztahy mezi tabulkami. Nejasné hodnoty dohledávejte zpět k původnímu zdroji. Stejné datum může být uvedeno jako 15.04.2026, 2026-04-15 nebo 15/04/2026. Překlep může způsobit, že bude místo roku 2026 uveden rok 2025.
2. Sjednoťte názvy a kategorie Zajistit konzistentní názvy proměnných a kategoriální hodnoty v celém datovém souboru. Sjednoťte pravopis, používání velkých a malých písmen, zkratky, překlady a mezery. Kde je to užitečné, zachovejte původní označení, zejména u vícejazyčných datových souborů. Oak, oak, OAK, Oak a Oka mohou představovat stejný druh — před jejich sloučením je však třeba tuto skutečnost ověřit.
3. Identifikujte a vyjasněte chybějící nebo neplatná data Určit, které hodnoty skutečně chybějí nebo jsou neplatné, a zjistit proč. Vyhledejte kódy jako N/A, -99, 9999, ?, unknown. Před jejich nahrazením nebo odstraněním ověřte jejich význam v dokumentaci, poznámkách nebo s výzkumným týmem. -99 může v jednom datovém souboru znamenat „chybějící hodnotu“, ale v jiném může jít o platnou zápornou hodnotu.
4. Sjednoťte jednotky a formáty Zajistit, aby měření a formáty byly konzistentní napříč všemi datovými zdroji. Převeďte hodnoty na společné jednotky, sjednoťte formáty dat a čísel a zdokumentujte všechny transformace. Zkontrolujte chyby při zadávání dat. Převeďte měření zaznamenaná v m, cm a mm na jednu společnou jednotku. Zkontrolujte chyby, například hodnotu 150 namísto 15,0.
5. V případě potřeby změňte strukturu datového souboru Uspořádat data do struktury vhodné pro analýzu. Oddělte více hodnot uložených v jedné buňce, v případě potřeby změňte strukturu širokých tabulek a usilujte o to, aby jeden řádek odpovídal jednomu pozorování a jeden sloupec jedné proměnné. Dvanáct samostatných sloupců pro jednotlivé měsíce lze převést na jeden sloupec měsíc a jeden sloupec hodnota.
6. Zkontrolujte, zdokumentujte a uložte vyčištěný datový soubor Ověřit, že proces čištění nezavedl nové chyby, a uchovat reprodukovatelný záznam všech změn. Znovu spočítejte záznamy a kategorie, zkontrolujte chybějící hodnoty a rozsahy, ověřte vazby mezi soubory, porovnejte vybrané záznamy s původními daty a uložte vyčištěný datový soubor samostatně. Všechny změny zdokumentujte v záznamu o čištění dat nebo v souboru README. Opětovné spočítání jedinečných kategorií po standardizaci může odhalit, zda nebyla některá důležitá kategorie omylem vynechána.

 

Jak vám může pomoci Open Science centrum MENDELU

Pokud máte hotový nebo téměř hotový datový soubor, který chcete sdílet, archivovat v repozitáři nebo přiložit k publikaci, tým Data Stewardů Open Science centra MENDELU vám může pomoci s jeho přípravou.

V závislosti na konkrétním projektu vám můžeme pomoci například s:

  • kontrolou struktury a formátů datových souborů,
  • identifikací potenciálních technických problémů a nekonzistencí,
  • standardizací proměnných, kategorií, měrných jednotek a dat,
  • pomoci s výběrem vhodné terminologie a dokumentací vícejazyčných dat,
  • vytvořením opakovatelného postupu čištění dat,
  • přípravou dokumentace (README, codebook, datový slovník, cleaning log),
  • kontrolou, zda soubory a dokumentace odpovídají požadavkům datového repozitáře nebo odborného časopisu.

Nerozhodujeme o odborném významu vašich dat; interpretace dat a rozhodnutí týkající se oprav, vyřazování hodnot, překladů nebo zacházení s chybějícími údaji zůstávají plně v odpovědnosti výzkumníků.

Můžeme vám však pomoci s jejich technickým zpracováním. Vaše data jsou zpracovávána bezpečně a důvěrně a jsou chráněna před neoprávněným přístupem nebo zveřejněním.

 

Kontaktujte tým Data Stewardů

Pokud připravujete datový soubor pro datový repozitář nebo institucionální repozitář, můžete se obrátit na MENDELU Open Science centrum a domluvit si úvodní konzultaci. Krátký dotazník nám pomůže zjistit typ a strukturu vašeho datového souboru, fázi projektu, zamýšlený datový repozitář a cílové uživatele dat a případné požadavky týkající se jazyka nebo dokumentace.

Na základě těchto informací následně můžeme společně určit, ve kterých částech procesu čištění a dokumentace dat by pro vás byla naše podpora nejpřínosnější.

Sjednat konzultaci

Software a nástroje

Pro čištění dat lze využít řadu programů a nástrojů, například statistický software (R, Stata, SPSS), tabulkové procesory (Excel, Google Sheets), specializované nástroje pro čištění dat (např. OpenRefine) nebo skriptovací/programovací jazyky (např. R a Python). Výběr nástroje závisí na složitosti a velikosti datového souboru, dovednostech vašeho týmu a také na tom, zda budete chtít stejný postup čištění v budoucnu opakovat. Pro ruční čištění malého a jednoduchého datového souboru může být tabulkový procesor dostačující.

Pokud jsou však data rozsáhlá nebo komplexní, případně budete podobné kroky čištění opakovat, je zpravidla vhodnější použít skriptovaný postup v R nebo Pythonu, který je lépe reprodukovatelný a udržovatelný.

Bez ohledu na zvolený nástroj je důležité všechny kroky čištění dokumentovat.

 

Praktický návod

Open Science centre MENDELU prepared data cleaning tutorials for researchers using RStudio and Excel / PowerQuery.

Výzkumníci používající R mohou využít Nápovědu pro R, kde je zaznamenán jeden z možných postupů čištění dat (od importu a kontroly přes organizaci a úpravy až po závěrečnou kontrolu a uložení dat). Nápověda pro R představuje jeden praktický příklad workflow pro čištění dat. Nejde o povinný postup a výzkumníci mohou využít jiné nástroje nebo metody, které lépe odpovídají jejich datům. V budoucnu mohou být doplněny návody pro další nástroje.

Ke stažení: Nápověda pro RStudio - Od raw dat k čistým datům v R (EN)