Ve většině firem, které rostly několik let, existuje stejná firma v systému vícekrát. Jednou ji založil obchodník po telefonátu, jednou vznikla automaticky z objednávky v e-shopu, jednou ji přinesla fakturace z jiné firmy při převzetí zakázky. Každý záznam má trochu jiný název, jiné IČO vyplněné nebo nevyplněné, jiný kontakt. Nikdo neví s jistotou říct, který z nich je aktuální.
Toto není důsledek nedbalosti. Je to přirozený výsledek toho, že zákazník do firmy vstupuje více kanály najednou, a každý z nich měl svůj vlastní způsob, jak záznam založil.
Proč duplicity vznikají
- Různé kanály vstupu. Obchodník, e-shop, fakturační systém, marketingový formulář — každý může vytvořit nový záznam, pokud si nevšimne, že zákazník už existuje.
- Překlepy a varianty názvu. „ABC s.r.o.", „ABC, s. r. o." a „ABC spol. s r.o." jsou pro systém tři různé řetězce, ačkoli jde o stejnou firmu.
- Změna údajů v čase. Firma změní sídlo, statutára nebo se přejmenuje po akvizici — starý záznam zůstává a nový vzniká vedle něj.
- Chybějící jednoznačné pravidlo při zakládání. Pokud systém nevynucuje kontrolu podle IČO nebo jiného jednoznačného identifikátoru před založením nového záznamu, duplicita vznikne při první nepozornosti.
Co se dá čistit automaticky
Nalezení kandidátů na duplicitu. Porovnání podle IČO je jednoznačné a bezpečné — dvě firmy se stejným IČO jsou stejná firma s jistotou. Porovnání podle názvu a adresy je pravděpodobnostní: podobnost textu, podobná adresa, stejné telefonní číslo. To umí systém navrhnout jako pravděpodobný pár, ne potvrdit.
Normalizace formátu. Sjednocení zápisu — velikost písmen, mezery, diakritika, formát telefonního čísla. To je bezpečná automatizace, protože nemění význam dat, jen jejich tvar.
Doplnění chybějících údajů z veřejných registrů. Pokud má záznam IČO, ale chybí mu právní forma nebo aktuální adresa, dá se doplnit z veřejně dostupného registru. To jsme podrobněji rozebrali v případové studii automatizovaného ověřování údajů z veřejných registrů, princip je stejný i u jednoduššího doplňování záznamů.
Upozornění na podezřelý duplicitní zápis při zakládání. Místo čištění po faktu je účinnější zabránit vzniku duplicity už při zakládání nového záznamu — systém upozorní obchodníka, že podobný záznam už existuje, dřív než se založí další.
Proč je automatické slučování bez dohledu nebezpečné
Toto je místo, kde se automatizace nejčastěji přežene. Sloučení dvou záznamů znamená spojit historii objednávek, faktur a komunikace do jednoho — a pokud se sloučí dvě různé firmy, které si jen podobají (stejné jméno v jiném městě, franšízový partner s vlastním IČO), vznikne škoda, kterou je těžké rozplést.
| Situace | Automatizovat | Proč |
|---|---|---|
| Shoda podle IČO | ano, automaticky sloučit | jednoznačný identifikátor |
| Shoda názvu a adresy nad 90 % | navrhnout ke schválení | pravděpodobné, ne jisté |
| Podobný název, jiné město | nenabízet jako duplicitu | může jít o pobočku nebo jinou firmu |
| Stejné telefonní číslo, jiný název | navrhnout ke schválení | může být stejný kontakt ve firmě |
Kdo je zdroj pravdy
Dřív než se spustí cokoli automatické, musí být jasné, který systém je pro které pole zdroj pravdy. Pokud CRM i fakturační systém obsahují adresu zákazníka a liší se, automat bez tohoto pravidla neví, kterou přepsat a kterou zachovat — jen přenáší nejistotu z jednoho místa na druhé.
Typické rozdělení:
- Fakturační a právní údaje (IČO, DIČ, sídlo) — zdroj pravdy je většinou účetní nebo ERP systém, případně přímo veřejný registr.
- Kontaktní údaje pro obchod (osoba, telefon, e-mail) — zdroj pravdy je CRM, kde je obchodník průběžně aktualizuje.
- Preference a historie komunikace — zdroj pravdy je systém, kde komunikace reálně probíhá.
Toto rozdělení souvisí s tím, jak se systémy vůbec propojují — podobnou úvahu jsme rozebírali u propojení ERP, CRM a e-shopu, kde jeden zdroj pravdy pro každý typ dat je podmínkou, ne volitelnou věcí.
Proč je to průběžný proces, ne projekt
Jednorázové vyčištění databáze přinese viditelný efekt hned, ale bez změny v tom, jak záznamy vznikají, se nepořádek vrací stejným tempem. Za půl roku bude databáze zase plná duplicit, pokud se nezmění proces zakládání nových záznamů — kontrola při vstupu, jednotný formulář, povinné pole na IČO tam, kde je dostupné.
Účinný přístup kombinuje jednorázové vyčištění existujících dat s trvalou změnou procesu, která zabrání vzniku nových duplicit. Bez druhé části je první jen dočasná kosmetika.
Shrnutí
Duplicity v zákaznických datech vznikají z více vstupních kanálů, ne z nedbalosti, a čištění má smysl jen tehdy, pokud se spojí s trvalou změnou procesu zakládání záznamů. Shodu podle jednoznačného identifikátoru jako IČO lze slučovat automaticky, pravděpodobnostní shodu jen navrhovat ke schválení. A předtím, než se cokoli automatizuje, musí být jasné, který systém je zdroj pravdy pro které pole.
Rozsah takového projektu závisí na počtu systémů, které data o zákaznících drží, a na tom, jak moc se dnes liší. Pokud řešíte podobnou situaci, projdeme si ji na nezávazné konzultaci.