← Novinky
Automatizace••7 min čtení

Automatizace čištění firemních dat: duplicity a jednotný záznam zákazníka

Stejná firma je v CRM třikrát, jednou s IČO, jednou bez, jednou s překlepem v názvu — a nikdo s jistotou neví, který záznam je ten správný. Proč duplicity vznikají, co se dá čistit automaticky a proč bývá slučování záznamů bez dohledu člověka nebezpečnější než samotný nepořádek.

Ve většině firem, které rostly několik let, existuje stejná firma v systému vícekrát. Jednou ji založil obchodník po telefonátu, jednou vznikla automaticky z objednávky v e-shopu, jednou ji přinesla fakturace z jiné firmy při převzetí zakázky. Každý záznam má trochu jiný název, jiné IČO vyplněné nebo nevyplněné, jiný kontakt. Nikdo neví s jistotou říct, který z nich je aktuální.

Toto není důsledek nedbalosti. Je to přirozený výsledek toho, že zákazník do firmy vstupuje více kanály najednou, a každý z nich měl svůj vlastní způsob, jak záznam založil.

Proč duplicity vznikají

  • Různé kanály vstupu. Obchodník, e-shop, fakturační systém, marketingový formulář — každý může vytvořit nový záznam, pokud si nevšimne, že zákazník už existuje.
  • Překlepy a varianty názvu. „ABC s.r.o.", „ABC, s. r. o." a „ABC spol. s r.o." jsou pro systém tři různé řetězce, ačkoli jde o stejnou firmu.
  • Změna údajů v čase. Firma změní sídlo, statutára nebo se přejmenuje po akvizici — starý záznam zůstává a nový vzniká vedle něj.
  • Chybějící jednoznačné pravidlo při zakládání. Pokud systém nevynucuje kontrolu podle IČO nebo jiného jednoznačného identifikátoru před založením nového záznamu, duplicita vznikne při první nepozornosti.
Ve zkratce: Duplicity nejsou chyba jednoho člověka, jsou důsledek chybějícího jednotného vstupního bodu. Bez něj vznikají znovu stejným tempem, jakým firma roste.

Co se dá čistit automaticky

Nalezení kandidátů na duplicitu. Porovnání podle IČO je jednoznačné a bezpečné — dvě firmy se stejným IČO jsou stejná firma s jistotou. Porovnání podle názvu a adresy je pravděpodobnostní: podobnost textu, podobná adresa, stejné telefonní číslo. To umí systém navrhnout jako pravděpodobný pár, ne potvrdit.

Normalizace formátu. Sjednocení zápisu — velikost písmen, mezery, diakritika, formát telefonního čísla. To je bezpečná automatizace, protože nemění význam dat, jen jejich tvar.

Doplnění chybějících údajů z veřejných registrů. Pokud má záznam IČO, ale chybí mu právní forma nebo aktuální adresa, dá se doplnit z veřejně dostupného registru. To jsme podrobněji rozebrali v případové studii automatizovaného ověřování údajů z veřejných registrů, princip je stejný i u jednoduššího doplňování záznamů.

Upozornění na podezřelý duplicitní zápis při zakládání. Místo čištění po faktu je účinnější zabránit vzniku duplicity už při zakládání nového záznamu — systém upozorní obchodníka, že podobný záznam už existuje, dřív než se založí další.

Proč je automatické slučování bez dohledu nebezpečné

Toto je místo, kde se automatizace nejčastěji přežene. Sloučení dvou záznamů znamená spojit historii objednávek, faktur a komunikace do jednoho — a pokud se sloučí dvě různé firmy, které si jen podobají (stejné jméno v jiném městě, franšízový partner s vlastním IČO), vznikne škoda, kterou je těžké rozplést.

SituaceAutomatizovatProč
Shoda podle IČOano, automaticky sloučitjednoznačný identifikátor
Shoda názvu a adresy nad 90 %navrhnout ke schválenípravděpodobné, ne jisté
Podobný název, jiné městonenabízet jako duplicitumůže jít o pobočku nebo jinou firmu
Stejné telefonní číslo, jiný názevnavrhnout ke schválenímůže být stejný kontakt ve firmě
Pozor: Sloučení dvou záznamů je operace, kterou je třeba umět vrátit zpět. Pokud se omylem sloučí dvě různé firmy, historie obou se promíchá — bez zálohy původního stavu se to dá rozplétat jen ručně a zdlouhavě.

Kdo je zdroj pravdy

Dřív než se spustí cokoli automatické, musí být jasné, který systém je pro které pole zdroj pravdy. Pokud CRM i fakturační systém obsahují adresu zákazníka a liší se, automat bez tohoto pravidla neví, kterou přepsat a kterou zachovat — jen přenáší nejistotu z jednoho místa na druhé.

Typické rozdělení:

  • Fakturační a právní údaje (IČO, DIČ, sídlo) — zdroj pravdy je většinou účetní nebo ERP systém, případně přímo veřejný registr.
  • Kontaktní údaje pro obchod (osoba, telefon, e-mail) — zdroj pravdy je CRM, kde je obchodník průběžně aktualizuje.
  • Preference a historie komunikace — zdroj pravdy je systém, kde komunikace reálně probíhá.

Toto rozdělení souvisí s tím, jak se systémy vůbec propojují — podobnou úvahu jsme rozebírali u propojení ERP, CRM a e-shopu, kde jeden zdroj pravdy pro každý typ dat je podmínkou, ne volitelnou věcí.

Proč je to průběžný proces, ne projekt

Jednorázové vyčištění databáze přinese viditelný efekt hned, ale bez změny v tom, jak záznamy vznikají, se nepořádek vrací stejným tempem. Za půl roku bude databáze zase plná duplicit, pokud se nezmění proces zakládání nových záznamů — kontrola při vstupu, jednotný formulář, povinné pole na IČO tam, kde je dostupné.

Účinný přístup kombinuje jednorázové vyčištění existujících dat s trvalou změnou procesu, která zabrání vzniku nových duplicit. Bez druhé části je první jen dočasná kosmetika.

Shrnutí

Duplicity v zákaznických datech vznikají z více vstupních kanálů, ne z nedbalosti, a čištění má smysl jen tehdy, pokud se spojí s trvalou změnou procesu zakládání záznamů. Shodu podle jednoznačného identifikátoru jako IČO lze slučovat automaticky, pravděpodobnostní shodu jen navrhovat ke schválení. A předtím, než se cokoli automatizuje, musí být jasné, který systém je zdroj pravdy pro které pole.

Rozsah takového projektu závisí na počtu systémů, které data o zákaznících drží, a na tom, jak moc se dnes liší. Pokud řešíte podobnou situaci, projdeme si ji na nezávazné konzultaci.

INTERFASE