Skip to content

CRM-Datenqualität in HubSpot: Warum Dublettenmanagement allein nicht reicht

Inhaltsverzeichnis

Ein CRM kann nur so verlässlich sein wie die Daten, die darin gepflegt werden. In der Praxis zeigt sich das häufig nicht an einem einzelnen falschen Feld, sondern an widersprüchlichen Datensätzen: derselbe Ansprechpartner ist mehrfach angelegt, ein Unternehmen existiert unter verschiedenen Schreibweisen oder wichtige Informationen stehen in Freitextfeldern statt in auswertbaren Eigenschaften.

HubSpot bietet inzwischen mehrere Funktionen, um solche Probleme zu erkennen und zu bearbeiten. Trotzdem löst ein Dublettenmanager allein kein Datenqualitätsproblem. Er beseitigt Symptome. Nachhaltig wird die Datenbasis erst, wenn Erkennung, Bereinigung und Vermeidung zusammenspielen.

Die zentrale Frage: Bereinigen oder Ursachen beheben?

Für ein mittelständisches Unternehmen ist die richtige Frage deshalb nicht nur: „Wie finden wir Dubletten?“ Entscheidend ist: Warum entstehen sie überhaupt – und an welcher Stelle muss der Prozess geändert werden?

Ein typisches Beispiel: Ein Vertrieb importiert eine Messe-Liste, das Marketing übernimmt Kontakte aus einem Formular und ein externer Dienstleister synchronisiert Unternehmensdaten. Wenn diese Quellen unterschiedliche Identifikatoren, Schreibweisen oder Pflichtfelder verwenden, entstehen Dubletten oft schon beim Eingang der Daten.

Die spätere Zusammenführung ist dann nur noch Reparaturarbeit. Sie kann Beziehungen, Zuständigkeiten und historische Informationen betreffen. Deshalb sollte die Bereinigung immer mit einer Analyse des Datenflusses beginnen.

Was HubSpot automatisch erkennt – und was nicht

HubSpot dedupliziert Kontakte grundsätzlich über die E-Mail-Adresse und Unternehmen über den Unternehmensdomainnamen. Auch beim Import können Record IDs oder Eigenschaften mit eindeutigen Werten verwendet werden, um bestehende Datensätze gezielt zu aktualisieren statt neue anzulegen.

Diese Mechanismen sind wichtig, aber sie decken nicht jede reale Situation ab. Bei Kontakten fehlen beispielsweise häufig E-Mail-Adressen, etwa bei Telefonanfragen, Filialkontakten oder frühen Vertriebsphasen. Bei Unternehmen können unterschiedliche Domains, Tochtergesellschaften oder mehrere Standorte fachlich korrekt sein – oder eben eine ungewollte Doppelanlage.

Automatische Erkennung ist daher keine fachliche Entscheidung. Sie kann einen möglichen Treffer markieren, aber nicht zuverlässig beurteilen, ob zwei Datensätze tatsächlich dieselbe Organisation oder zwei eigenständige Geschäftseinheiten darstellen.

Der Dublettenmanager ist ein Kontrollpunkt, kein Datenmodell

Mit dem Dublettenmanager lassen sich potenzielle doppelte Kontakt- und Unternehmensdatensätze prüfen, zusammenführen oder zurückweisen. HubSpot vergleicht dafür unter anderem Namen, E-Mail-Adresse, Telefonnummer, Postleitzahl und Unternehmensdaten. Die Prüfung wird regelmäßig aktualisiert, sodass neue mögliche Dubletten sichtbar werden können.

Das ist besonders hilfreich für Administratoren und Operations-Teams, die nicht mehr ausschließlich mit manuellen Listen arbeiten wollen. Dennoch sollte jede Organisation vor dem Zusammenführen definieren, welche Datenquelle im Konfliktfall maßgeblich ist.

Beispiel: Ein Datensatz enthält die aktuelle Telefonnummer aus dem Vertrieb, ein anderer die ältere Telefonnummer aus einem Import. Ohne klare Regel kann beim Merge ein fachlich falscher Wert übernommen werden. Noch kritischer ist die Frage, welcher Datensatz Eigentümer, Zuordnung, Aktivitäten oder integrationsrelevante IDs behalten soll.

SMARTTEC-Empfehlung: Legt vor einer größeren Bereinigungsaktion eine kurze Merge-Regel fest. Sie sollte mindestens Zuständigkeit, bevorzugte Quelle, Pflichtfelder und den Umgang mit abweichenden Unternehmensstrukturen beschreiben.

Ein belastbares Vorgehen in fünf Schritten

1. Datenproblem eingrenzen

Startet nicht mit dem gesamten CRM. Wählt zunächst einen klaren Bereich: zum Beispiel Kontakte aus einem bestimmten Import, Unternehmen mit fehlendem Domainnamen oder Datensätze aus einer bestimmten Integration. So lässt sich nachvollziehen, ob das Problem einzelne Quellen oder das gesamte Datenmodell betrifft.

2. Identifikatoren festlegen

Definiert pro Objekt, woran ein Datensatz eindeutig erkannt wird. Bei Kontakten kann das – je nach Prozess – die E-Mail-Adresse sein. Bei Unternehmen reicht der Domainname nicht immer aus, wenn mehrere Standorte oder rechtlich getrennte Gesellschaften existieren. Dann können zusätzliche eindeutige Kennungen, etwa eine ERP- oder Kundennummer, erforderlich sein.

Wichtig ist, diese Kennung nicht nur zu dokumentieren, sondern auch in Importen und Integrationen konsequent zu verwenden. Ein Datenfeld, das nur in einer Excel-Datei existiert, verhindert keine neuen Dubletten.

3. Eingangsprozesse prüfen

Untersucht, wie neue Kontakte und Unternehmen entstehen: Formulare, Importe, manuelle Anlage, Schnittstellen, Meetings oder Commerce-Prozesse. Prüft dabei insbesondere, ob Pflichtinformationen fehlen, ob Schreibweisen standardisiert werden und ob die Quelle einen bestehenden Datensatz aktualisieren kann.

Bei wiederkehrenden Importen sollte der Record ID oder eine definierte eindeutige Eigenschaft Vorrang vor einer unsicheren Namenssuche haben. So wird aus einem wiederkehrenden Datenimport ein Update-Prozess statt eine neue Entstehungsquelle für Dubletten.

4. Bestehende Datensätze kontrolliert bereinigen

Erst jetzt sollte die eigentliche Bereinigung beginnen. Prüft mögliche Paare oder Gruppen fachlich und führt sie nicht blind zusammen. Bei größeren Mengen können Datenqualitätsfunktionen helfen; die verfügbaren Möglichkeiten und Mengengrenzen hängen jedoch vom gebuchten HubSpot-Abonnement und den Berechtigungen ab.

Dokumentiert außerdem, welche Datensätze zusammengeführt wurden und ob nachgelagerte Systeme betroffen sein könnten. Besonders bei Integrationen sollte vorab geprüft werden, ob externe Systeme mit HubSpot-Record-IDs oder eigenen Kundennummern arbeiten.

5. Datenqualität regelmäßig messen

Datenqualität ist kein einmaliges Aufräumprojekt. Sinnvoll sind wenige, aber klare Kennzahlen, zum Beispiel:

  • Anteil der Kontakte ohne eindeutige Zuordnung
  • Anzahl neu erkannter potenzieller Dubletten pro Zeitraum
  • Anteil der Unternehmen mit fehlender oder unplausibler Domain
  • Anteil der Datensätze mit vollständigen Pflichtfeldern
  • Anzahl manueller Korrekturen je Datenquelle

Der Zweck dieser Kennzahlen ist nicht, Teams zu überwachen. Sie sollen sichtbar machen, an welcher Stelle der Prozess unnötige Nacharbeit erzeugt.

Wann reichen Standardfunktionen – und wann braucht es mehr?

Die Standardfunktionen reichen häufig aus, wenn ein Unternehmen wenige Datenquellen hat, Kontakte überwiegend mit E-Mail-Adresse angelegt werden und die Unternehmensstruktur überschaubar ist. In diesem Fall sind klare Pflichtfelder, eindeutige Importregeln und eine regelmäßige manuelle Prüfung oft wirksamer als ein komplexes Regelwerk.

Mehr Struktur ist sinnvoll, wenn mehrere Systeme Daten synchronisieren, ein Unternehmen viele Standorte oder Gesellschaften führt, Kontakte ohne E-Mail-Adresse verarbeitet werden oder CRM-Daten regelmäßig in Reporting und Automatisierungen einfließen. Dann sollte das Datenmodell vor der Automatisierung geklärt werden. Sonst werden fehlerhafte Werte nur schneller verteilt.

HubSpot beschreibt für die Datenqualität unter anderem Übersichten zu Dubletten, Formatierungsproblemen und Eigenschaftsnutzung. Solche Funktionen können die Diagnose erleichtern. Sie ersetzen aber weder ein fachliches Datenmodell noch Verantwortlichkeiten für kritische Eigenschaften.

Die häufigsten Implementierungsfehler

  • Nur Namen vergleichen: Gleiche Namen bedeuten nicht automatisch gleiche Unternehmen.
  • Alle Datenquellen gleich behandeln: Ein ERP, ein Formular und eine Messe-Liste haben oft unterschiedliche Qualitäts- und Aktualitätsregeln.
  • Merge ohne Rückfallebene: Vor umfangreichen Bereinigungen sollten Exporte, Regeln und Verantwortlichkeiten dokumentiert sein.
  • Freitext statt strukturierter Felder: Was später segmentiert, automatisiert oder reportet werden soll, braucht eine definierte Eigenschaft.
  • Keine Zuständigkeit: Wenn niemand für Datenqualität verantwortlich ist, wird die Bereinigung zur sporadischen Nebenaufgabe.

Fazit: Gute CRM-Datenqualität beginnt vor dem Dublettenmanager

HubSpot liefert wichtige Werkzeuge, um doppelte oder fehlerhaft formatierte Datensätze sichtbar zu machen. Der nachhaltige Nutzen entsteht jedoch erst, wenn Unternehmen die Ursache im Datenfluss angehen: eindeutige Identifikatoren, klare Objektlogik, kontrollierte Importe und definierte Verantwortlichkeiten.

Für die meisten mittelständischen Unternehmen ist ein schrittweises Vorgehen sinnvoller als ein umfassendes Bereinigungsprojekt ohne Priorisierung. Startet mit einem relevanten Datenbereich, legt die fachlichen Regeln fest und verbessert anschließend den Entstehungsprozess. So wird Datenqualität nicht zu einer einmaligen Aufräumaktion, sondern zu einem steuerbaren Bestandteil der CRM-Architektur.

Wenn du prüfen möchtest, ob dein HubSpot-Datenmodell, deine Importe oder deine Integrationen unnötige Dubletten erzeugen, unterstützt SMARTTEC bei Analyse, Strukturierung und Umsetzung.

Quellen

HubSpot: Deduplicate records in HubSpot

HubSpot: Review and manage duplicate records

HubSpot: Use data quality tools

HubSpot: Maintain a trusted source of customer data