Fügen Sie eine zeilenweise Liste ein und behalten Sie nur eindeutige Werte. Zusätzlich können Sie leere Zeilen entfernen, die Groß-/Kleinschreibung anpassen und das Ergebnis sortieren. Prüfen Sie vor der Normalisierung von URLs, E-Mail-Adressen, Artikeln und Identifikatoren, welche Unterschiede in Ihrem System relevant sind.
Was genau als Duplikat gilt
Das Werkzeug vergleicht Zeichenketten, nicht deren Bedeutung. Volle Duplikate sind Werte, die nach den gewählten Umwandlungen übereinstimmen.
Ohne vorherige Bereinigung könnten diese Zeilen als unterschiedlich betrachtet werden:
seo audit
SEO Audit
seo audit
Gründe für die Unterschiede:
- unterschiedliche Groß-/Kleinschreibung;
- Leerzeichen oder Tabulator am Anfang oder Ende;
- zwei Leerzeichen statt einem;
- geschütztes Leerzeichen (NBSP);
- unterschiedliche Bindestriche oder Anführungszeichen;
- unsichtbares Unicode-Zeichen;
- verschiedene Wortformen oder Wortreihenfolge.
Die Sätze Sofa kaufen und kaufen Sofa sind keine exakten Duplikate. Ihre mögliche inhaltliche Nähe erfordert eine gesonderte Analyse.
Sichere Reihenfolge für die Bereinigung einer gewöhnlichen Liste
Für Keywords, Tags, Städte oder Namen eignet sich oft diese Reihenfolge:
- eine Kopie des Originals aufbewahren;
- Leerzeichen und Tabulatoren an den Zeilenrändern entfernen;
- leere Zeilen löschen;
- bei Bedarf den Text in eine einheitliche Schreibweise bringen;
- exakte Duplikate entfernen;
- nur sortieren, wenn die Reihenfolge nicht mehr benötigt wird.
Die Umwandlungen müssen vor dem Entfernen der Duplikate durchgeführt werden. Sonst bleiben Example und example getrennte Zeilen und werden nach einer späteren Änderung der Groß-/Kleinschreibung zu zwei identischen Werten.
Exakte und semantische Duplikate
Exakte Duplikate
seo audit
seo audit
Sie können automatisch entfernt werden.
Duplikate nach einfacher Normalisierung
SEO audit
seo audit
Sie stimmen nach Änderung der Groß-/Kleinschreibung und Entfernung von Leerzeichen am Ende überein.
Semantische oder kanonische Duplikate
Laptop kaufen
Kauf eines Laptops
einen Laptop kaufen
Ein einfaches Tool sollte sie nicht automatisch entfernen. Für Keywords sind eine Analyse der Suchergebnisse, die Absicht und Clustering erforderlich; für Produkte die Katalogregeln; für Personen und Organisationen Identifikatoren oder manuelle Prüfung.
Besondere Vorsicht bei URL-Listen
Es ist nicht zulässig, die gesamte URL bedingungslos in Kleinbuchstaben umzuwandeln. Standardgemäß sind Schema und Hostname nicht case-sensitiv:
HTTPS://EXAMPLE.COM
https://example.com
Pfad, Parameter und Fragment können jedoch in bestimmten Systemen case-sensitiv sein:
https://example.com/Catalog
https://example.com/catalog
Diese Adressen können ohne Überprüfung der Website nicht als eine einzige URL betrachtet werden.
Darüber hinaus erkennt das exakte Deduplizierungstool nicht automatisch, ob diese Varianten gleichwertig sind:
https://example.com/page
https://example.com/page/
https://example.com/page?utm_source=email
http://example.com/page
https://www.example.com/page
Ihre Zusammenführung hängt von Weiterleitungen, kanonischen URLs, Serverkonfiguration und Ihrer Aufgabe ab. Entfernen Sie zuerst nur exakte Wiederholungen und analysieren Sie dann die Kanonisierung separat.
Was bei E-Mail-Adressen zu beachten ist
Der Domainteil nach @ kann in Kleinbuchstaben umgewandelt werden. Beim lokalen Teil vor @ ist die Situation komplexer: Der Standard erlaubt Case-Sensitivität, obwohl viele moderne E-Mail-Systeme sie faktisch nicht verwenden.
Daher ist die vollständige Umwandlung aller E-Mail-Adressen in Kleinbuchstaben für eine bestimmte bekannte Datenbank meist praktisch, sollte aber nicht als universell fehlerfreie Regel betrachtet werden. Für Newsletter reicht es zudem nicht aus, textuelle Duplikate zu entfernen: Sie müssen die Einwilligung der Empfänger, ungültige Adressen, Abmeldungen und unterdrückte Kontakte berücksichtigen.
Artikelnummern, Codes, Hashes und Identifikatoren
Bei solchen Werten kann die Groß-/Kleinschreibung Teil des Identifikators sein:
abc123
ABC123
Prüfen Sie vor der Änderung der Groß-/Kleinschreibung die Dokumentation Ihres CRM, Shops, der API oder der Datenbank. Gleiches gilt für Promo-Codes, Token, UUIDs in nicht standardisierten Formaten, Dateinamen und Objektschlüssel.
Unicode und unsichtbare Unterschiede
Äußerlich identischer Text kann durch unterschiedliche Unicode-Sequenzen dargestellt werden. Beispielsweise kann ein Buchstabe mit Diakritikum als einzelnes Zeichen oder als Buchstabe mit einem separaten kombinierenden Zeichen gespeichert sein. Ein gewöhnlicher Vergleich könnte sie als unterschiedliche Zeichenketten betrachten.
Ebenfalls vorkommend:
- geschütztes Leerzeichen (NBSP);
- schmales geschütztes Leerzeichen;
- Nullbreitenzeichen;
- unterschiedliche Bindestriche:
-,–,—; - visuell ähnliche Buchstaben aus lateinischem und kyrillischem Alphabet.
Das aktuelle Tool ist nicht verpflichtet, eine vollständige Unicode-Normalisierung durchzuführen oder Alphabet-Substitutionen zu erkennen. Wenn nach der Bereinigung rätselhafte Duplikate übrig bleiben, überprüfen Sie die Codepunkte mit einem speziellen Analysetool.
Ist die Sortierung des Ergebnisses notwendig?
Die Sortierung erleichtert die Durchsicht und hilft, ähnliche Zeilen nebeneinander zu erkennen, verändert jedoch die ursprüngliche Reihenfolge. Dies kann kritisch sein für:
- Prioritätenlisten;
- Aufgabenwarteschlangen;
- Menüstrukturen;
- Befehlssequenzen;
- Daten, bei denen eine Zeile mit einer Nummer oder einer benachbarten Zeile verknüpft ist.
Wenn die Reihenfolge wichtig ist, entfernen Sie Duplikate unter Beibehaltung des ersten Vorkommens und aktivieren Sie keine Sortierung.
Praktische Szenarien
Keywords
Vereinheitlichen Sie die Groß-/Kleinschreibung, bereinigen Sie die Zeilenränder und entfernen Sie exakte Duplikate. Entfernen Sie keine Wortumstellungen oder ähnliche Formulierungen, bevor Sie die Suchergebnisse und das Clustering analysiert haben.
Domain-Liste
Domainnamen können in Kleinschreibung umgewandelt werden. Überprüfen Sie, ob die Liste vollständige URLs mit Pfaden und Parametern enthält – für diese gelten strengere Regeln.
URLs aus mehreren Exporten
Entfernen Sie zuerst exakte Duplikate. Entscheiden Sie dann separat, ob UTM-Parameter, Fragmente, der abschließende Schrägstrich, das Protokoll oder www ausgeschlossen werden sollen. Diese Entscheidung kann nicht für alle Websites gleich getroffen werden.
Produktnamen
Die exakte Übereinstimmung des Namens bedeutet nicht immer ein Produktduplikat: Größe, Farbe, Ausstattung oder SKU können abweichen. Und umgekehrt kann ein Produkt leicht unterschiedliche Namen haben. Verwenden Sie die Artikelnummer oder einen anderen stabilen Identifikator.
E-Mail-Datenbank
Entfernen Sie leere und doppelte Zeilen, aber betrachten Sie dies nicht als vollständige Newsletter-Vorbereitung. Es sind eine Syntaxprüfung, der Abonnementstatus, Abmeldungen und die Regeln des jeweiligen E-Mail-Dienstes erforderlich.
So überprüfen Sie das Ergebnis
- Vergleichen Sie die Anzahl der Zeilen vor und nach der Verarbeitung.
- Sehen Sie sich einige entfernte Werte an, falls die Oberfläche es erlaubt, das Original daneben zu behalten.
- Stellen Sie sicher, dass die Groß-/Kleinschreibung nicht bedeutsam war.
- Überprüfen Sie den Anfang und das Ende der Liste nach der Sortierung.
- Für wichtige Daten führen Sie einen Testimport mit einem kleinen Teil durch.
Häufige Fragen
Warum sind ähnliche Zeilen nach dem Entfernen von Duplikaten geblieben?
Sie können sich in Leerzeichen, Groß-/Kleinschreibung, Satzzeichen, Unicode-Zeichen oder Wortformen unterscheiden. Das Tool entfernt übereinstimmende Zeichenketten, nicht die gleiche Bedeutung.
Kann man alle URLs in Kleinbuchstaben umwandeln?
Nein. Sicher ist es, Schema und Domain zu normalisieren, aber Pfad und Parameter können case-sensitiv sein.
Welches Vorkommen bleibt bei Wiederholung erhalten?
Normalerweise bleibt einer der identischen Werte erhalten. Wenn für Ihre Aufgabe das erste oder letzte Vorkommen und die zugehörige Reihenfolge wichtig sind, überprüfen Sie das Verhalten anhand einer kurzen Testliste.
Warum hat die Sortierung die Datenstruktur zerstört?
Die Sortierung arbeitet unabhängig mit Zeichenketten und kennt deren semantische Gruppen nicht. Verwenden Sie sie nicht für mehrzeilige Einträge oder zusammenhängende Spalten, die als einfacher Text eingefügt wurden.
Entfernt das Tool doppelte Seiten mit UTM-Parametern?
Nicht als kanonische Duplikate: URLs mit unterschiedlichen Parametern sind verschiedene Zeichenketten. Für ihre Zusammenführung müssen Sie separat festlegen, welche Parameter ohne Bedeutungsänderung entfernt werden können.
Verwandte Tools: Textverarbeitung; Keyword-Kombinator; Diffchecker.
Offizieller Standard:
RFC 3986 — URI Generic Syntax: https://www.rfc-editor.org/rfc/rfc3986
