Bereiten Sie Schlüsselwörter, URLs, Überschriften, CSV-Fragmente und andere Textlisten für den Import oder die Überprüfung vor. Das Tool entfernt überflüssige Zeichen und Zeilen, ändert die Groß-/Kleinschreibung, ersetzt Trennzeichen, sortiert Daten und führt mehrere Vorgänge in einem Durchlauf aus.
In welcher Reihenfolge Daten verarbeitet werden
Das Ergebnis hängt nicht nur von den ausgewählten Aktionen ab, sondern auch von ihrer Reihenfolge. Für eine gewöhnliche zeilenweise Liste ist diese Reihenfolge geeignet:
- Trennzeichen durch Zeilenumbruch ersetzen;
- Leerzeichen und Tabulatoren am Zeilenanfang und -ende entfernen;
- leere Zeilen löschen;
- bei Bedarf Werte auf eine einheitliche Schreibweise bringen;
- Duplikate entfernen;
- Ergebnis nur sortieren, wenn die ursprüngliche Reihenfolge nicht wichtig ist.
Beispielsweise sehen die Zeichenfolgen example, Example und example fast gleich aus,
können aber vor dem Entfernen von Leerzeichen und der Normalisierung der Groß-/Kleinschreibung als drei verschiedene Werte betrachtet werden.
Was jede Operation bewirkt und wann Vorsicht geboten ist
| Operation | Praktische Anwendung | Was zu prüfen ist |
|---|---|---|
| BOM entfernen | Korrektur eines unsichtbaren Zeichens vor der ersten Überschrift oder dem ersten Wert | BOM nicht aus einer UTF-16-Datei entfernen, ohne die Kodierung zu kennen |
| Trennzeichen durch Zeilenumbruch ersetzen | Umwandlung einer durch Kommas oder Semikolons getrennten Liste in eine zeilenweise Liste | einfacher Ersatz berücksichtigt nicht die vollständigen CSV-Regeln mit Anführungszeichen |
| Leere Zeilen entfernen | Bereinigung von Listen vor dem Import | eine leere Zeile dient manchmal als semantischer Trenner zwischen Blöcken |
| Zeilenumbrüche entfernen | Text in einer einzigen Zeile zusammenfassen | Absätze und Elementgrenzen gehen verloren |
| Überflüssige Leerzeichen entfernen | Korrektur von wiederholten Leerzeichen innerhalb des Textes | in Code und formatierten Daten können Leerzeichen bedeutsam sein |
| Ränder von Zeilen abschneiden | Entfernung von zufälligen Leerzeichen und Tabulatoren | normalerweise sicher für Listen, aber nicht für Fragmente mit festem Format |
| Groß-/Kleinschreibung ändern | Vereinheitlichung von Schlüsselwörtern, Tags oder Codes | URLs, Kennungen, Passwörter und einige Werte sind groß-/kleinschreibungsempfindlich |
| Zeilen nach Bedingung entfernen | Ausschluss von Dienst- oder unerwünschten Elementen | prüfen, ob der gesuchte Teilstring in nützlichen Zeilen vorkommt |
| Duplikate entfernen | Erhalten einer Liste eindeutiger Zeichenfolgen | das Tool sucht nach exakten Zeichenfolgenübereinstimmungen, nicht nach gleicher Bedeutung |
| Sortieren | bequeme manuelle Überprüfung und Vergleich | nach dem Sortieren bleibt die ursprüngliche Reihenfolge nicht erhalten |
Was ist BOM und warum stört es den Import?
BOM ist eine Dienstmarkierung der Kodierung am Anfang eines Textstroms. In UTF-8 kann sie als unsichtbares Zeichen vor dem ersten Wort erscheinen.
Dadurch interpretiert das Import-System manchmal die erste Überschrift als URL statt URL,
erkennt den Spaltennamen nicht oder fügt ein seltsames Zeichen am Zeilenanfang hinzu.
Das Entfernen von UTF-8-BOM ist nützlich, wenn das empfangende System es nicht erwartet. BOM wird aber auch zur Bestimmung der Byte-Reihenfolge in UTF-16 und UTF-32 verwendet. Daher sollte es nicht mechanisch aus jeder Datei entfernt werden: Zuerst muss die ursprüngliche Kodierung verstanden werden.
Warum das Ersetzen von Kommas nicht immer der CSV-Verarbeitung entspricht
Eine CSV kann das Trennzeichen innerhalb eines in Anführungszeichen gesetzten Werts enthalten:
"Berlin, Mitte",1200
Wenn Sie einfach jedes Komma durch einen Zeilenumbruch ersetzen, wird ein Wert fälschlicherweise in Teile zerlegt. Der Prozessor eignet sich für einfache Listen und Fragmente, in denen das Trennzeichen definitiv nicht innerhalb der Daten vorkommt. Für komplexe CSV-Dateien mit Anführungszeichen, Escape-Zeichen und mehreren Spalten ist ein vollwertiger CSV-Parser erforderlich.
Vorsicht bei URLs und Kennungen
Wenden Sie die Umwandlung in Kleinbuchstaben nicht auf die gesamte URL-Liste ohne Prüfung an. In einer Adresse sind Schema und Domain groß-/kleinschreibungsunabhängig, aber Pfad und Parameter auf einem bestimmten Server können variieren:
https://example.com/Catalog
https://example.com/catalog
Diese Adressen können zu verschiedenen Seiten führen. Ebenso sollte die Groß-/Kleinschreibung von Tokens, Artikeln, Hashes, API-Schlüsseln, Promo-Codes und Kennungen nicht geändert werden, wenn die Systemregeln nicht bekannt sind.
Längenzählung: Zeichen, Bytes und Emojis
Verschiedene Systeme können die Länge derselben Zeichenfolge unterschiedlich zählen. Ein normaler Buchstabe zählt meist als ein Zeichen, während Emojis, zusammengesetzte Zeichen und einige Unicode-Kombinationen mehrere Codeeinheiten belegen können. Daher stimmt das Ergebnis eines Online-Zählers nicht immer mit dem Limit eines bestimmten CMS, einer Werbeplattform oder einer Datenbank überein.
Für Titel, Beschreibungen und Werbetexte prüfen Sie nicht nur die Anzahl der Zeichen, sondern auch, wie die Zeichenfolge tatsächlich im jeweiligen System angezeigt wird.
Praktische Szenarien
Vorbereitung von Semantik
Fügen Sie eine Liste von Suchanfragen ein, entfernen Sie Ränder und leere Zeilen, vereinheitlichen Sie die Groß-/Kleinschreibung und entfernen Sie Duplikate. Sortieren Sie erst nach der Bereinigung, wenn die Exportreihenfolge nicht wichtig ist.
Umwandlung einer Liste aus einer Tabelle
Wenn Werte mit Tabulatoren oder einem anderen einfachen Trennzeichen kopiert wurden, ersetzen Sie es durch Zeilenumbrüche. Überprüfen Sie dann manuell einige Zeilen, um sicherzustellen, dass dieses Zeichen nicht innerhalb der Werte vorkommt.
Bereinigung einer URL-Liste
Entfernen Sie leere Zeilen und Ränder, aber ändern Sie nicht die Groß-/Kleinschreibung von Pfaden und Parametern. Nach der Bereinigung ist es sinnvoll, die Liste mit dem Duplikatentfernungs-Tool zu überprüfen.
Ausschluss unerwünschter Zeilen
Die Funktion zum Entfernen von Zeilen nach Teilstring eignet sich beispielsweise zum Ausschließen einer Dienst-Domain, eines Parameters oder eines Worts. Testen Sie die Bedingung zuerst an einer kleinen Kopie: Die Suche nach einem kurzen Teilstring kann mehr Zeilen entfernen als erwartet.
Wie Sie die Originaldaten nicht verlieren
Speichern Sie vor der Stapelverarbeitung das Original. Besonders wichtig beim Entfernen von Zeilen, Zusammenführen von Absätzen, Sortieren und Ändern der Groß-/Kleinschreibung: Solche Vorgänge können nach dem Überschreiben der ursprünglichen Liste nicht zuverlässig rückgängig gemacht werden.
Häufige Fragen
Kann eine echte CSV-Datei verarbeitet werden?
Das Tool eignet sich für Text und einfache CSV-Fragmente. Wenn die Datei mehrere Spalten, Anführungszeichen, Zeilenumbrüche innerhalb von Zellen oder maskierte Trennzeichen enthält, verwenden Sie ein Programm, das CSV nach seinen Regeln parst.
Warum bleiben nach dem Entfernen von Duplikaten ähnliche Zeilen übrig?
Sie können sich in Groß-/Kleinschreibung, Leerzeichen, geschützten Leerzeichen oder unsichtbaren Zeichen unterscheiden. Führen Sie zuerst eine geeignete Normalisierung durch und wiederholen Sie dann die Duplikatsentfernung.
Ist es sicher, den gesamten Text in Kleinbuchstaben zu konvertieren?
Für gewöhnliche Schlüsselwörter oft ja. Für URLs, Codes, Kennungen, Passwörter und Programmcode nicht: Die Groß-/Kleinschreibung kann die Bedeutung ändern.
Entfernt die Operation alle unsichtbaren Unicode-Zeichen?
Nicht unbedingt. Das Entfernen von BOM betrifft eine bestimmte Dienstmarkierung, nicht alle geschützten Leerzeichen, Zeichen mit Nullbreite und andere unsichtbare Zeichen.
Verwandte Tools: Duplikate entfernen; Diffchecker; Keyword-Kombinator.
