Praktische Regex-Anwendungen in der Datenbereinigung
Swipe um das Menü anzuzeigen
Häufige Aufgaben der Datenbereinigung mit Regex
Bei der Arbeit mit realen Daten treten häufig Inkonsistenzen, unerwünschte Zeichen und unvorhersehbare Formatierungen auf. Reguläre Ausdrücke (Regex) sind leistungsstarke Werkzeuge, die die Automatisierung von Datenbereinigungsaufgaben ermöglichen und große Datensätze handhabbar und analysierbar machen.
Typische Aufgaben der Datenbereinigung, die mit Regex gelöst werden können, sind:
- Entfernen unerwünschter Zeichen wie überflüssiger Satzzeichen oder Symbole;
- Vereinheitlichung von Formaten wie Telefonnummern oder Datumsangaben;
- Extraktion strukturierter Daten wie E-Mail-Adressen oder Produktcodes aus unstrukturiertem Text.
Durch das Beherrschen von Regex lassen sich unübersichtliche Daten schnell in saubere, strukturierte Informationen umwandeln, die für die weitere Verarbeitung geeignet sind.
12345678910111213141516import re # Messy CSV line with extra commas and spaces line = " John , Doe , , 29 , New York ,, " # Step 1: Remove extra commas (replace multiple commas with a single comma) line = re.sub(r',\s*,+', ',', line) # Step 2: Remove leading/trailing whitespace from each field fields = [re.sub(r'^\s+|\s+$', '', field) for field in line.split(',')] # Step 3: Remove any empty fields clean_fields = [field for field in fields if field] print(clean_fields) # Output: ['John', 'Doe', '29', 'New York']
Erläuterung des Bereinigungsprozesses
In diesem Beispiel beginnt man mit einer CSV-Zeile, die zusätzliche Kommas und uneinheitliche Leerzeichen enthält. Der Bereinigungsprozess verwendet Regex in mehreren Schritten:
- Entfernen überflüssiger Kommas: Das Muster
',\s*,+'findet Folgen von Kommas, die möglicherweise durch Leerzeichen getrennt sind, und ersetzt sie durch ein einzelnes Komma, um Redundanzen zu reduzieren; - Trimmen von Leerzeichen: Das Muster
r'^\s+|\s+$'entfernt führende und nachfolgende Leerzeichen aus jedem Feld, sodass nur der tatsächliche Inhalt übrig bleibt; - Entfernen leerer Felder: Leere Felder werden entfernt, sodass eine saubere Liste von Werten entsteht.
Regex-Muster werden erstellt, indem die unerwünschten Elemente in den Daten (wie mehrere Kommas oder verstreute Leerzeichen) identifiziert und Muster geschrieben werden, die diese Elemente zum Ersetzen oder Entfernen erfassen. Dieser Ansatz ermöglicht eine effiziente Umwandlung unübersichtlicher, inkonsistenter Daten in ein leicht weiterzuverarbeitendes Format.
Danke für Ihr Feedback!
Fragen Sie AI
Fragen Sie AI
Fragen Sie alles oder probieren Sie eine der vorgeschlagenen Fragen, um unser Gespräch zu beginnen