Notice: This page requires JavaScript to function properly.
Please enable JavaScript in your browser settings or update your browser.
Lernen Praktische Regex-Anwendungen in der Datenbereinigung | Fortgeschrittene Reguläre Ausdrücke und Anwendungen
Python Reguläre Ausdrücke

Praktische Regex-Anwendungen in der Datenbereinigung

Swipe um das Menü anzuzeigen

Häufige Aufgaben der Datenbereinigung mit Regex

Bei der Arbeit mit realen Daten treten häufig Inkonsistenzen, unerwünschte Zeichen und unvorhersehbare Formatierungen auf. Reguläre Ausdrücke (Regex) sind leistungsstarke Werkzeuge, die die Automatisierung von Datenbereinigungsaufgaben ermöglichen und große Datensätze handhabbar und analysierbar machen.

Typische Aufgaben der Datenbereinigung, die mit Regex gelöst werden können, sind:

  • Entfernen unerwünschter Zeichen wie überflüssiger Satzzeichen oder Symbole;
  • Vereinheitlichung von Formaten wie Telefonnummern oder Datumsangaben;
  • Extraktion strukturierter Daten wie E-Mail-Adressen oder Produktcodes aus unstrukturiertem Text.

Durch das Beherrschen von Regex lassen sich unübersichtliche Daten schnell in saubere, strukturierte Informationen umwandeln, die für die weitere Verarbeitung geeignet sind.

12345678910111213141516
import re # Messy CSV line with extra commas and spaces line = " John , Doe , , 29 , New York ,, " # Step 1: Remove extra commas (replace multiple commas with a single comma) line = re.sub(r',\s*,+', ',', line) # Step 2: Remove leading/trailing whitespace from each field fields = [re.sub(r'^\s+|\s+$', '', field) for field in line.split(',')] # Step 3: Remove any empty fields clean_fields = [field for field in fields if field] print(clean_fields) # Output: ['John', 'Doe', '29', 'New York']

Erläuterung des Bereinigungsprozesses

In diesem Beispiel beginnt man mit einer CSV-Zeile, die zusätzliche Kommas und uneinheitliche Leerzeichen enthält. Der Bereinigungsprozess verwendet Regex in mehreren Schritten:

  • Entfernen überflüssiger Kommas: Das Muster ',\s*,+' findet Folgen von Kommas, die möglicherweise durch Leerzeichen getrennt sind, und ersetzt sie durch ein einzelnes Komma, um Redundanzen zu reduzieren;
  • Trimmen von Leerzeichen: Das Muster r'^\s+|\s+$' entfernt führende und nachfolgende Leerzeichen aus jedem Feld, sodass nur der tatsächliche Inhalt übrig bleibt;
  • Entfernen leerer Felder: Leere Felder werden entfernt, sodass eine saubere Liste von Werten entsteht.

Regex-Muster werden erstellt, indem die unerwünschten Elemente in den Daten (wie mehrere Kommas oder verstreute Leerzeichen) identifiziert und Muster geschrieben werden, die diese Elemente zum Ersetzen oder Entfernen erfassen. Dieser Ansatz ermöglicht eine effiziente Umwandlung unübersichtlicher, inkonsistenter Daten in ein leicht weiterzuverarbeitendes Format.

question mark

Welches Regex-Muster entfernt alle nicht-alphanumerischen Zeichen aus einem String?

Wählen Sie die richtige Antwort aus

War alles klar?

Wie können wir es verbessern?

Danke für Ihr Feedback!

Abschnitt 3. Kapitel 2

Fragen Sie AI

expand

Fragen Sie AI

ChatGPT

Fragen Sie alles oder probieren Sie eine der vorgeschlagenen Fragen, um unser Gespräch zu beginnen

Abschnitt 3. Kapitel 2
some-alt