Praktische Regex-toepassingen bij Gegevensopschoning
Veeg om het menu te tonen
Veelvoorkomende data cleaning-taken oplosbaar met regex
Bij het werken met real-world data kom je vaak inconsistenties, ongewenste tekens en onvoorspelbare opmaak tegen. Reguliere expressies (regex) zijn krachtige hulpmiddelen die helpen bij het automatiseren van data cleaning-taken, waardoor grote datasets beheersbaar en klaar voor analyse worden.
Veelvoorkomende data cleaning-taken die met regex kunnen worden opgelost zijn:
- Verwijderen van ongewenste tekens zoals extra interpunctie of symbolen;
- Standaardiseren van formaten zoals telefoonnummers of datums;
- Extraheren van gestructureerde data zoals e-mailadressen of productcodes uit ongestructureerde tekst.
Door regex te beheersen kun je rommelige data snel omzetten naar schone, gestructureerde informatie die geschikt is voor verdere verwerking.
12345678910111213141516import re # Messy CSV line with extra commas and spaces line = " John , Doe , , 29 , New York ,, " # Step 1: Remove extra commas (replace multiple commas with a single comma) line = re.sub(r',\s*,+', ',', line) # Step 2: Remove leading/trailing whitespace from each field fields = [re.sub(r'^\s+|\s+$', '', field) for field in line.split(',')] # Step 3: Remove any empty fields clean_fields = [field for field in fields if field] print(clean_fields) # Output: ['John', 'Doe', '29', 'New York']
Uitleg van het schoonmaakproces
In dit voorbeeld begin je met een CSV-regel die extra komma's en inconsistente witruimtes bevat. Het schoonmaakproces gebruikt regex in verschillende stappen:
- Verwijder extra komma's: het patroon
',\s*,+'vindt reeksen van komma's die mogelijk gescheiden zijn door witruimte en vervangt deze door één enkele komma, waardoor overbodigheid wordt verminderd; - Trim witruimte: het patroon
r'^\s+|\s+$'verwijdert voor- en achterliggende witruimte uit elk veld, zodat alleen de daadwerkelijke inhoud overblijft; - Verwijder lege velden: lege velden worden verwijderd, wat resulteert in een schone lijst met waarden.
Regex-patronen worden geconstrueerd door de ongewenste elementen in de data te identificeren (zoals meerdere komma's of losse spaties) en patronen te schrijven die deze elementen matchen voor vervanging of verwijdering. Deze aanpak maakt het mogelijk om rommelige, inconsistente data efficiënt om te zetten naar een formaat dat eenvoudig te verwerken is.
Bedankt voor je feedback!
Vraag AI
Vraag AI
Vraag wat u wilt of probeer een van de voorgestelde vragen om onze chat te starten.