TXT-Tiedostot
Tekstitiedostojen lukemiseen pandas-kirjastossa voidaan käyttää samaa funktiota, pd.read_csv(). Jotta tekstitiedosto luetaan oikein, on kuitenkin tärkeää käyttää lisäparametria nimeltä sep, joka tarkoittaa erotinta tai delimitteriä tekstissä.
# Importing pandas library
import pandas as pd
# Reading a text file into a DataFrame
text_data = pd.read_csv('file.txt', sep='\r', header=None)
Jos tekstitiedostossasi ei ole otsikkoriviä, joka sisältää sarakkeiden nimet, aseta header-parametri arvoon None. Tämä kertoo pandas-kirjastolle, ettei ensimmäistä riviä käsitellä sarakeotsikoina.
Jos haluat käyttää tiedostossa rivinvaihtoa erottimena, mikä on yleistä tekstitiedostoissa, aseta sep='\r'. Tässä '\r' tarkoittaa rivinvaihtomerkkiä (carriage return), joka on erikoismerkki uuden rivin osoittamiseen.
Yksittäisen rivin poimiminen
Kun tekstitiedosto on ladattu DataFrame, yksittäisiin riveihin pääsee käsiksi käyttämällä .iloc[]-indeksointia ja antamalla halutun rivin sijainnin:
# Extracting the first row
first_row = text_data.iloc[0]
Kun valitset yksittäisen rivin (tai sarakkeen) DataFrame-rakenteesta, pandas ei palauta toista DataFrame-rakennetta — vaan palauttaa Series-olion. Series on yksisuuntainen nimetty taulukko, eli se sisältää yhden arvojoukon sekä indeksin, mutta ei erillistä sarakerakennetta. Tämän vuoksi first_row näyttää ja käyttäytyy hieman eri tavalla kuin text_data: sillä ei ole .columns-ominaisuutta, ja tulostettaessa näytetään indeksi jokaisen arvon yhteydessä taulukon sijaan.
Kiitos palautteestasi!
single
TXT-Tiedostot
Pyyhkäise näyttääksesi valikon
Tekstitiedostojen lukemiseen pandas-kirjastossa voidaan käyttää samaa funktiota, pd.read_csv(). Jotta tekstitiedosto luetaan oikein, on kuitenkin tärkeää käyttää lisäparametria nimeltä sep, joka tarkoittaa erotinta tai delimitteriä tekstissä.
# Importing pandas library
import pandas as pd
# Reading a text file into a DataFrame
text_data = pd.read_csv('file.txt', sep='\r', header=None)
Jos tekstitiedostossasi ei ole otsikkoriviä, joka sisältää sarakkeiden nimet, aseta header-parametri arvoon None. Tämä kertoo pandas-kirjastolle, ettei ensimmäistä riviä käsitellä sarakeotsikoina.
Jos haluat käyttää tiedostossa rivinvaihtoa erottimena, mikä on yleistä tekstitiedostoissa, aseta sep='\r'. Tässä '\r' tarkoittaa rivinvaihtomerkkiä (carriage return), joka on erikoismerkki uuden rivin osoittamiseen.
Yksittäisen rivin poimiminen
Kun tekstitiedosto on ladattu DataFrame, yksittäisiin riveihin pääsee käsiksi käyttämällä .iloc[]-indeksointia ja antamalla halutun rivin sijainnin:
# Extracting the first row
first_row = text_data.iloc[0]
Kun valitset yksittäisen rivin (tai sarakkeen) DataFrame-rakenteesta, pandas ei palauta toista DataFrame-rakennetta — vaan palauttaa Series-olion. Series on yksisuuntainen nimetty taulukko, eli se sisältää yhden arvojoukon sekä indeksin, mutta ei erillistä sarakerakennetta. Tämän vuoksi first_row näyttää ja käyttäytyy hieman eri tavalla kuin text_data: sillä ei ole .columns-ominaisuutta, ja tulostettaessa näytetään indeksi jokaisen arvon yhteydessä taulukon sijaan.
Pyyhkäise aloittaaksesi koodauksen
Sinulle annetaan URL-osoite TXT-tiedostoon, joka on tallennettu merkkijonona muuttujaan file_url.
- Lue TXT-tiedosto
DataFrame-muuttujaan nimeltätext_data. Jokainen tiedoston rivi on erotettu rivinvaihdolla ('\r'). Tiedostossa ei ole sarakeotsikoita, joten käytäheader-parametria oikein. - Tämän jälkeen poimi
DataFrame:n ensimmäinen rivi ja tallenna se muuttujaan nimeltäfirst_row.
Ratkaisu
Kiitos palautteestasi!
single
Kysy tekoälyä
Kysy tekoälyä
Kysy mitä tahansa tai kokeile jotakin ehdotetuista kysymyksistä aloittaaksesi keskustelumme