Pandas
Kurz: Die Standard-Python-Bibliothek für tabellarische Daten — lädt, filtert, gruppiert und transformiert Daten ähnlich wie eine Excel-Tabelle, nur programmierbar.
Genauer: Pandas’ zentrale Datenstruktur ist der DataFrame (eine Tabelle mit benannten Spalten), gebaut auf NumPy. Damit lassen sich CSV-/Excel-/Datenbank-Daten einlesen, bereinigen, aggregieren und wieder exportieren — der de-facto Standard für Datenanalyse in Python.
Im Detail
Grundstruktur: DataFrame und Series
import pandas as pd
df = pd.read_csv("verkaeufe.csv")
umsatz_pro_kategorie = df.groupby("kategorie")["umsatz"].sum()
# Filtern
teure_verkaeufe = df[df["umsatz"] > 1000]
# Neue Spalte berechnen
df["umsatz_mit_steuer"] = df["umsatz"] * 1.19
# Fehlende Werte behandeln
df = df.dropna(subset=["kunde_id"])Ein DataFrame besteht aus benannten Spalten (jede Spalte selbst ein Series-Objekt, technisch ein NumPy-Array eines einheitlichen Typs) und einem Index für die Zeilen — konzeptionell einer Tabellenkalkulation ähnlich, aber vollständig programmatisch steuerbar und ohne die Zeilenlimits einer Excel-Datei (Pandas verarbeitet problemlos Millionen von Zeilen, solange der Arbeitsspeicher ausreicht). Eine einzelne Spalte für sich (df["umsatz"]) ist eine Series — eindimensional, mit demselben Index wie der DataFrame, aus dem sie stammt.
Typische Operationen
- Filtern: boolesche Indizierung wie
df[df["umsatz"] > 1000]— liest sich fast wie eine SQL-WHERE-Klausel. - Gruppieren und Aggregieren:
groupbyentspricht SQLGROUP BY, gefolgt von einer Aggregationsfunktion (sum,mean,count). - Zusammenführen:
mergeentspricht einem SQL-JOINzwischen zwei DataFrames anhand gemeinsamer Spalten. - Umformen: Pivot-Tabellen (
pivot_table) drehen Zeilen zu Spalten und umgekehrt, nützlich für Kreuztabellen-Auswertungen. - Zeitreihen: eingebaute Funktionen für Datums-/Zeitspalten (Resampling auf Tages-/Monatsebene, Zeitzonenumrechnung) — einer der Gründe, warum Pandas ursprünglich für Finanzdatenanalyse entwickelt wurde (der Name steht für “Panel Data”).
Rolle im Data-Science-Workflow
Pandas übernimmt in einem typischen Data-Science-Workflow meist die Bereinigungs- und Vorverarbeitungsphase (“Data Wrangling”): fehlende Werte behandeln (löschen oder auffüllen), Datentypen korrigieren (z. B. Text-Datumsangaben in echte Datumsobjekte umwandeln), Spalten umbenennen oder neu berechnen, Duplikate entfernen — bevor die aufbereiteten Daten an spezialisiertere Bibliotheken wie SciPy (statistische Tests) oder Machine-Learning-Werkzeuge (scikit-learn) weitergereicht werden. In der Praxis verbringen Data-Science-Teams oft den Großteil der Projektzeit genau in dieser Pandas-lastigen Bereinigungsphase, nicht im eigentlichen Modelltraining.
Siehe auch: NumPy, Data Science, SciPy