EMZETT.
Login

Data Science

Kurz: Das Fachgebiet, aus (oft großen) Datenmengen mit statistischen und programmiertechnischen Methoden Erkenntnisse zu gewinnen — Schnittmenge aus Statistik, Programmierung und Fachwissen zur jeweiligen Domäne.

Genauer: Ein typischer Data-Science-Workflow umfasst Datenbeschaffung, Bereinigung (oft der zeitaufwändigste Schritt), Analyse/Visualisierung und häufig den Bau von Vorhersagemodellen (Machine Learning). In Python dafür das Standard-Trio: Pandas (Daten), NumPy (Numerik), SciPy/scikit-learn (fortgeschrittene Verfahren).

Im Detail

Der klassische Data-Science-Workflow lässt sich grob in Phasen einteilen: Datenbeschaffung (aus Datenbanken, APIs, Dateien), Bereinigung (fehlende Werte, Ausreißer, Duplikate — in der Praxis oft 60-80% der tatsächlichen Arbeitszeit), explorative Analyse (Verteilungen verstehen, Muster erkennen, meist mit Visualisierung), Modellierung (statistische Modelle oder Machine-Learning-Verfahren) und schließlich Kommunikation der Ergebnisse (Dashboards, Berichte, Präsentationen).

Python dominiert das Feld dank eines eingespielten Werkzeug-Stapels: Pandas für tabellarische Daten (DataFrames, ähnlich einer Excel-Tabelle, aber programmierbar), NumPy für schnelle numerische Array-Operationen darunter, SciPy und scikit-learn für statistische Tests und klassisches Machine Learning, sowie Jupyter Notebooks als interaktive Entwicklungsumgebung, in der Code, Ausgabe und Visualisierung nebeneinander in einem Dokument leben. Für größere Datenmengen, die nicht mehr in den Arbeitsspeicher passen, kommen verteilte Frameworks wie Spark zum Einsatz.

Data Science überschneidet sich stark mit, ist aber nicht identisch mit KI/Machine Learning: Data Science ist der breitere Prozess aus Datenanalyse und Erkenntnisgewinnung, Machine Learning ist eines der möglichen Werkzeuge darin (nicht jede Data-Science-Frage braucht ein trainiertes Modell — oft reicht eine gute Visualisierung oder ein statistischer Test).

Das Data-Science-Team

In größeren Unternehmen wird die Data-Science-Rolle oft weiter aufgeteilt: Data Engineers bauen und pflegen die Infrastruktur, die Daten überhaupt zuverlässig fließen lässt (Pipelines, Datenbanken, Data Warehouses); Data Scientists analysieren diese Daten und bauen Modelle; Data Analysts konzentrieren sich stärker auf Reporting und Visualisierung für Geschäftsentscheidungen statt auf Machine-Learning-Modellierung. In kleineren Teams oder Startups übernimmt oft eine einzelne Person alle drei Rollen gleichzeitig.

Siehe auch: Pandas, NumPy, SciPy, KI