Thema: data
-
Feature-Skalierung und kategoriale Kodierung: was transformiert wird, und die Anpassung nur an Trainingsdaten
Distanz- und gradientenbasierte Modelle brauchen numerische Merkmale auf vergleichbaren Skalen (StandardScaler, MinMaxScaler, RobustScaler); kategoriale Spalten werden je nach Kardinalität und Modelltyp per One-Hot-, Ordinal- oder Target-Encoding zu Zahlen. Jeder Transformer wird auf dem Trainingssplit angepasst und unverändert auf Validierungs-, Test- und Produktionszeilen angewendet.
-
Trainings-, Validierungs- und Testmenge: wofür jeder Split dient und wie er geschnitten wird
Ein Modell wird auf der Trainingsmenge angepasst, Entscheidungen zwischen Modellen und Hyperparametern werden auf der Validierungsmenge (oder per Kreuzvalidierung) getroffen, und die Testmenge wird für die finale Schätzung nur einmal angefasst; wie Zeilen den Splits zugeordnet werden (zufällig, geschichtet, nach Gruppe, nach Zeit) entscheidet, ob die Schätzung überhaupt etwas über die Produktion aussagt.
-
Data Leakage im maschinellen Lernen: Wie Informationen aus der Zukunft oder dem Testdatensatz in ein Modell gelangen
Leakage bedeutet, dass das Modell mit Informationen gebaut wird, die zum Zeitpunkt der Vorhersage nicht verfügbar sein werden: eine Vorverarbeitung, die auf allen Zeilen angepasst wurde, Merkmale, die aus dem Zielwert abgeleitet sind, Zeilen einer Entität auf beiden Seiten einer Aufteilung, oder zeitlich geordnete Daten, die durchmischt wurden. Das Ergebnis sind optimistische Validierungswerte und ein Modell, das in der Produktion enttäuscht.
-
Provenienz und Versionierung für kleine Datensätze
Rohdaten bleiben unveränderlich, gesichert durch Prüfsummen und eine dokumentierte Herkunft; neue Dateien entstehen über Skripte statt durch Bearbeitung, Datenverweise werden zusammen mit dem Code versioniert (DVC oder Git LFS), das Paket wird mit einer datapackage.json beschrieben, und die Herkunft wird in PROV-Begriffen festgehalten – so lässt sich jede Zahl in einem Bericht auf einen Commit, eine Prüfsumme und ein Skript zurückführen.
-
Umgang mit Klassenungleichgewicht: Zuerst Metriken, dann Gewichte, Schwellenwerte und Resampling innerhalb der Pipeline
Ist eine Klasse selten, ist die Genauigkeit (Accuracy) aussagelos, und ein Modell kann die Minderheit vollständig ignorieren; zuerst die Evaluation korrigieren (stratifizierte Splits, klassenweise Metriken, balancierte Genauigkeit), dann Klassengewichte oder einen angepassten Schwellenwert einsetzen, und Resampling wie SMOTE nur auf den Trainingsfold innerhalb der kreuzvalidierten Pipeline anwenden.
-
Embeddings als Datentyp: Vektoren fester Länge, eine Distanzfunktion und was eine Spalte davon braucht
Ein Embedding ist ein Fliesskommavektor fester Länge, den ein bestimmtes Modell erzeugt, aussagekräftig nur unter der Distanz, für die dieses Modell trainiert wurde, und nur neben Vektoren derselben Modellversion; sein Speichern verlangt, dass die Dimension, der Modellbezeichner und die Distanz festgehalten werden, und sein Abfragen bedeutet Nächste-Nachbarn-Suche, exakt oder approximiert.
Maschinenlesbar: JSON