Thema: machine-learning
-
Eine Baseline festlegen, bevor das erste Modell trainiert wird
Bevor irgendein Lernalgorithmus läuft, festhalten, was ein trivialer Prädiktor, eine einfache Regel und der aktuelle Prozess auf demselben Split mit derselben Metrik erreichen; jedes spätere Modell wird als Differenz zu dieser Baseline berichtet, und ein Modell, das die Regel nicht schlägt, wird nicht ausgeliefert.
-
Feature-Skalierung und kategoriale Kodierung: was transformiert wird, und die Anpassung nur an Trainingsdaten
Distanz- und gradientenbasierte Modelle brauchen numerische Merkmale auf vergleichbaren Skalen (StandardScaler, MinMaxScaler, RobustScaler); kategoriale Spalten werden je nach Kardinalität und Modelltyp per One-Hot-, Ordinal- oder Target-Encoding zu Zahlen. Jeder Transformer wird auf dem Trainingssplit angepasst und unverändert auf Validierungs-, Test- und Produktionszeilen angewendet.
-
Reproduzierbarkeit eines Machine-Learning-Experiments: Seeds, Umgebung, Daten und die Grenzen des Determinismus
Ein Experiment erneut auszuführen und dieselbe Zahl zu erhalten, verlangt explizit übergebene feste Zufallszustände, festgepinnte Bibliotheksversionen, einen identifizierten Datensatz samt Split sowie das Wissen, dass GPU-Kernel und Bibliotheksversionen Ergebnisse dennoch verändern können; das Protokoll macht Durchläufe reproduzierbar, wo das möglich ist, und macht explizit, wo nicht.
-
Trainings-, Validierungs- und Testmenge: wofür jeder Split dient und wie er geschnitten wird
Ein Modell wird auf der Trainingsmenge angepasst, Entscheidungen zwischen Modellen und Hyperparametern werden auf der Validierungsmenge (oder per Kreuzvalidierung) getroffen, und die Testmenge wird für die finale Schätzung nur einmal angefasst; wie Zeilen den Splits zugeordnet werden (zufällig, geschichtet, nach Gruppe, nach Zeit) entscheidet, ob die Schätzung überhaupt etwas über die Produktion aussagt.
-
Data Leakage im maschinellen Lernen: Wie Informationen aus der Zukunft oder dem Testdatensatz in ein Modell gelangen
Leakage bedeutet, dass das Modell mit Informationen gebaut wird, die zum Zeitpunkt der Vorhersage nicht verfügbar sein werden: eine Vorverarbeitung, die auf allen Zeilen angepasst wurde, Merkmale, die aus dem Zielwert abgeleitet sind, Zeilen einer Entität auf beiden Seiten einer Aufteilung, oder zeitlich geordnete Daten, die durchmischt wurden. Das Ergebnis sind optimistische Validierungswerte und ein Modell, das in der Produktion enttäuscht.
-
Umgang mit Klassenungleichgewicht: Zuerst Metriken, dann Gewichte, Schwellenwerte und Resampling innerhalb der Pipeline
Ist eine Klasse selten, ist die Genauigkeit (Accuracy) aussagelos, und ein Modell kann die Minderheit vollständig ignorieren; zuerst die Evaluation korrigieren (stratifizierte Splits, klassenweise Metriken, balancierte Genauigkeit), dann Klassengewichte oder einen angepassten Schwellenwert einsetzen, und Resampling wie SMOTE nur auf den Trainingsfold innerhalb der kreuzvalidierten Pipeline anwenden.
-
Wahl von Klassifikationsmetriken: Precision, Recall, F1, Schwellenwerte und Kalibrierung
Die Genauigkeit (Accuracy) verdeckt das Wesentliche, wenn Klassen ungleich verteilt sind oder Fehler unterschiedliche Kosten haben; Precision und Recall beschreiben die beiden Fehlerarten, F1 kombiniert sie, schwellenwertfreie Scores beschreiben die Rangfolge, und die Kalibrierung sagt aus, ob eine vorhergesagte Wahrscheinlichkeit von 0,8 tatsächlich 80 Prozent bedeutet. Die Metrik ist vor dem Training anhand der Entscheidung zu wählen, die das Modell unterstützen soll.
-
Embeddings als Datentyp: Vektoren fester Länge, eine Distanzfunktion und was eine Spalte davon braucht
Ein Embedding ist ein Fliesskommavektor fester Länge, den ein bestimmtes Modell erzeugt, aussagekräftig nur unter der Distanz, für die dieses Modell trainiert wurde, und nur neben Vektoren derselben Modellversion; sein Speichern verlangt, dass die Dimension, der Modellbezeichner und die Distanz festgehalten werden, und sein Abfragen bedeutet Nächste-Nachbarn-Suche, exakt oder approximiert.
-
Ein produktives Modell auf Drift überwachen: Eingaben, Ausgaben und verzögerte Labels
Der Offline-Score eines Modells hört in dem Moment auf, zuzutreffen, in dem sich die Eingabeverteilung, die Label-Verteilung oder der Zusammenhang zwischen beiden ändert; Feature- und Vorhersageverteilungen gegen eine Trainingsreferenz überwachen, ausgelieferte Features protokollieren, um Training-Serving-Skew zu erkennen, und verzögerte Labels zurückjoinen, um die reale Kennzahl mit einer Verzögerung zu berechnen.
-
Overfitting und Regularisierung im Überblick: Bias, Varianz und der Strafterm-Regler
Ein Modell overfittet, wenn es das Rauschen in den Trainingszeilen mitlernt und sein Validierungswert hinter seinen Trainingswert zurückfällt; Regularisierung tauscht einen Teil der Anpassungsgüte gegen Stabilität, indem sie grosse Koeffizienten bestraft oder die Modellkapazität begrenzt, und Lern- sowie Validierungskurven zeigen, auf welcher Seite dieses Zielkonflikts ein Modell steht.
-
Versioning a trained model: the artefact together with the code, data, parameters and environment that produced it
A model file alone cannot be reproduced, audited or safely replaced; version it as a record that links the serialised artefact to the code commit, the dataset version, the hyperparameters, the metrics on the fixed test split and the exact dependency versions, and promote versions with aliases rather than by overwriting a file.
-
How should a product feature backed by a language model be evaluated when there is no single correct output?
Open question: classification models have labels and a confusion matrix, but a summariser, an assistant or an extraction step that returns free text has neither; the wiki has no record of which combination of small labelled sets, rubric grading by people, model-based graders and production signals has held up over several model and prompt changes, nor of how the agreement between graders was measured.
Maschinenlesbar: JSON