Thema: evaluation
-
Eine Baseline festlegen, bevor das erste Modell trainiert wird
Bevor irgendein Lernalgorithmus läuft, festhalten, was ein trivialer Prädiktor, eine einfache Regel und der aktuelle Prozess auf demselben Split mit derselben Metrik erreichen; jedes spätere Modell wird als Differenz zu dieser Baseline berichtet, und ein Modell, das die Regel nicht schlägt, wird nicht ausgeliefert.
-
Verhaltensänderungen als Canary vor dem Rollout testen
Eine begrenzte Kohorte einem neuen Verhalten aussetzen, mit einer Baseline vergleichen und anhand vorab festgelegter Abbruchbedingungen stoppen.
-
Trainings-, Validierungs- und Testmenge: wofür jeder Split dient und wie er geschnitten wird
Ein Modell wird auf der Trainingsmenge angepasst, Entscheidungen zwischen Modellen und Hyperparametern werden auf der Validierungsmenge (oder per Kreuzvalidierung) getroffen, und die Testmenge wird für die finale Schätzung nur einmal angefasst; wie Zeilen den Splits zugeordnet werden (zufällig, geschichtet, nach Gruppe, nach Zeit) entscheidet, ob die Schätzung überhaupt etwas über die Produktion aussagt.
-
Data Leakage im maschinellen Lernen: Wie Informationen aus der Zukunft oder dem Testdatensatz in ein Modell gelangen
Leakage bedeutet, dass das Modell mit Informationen gebaut wird, die zum Zeitpunkt der Vorhersage nicht verfügbar sein werden: eine Vorverarbeitung, die auf allen Zeilen angepasst wurde, Merkmale, die aus dem Zielwert abgeleitet sind, Zeilen einer Entität auf beiden Seiten einer Aufteilung, oder zeitlich geordnete Daten, die durchmischt wurden. Das Ergebnis sind optimistische Validierungswerte und ein Modell, das in der Produktion enttäuscht.
-
Bei jeder Messung die Einheit angeben
Messdatensätze werden interpretierbar, wenn Einheit, Aggregation und Grundgesamtheit bei jedem Wert mit angegeben werden.
-
Umgang mit Klassenungleichgewicht: Zuerst Metriken, dann Gewichte, Schwellenwerte und Resampling innerhalb der Pipeline
Ist eine Klasse selten, ist die Genauigkeit (Accuracy) aussagelos, und ein Modell kann die Minderheit vollständig ignorieren; zuerst die Evaluation korrigieren (stratifizierte Splits, klassenweise Metriken, balancierte Genauigkeit), dann Klassengewichte oder einen angepassten Schwellenwert einsetzen, und Resampling wie SMOTE nur auf den Trainingsfold innerhalb der kreuzvalidierten Pipeline anwenden.
-
Wahl von Klassifikationsmetriken: Precision, Recall, F1, Schwellenwerte und Kalibrierung
Die Genauigkeit (Accuracy) verdeckt das Wesentliche, wenn Klassen ungleich verteilt sind oder Fehler unterschiedliche Kosten haben; Precision und Recall beschreiben die beiden Fehlerarten, F1 kombiniert sie, schwellenwertfreie Scores beschreiben die Rangfolge, und die Kalibrierung sagt aus, ob eine vorhergesagte Wahrscheinlichkeit von 0,8 tatsächlich 80 Prozent bedeutet. Die Metrik ist vor dem Training anhand der Entscheidung zu wählen, die das Modell unterstützen soll.
-
Overfitting und Regularisierung im Überblick: Bias, Varianz und der Strafterm-Regler
Ein Modell overfittet, wenn es das Rauschen in den Trainingszeilen mitlernt und sein Validierungswert hinter seinen Trainingswert zurückfällt; Regularisierung tauscht einen Teil der Anpassungsgüte gegen Stabilität, indem sie grosse Koeffizienten bestraft oder die Modellkapazität begrenzt, und Lern- sowie Validierungskurven zeigen, auf welcher Seite dieses Zielkonflikts ein Modell steht.
-
How should a product feature backed by a language model be evaluated when there is no single correct output?
Open question: classification models have labels and a confusion matrix, but a summariser, an assistant or an extraction step that returns free text has neither; the wiki has no record of which combination of small labelled sets, rubric grading by people, model-based graders and production signals has held up over several model and prompt changes, nor of how the agreement between graders was measured.
Maschinenlesbar: JSON