Thema: statistics
-
Ein Konfidenzintervall für einen Median, ein Perzentil oder ein Verhältnis per Bootstrap ermitteln
Die Rohbeobachtungen viele Male mit Zurücklegen neu ziehen, die Statistik für jede Ziehung berechnen und das Intervall aus der entstehenden Verteilung ablesen; das liefert eine Unsicherheit für Mediane, Perzentile, Verhältnisse und Differenzen, für die keine Lehrbuchformel gilt. Methode, Anzahl der Ziehungen und Stichprobengrösse angeben und dem Verfahren bei extremen Perzentilen kleiner Stichproben nicht vertrauen.
-
Differential Privacy in einem Absatz, und wo sie nicht passt
Differential Privacy begrenzt, wie stark der Datensatz einer einzelnen Person die Ausgabeverteilung eines Abfragemechanismus verändern kann, indem kalibriertes Rauschen hinzugefügt und jede Antwort einem Budget belastet wird; sie passt zu wiederholten aggregierten Veröffentlichungen über grosse Populationen und passt nicht zu Datensätzen auf Einzelfallebene, kleinen Gruppen, exakten Operationen oder einmaligen internen Analysen.
-
Messunsicherheit und signifikante Stellen in technischen Berichten
Ein Messwert ohne Unsicherheit ist unvollständig: die Messung wiederholen, den Mittelwert mit der Standardabweichung des Mittelwerts und der Anzahl Durchläufe angeben, die Unsicherheit auf eine oder zwei signifikante Stellen runden und den Wert auf dieselbe Stelle, und angeben, was das Intervall bedeutet; Stellen jenseits der Unsicherheit sind Rauschen.
-
Korrelation versus Kausalität in Vorfalls- und Betriebsdaten
Ein Korrelationskoeffizient misst, wie sich zwei Reihen gemeinsam bewegen; er sagt nichts darüber, welche die andere antreibt, ob ein dritter Faktor wie Traffic beide antreibt, oder ob die Daten nach dem Ergebnis ausgewählt wurden. Zuerst plotten, für die naheliegenden gemeinsamen Ursachen konditionieren, das zeitliche Verhältnis prüfen und mit einer Intervention wie einem Flag oder einem Canary bestätigen, bevor gehandelt wird.
-
p-Werte: was sie messen und was nicht
Ein p-Wert ist die unter dem gesamten statistischen Modell einschliesslich der Nullhypothese berechnete Wahrscheinlichkeit für eine Teststatistik, die mindestens so extrem ist wie die beobachtete. Er ist nicht die Wahrscheinlichkeit, dass die Nullhypothese wahr ist, nicht die Wahrscheinlichkeit, dass der Zufall das Ergebnis hervorgebracht hat, kein Mass für die Effektgrösse, und 0,05 ist eine Konvention und keine Grenze zwischen Wahrheit und Rauschen.
-
Logarithmische Skalen, gekappte Achsen und andere Wege, wie ein Chart in die Irre führt
Eine logarithmische Achse macht aus gleichen Verhältnissen gleiche Abstände und ist die richtige Wahl für Daten über mehrere Grössenordnungen, verbirgt aber absolute Unterschiede und kann Null nicht darstellen; ein Balkendiagramm, dessen Achse nicht bei Null beginnt, verfälscht Proportionen. Die Skala beschriften, die Grundlinie bei Balken beibehalten und für Zählwerte mit Null eine Symlog-Skala verwenden.
-
Wie stark lagen die Varianzannahmen hinter Stichprobengrössen-Berechnungen in kleinen Online-Experimenten daneben, und in welche Richtung?
Offene Frage: Das NIST/SEMATECH-Handbuch weist darauf hin, dass die klassische Formel zur Stichprobengrössenberechnung eine bekannte Standardabweichung voraussetzt, die in der Praxis aus früheren Daten geschätzt wird. Wie verhielt sich bei so geplanten kleinen Produktexperimenten die angenommene Varianz zur tatsächlich beobachteten Varianz, sobald die Daten vorlagen, war der Fehler systematisch zu optimistisch, und was taten Teams, wenn sich das Experiment als unterdimensioniert erwies?
-
Wie sollte ein Dashboard die Unsicherheit einer Kennzahl darstellen, damit Betreiber auf Signal statt auf Rauschen reagieren?
Offene Frage: Dashboards zeichnen einen Prozentsatz aus drei Anfragen mit derselben scheinbaren Sicherheit wie einen aus drei Millionen, und ein p99 aus einem dünn besetzten Histogramm-Bucket als präzise Linie; welche Arten, Stichprobengrössen, Konfidenzbänder oder Schätzfehler darzustellen, haben sich nachweislich als wirksam erwiesen, um Fehlalarme und übersehene Probleme bei Bereitschaftsdienst-Betreibern zu verringern?
-
Reservoir-Sampling: eine gleichverteilte Stichprobe aus einem Datenstrom unbekannter Länge
k Elemente aus einem Datenstrom behalten, ohne dessen Länge zu kennen: das Reservoir zunächst mit den ersten k Elementen füllen, danach für Element i mit Wahrscheinlichkeit k/i einen zufälligen Platz ersetzen. Ein einziger Durchlauf, O(k) Speicher, jedes Element landet mit exakter Wahrscheinlichkeit k/n in der Stichprobe, was sich mit einem kurzen teleskopierenden Argument zeigen lässt.
-
Wahl von Klassifikationsmetriken: Precision, Recall, F1, Schwellenwerte und Kalibrierung
Die Genauigkeit (Accuracy) verdeckt das Wesentliche, wenn Klassen ungleich verteilt sind oder Fehler unterschiedliche Kosten haben; Precision und Recall beschreiben die beiden Fehlerarten, F1 kombiniert sie, schwellenwertfreie Scores beschreiben die Rangfolge, und die Kalibrierung sagt aus, ob eine vorhergesagte Wahrscheinlichkeit von 0,8 tatsächlich 80 Prozent bedeutet. Die Metrik ist vor dem Training anhand der Entscheidung zu wählen, die das Modell unterstützen soll.
-
Nach Fokussierung auf die schlechtesten Fälle gemessene Verbesserungen sind teilweise Regression zur Mitte
Hypothese: Wenn ein technisches Vorhaben anhand einer verrauschten Kennzahl die am schlechtesten bewerteten Endpunkte, Tests, Hosts oder Mandanten auswählt und deren Verbesserung nach einer Intervention berichtet, wäre ein erheblicher Teil des berichteten Gewinns auch ohne die Intervention eingetreten, weil auf extreme Messwerte tendenziell weniger extreme folgen. Ein vorgeschlagener Test mit einer unberührten Kontrollgruppe wird beschrieben.
-
Konfidenzintervalle im Überblick: Was das Intervall aussagt und was nicht
Ein 95%-Konfidenzintervall stammt aus einem Verfahren, das bei wiederholten Stichproben in 95% der Fälle den wahren Wert einschliesst; ein bestimmtes Intervall enthält ihn entweder oder nicht. Seine Breite schrumpft mit der Wurzel aus dem Stichprobenumfang und wächst mit der Streuung. Es als den Bereich der mit den Daten verträglichen Werte lesen, es neben jeder Schätzung angeben und beim Vergleichen das Intervall einer Differenz berechnen.
-
Overfitting und Regularisierung im Überblick: Bias, Varianz und der Strafterm-Regler
Ein Modell overfittet, wenn es das Rauschen in den Trainingszeilen mitlernt und sein Validierungswert hinter seinen Trainingswert zurückfällt; Regularisierung tauscht einen Teil der Anpassungsgüte gegen Stabilität, indem sie grosse Koeffizienten bestraft oder die Modellkapazität begrenzt, und Lern- sowie Validierungskurven zeigen, auf welcher Seite dieses Zielkonflikts ein Modell steht.
-
Ein A/B-Test auswerten: feste Zeithorizonte, Zwischenschauen und multiple Vergleiche
Zwei Gewohnheiten machen aus einem A/B-Test unbemerkt einen Zufallsgenerator: das Abbrechen, sobald der p-Wert erstmals unter die Schwelle fällt, und das Testen vieler Kennzahlen oder Segmente, bis eines davon „gewinnt“. Zeithorizont und primäre Kennzahl im Voraus festlegen, bei laufender Beobachtung eine sequenzielle Methode verwenden, sekundäre Vergleiche korrigieren und alles berichten, was betrachtet wurde.
-
Ein kleines Experiment vorregistrieren, bevor die Daten betrachtet werden
Hypothese, primäres Ergebnis, Stichprobe und Abbruchregel, Ausschlüsse und Analyseplan schriftlich festhalten, dann das Dokument mit Zeitstempel committen oder registrieren, bevor die Daten erhoben oder eingesehen werden; die geplante Analyse zuerst berichten und alles andere als explorativ kennzeichnen.
-
Effect size versus statistical significance: which one decides
Significance says whether the data are unusual under the null model at the sample size used; the effect size says how big the difference is in units that matter. Large systems make trivial effects significant and small pilots make large effects non-significant. Define the smallest effect worth acting on before the experiment and compare the interval to it.
-
Variance, standard deviation, MAD and IQR: reporting the spread
A location without a spread is half a number. The standard deviation describes spread well for roughly normal data and is dominated by the tails otherwise; the interquartile range and the median absolute deviation describe the bulk. Name the measure, give the sample size, use the n−1 form for estimates from samples, and never label an error bar with a bare ±.
-
Estimating how many samples a comparison needs before collecting them
Small samples mislead because their means and spreads wander far from the truth, so a difference between two small groups is often noise. Decide the smallest difference worth detecting, estimate the spread from a pilot, choose the error rates, and compute the sample size per group before the comparison; it grows with the square of spread over difference.
-
Mean, median and mode: choosing a summary statistic that does not mislead
The arithmetic mean is pulled by skew and outliers, the median ignores how far the extremes go, and the mode only makes sense for categorical or clearly peaked data. Choose by the shape of the distribution and by the question asked, print the count next to every summary, and never average ratios or percentiles.
-
Simpson's paradox and base-rate neglect in reports
Two arithmetic effects make a correct table support a wrong sentence: an association can reverse when a population is split into groups that were mixed in different proportions, and a signal's accuracy says little about what a positive signal means until the base rate is known. Ask how groups were mixed and keep denominators visible.
Maschinenlesbar: JSON