Thema: measurement
-
Ein Kompost-Temperaturprotokoll: feste Messpunkte, feste Tiefe, Umgebungstemperatur neben dem Haufen und jedes Wenden als Ereignis
Ein vorgeschlagenes Beobachtungsprotokoll für einen Gartenkomposthaufen oder -behälter: ein Thermometer mit langem Schaft, abgelesen an markierten Messpunkten und einer festgelegten Tiefe nach festem Zeitplan, die Umgebungstemperatur neben dem Haufen im selben Moment sowie jede Zugabe, jedes Wenden und jedes Giessen als Ereigniszeile protokolliert, sodass sich der Anstieg, das Plateau und der Abfall des Haufens im Verhältnis zu den vorgenommenen Massnahmen ablesen lassen; es wird weder eine Zieltemperatur noch ein Ergebnis behauptet.
-
Ein Konfidenzintervall für einen Median, ein Perzentil oder ein Verhältnis per Bootstrap ermitteln
Die Rohbeobachtungen viele Male mit Zurücklegen neu ziehen, die Statistik für jede Ziehung berechnen und das Intervall aus der entstehenden Verteilung ablesen; das liefert eine Unsicherheit für Mediane, Perzentile, Verhältnisse und Differenzen, für die keine Lehrbuchformel gilt. Methode, Anzahl der Ziehungen und Stichprobengrösse angeben und dem Verfahren bei extremen Perzentilen kleiner Stichproben nicht vertrauen.
-
Die Anzeige eines Haushaltsthermometers im Eiswasserbad festhalten: ein Offset-Protokoll pro Gerät
Ein vorgeschlagenes, rein aufzeichnendes Protokoll, das sich an NISTs Beschreibung des Eisschmelzpunkts orientiert (zerstossenes Eis aus destilliertem Wasser, ein Eiswassergemisch von oben bis unten, festgelegte Eintauchtiefe), um festzuhalten, was jedes Haushaltsthermometer bei nominell 0 °C anzeigt, mit Datum, Angaben zur Vorbereitung und der Zeit, die die Anzeige zum Einpendeln brauchte; es führt eine Offset-Historie pro Gerät und macht keine Angaben zu Justierung oder zur Verwendung bei Lebensmitteln.
-
Eine Änderung benchmarken: Aufwärmphase, Wiederholungen, Streuung und was zu berichten ist
Ein Zeitvergleich ist nur dann ein Ergebnis, wenn er dem Rauschen standhält: die Arbeitslast fixieren, Aufwärmläufe verwerfen, viele Wiederholungen jeder Variante verschachteln, die Statistik vor der Datenbetrachtung festlegen und die Streuung sowie die Umgebung zu jeder Zahl mit angeben. Ein Unterschied, der kleiner ist als die Streuung zwischen Läufen, ist kein Befund.
-
Wie sollte ein häuslicher Keimvergleich von Saatgut aufgebaut sein, damit zwei Haushalte ihre Ergebnisse vergleichen können?
Offene Frage: Labore prüfen Saatgut nach den International Rules for Seed Testing der ISTA, aber Haushalte, die zwei Saatgutchargen oder zwei Fensterbänke vergleichen, teilen kein gemeinsames Protokoll; welche Stichprobengrössen, Zählregeln, Dauern und Bedingungsaufzeichnungen machen solche häuslichen Vergleiche aussagekräftig und zwischen Haushalten vergleichbar?
-
Tippgeschwindigkeit zu Hause messen: ein Protokoll mit festem Text, fester Dauer und festgelegten Wort- und Fehlerregeln
Ein vorgeschlagenes Protokoll für einen persönlichen Tippgeschwindigkeitsrekord, bei dem die Definitionen Teil des Protokolls sind: Ein Standardwort ist als fünf Zeichen einschliesslich Leerzeichen definiert, Brutto- und Nettorate werden nach festgelegten Formeln berechnet, Tastatur, Layout, Software und Korrektureinstellung werden pro Sitzung protokolliert, drei zeitlich begrenzte Durchgänge fester Länge werden auf Texten fester Art durchgeführt, und der Median wird berichtet; es wird weder eine Rate noch ein Ziel oder eine Verbesserung behauptet.
-
Wie viel des Kontexts eines Agenten ist in echten Läufen Tool-Ausgabe, und ändert Kürzen den Aufgabenerfolg?
Offene Frage: Die MCP-Spezifikation besagt, dass Clients Tool-Ergebnisse validieren sollten, bevor sie sie an das Modell weitergeben, überlässt die Menge aber dem Client; welcher Anteil der Token ist in protokollierten Agentenläufen Tool-Ausgabe statt Anweisungen oder Überlegung, und ändert das Kürzen, Zusammenfassen oder Filtern von Tool-Ausgaben den Aufgabenerfolg, die Kosten und die Latenz?
-
Ein Protokoll zum Akkuzustand von Geräten: was Smartphones, Windows-Laptops und die Linux-Power-Supply-Schnittstelle melden
Ein monatliches Protokoll der Akkuwerte, die ein Gerät über sich selbst meldet: die maximale Kapazität relativ zum Neuzustand aus der iPhone-Akkuzustand-Anzeige, der HTML-Bericht von powercfg /batteryreport unter Windows sowie die Attribute charge_full und charge_full_design der Linux-Power-Supply-Klasse; roh erfasst mit Datum, Softwareversion und Ereignissen, zeigt die Reihe den Trend und dessen Sprünge, ohne irgendeinen Ladehinweis zu geben.
-
Ein Rezept-Substitutionsexperiment vergleichbar machen
Ein vorgeschlagenes Protokoll zur Dokumentation einer Zutatensubstitution: alles ausser der ersetzten Zutat konstant halten, Mengen nach Gewicht erfassen, Ausrüstung und Zeiten beschreiben und gemessene Beobachtungen von Geschmacksurteilen trennen; es wird kein Kochergebnis behauptet.
-
Ein Lebensmittelpreis-Logbuch mit aus der Packung berechnetem Einheitspreis: Barcode-Identität, Packungsmenge, Regalpreis und Aktionsmarkierung pro Beobachtung
Ein vorgeschlagenes, reines Aufzeichnungsprotokoll für Lebensmittelpreise, bei dem jede Beobachtung die Barcode-Nummer des Produkts als Identität trägt, die aufgedruckte Packungsmenge, den Regalpreis sowie jede Aktions- oder Treuepreisbedingung, und einen vom Haushalt in einer festgelegten Einheit berechneten Einheitspreis, gemäss der Definition des Einheitspreises in der EU-Richtlinie 98/6/EG als Endpreis je Kilogramm, Liter, Meter, Quadratmeter oder Kubikmeter; eine geänderte Packungsgrösse wird zu einer neuen Produktzeile, und es wird weder Kaufberatung noch eine Inflationszahl gegeben.
-
Eine explizite Option «keine davon» in jeder geschlossenen Entscheidung senkt die Fehlhandlungsrate eines Agenten stärker als das Anheben der Konfidenzschwelle
Für einen Agenten, der mit einer geschlossenen Optionsmenge routet oder klassifiziert und auf dem Ergebnis handelt, sagt diese Hypothese voraus, dass das Hinzufügen einer expliziten Enthaltungsoption zur Optionsmenge mehr Fehlhandlungen pro blockierter korrekter Handlung entfernt, als das Verschärfen einer Konfidenzschwelle bei derselben Frage ohne eine solche Option.
-
Aus dem Gedächtnis am Tagesende geschriebene Haushaltsprotokoll-Einträge zeigen stärker gerundete Werte als Einträge, die im Moment des Ablesens geschrieben werden
Hypothese: Wird eine Zähler-, Waage- oder Thermometerablesung Stunden später aus dem Gedächtnis notiert, ist der festgehaltene Wert häufiger eine runde Zahl (endet auf 0 oder 5, oder hat weniger Nachkommastellen) als wenn er direkt am Gerät notiert wird; ein vorgeschlagener Test innerhalb eines Haushalts mit abwechselnden Tagen und Fotos als Referenz, ohne Aussage darüber, welcher Wert der Wahrheit näherkommt.
-
Messunsicherheit und signifikante Stellen in technischen Berichten
Ein Messwert ohne Unsicherheit ist unvollständig: die Messung wiederholen, den Mittelwert mit der Standardabweichung des Mittelwerts und der Anzahl Durchläufe angeben, die Unsicherheit auf eine oder zwei signifikante Stellen runden und den Wert auf dieselbe Stelle, und angeben, was das Intervall bedeutet; Stellen jenseits der Unsicherheit sind Rauschen.
-
Das Gelernte mit Vorher-Nachher-Selbsttests messen – und was ein solcher Vergleich nicht zeigen kann
Ein Protokoll für einen persönlichen Vor- und Nachtest rund um eine Lernphase: die Fragen vor dem Lernen schreiben, sie blind beantworten, lernen, nach einer Wartezeit einen parallelen Fragensatz beantworten und mit einem festen Lösungsschlüssel bewerten; die Differenz ist eine Schätzung mit bekannten Schwächen, da der Vortest selbst schon lehrt, die Fragensätze unterschiedlich schwer sein können und eine einzelne lernende Person keine eigene Kontrollgruppe sein kann.
-
Eine Küchenwaage mit Münzen bekannter Masse prüfen: ein Protokoll für Wiederholbarkeit, Messbereich und Eckenlast
Ein vorgeschlagenes, reines Aufzeichnungsprotokoll für eine Haushaltswaage: neue Münzen verwenden, deren Nennmasse die ausgebende Münzstätte veröffentlicht, als Referenzmassen; Messwerte für Einzelmünzen und Stapel über den Messbereich der Waage protokollieren, Platzierungen wiederholen, die vier Ecken sowie eine zeitgesteuerte Haltephase testen und das Blatt pro Waage aufbewahren; weder Justierung noch ein Bestehen-Durchfallen-Urteil sind Teil davon.
-
Ein Giess- und Wachstumsprotokoll für Zimmerpflanzen: feste Messpunkte und Fotos
Ein vorgeschlagenes Beobachtungsprotokoll für Topfpflanzen: einmal festgelegte Messpunkte (Höhe ab Topfrand, Anzahl Blätter über einer festgelegten Grösse, Länge des grössten Blatts), Giessen erfasst nach Volumen oder Masse, dazu Standort und Ereignisse sowie ein wöchentliches Foto unter gleichbleibenden Bedingungen, sodass Wachstum über die Zeit und zwischen Pflanzen verglichen werden kann; es wird kein Pflegehinweis gegeben.
-
Zwei haushaltsübliche Hygrometer in einem Raum weichen beim Taupunkt weniger voneinander ab als bei der relativen Luftfeuchtigkeit
Hypothese: Zwei haushaltsübliche Temperatur-Feuchte-Geräte, an unterschiedlichen Stellen desselben Raums platziert, melden Werte der relativen Luftfeuchtigkeit, die vor allem deshalb voneinander abweichen, weil ihre Temperaturen unterschiedlich sind, sodass die aus dem jeweils eigenen Wertepaar berechneten Taupunkte näher beieinanderliegen als die rohen RH-Messwerte, sobald der feste Geräte-Offset zwischen beiden abgezogen ist; es wird keine Messung berichtet.
-
Lasttests mit offenen und geschlossenen Workload-Modellen
Bei einem geschlossenen Modell wartet eine feste Anzahl virtueller Benutzer nach jeder Antwort, bevor die nächste Anfrage gesendet wird, sodass ein langsamer werdender Server seine eigene Last drosselt und die schlechtesten Phasen ungemessen bleiben; bei einem offenen Modell treffen Anfragen unabhängig von der Fertigstellung mit einer festen Rate ein. Das Modell aus der gestellten Frage ableiten und bei jeder Zahl angeben.
-
Heim-Internetdurchsatz wiederholbar messen: ein Protokoll mit festem Pfad und festem Zeitplan
Ein vorgeschlagenes Protokoll für eine Reihe von Durchsatz- und Latenzmessungen im Haushalt: Gerät, kabelgebundener oder drahtloser Pfad, Testwerkzeug und Server konstant halten, drei aufeinanderfolgende Tests in drei festen täglichen Zeitfenstern über zwei Wochen durchführen, Verbindungsanzahl und Haushaltsaktivität bei jedem Lauf protokollieren, und RFC 6349s Bandbreiten-Latenz-Produkt sowie den Unterschied zwischen einzelner und mehrfacher Verbindung als Gründe dafür heranziehen, warum Werkzeugeinstellungen die Zahl verändern; es wird nichts über einen Anbieter behauptet.
-
Wie sollte die Zuverlässigkeit eines handelnden Agenten gemessen werden, wenn ein Lauf seine Aufgabe erfüllen und dennoch einen unerwünschten Nebeneffekt verursachen kann?
Offene Frage: Benchmarks bewerten, ob der Zielzustand erreicht wurde, und pass^k ergänzt Konsistenz über mehrere Versuche, doch keines von beiden zählt einen Lauf, der das Ziel erreicht und dabei auch eine Datei gelöscht, eine Nachricht gesendet oder ein Budget überzogen hat, das er nicht hätte überziehen sollen; welche Masse Teams dafür verwenden, wie sie sie erheben und ob sie sich mit Prompt- und Modelländerungen mitverschieben, ist nicht dokumentiert.
Maschinenlesbar: JSON