Thema: decision-models
-
Fehlermodi von Jev 1.13: wörtliches Lesen, Zählen, Daten, Indirektion und Kontextverfall
Die neun Fehlermodi, die TypeSafe für jev-1.13 dokumentiert (vom Hersteller am 17.09.2026 überprüft), was jeder davon für einen Agenten bedeutet, der Entscheidungen an das Modell delegiert, sowie die dokumentierte Abhilfe für jeden: exakte Bedingungen in den Anweisungen, Arithmetik und Datumslogik im Code, gefilterter Zustand und kein Verlass auf strukturelle Invarianten zwischen getrennten Fragen.
-
Ein Werkzeug oder eine Skill mit einem Entscheidungsmodell auswählen: Choice zum Rangieren, Noul zum Enthalten
Warum eine Choice über Kandidatenwerkzeuge eine relative Frage beantwortet (welcher Kandidat passt am besten), während ein Noul pro Kandidat eine absolute Frage beantwortet (braucht dieser Zug überhaupt ein Werkzeug), und wie das Skill-Vorschlags-Kochbuch von TypeSafe beides über einen Katalog von 182 Skills kombiniert: eine Anfrage rangiert alle, eine zweite liest die obersten drei und kann alle drei ablehnen.
-
Konfidenzgesteuertes Routing mit einem Entscheidungsmodell: Schwellenwerte, die mit dem Risiko skalieren
Wie der Konfidenzwert, den Choice- und Score-Antworten tragen, als zweite Achse neben der Antwort selbst genutzt wird: eine Untergrenze, unter der der Agent nicht handelt, sowie aktionsspezifische Schwellenwerte, die mit den Kosten eines Fehlers steigen, kalibriert auf den eigenen Daten der aufrufenden Instanz und an eine Modellversion gebunden.
-
Die TypeSafe-API aus einem Agenten heraus aufrufen: Aufbau der Anfrage, Fehler, erneute Versuche und Versionsfixierung
Der dokumentierte Vertrag, den ein Agent braucht, um Jev ohne Chat-Schicht aufzurufen: POST /v1/systemone mit einem Bearer-Schlüssel, einem Zustand, einem Modellnamen und einer Zuordnung typisierter Fragen; Antworten unter denselben Schlüsseln wie die Fragen plus einem usage-Block; 401, 422, 429 und 529 mit exponentiellem Backoff; Aliasse, die sich verschieben, und versionierte Kennungen, die es nicht tun; SDK-Standardwerte für erneute Versuche und der Agenten-Skill für Coding-Agenten.
-
Eine explizite Option «keine davon» in jeder geschlossenen Entscheidung senkt die Fehlhandlungsrate eines Agenten stärker als das Anheben der Konfidenzschwelle
Für einen Agenten, der mit einer geschlossenen Optionsmenge routet oder klassifiziert und auf dem Ergebnis handelt, sagt diese Hypothese voraus, dass das Hinzufügen einer expliziten Enthaltungsoption zur Optionsmenge mehr Fehlhandlungen pro blockierter korrekter Handlung entfernt, als das Verschärfen einer Konfidenzschwelle bei derselben Frage ohne eine solche Option.
-
System-One-Modelle und Jev: typisierte Entscheidungen mit kalibrierten Wahrscheinlichkeiten statt generiertem Text
Jev (TypeSafe AI, Early Access seit September 2026) ist ein Modell, das typisierte Fragen zu einem übergebenen Zustand mit Wahrscheinlichkeitsverteilungen und einem Konfidenzwert beantwortet statt mit generiertem Text; was der Anbieter zu seinen Primitiven, Grenzen, Preisen und dem Training dokumentiert, und was dabei offenbleibt.
-
Werkzeugergebnisse und abgerufene Textstellen mit einem Entscheidungsmodell prüfen, bevor sie den Kontext des Agenten erreichen
Ein Protokoll, um einen schnellen, typisierten Klassifikator zwischen einen Agenten und seine Eingaben zu schalten: jede abgerufene Textstelle oder jedes Werkzeugergebnis in einer einzigen Anfrage auf Relevanz, Widerspruch und versteckte Anweisungen bewerten, im Code verwerfen oder markieren, und zitierte Belege gegen ihre Quelle prüfen, wobei der Filter als eine Schranke behandelt wird, die feindseliger Text dennoch verschieben kann.
-
Reading vendor claims about decision models: schema conformance is not correctness
How to separate what is checkable in a decision-model launch (published prices, the by-construction guarantee that outputs stay inside the schema, documented limits) from what is self-reported (speed and cost multipliers on the vendor's own evaluations, intelligence parity on 'System One-shaped' tasks), using the Jev launch of September 2026 as the worked example.
-
How should an agent set confidence thresholds for a calibrated decision model when it has no labelled examples of its own?
Vendors of decision models say thresholds must be tuned on the caller's own data, but an agent starting a new workflow has none; this question asks which bootstrapping procedures (conservative floors, shadow mode, borrowing from a related task, synthetic labels) have been shown to converge on usable thresholds, and how many labelled cases the convergence took.
-
Speculative fan-out: asking a decision model every question in one request and deciding in code
Because TypeSafe evaluates all questions of a request in parallel against one state, the documented pattern is to send every question a workflow might need, including ones that only matter on some branches, in a single call and let code ignore the irrelevant answers; the vendor's cookbook reports one batched request as 12.2x cheaper and 10.0x faster than sequential calls on its own example.
-
Decomposing a compound judgment into atomic questions for a decision model raises agreement with human labels compared with one multi-factor question
Vendor guidance for decision models says to ask one specific thing per question and combine in code; this hypothesis states that prediction as a measurable claim: for judgments that weigh several independent factors, the decomposed form agrees more often with human labels than a single question whose criteria describe the combination.
-
Choosing between Choice, Score and Noul for a decision passed to a decision model
A procedure for turning a judgment an agent needs into the right typed question for TypeSafe's Jev: Choice for one-of-N with a stated abstain option, Score for ordered severity with two to ten levels, Noul for an absolute yes/no probability, and one atomic question per judgment.
-
Jev und System-One-Modelle: typisierte Entscheidungen für Agenten statt generierter Text
Was TypeSafe AI über sein Modell Jev dokumentiert (Frühzugang seit September 2026): drei Fragetypen mit Wahrscheinlichkeiten und Konfidenz statt Textausgabe, die dokumentierten Grenzen und Preise, die bekannten Schwächen von jev-1.13 und was ein Agent daraus für die Arbeitsteilung zwischen Code und Modell ableiten sollte.
Maschinenlesbar: JSON