Thema: agents
-
Pipeline, Fan-out, Orchestrator und Kritikergremium: welches Multi-Agenten-Muster zu welcher Aufgabe passt
Eine Pipeline passt zu Aufgaben mit einer festen Abfolge von Transformationsschritten; paralleler Fan-out passt zu unabhängigen Teilfragen oder zu mehrfachen Versuchen, über die abgestimmt wird; ein Orchestrator mit Workern passt zu Aufgaben, deren Zerlegung erst zur Laufzeit bekannt ist; ein Kritikergremium passt zu Ergebnissen, die anhand mehrerer Kriterien geprüft werden müssen; jedes Muster vervielfacht die Tokenkosten und fügt eine Koordinationsschicht hinzu, die selbst scheitern kann.
-
Die Standardfilterung von ripgrep verkürzt Agenten-Codesuchen gegenüber grep -r
Hypothese: Coding-Agenten, die Repositorys mit den Standard-Ignorierregeln von ripgrep durchsuchen (git-ignorierte, versteckte und binäre Dateien werden übersprungen), brauchen pro Aufgabe weniger Suchaufrufe und lesen weniger irrelevante Ausgabe als Agenten, die grep -r ohne Ausschlüsse verwenden, weil Treffer in Build-Ausgaben und Abhängigkeiten fehlen; es wird keine Messung berichtet.
-
Ein Python-Kommandozeilenwerkzeug entwerfen: argparse, main() und Exit-Codes
Die Schnittstelle in eine als Konsolenskript registrierte Funktion main(argv) -> int legen, mit den argparse-Parametern type und choices validieren, der Exit-Code-Konvention folgen (0 Erfolg, 2 Aufruffehler, 1 sonstiger Fehlschlag, sysexits-Codes nur wenn dokumentiert), Ergebnisse auf stdout und Diagnosemeldungen auf stderr ausgeben sowie SIGINT und abgebrochene Pipes behandeln.
-
Maschinenlesbare Fehlertypen verringern schädliche Wiederholungsversuche durch Agenten
Hypothese: Wenn eine API stabile Problemtypen mit Hinweisen zu Wiederholungsversuchen zurückgibt, führen automatisierte Clients weniger Wiederholungen nicht wiederholbarer Anfragen und weniger doppelte Schreibvorgänge aus als bei rein textbasierten Fehlermeldungen; ein vorgeschlagener Vergleich.
-
Eine Quelle zusammenfassen, ohne sie zu verzerren
Eine faire Zusammenfassung erhält die Aussagen der Quelle in deren Stärke und Reichweite, ordnet sie nach der Gewichtung der Quelle, hält Zahlen zusammen mit ihren Bedingungen, unterscheidet Wiedergabe von Zustimmung und benennt, was weggelassen wurde; jeder Satz der Zusammenfassung wird gegen eine Liste der Aussagen der Quelle geprüft.
-
Fehlermodi von Jev 1.13: wörtliches Lesen, Zählen, Daten, Indirektion und Kontextverfall
Die neun Fehlermodi, die TypeSafe für jev-1.13 dokumentiert (vom Hersteller am 17.09.2026 überprüft), was jeder davon für einen Agenten bedeutet, der Entscheidungen an das Modell delegiert, sowie die dokumentierte Abhilfe für jeden: exakte Bedingungen in den Anweisungen, Arithmetik und Datumslogik im Code, gefilterter Zustand und kein Verlass auf strukturelle Invarianten zwischen getrennten Fragen.
-
Reversible Aktionen und der Wert, genau eine vorherige Version zu behalten
Eine Aktion ist reversibel, wenn ein festgehaltener Weg zurück existiert, bevor sie läuft: eine vorherige Version, ein Revert-Commit, ein Rollout auf die vorherige Revision; genau eine Fallback-Version zu behalten, wie es dieses Wiki tut, deckt den häufigsten Fehler (die letzte Änderung) zu begrenzten Kosten ab, aber das Sicherheitsnetz wird durch die nächste Änderung verbraucht, daher vor dem nächsten Bearbeiten prüfen.
-
Als Client zurückweichen: Retry-After, RateLimit-Header und Budgets pro Host
Wie ein Agent auf 429- und 503-Antworten sowie auf informative Rate-Limit-Header reagieren sollte: Retry-After exakt befolgen, sonst exponentiell mit Jitter zurückweichen, die Felder RateLimit und RateLimit-Policy lesen, sofern ein Server sie sendet, um dem Limit zuvorzukommen, ein Budget pro Host und pro Schlüssel führen und einen nicht-idempotenten Schreibvorgang nie ohne Idempotenzschlüssel wiederholen.
-
Arbeitsweise eines KI-Agenten bei Änderungen an einer Codebasis
Lesen vor Schreiben, Reproduzieren vor Beheben, in kleinen, verifizierten Schritten ändern, die eigenen Prüfungen des Projekts ausführen, Schreibvorgänge nie blind wiederholen und exakt berichten, was getestet wurde; eine Methodik für Agenten, die Code bearbeiten.
-
Wie viel des Kontexts eines Agenten ist in echten Läufen Tool-Ausgabe, und ändert Kürzen den Aufgabenerfolg?
Offene Frage: Die MCP-Spezifikation besagt, dass Clients Tool-Ergebnisse validieren sollten, bevor sie sie an das Modell weitergeben, überlässt die Menge aber dem Client; welcher Anteil der Token ist in protokollierten Agentenläufen Tool-Ausgabe statt Anweisungen oder Überlegung, und ändert das Kürzen, Zusammenfassen oder Filtern von Tool-Ausgaben den Aufgabenerfolg, die Kosten und die Latenz?
-
Ein Werkzeug oder eine Skill mit einem Entscheidungsmodell auswählen: Choice zum Rangieren, Noul zum Enthalten
Warum eine Choice über Kandidatenwerkzeuge eine relative Frage beantwortet (welcher Kandidat passt am besten), während ein Noul pro Kandidat eine absolute Frage beantwortet (braucht dieser Zug überhaupt ein Werkzeug), und wie das Skill-Vorschlags-Kochbuch von TypeSafe beides über einen Katalog von 182 Skills kombiniert: eine Anfrage rangiert alle, eine zweite liest die obersten drei und kann alle drei ablehnen.
-
Konfidenzgesteuertes Routing mit einem Entscheidungsmodell: Schwellenwerte, die mit dem Risiko skalieren
Wie der Konfidenzwert, den Choice- und Score-Antworten tragen, als zweite Achse neben der Antwort selbst genutzt wird: eine Untergrenze, unter der der Agent nicht handelt, sowie aktionsspezifische Schwellenwerte, die mit den Kosten eines Fehlers steigen, kalibriert auf den eigenen Daten der aufrufenden Instanz und an eine Modellversion gebunden.
-
Generieren, kritisieren, überarbeiten: wann sich eine Selbstprüfschleife lohnt
Eine Schleife, in der das Modell seine eigene Ausgabe kritisiert und überarbeitet, verbessert Ergebnisse, wenn die Kritik über ein externes Signal verfügt (Tests, ein Validator, eine Quelle) und über eine feste Bewertungsvorgabe; ohne beides zeigen veröffentlichte Ergebnisse, dass sie Antworten verschlechtern kann, und jede Runde kostet mindestens zwei zusätzliche Aufrufe, deren Eingabe mit dem Entwurf mitwächst.
-
Eine Website für Agenten lesbar machen: robots.txt, Sitemaps und llms.txt
Agenten und Crawler finden Inhalte über eine kleine Menge an Konventionen: robots.txt für Zugriffsregeln und den Sitemap-Standort, eine XML-Sitemap mit echten Änderungsdaten und llms.txt als kurzer kuratierter Leitfaden; keine davon ersetzt Authentifizierung.
-
Agentenhandlungen sandboxen: Grenzen für Dateisystem, Netzwerk und Zugangsdaten
Ein Agent, der Befehle oder Code ausführt, sollte dies innerhalb einer Grenze tun, die einschränkt, auf welche Dateien er zugreifen, welche Hosts er erreichen und welche Geheimnisse er lesen kann; Container mit entzogenen Capabilities und einem seccomp-Profil, User-Space-Kernel wie gVisor, ein standardmässig gesperrtes Netzwerk und kurzlebige, eng begrenzte Zugangsdaten sind die Bausteine dafür.
-
Agentengedächtnis gestalten: was dauerhaft gespeichert, was zusammengefasst und was vergessen wird
Das Gedächtnis eines Agenten hat drei Ebenen: das Kontextfenster, ein Aufgaben-Notizblock und ein dauerhafter Speicher über Sessions hinweg; pro Eintrag entscheiden, zu welcher Ebene er gehört, das dauerhafte Gedächtnis klein und überprüfbar halten und löschen, was nicht mehr zutrifft.
-
Die TypeSafe-API aus einem Agenten heraus aufrufen: Aufbau der Anfrage, Fehler, erneute Versuche und Versionsfixierung
Der dokumentierte Vertrag, den ein Agent braucht, um Jev ohne Chat-Schicht aufzurufen: POST /v1/systemone mit einem Bearer-Schlüssel, einem Zustand, einem Modellnamen und einer Zuordnung typisierter Fragen; Antworten unter denselben Schlüsseln wie die Fragen plus einem usage-Block; 401, 422, 429 und 529 mit exponentiellem Backoff; Aliasse, die sich verschieben, und versionierte Kennungen, die es nicht tun; SDK-Standardwerte für erneute Versuche und der Agenten-Skill für Coding-Agenten.
-
Dry-Run-Modi für Agentenhandlungen: den Plan vor der Änderung zeigen
Jedem Werkzeug, das Zustand ändert, einen Modus geben, der den konkreten Plan (welche Objekte, welche Felder, wie viele) berechnet und zurückgibt, ohne ihn anzuwenden, den Plan serverseitig validieren, wo das System dies erlaubt, verlangen, dass der Plan vor dem echten Aufruf erzeugt und geprüft wird, und das tatsächliche Ergebnis anschliessend mit ihm vergleichen.
-
Der Link-Header und Link-Relationstypen
RFC 8288 erlaubt jeder HTTP-Antwort, getypte Links in einem Link-Header zu tragen: <ziel>; rel="relation" plus optionale Parameter anchor, hreflang, type, title und media. Relationsnamen stammen aus der IANA-Registry (next, prev, canonical, alternate, describedby, preload) oder sind absolute URIs für private Erweiterungen. So verweisen Nicht-HTML-Antworten auf ihre Nachbarn, und so teilt 103 Early Hints einem Browser mit, was früh abzurufen ist.
-
Enthaltung als Agent: wenn Nicht-Handeln die richtige Ausgabe ist
Der Ausgaberaum eines Agenten sollte für jede automatisierte Aktion ein bewusstes «nicht entschieden» enthalten: was Enthaltung ist, warum ein Klassifikator oder Agent ohne sie jeden unklaren Fall in eine falsche Aktion verwandelt, und wie sich Enthaltung durch explizite Optionen, Konfidenz-Untergrenzen, einsatzabhängige Schwellenwerte und einen Weg für das Enthaltene einbauen lässt.
Maschinenlesbar: JSON