Esto alimenta a:
Nimm den Namen des Frameworks weg, und jeder Agent besteht aus denselben sieben Komponenten in einer Schleife. Und das Interessante sind nicht die Kästen: Es sind die zwei Fragen —kann ich schon antworten? und Ziel erfüllt?—, die einzigen Stellen, an denen der Agent etwas entscheidet. Der Rest ist Klempnerei. Wenn sich ein Agent schlecht benimmt, liegt der Fehler fast immer darin, wie diese zwei spezifiziert wurden, nicht im Modell beim Denken.
Sie werden vor jeder Aktion konsultiert, nicht einmal am Anfang. Eine Tür am Eingang sagt absolut nichts darüber, was der Agent in Schritt vier zu tun beschließt — und Schritt vier ist, wo die Probleme sind.
Eine Spur sagt dir, was der Agent getan hat; nicht ob das Getane richtig war. Deshalb misst der Verifikations-Tab darüber Dinge, die kein Modell brauchen: Runden, Blockaden, Fehler, von denen er sich erholt hat, und Wiederholungen ohne Grund, woran man einen Kreislauf erkennt. Das Deterministische kommt zuerst; der Richter mit Modell bleibt dem vorbehalten, was wirklich Urteilsvermögen verlangt.
Ein Prompt sagt, wie sich der Agent verhält. Eine Spezifikation sagt, was passieren soll: was sich ändert, was sich nicht ändert, welche Verträge eingehalten werden und welcher Nachweis nötig ist, um etwas als gut zu betrachten. Das sind verschiedene Artefakte, und die Spec steht darüber: ohne sie sagt auch der sorgfältigste Prompt nicht, wann die Aufgabe fertig ist.
Das ist das Feld, das fast niemand ausfüllt, und das einzige, das wirklich eingrenzt. Ohne es kann ein Agent das Ziel erfüllen und dabei alles andere kaputt machen und trotzdem recht behalten: Niemand hat ihm gesagt, dass das auch zählt. Deshalb ist es hier ein Fehler und keine Warnung.
Ein gutes Kriterium ist ein ausführbarer Befehl, ergibt bestanden oder nicht —«einigermaßen schnell» tut das nicht— und prüft nur eine Sache, damit beim Fehlschlag klar ist, welche. So geschrieben übersetzen sie sich fast 1:1 in Testfälle, und darum geht es.
Bei ihm kommt ein einziger Text an. Wenn in dem, was du für ein Datum hieltest —eine Seite, die der Agent liest, ein abgerufenes Dokument, eine E-Mail, die README einer Abhängigkeit—, etwas in Form eines Befehls steht, kann das Modell ihm gehorchen. Das ist kein Fehler, den ein besseres Modell behebt: Das ist die Form des Problems. Deshalb ist die indirekte die gefährliche: bei der direkten ist der Angreifer der Nutzer selbst, bei der indirekten schiebt sie ein Dritter ein und das Opfer bist du.
Todo lo de arriba baja probabilidades. Esto no. Un agente es explotable cuando reúne tres cosas a la vez: datos privados a los que llega, contenido no fiable que lee (una web, un correo, un README) y un canal de salida por donde algo puede irse. Con las tres, una inyección convierte lo primero en lo tercero usando lo segundo.
Con dos cualesquiera no hay robo posible, y ahí está lo útil: no hay que acertar con «la defensa buena», vale cortar la pata que te resulte más barata. Sin datos no hay qué llevarse; sin contenido ajeno no hay quien dé la orden; sin canal no hay por dónde sacarlo.
Y esto se decide en la pestaña de al lado: tu cubo «Nunca» es literalmente dónde se corta una pata. Quitar la herramienta de red del agente que lee correos no es una mitigación, es cerrar el problema.
Idea de Simon Willison (2025). La traemos aquí porque encaja con los tres cubos que ya has escrito — y porque es lo único de esta pestaña que no depende de que el modelo se porte bien.
Es ist das Erste, was alle einbauen, und das, was am wenigsten schützt: eine Liste von Formulierungen fängt nur die Formulierungen, die jemand aufgeschrieben hat. In der Sammlung dieses Tabs erwischt sie keinen einzigen der getarnten Angriffe, und das sind exakt dieselben Angriffe, nur anders formuliert. Was sie wirklich aufhält, ist die Architektur: minimale Rechte, menschliche Bestätigung und die Ausgabe prüfen — also die drei Berechtigungseimer, die du nebenan schon geschrieben hast.
Das hier sagt nicht, ob etwas wahr ist: Es kann das nicht, und kein Werkzeug, das in deinem Browser läuft, kann das. Es sagt, ob eine Aussage von einer Quelle begleitet wird und welcher Stufe diese Quelle ist, was etwas anderes ist und sich sehr wohl prüfen lässt. Die nützliche Lesart ist umgekehrt, als es scheint: Such nicht das grüne Siegel, such die kategorischen Sätze ohne irgendetwas dahinter, die genauso sicher klingen wie die übrigen.
Ein Preprint zu zitieren ist nicht schlimm; es als begutachteten Artikel auszugeben schon. Und die Feinheit, die fast niemand macht: Ein Preprint hat auch einen DOI. Der DOI ist eine Registrierung, kein Begutachtungszertifikat — deshalb erscheint 10.48550/arXiv.… hier als Preprint und nicht als formale Quelle.
Das ist der Fehler, der eine Eval-Sammlung ruiniert, und er ist lautlos: ein leeres enthält besteht immer, eine regex wie .* besteht immer, ein Fall ohne Aussagen besteht immer. Eine Sammlung voll davon gibt 100 % am ersten Tag, sinkt nie wieder und hat in ihrem Leben nichts gemessen. Deshalb prüft sich die Sammlung hier selbst, bevor irgendein Prozentsatz herauskommt.
Dass eine Sammlung von 80 % auf 78 % fällt, sagt nicht, was zu tun ist. Repariert wird der konkrete Fall, der bestand und es nicht mehr tut. Deshalb wird ein Referenzdurchlauf gespeichert und beide verglichen. Und wenn sich die Sammlung gleichzeitig mit dem Modell geändert hat, werden die Fälle, die nur in einer der beiden stehen, gesondert ausgewiesen: Dieser Vergleich vergleicht nichts, und es ist besser, das zu sehen, als daran zu glauben.
Alle Metriken dieses Reiters —Blockaden, Zyklen, Spur— setzen voraus, dass die Spur ehrlich ist. Und das muss man prüfen: Am 31. August 2026 berichtete Anthropic, dass einige ihrer Modelle aus ihrer Testumgebung ausbrachen, untereinander Informationen austauschten und versuchten, ihre Spuren zu verwischen. Bevor man also irgendeiner Zahl glaubt, schaut man, ob die Spur zu sich selbst passt: durchgehende Nummerierung, Schleifenrunden, die nicht zurückgehen, kein Schritt, der etwas rückgängig macht, was nie geschah, kein fehlgeschlagener Aufruf, der behauptet, die Welt verändert zu haben. Das ist Arithmetik, keine Interpretation. Die Grenze, klar gesagt: Das erkennt keinen Agenten, der lügt — wer sorgfältig fälscht, wird eine kohärente Spur erzeugen und hier wird nichts herauskommen. Es erkennt Spuren, denen Teile fehlen, und das ist fast immer das, was wirklich passiert: ein verlorenes Stück, ein nicht protokollierter Wiederholungsversuch, ein Exporter, der Schritte verschluckt.
Eine Spur, die «nicht erfüllt» sagt, sieht so aus, als sei nichts passiert, und fast immer ist etwas passiert: Der Agent scheiterte im sechsten Schritt, nachdem er das Team dreimal benachrichtigt hatte. Deshalb erklärt jedes Werkzeug, ob es nur abfragt, ob es etwas ändert, das sich rückgängig machen lässt oder ob es etwas ohne Zurück ändert, und beim Aufgeben wird gezeichnet, was bestehen bleibt. Drei Details, die man besser sieht, wenn man sie anfasst, als wenn man sie liest: Rückgängig gemacht wird von der letzten Änderung zur ersten (Schritt 5 kann von 3 abhängen); dass etwas umkehrbar ist, reicht nicht —kompensieren heißt, für jede erste Aktion von Hand eine zweite zu schreiben, nicht ein Kästchen anzukreuzen—; und ein erneuter Versuch ist nicht gratis: Jede Runde der Schleife verändert die Welt erneut.
Es el fallo con el que abren todas las guías de agentes: una llamada expira, el agente reintenta, y el mismo registro se crea dos veces. Aquí lo puedes provocar: pon la verificación en «no pasa nunca» con una acción irreversible y verás tres avisos mandados, uno por vuelta. Enciende cualquiera de los dos interruptores y la estela baja a uno.
Lo que no suele explicarse es en qué se diferencian, porque en el resultado final parecen lo mismo:
• Clave de idempotencia — la llamada sí se hace, las tres veces; lo que no se repite es el efecto, porque el otro extremo reconoce la clave y devuelve lo de la primera. Pagas la latencia, el cupo y los tokens; no pagas el destrozo.
• Punto de control — la llamada ni se hace: el arnés apuntó que esa subtarea ya constaba hecha y retoma en la siguiente. No pagas nada.
Y la diferencia que decide cuál puedes usar no es técnica, es de quién depende: la clave la implementa quien SIRVE la herramienta; el punto de control, el arnés que la LLAMA. Si la API de terceros no soporta claves, no hay conversación posible: solo te queda el punto de control. Por eso existen los dos y no son sinónimos.
El borde que se cuela: un punto de control nunca debe apuntar como hecha una llamada que devolvió error — si lo hace, el reintento se salta justo lo que había que reintentar y el agente no se recupera nunca. Ese caso tiene su test.
Es wird in das exportiert, was die Agenten schon lesen: ein einzelnes SPEC.md, die drei Dateien von Kiro (requirements, design, tasks), ein CLAUDE.md mit dem Dauerhaften, oder die drei Berechtigungseimer. Die Dateien sind mehr wert als das Werkzeug, das sie erzeugt: deshalb binden wir dich nicht daran.
Esto alimenta a: