CounterProof

TypeSafe Jev, per Konsens bewertet: wenn der Zeuge aufhört zu schreiben

TypeSafe AIs Jev ist ein neuartiges Modell: Es schreibt nie Text, sondern gibt nur typisierte Entscheidungen mit Wahrscheinlichkeiten zurück. Sein Benchmark bewertet es gegen den Durchschnitt zweier anderer KI-Modelle. Wir haben die von TypeSafe veröffentlichten Fälle geöffnet und nachgezählt. In 8 der 19 Fälle, in denen beide Bewerter geantwortet haben, waren die Bewerter untereinander uneins. Jeder der vier Fälle, die TypeSafe unter „alle drei verfehlen die Referenz“ führt, ist einer, in dem die Referenz selbst strittig war. Eine Notiz in einfacher Sprache darüber, was das dafür bedeutet, wie wir KI beurteilen.

Wie diese Notiz geprüft wurde. Vor der Veröffentlichung wurde sie widerlegungsorientiert von acht externen Prüfinstanzen aus vier Modellfamilien angegriffen (Moonshot Kimi, xAI Grok, DeepSeek, Alibaba Qwen), die jede Zählung aus den Dateien des Anbieters neu berechnet haben. Was sie gebrochen haben und wie es behoben wurde, steht in §5. Die technische Begleitschrift, mit Methode, vollständigen Zählungen und Grenzen, ist Field Note 1. Die Instanzprotokolle und das gehashte Datenarchiv liegen in unserem Berichtsspeicher und sind auf Anfrage verfügbar.

In einer Minute. Ein Unternehmen namens TypeSafe AI hat Jev veröffentlicht, ein KI-Modell, das nie einen Satz schreibt. Stellen Sie ihm eine Frage mit einer festen Antwortmenge, und es gibt eine Antwort zurück, dazu eine Wahrscheinlichkeit für jede Option. Für ein Modell dieser Leistungsklasse ist das neu, und es verschärft eine Frage, die Klassifikatoren uns nie aufgezwungen haben: Wie prüft man einen Zeugen, der sich nicht erklären kann? TypeSafes Antwort lautet, Jev gegen die Durchschnittsmeinung zweier anderer KI-Modelle zu bewerten. Wir haben die zwanzig Fälle geöffnet, die TypeSafe zur Veranschaulichung seines Benchmarks veröffentlicht, und festgestellt, dass in acht der neunzehn Fälle, in denen beide Bewerter geantwortet haben, diese beiden Modelle untereinander uneins darüber waren, welches die richtige Antwort ist. Diese Notiz erklärt, warum das weit über ein Unternehmen hinaus zählt.

1. Ein Modell, das nicht spricht

Drei Jahre lang gab uns ein KI-Spitzenmodell Wörter, wenn es uns eine Antwort gab. Wir konnten sie lesen, mit ihnen streiten und das Modell dabei ertappen, wie es sich widersprach. Kleinere Klassifikatoren haben immer schon nackte Labels zurückgegeben; neu ist ein Modell auf Spitzenniveau, das nichts anderes zurückgibt. TypeSafe AI, ein Unternehmen aus San Francisco ohne Bezug zur Programmiersprache TypeScript, hat ein Modell ausgeliefert, das nichts davon tut. Es heißt Jev, und TypeSafe nennt es das erste einer neuen Kategorie, „System One models", nach dem schnellen, intuitiven Denken in Daniel Kahnemans Schnelles Denken, langsames Denken.

So arbeitet Jev. Sie geben ihm Material, etwa das Support-Ticket eines Kunden. Sie geben ihm eine Menge typisierter Fragen: Verlangt dieser Kunde eine Rückerstattung? (ja oder nein, mit einer Wahrscheinlichkeit). Welches Team soll das bearbeiten? (eines aus einer Liste). Wie verärgert ist der Kunde, von 0 bis 4? (ein Wert). Jev gibt die Antworten zurück, jede mit einer Wahrscheinlichkeitsverteilung, im Bruchteil einer Sekunde. Keine Prosa, keine Erklärung, kein Code. Ihre Software handelt direkt auf den Antworten.

Für die Automatisierung von Routineentscheidungen ist das attraktiv, und wir sind nicht hier, um das Gegenteil zu behaupten. Den Freitext wegzulassen beseitigt eine ganze Klasse von Fehlern, und eine Wahrscheinlichkeit, auf die man einen Schwellenwert setzen kann, nützt einem Programm mehr als ein Absatz. Uns interessiert eine Nebenwirkung. Ein Modell, das nur aus Ihrer Liste wählt, kann Ihnen nie sagen, dass die Liste etwas auslässt. Ein menschlicher Prüfer, oder ein Modell, das schreibt, kann sagen: „Sie haben die falsche Frage gestellt." Jev kann das nicht. Es kann andeuten, dass keine der Optionen gut passt, weil seine Wahrscheinlichkeiten dann gestreut statt konzentriert sind, und TypeSafes eigene Dokumentation sagt das auch. Aber es kann nie die Option benennen, die Sie vergessen haben. Was immer Sie aus der Fragemenge herausgelassen haben, bleibt draußen, für jeden Zeugen, der sie beantwortet.

Wir kommen aus einem ungewöhnlichen Blickwinkel. Unser Arbeitspapier behandelt KI-Ausgaben so, wie Wissenschaftler alte Handschriften behandeln: als Zeugnis von Zeugen, die Quellen teilen, einander abschreiben und aus denselben Gründen dieselben Fehler machen können. In diesem Rahmen ist Jev ein Zeuge, der aufgehört hat zu schreiben.

2. Wer bewertet den Bewerter?

Jedes KI-Modell bekommt einen Benchmark-Wert. Die Frage, die man zu jedem Wert stellen sollte, ist: verglichen womit? Bei einer Mathematikaufgabe ist die Antwort leicht: mit der richtigen Zahl. Bei „sollte dieser Sicherheitsalarm eskaliert werden?" gibt es keinen Antwortschlüssel. Irgendjemand muss entscheiden, was die richtige Antwort war.

TypeSafe veröffentlicht seinen Benchmark unter evals.typesafe.ai. Der Methodenabschnitt erklärt die Entscheidung:

“Instead of debating the correctness of the harness and labels, we assume that the code is correct, and measure against the current smartest large models. For this eval, the reference labels are generated via an average of the responses of GPT-6 Astra and Claude Fable 5.1, both at high thinking, answering every question in the harness. All other models are evaluated using the provider’s default reasoning settings.”

Unsere Übersetzung: Statt über die Korrektheit des Harness und der Labels zu streiten, nehmen wir an, der Code sei korrekt, und messen gegen die derzeit intelligentesten großen Modelle; für diese Auswertung werden die Referenz-Labels als Durchschnitt der Antworten von GPT-6 Astra und Claude Fable 5.1 erzeugt, beide auf hoher Denkstufe.

Im Klartext: Die „richtige Antwort" auf jede Frage ist das, was zwei führende KI-Modelle, OpenAIs GPT-6 Astra und Anthropics Claude Fable 5.1, im Durchschnitt gesagt haben. Jevs Genauigkeit ist, wie oft es mit diesem Durchschnitt übereinstimmt. Die aller anderen auch.

TypeSafe benennt das offensichtliche Problem offen. Der Ankündigungsbeitrag sagt, dies „biases answers towards OpenAI and Anthropic’s models. We likely underestimate the relative performance of our model and DeepSeek’s models" (verzerre die Antworten zugunsten der Modelle von OpenAI und Anthropic und unterschätze wahrscheinlich die relative Leistung des eigenen Modells und der Modelle von DeepSeek). Das ist ein ehrlicher Vorbehalt. Aber es gibt ein tieferliegendes Problem, das dort nicht benannt wird.

Wenn zwei KI-Modelle beide falsch liegen, liegen sie meist auf dieselbe Weise falsch. Eine Studie von 2025 über mehr als 350 Modelle fand, dass zwei Modelle, wenn sie beide eine Frage verfehlen, weit häufiger dieselbe falsche Antwort geben, als der Zufall erwarten ließe. Der Effekt wird stärker, je leistungsfähiger die Modelle werden, und er hält über verschiedene Unternehmen und Architekturen hinweg (Kim, Garg, Peng und Garg, ICML 2025). Zwei Bewerter zu mitteln dämpft die Fehler, die sie einzeln machen; auf der Ebene einer endgültigen Entscheidung schlägt es sich schlicht auf die Seite eines der beiden, wie wir unten zeigen. Gegen die Fehler, die sie gemeinsam machen, richtet es nichts aus, und an der Spitze des Feldes sind gerade die gemeinsamen Fehler die großen.

Ein Durchschnitt zweier Spitzenmodelle ist also kein neutraler Schiedsrichter. Er ist deren geteilte Meinung, zur Grundwahrheit befördert. Ein Modell, das ihren gemeinsamen Fehler kopiert, wird als richtig gewertet. Ein Modell, das es richtig hat, wenn beide falsch liegen, wird als Fehlschlag gewertet. Wir haben das die Konsensfalle genannt, als wir im August über Benchmarks geschrieben haben. TypeSafes Benchmark ist das klarste offengelegte Beispiel, das wir gesehen haben. Eine Ehrlichkeitsnotiz in eigener Sache: Die Studie hat das an zwei öffentlichen Bestenlisten und einer Einstellungsaufgabe gemessen. Dass dasselbe innerhalb eines Workflow-Benchmarks ohne unabhängige Wahrheit geschieht, ist unsere Schlussfolgerung, nicht der Befund der Studie.

3. Wir haben die Fälle geöffnet. Das haben wir gefunden.

Das Benchmark-Dashboard bewertet neun Modelle über vier Workflows: Sicherheitsalarme, Überwachung von Support-Agenten, Rechnungsverarbeitung und Kundenservice, insgesamt 711 Fälle. Jev landet im Mittelfeld: 67,8 % Übereinstimmung mit der Referenz im Durchschnitt, gegenüber 74,1 % beim besten Modell. Es liegt unter den führenden Modellen von OpenAI und Anthropic, einen Zehntelpunkt hinter GPT-5.6 Terra, gleichauf mit Claude Sonnet 5 und über beiden DeepSeek-Modellen. Wenn Sie hergekommen sind mit der Frage, ob Jev „halluziniert", ist TypeSafes Ankündigungsbeitrag auch dazu offen: Die 0 %, die dort eingezeichnet werden, sind in den Worten des Beitrags „not empirical. Schema matching is guaranteed, thus we can confidently add 0% into the plots" (nicht empirisch; die Schema-Übereinstimmung ist garantiert). Jev kann keine fehlerhaft geformte Antwort zurückgeben. Das ist etwas anderes, als eine richtige zurückzugeben.

Der Teil, der uns angeht, ist kleiner und aufschlussreicher. TypeSafe veröffentlicht außerdem zwanzig durchgearbeitete Fälle, fünf je Workflow, ausgewählt zur Veranschaulichung von fünf Situationen: jedes der drei verglichenen Modelle weicht reihum von den beiden anderen ab, alle drei verfehlen die Referenz, und alle drei stimmen überein. Für neunzehn dieser Fälle veröffentlicht TypeSafe, was jedes der beiden bewertenden Modelle gesagt hat, Frage für Frage, und nicht nur deren Durchschnitt; in einem der neunzehn fehlen die meisten Folgeantworten des zweiten Bewerters in der Datei, und in zwei der vier Workflows wird der Durchschnitt selbst gar nicht veröffentlicht. Das ist mehr Transparenz, als die meisten Benchmarks bieten, und sie hat uns das Zählen ermöglicht.

Die beiden Bewerter waren bei der endgültigen Entscheidung in 8 der 19 Fälle untereinander uneins. Wir haben die vollständige Liste der Maßnahmen verglichen, zu denen jeder Bewerter gelangt ist; in einigen Fällen war die Liste des einen die des anderen plus zusätzliche Schritte, und auch das zählen wir als Uneinigkeit. Frage für Frage gaben sie 31 Mal unterschiedliche Antworten, von 356 Fragen, die beide Bewerter beantwortet haben, und alle stehen in den archivierten Dateien; in sechs weiteren Fällen gab einer von beiden gar keine Antwort. Diese zwanzig Fälle wurden von TypeSafe von Hand ausgewählt, um Uneinigkeit unter den bewerteten Modellen zu zeigen; dies ist also keine Messung dafür, wie oft die Bewerter über alle 711 Fälle hinweg uneins sind. Es ist das, was TypeSafe veröffentlicht hat, von der anderen Seite gelesen.

Jeder einzelne Fall, den TypeSafe mit „alle drei verfehlen die Referenz" kennzeichnet, ist ein Fall, in dem auch die beiden Bewerter untereinander uneins waren. Nehmen Sie das Sicherheitsbeispiel. Ein Bewerter sagte ISOLATE HOST. Der andere sagte REVOKE SESSIONS. Der Durchschnitt ergab ISOLATE HOST. Alle drei bewerteten Modelle sagten QUARANTINE FILE. Drei Modelle wurden also gegen eine Antwort als falsch gewertet, die eines der beiden Modelle, die den Antwortschlüssel schreiben, ebenfalls nicht gegeben hat. Um genau zu sagen, was das zeigt: Die drei Modelle wären unter dem Urteil jedes der beiden Bewerter als falsch gewertet worden, dies ist also ein strittiger Antwortschlüssel und keine bestrafte richtige Antwort. Niemand kann sagen, welcher Bewerter recht hatte: Diese Workflows haben keinen unabhängigen Antwortschlüssel, was ja gerade der Punkt ist. Zwei der vier Fälle, die mit „alle drei stimmen überein" gekennzeichnet sind, schneiden in die andere Richtung. In einem teilten sich die beiden Bewerter zwischen ISOLATE HOST und ESCALATE TIER2, der Durchschnitt wählte ESCALATE TIER2, und alle drei bewerteten Modelle sagten dasselbe, sodass es als richtig zählte, einem Bewerter gegen den anderen zuzustimmen. Überall, wo TypeSafe den Durchschnitt veröffentlicht, entspricht er der Antwort des einen oder des anderen Bewerters, nie einer dritten. Das ist kein Zufall: Die gemittelten Wahrscheinlichkeiten laufen durch dieselben Entscheidungsregeln wie die Antworten jedes Modells, der Durchschnitt muss also auf irgendeiner Maßnahme landen, und in jedem veröffentlichten Fall landet er auf der Seite eines der Bewerter.

Einer der Bewerter war teilweise ein Ersatz. Im Sicherheits-Workflow lautet die Datei, die den zweiten Bewerter beschreibt, wörtlich: “Claude Fable 5.1 high, one question per request; Claude Opus 5 high on the 88 documents Fable refused or failed”. Für die Dokumente also, die Fable nicht beantworten wollte oder konnte, sprang ein anderes Anthropic-Modell ein, Claude Opus 5. Die Datei zählt 240 Fälle in diesem Workflow, sagt aber nicht, wie Dokumente auf Fälle abgebildet werden, und deshalb machen wir aus den 88 keinen Prozentsatz. Es folgt daraus eines: Ein Bewerter für einen Workflow ist eine Mischung, deren Rezept über eine Dokumentenzahl hinaus nicht offengelegt ist. Die Datei hält den Ersatz fest; die Bestenliste erwähnt ihn nicht. Und weil die Datei nicht sagt, bei welchen Dokumenten Fable ausgefallen ist, können wir nicht feststellen, ob jenes REVOKE SESSIONS oben von Fable oder von Opus 5 kam.

Jevs eigene Antworten sind ebenfalls veröffentlicht, und sie neigen sich zu keiner Seite. Bei den 31 Fragen, in denen die beiden Bewerter uneins waren, stellte sich Jev 14 Mal auf Astras Seite, 14 Mal auf die des zweiten Bewerters und 3 Mal auf keine von beiden. Für einen Wert von 0 bis 4 ist TypeSafes eigene Konvention der wahrscheinlichkeitsgewichtete Durchschnitt statt der einzelnen wahrscheinlichsten Stufe; so gewertet kippt eine Antwort, und es wird 13 zu 15. So oder so gibt es in dieser winzigen, kuratierten Stichprobe kein Anzeichen dafür, dass Jev zu einem der beiden Modelle neigt, deren Durchschnitt es bewertet. Aber Vorsicht damit, was das zeigt. Eine gleichmäßige Aufteilung ist das, wonach „kein Favorit" aussieht. Sie ist aber auch, wie einer unserer externen Prüfer anmerkte, das, wonach ein Modell aussähe, das darauf trainiert wurde, dem Durchschnitt der beiden zu folgen. Diese Zählung kann die beiden Geschichten nicht auseinanderhalten. Behalten Sie den Gedanken für den nächsten Abschnitt.

Nichts davon macht Jev besser oder schlechter, als das Dashboard sagt. Es zeigt, dass die Definition von „richtig" in diesem Benchmark innerhalb seiner eigenen Daten strittig ist, auf eine Weise, die TypeSafe sichtbar gemacht hat und die die Schlagzahl nicht zeigt.

4. Wo hat Jev das Urteilen gelernt?

Unser Forschungsprogramm stellt jedem Modell eine Frage: Woher stammen seine Gewohnheiten? Wurde es auf der Ausgabe eines anderen Modells trainiert? Teilt es eine Basis mit einem Wettbewerber? Für Modelle, die schreiben, steckt ein überraschend starker Hinweis im Schreiben selbst: Verteilungen von Wortwahlen sind unterscheidend genug, um fünf große KI-Systeme mit 97 % Genauigkeit auseinanderzuhalten (Sun et al., ICML 2025). Es ist das maschinelle Gegenstück dazu, einen Schreiber an seiner Hand zu erkennen.

Jev schreibt nichts, also fällt dieser Hinweis weg. Es bleiben zwei schwierigere Methoden: absichtlich eingebrachte Marker, und ein Modell mit einer früheren Fassung seiner selbst zu vergleichen, um zu sehen, von welchem Lehrer es gelernt hat. Keine davon steht einem Außenstehenden zur Verfügung. TypeSafes eigene Einführung sagt, seine Modelle gingen von gewöhnlichen vortrainierten Sprachmodellen aus und fügten eine neue Trainingsstufe hinzu, „Reinforcement learning for calibrated decisions". TypeSafe äußert sich zur Herkunft seiner Trainingsdaten, in einer FAQ-Antwort des Ankündigungsbeitrags, die keine Textdarstellung der Seite zeigt und die einer unserer Prüfer in der Skript-Nutzlast der Seite fand: “We make all the data ourselves” (wir erstellen alle Daten selbst). Das schließt ein Training auf Kundendaten aus. Es benennt kein Basismodell, benennt keinen Lehrer und sagt nicht, ob selbst erstellte Daten die Antworten anderer Modelle tragen können. Dieselbe FAQ sagt, Jev sei “neither small nor an LLM” (weder klein noch ein LLM), was sich schwer mit der Beschreibung eines dritten Wegs verträgt, vortrainierte Sprachmodelle anzupassen, wie sie die Einführung gibt; TypeSafe bringt die beiden nicht zusammen, und wir können es nicht. Nach unseren eigenen Regeln ist Jevs Abstammung damit ein Forschungsprogramm und kein Ergebnis, und ein dünneres als bei Modellen, die schreiben.

Bleibt eine Hypothese, die wir sorgfältig formulieren wollen. Wäre Jev darauf trainiert worden, derselben Art von Zwei-Modell-Durchschnitt zu entsprechen, den sein Benchmark verwendet, dann würde ein Prüfpanel, das Jev als „vierte unabhängige Meinung" hinzunimmt, tatsächlich einen Nachkommen zweier Meinungen hinzunehmen, die es bereits hatte, und jedes Verfahren, das es als unabhängig zählte, wäre getäuscht, ohne es zu wissen. Zwei Dinge sprechen dazu, keines davon entscheidend. Jev liegt im Mittelfeld des Dashboards, wo man von einem Modell, das auf das Kopieren der Bewerter trainiert wäre, mehr Übereinstimmung mit ihnen erwarten könnte; Fähigkeit und Übereinstimmung sind dort aber miteinander verwoben, also ist das schwache Evidenz. Und bei den 31 strittigen Fragen teilte sich Jev vierzehn zu vierzehn zwischen den beiden Bewertern (dreizehn zu fünfzehn unter TypeSafes eigener Wertung eines Antworttyps). Das ist vereinbar damit, keinen Favoriten zu haben, und ebenso vereinbar damit, dem Durchschnitt des Paares zu folgen, es entscheidet also nichts. Wir halten die Hypothese für möglich und sagen, was sie entscheiden würde: dass TypeSafe offenlegt, woher seine Trainingsantworten stammen, oder ein Vergleich, der Jevs Nähe zum Durchschnitt der beiden Bewerter gegen andere leistungsfähige Modelle stellt, die nicht auf ihnen trainiert wurden, gemessen über alle 711 Fälle statt über die 20, die wir sehen können. Nähe allein würde es nicht entscheiden: Jedes leistungsfähige Modell landet tendenziell zwischen zwei leistungsfähigen Bewertern.

5. Unsere eigene Hand im Spiel

Diese Notiz wurde mit Claude Fable 5.1 entworfen, einem der beiden Modelle, deren Durchschnitt TypeSafe als Wahrheit behandelt. Eine frühere Analyse, die wir herangezogen haben, stammte von einem OpenAI-Modell, der anderen Hälfte dieses Durchschnitts. Beide Verfasser sind also Parteien dessen, was sie beurteilt haben. Deshalb haben wir die zugrunde liegende Beurteilung, bevor diese Notiz geschrieben wurde, von einem Prüfer eines dritten Unternehmens angreifen lassen, Moonshots Kimi. Er hat drei unserer Zitate berichtigt und neunzehn unserer Schlussfolgerungen gebrochen, darunter die Behauptung eines ersten Entwurfs, Jev stimme „am wenigsten" mit dem Konsens überein. Das tut es nicht; es liegt im Mittelfeld. Eine zweite Kimi-Instanz hat dann jede Zählung von oben aus den Rohdateien neu berechnet und sie bestätigt, und hat ihrerseits den ersten Entwurf dieser Notiz gebrochen: Er hatte TypeSafes „88 Dokumente" in einen Anteil von 240 Fällen umgerechnet, zwei Einheiten, die die Dateien nicht gleichsetzen, und geschrieben, ein Bewerter habe „sich selbst bewertet", was die Daten nicht hergeben. Beides ist verschwunden. Eine dritte Instanz, von xAIs Grok, hat die Zählungen ein drittes Mal neu berechnet und gezeigt, dass unser Sicherheitsbeispiel weniger belegte, als wir angedeutet hatten, dass die Nachbarschaft der Ersatz-Tatsache zu Opus 5s Platzierung zu einer Schlussfolgerung einlud, die wir zurückgewiesen hatten, und dass eine unserer Zählungen von einer Wertungsentscheidung abhängt. Eine vierte, von DeepSeek, hat sie erneut nachgerechnet und uns dabei ertappt, wie wir eine gleichmäßige Aufteilung als Evidenz gegen eine Hypothese behandelten, von der sie sich nicht unterscheiden lässt. Eine fünfte, eine weitere Kimi-Instanz, hat eine FAQ-Antwort über Trainingsdaten gefunden, die vier Seitenleser, unserer eingeschlossen, als nicht vorhanden gemeldet hatten. Eine sechste, Alibabas Qwen, vom Autor und nicht von uns ausgeführt, hat jede Zählung bestätigt und war die vierte, die sagte, der Ersatz-Absatz insinuiere noch immer; er liest sich nun als schlichte Offenlegung. Alles ist oben berichtigt. Eine Notiz über korrelierte Bewerter, geschrieben von einem korrelierten Bewerter, ist genau so viel wert wie ihre externe Prüfung.

Am 17. September haben zwei weitere Prüfer, eine OpenAI-Codex-Instanz und eine Moonshot-Kimi-Instanz, unseren Plan geprüft, Jev direkt zu testen, und gezeigt, dass der in §4 vorgeschlagene Test die Frage für sich allein nicht entscheiden könnte. Der Satz in §4 sagt nun, was er dafür bräuchte.

Was wir nicht sagen

Wir sagen nicht, typisierte Entscheidungen seien eine schlechte Idee; für Weiterleitung und Triage sind sie wahrscheinlich eine gute. Wir sagen nicht, TypeSafes Benchmark sei unehrlich; er legt mehr offen als die meisten, und alles oben ist aus dem gezählt, was er offenlegt. Wir sagen nicht, Jev sei auf den Antworten seiner Bewerter trainiert worden; der eine Test, den wir durchführen konnten, kann es nicht sagen. Wir sagen drei Dinge. Ein Benchmark, dessen Wahrheit der Durchschnitt zweier Zeugen ist, erbt alles, was diese Zeugen gemeinsam falsch machen. TypeSafes eigene veröffentlichte Fälle zeigen die beiden Zeugen in acht von neunzehn uneins über die Antwort. Und eine Klasse von Modellen, die nicht schreiben kann, hat uns die Evidenz genommen, mit der wir sonst fragen würden, woher ihr Urteil kommt.

Warum uns das angeht

CounterProof prüft KI-geschriebenen Code so, wie ein Angreifer es täte. Unsere Arbeitsregel lautet, dass ein Befund durch das Ausführen des Codes entschieden wird, nie durch eine Abstimmung unter Modellen. Die neue Klasse von Entscheidungsmodellen wird gegen Modellkonsens bewertet und trainiert werden, weil Konsens billig ist und echte Ergebnis-Labels teuer sind. Unsere ganze Methode ist die teure Alternative: eingefrorene Fälle, Reproduktionen, die Sie ausführen können, und Labels, die daher kommen, was der Code tatsächlich getan hat, statt daher, worauf sich zwei Modelle geeinigt haben. Wenn Modelle mit typisierten Entscheidungen zu der Schicht werden, durch die KI-Agenten handeln, dann wird die Frage, wessen Urteil diese Schicht trägt, zur Herkunftsfrage des Jahrzehnts. Die einzige ehrliche Antwort wird aus der Prüfung gegen Ergebnisse kommen. Das ist die Arbeit.

Die technische Akte. Methode, Schema, die vollständige Zähltabelle, was das Exemplar erlaubt und was nicht, und die Grenzen: Field Note 1, Consensus as oracle: TypeSafe’s Jev benchmark as a type specimen, auf unserer Forschungsseite.


Offenlegung, aus der wir nichts ableiten. Claude Opus 5, der Ersatz für einen Teil des Antwortschlüssels im Sicherheits-Workflow, ist zugleich eines der neun bewerteten Modelle. Die Datei sagt nicht, welche Dokumente ersetzt wurden, und eine Ersatzantwort muss den Durchschnitt gegen Astra erst gewinnen, bevor sie zum Schlüssel wird. Wir ziehen daraus keine Schlussfolgerung über den Wert irgendeines Modells, und vier externe Prüfer haben uns gesagt, dass die Platzierung dieser Tatsache innerhalb der Argumentation oben dennoch zu einer einlud; deshalb steht sie hier.

Quellen. TypeSafe-Ankündigungsbeitrag, Dokumentation (introduction, introduction/machine-learning-primer, confidence, System One concepts, HTTP API, primitives/choice) und evals.typesafe.ai, gelesen am 16. September 2026; die fünf Seiten und vier Falldateien (*-cases.js), die diese Seite ausliefert, archiviert mit SHA-256-Hashes in unserem Berichtsspeicher. Kim, Garg, Peng und Garg, Correlated Errors in Large Language Models, ICML 2025, arXiv:2506.07962. Sun, Yin, Xu, Kolter und Liu, Idiosyncrasies in Large Language Models, ICML 2025, arXiv:2502.12150. Rawat et al., Reference-Based Distillation Detection in LLMs, arXiv:2607.09692. Soons, Agentic Stemmatics, v1.29, doi:10.5281/zenodo.22790100. Die Zählungen in §3 beziehen sich allein auf die zwanzig veröffentlichten Fälle; endgültige Entscheidungen wurden als ungeordnete Mengen von Maßnahmen verglichen; ein Fall trägt die Antwort nur eines Bewerters und ist von den acht von neunzehn ausgenommen.

← Alle Notizen