CounterProof

TypeSafe Jev, bedömd genom konsensus: när vittnet slutar skriva

TypeSafe AI:s Jev är en ny sorts modell: den skriver aldrig text, den returnerar bara typade beslut med sannolikheter. Dess riktmärke bedömer den mot genomsnittet av två andra AI-modeller. Vi öppnade de fall TypeSafe publicerar och räknade. I 8 av de 19 fall där båda bedömarna svarade var bedömarna oense med varandra. Vart och ett av de fyra fall TypeSafe publicerar under etiketten ”alla tre missar referensen” är ett fall där referensen själv var omtvistad. En anteckning på klarspråk om vad det betyder för hur vi bedömer AI.

Hur den här anteckningen kontrollerades. Före publicering angreps den, vederläggning först, av åtta utomstående granskningsinstanser från fyra modellfamiljer (Moonshot Kimi, xAI Grok, DeepSeek, Alibaba Qwen), som var och en räknade om varje siffra från leverantörens filer. Vad de bröt och hur det åtgärdades står i §5. Den tekniska följeskriften, med metod, fullständiga räkningar och gränser, är Field Note 1. Instansprotokollen och det hashade dataarkivet finns i vårt rapportförråd och är tillgängliga på begäran.

På en minut. Ett företag som heter TypeSafe AI har släppt Jev, en AI-modell som aldrig skriver en mening. Ställ en fråga med en fast uppsättning svar och den returnerar ett svar plus en sannolikhet för varje alternativ. För en modell i den här förmågeklassen är det nytt, och det skärper en fråga som klassificerare aldrig tvingade på oss: hur kontrollerar man ett vittne som inte kan förklara sig? TypeSafes svar är att bedöma Jev mot den genomsnittliga uppfattningen hos två andra AI-modeller. Vi öppnade de tjugo fall TypeSafe publicerar för att illustrera sitt riktmärke och fann att i åtta av de nitton där båda bedömarna svarade var dessa två modeller oense med varandra om vilket svar som var rätt. Den här anteckningen förklarar varför det spelar roll långt utanför ett enda företag.

1. En modell som inte talar

I tre år gav oss en AI-modell i framkant ord när den gav oss ett svar. Vi kunde läsa dem, argumentera mot dem och ta modellen på bar gärning när den motsade sig själv. Mindre klassificerare har alltid returnerat nakna etiketter; det nya är en modell med förmåga i framkant som inte returnerar något annat. TypeSafe AI, ett företag i San Francisco utan koppling till programmeringsspråket TypeScript, har levererat en modell som inte gör något av detta. Den heter Jev, och TypeSafe kallar den den första i en ny kategori, ”System One models”, efter det snabba, intuitiva tänkandet i Daniel Kahnemans Tänka, snabbt och långsamt.

Så här fungerar Jev. Ni ger den material, säg en kunds supportärende. Ni ger den en uppsättning typade frågor: Ber den här kunden om återbetalning? (ja eller nej, med en sannolikhet). Vilket team ska hantera det? (välj ett ur en lista). Hur frustrerad är kunden, från 0 till 4? (ett värde). Jev returnerar svaren, vart och ett med en sannolikhetsfördelning, på bråkdelen av en sekund. Ingen prosa, ingen förklaring, ingen kod. Er programvara agerar direkt på svaren.

För att automatisera rutinbeslut är detta tilltalande, och vi är inte här för att säga något annat. Att ta bort fritexten avlägsnar en hel klass av fel, och en sannolikhet som man kan sätta ett tröskelvärde på är mer användbar för ett program än ett stycke text. Det som intresserar oss är en sidoeffekt. En modell som bara väljer ur er lista kan aldrig säga er att listan saknar något. En mänsklig granskare, eller en modell som skriver, kan säga ”ni ställde fel fråga”. Jev kan inte det. Den kan antyda att inget alternativ passar väl, eftersom dess sannolikheter då blir utspridda i stället för koncentrerade, och TypeSafes egen dokumentation säger just det. Men den kan aldrig namnge det alternativ ni glömde. Vad ni än lämnade utanför frågeuppsättningen stannar utanför, för varje vittne som besvarar den.

Vi kommer till detta från en ovanlig vinkel. Vårt arbetsdokument behandlar AI-utdata som forskare behandlar gamla handskrifter: som vittnesmål från vittnen som kan dela källor, skriva av varandra och göra samma misstag av samma skäl. I den ramen är Jev ett vittne som har slutat skriva.

2. Vem bedömer bedömaren?

Varje AI-modell får en riktmärkespoäng. Frågan värd att ställa om varje poäng är: jämfört med vad? För ett matematiktal är svaret lätt: det korrekta talet. För ”ska det här säkerhetslarmet eskaleras?” finns ingen facitmall. Någon måste avgöra vad som var rätt svar.

TypeSafe publicerar sitt riktmärke på evals.typesafe.ai. Metodavsnittet förklarar hur de bestämde:

“Instead of debating the correctness of the harness and labels, we assume that the code is correct, and measure against the current smartest large models. For this eval, the reference labels are generated via an average of the responses of GPT-6 Astra and Claude Fable 5.1, both at high thinking, answering every question in the harness. All other models are evaluated using the provider’s default reasoning settings.”

Vår översättning: i stället för att debattera om körmiljön och etiketterna är korrekta antar vi att koden är korrekt och mäter mot de för närvarande smartaste stora modellerna; för den här utvärderingen genereras referensetiketterna som ett genomsnitt av svaren från GPT-6 Astra och Claude Fable 5.1, båda på hög tankenivå.

I klartext: det ”rätta svaret” på varje fråga är vad två ledande AI-modeller, OpenAI:s GPT-6 Astra och Anthropics Claude Fable 5.1, sade i genomsnitt. Jevs träffsäkerhet är hur ofta den stämmer överens med det genomsnittet. Alla andras också.

TypeSafe är öppna om det uppenbara problemet. Lanseringsinlägget säger att detta “biases answers towards OpenAI and Anthropic’s models. We likely underestimate the relative performance of our model and DeepSeek’s models” (snedvrider svaren mot OpenAI:s och Anthropics modeller och underskattar sannolikt den relativa prestandan hos den egna modellen och DeepSeeks modeller). Det är ett hederligt förbehåll. Men det finns ett djupare problem som inte nämns.

När två AI-modeller båda har fel brukar de ha fel på samma sätt. En studie från 2025 över mer än 350 modeller fann att när två modeller båda missar en fråga ger de samma felaktiga svar långt oftare än slumpen skulle förutsäga. Effekten blir starkare ju mer kapabla modellerna blir, och den håller tvärs över olika företag och arkitekturer (Kim, Garg, Peng och Garg, ICML 2025). Att ta genomsnittet av två bedömare dämpar de fel de gör var för sig; på nivån av ett slutligt beslut ställer det sig helt enkelt på den enas sida, som vi visar nedan. Mot de fel de gör tillsammans gör det ingenting, och i toppen av fältet är just de gemensamma felen de stora.

Ett genomsnitt av två modeller i framkant är alltså ingen neutral skiljedomare. Det är deras delade uppfattning, upphöjd till sanningsgrund. En modell som kopierar deras gemensamma fel bedöms som rätt. En modell som har rätt när båda har fel bedöms som ett misslyckande. Vi kallade detta konsensusfällan när vi skrev om riktmärken i augusti. TypeSafes riktmärke är det tydligaste redovisade exempel vi har sett. En hederlighetsnotering om oss själva: studien mätte detta på två offentliga rankningar och en rekryteringsuppgift. Att samma sak sker inuti ett arbetsflödesriktmärke utan oberoende sanning är vår slutsats, inte studiens fynd.

3. Vi öppnade fallen. Det här fann vi.

Instrumentpanelen bedömer nio modeller på fyra arbetsflöden: säkerhetslarm, övervakning av supportagenter, fakturahantering och kundtjänst, 711 fall totalt. Jev hamnar mitt i fältet: 67,8 % överensstämmelse med referensen i genomsnitt, mot 74,1 % för den bästa modellen. Den ligger under de ledande modellerna från OpenAI och Anthropic, en tiondels poäng efter GPT-5.6 Terra, i nivå med Claude Sonnet 5, och över båda DeepSeek-modellerna. Om ni kom hit och undrade om Jev ”hallucinerar” är TypeSafes lanseringsinlägg uppriktigt även där: de 0 % som ritas in är, med inläggets ord, “not empirical. Schema matching is guaranteed, thus we can confidently add 0% into the plots” (inte empiriska; schemaöverensstämmelsen är garanterad). Jev kan inte returnera ett felformat svar. Det är något annat än att returnera ett korrekt.

Den del vi bryr oss om är mindre och mer avslöjande. TypeSafe publicerar också tjugo genomarbetade fall, fem per arbetsflöde, valda för att illustrera fem situationer: var och en av de tre jämförda modellerna avviker i tur och ordning från de två andra, alla tre missar referensen, och alla tre är eniga. För nitton av dessa fall publiceras vad var och en av de två bedömande modellerna sade, fråga för fråga, och inte bara deras genomsnitt; i ett av de nitton saknas de flesta av den andra bedömarens följdsvar i filen, och i två av de fyra arbetsflödena publiceras genomsnittet självt inte alls. Det är mer öppenhet än de flesta riktmärken erbjuder, och den lät oss räkna.

De två bedömarna var oense med varandra om det slutliga beslutet i 8 av de 19 fallen. Vi jämförde hela listan av åtgärder som varje bedömare kom fram till; i några fall var den enas lista den andras plus extra steg, och även det räknar vi som oenighet. Fråga för fråga gav de olika svar 31 gånger av de 356 frågor som båda bedömarna besvarade, och alla finns i de arkiverade filerna; i sex ytterligare fall gav en av dem inget svar alls. De här tjugo fallen valdes ut för hand av TypeSafe för att visa oenighet bland de bedömda modellerna, så detta är ingen mätning av hur ofta bedömarna är oense över alla 711. Det är vad TypeSafe valde att publicera, läst från andra hållet.

Varje enskilt fall som TypeSafe märker ”alla tre missar referensen” är ett fall där även de två bedömarna var oense med varandra. Ta säkerhetsexemplet. En bedömare sade ISOLATE HOST. Den andra sade REVOKE SESSIONS. Genomsnittet blev ISOLATE HOST. Alla tre bedömda modeller sade QUARANTINE FILE. Tre modeller markerades alltså som fel mot ett svar som en av de två modeller som skriver facit inte heller gav. För att vara exakt om vad det visar: de tre modellerna skulle ha markerats som fel under endera bedömarens svar, så detta är ett omtvistat facit och inte ett korrekt svar som bestraffas. Ingen kan säga vilken bedömare som hade rätt: de här arbetsflödena har inget oberoende facit, vilket är hela poängen. Två av de fyra fall som märkts ”alla tre är eniga” skär åt andra hållet. I ett delade sig de två bedömarna mellan ISOLATE HOST och ESCALATE TIER2, genomsnittet valde ESCALATE TIER2, och alla tre bedömda modeller sade samma sak, så att hålla med den ena bedömaren mot den andra räknades som rätt. Överallt där TypeSafe publicerar genomsnittet är det lika med den ena eller den andra bedömarens svar, aldrig ett tredje. Det är ingen tillfällighet: de genomsnittliga sannolikheterna körs genom samma beslutsregler som vilken modells svar som helst, så genomsnittet måste landa på någon åtgärd, och i varje publicerat fall landar det på den ena bedömarens sida.

En av bedömarna var delvis en ersättare. I säkerhetsarbetsflödet lyder filen som beskriver den andra bedömaren, ord för ord: “Claude Fable 5.1 high, one question per request; Claude Opus 5 high on the 88 documents Fable refused or failed”. Så för de dokument Fable inte ville eller kunde besvara gick en annan Anthropic-modell in, Claude Opus 5. Filen räknar 240 fall i det arbetsflödet men säger inte hur dokument motsvarar fall, så vi gör inte om de 88 till en procentandel. Av detta följer en sak: en bedömare för ett arbetsflöde är en blandning vars recept inte redovisas utöver ett dokumentantal. Filen noterar ersättaren; rankningen nämner den inte. Och eftersom filen inte säger på vilka dokument Fable fallerade kan vi inte avgöra om det där REVOKE SESSIONS ovan kom från Fable eller från Opus 5.

Jevs egna svar är också publicerade, och de lutar åt ingetdera hållet. På de 31 frågor där de två bedömarna var oense ställde sig Jev på Astras sida 14 gånger, på den andra bedömarens sida 14 gånger, och på ingenderas 3 gånger. För ett värde från 0 till 4 är TypeSafes egen konvention det sannolikhetsviktade genomsnittet snarare än den enskilt mest sannolika nivån; bedömt så vänder ett svar och det blir 13 mot 15. Hur som helst finns det i detta pyttelilla, kurerade urval inget tecken på att Jev lutar mot någon av de modeller vars genomsnitt bedömer den. Men var försiktig med vad det visar. En jämn fördelning är vad ”ingen favorit” ser ut som. Den är också, som en av våra utomstående granskare påpekade, vad en modell tränad att följa de tvås genomsnitt skulle se ut som. Den här räkningen kan inte skilja de två berättelserna åt. Behåll den tanken till nästa avsnitt.

Inget av detta gör Jev bättre eller sämre än instrumentpanelen säger. Det visar att riktmärkets definition av ”rätt” är omtvistad inuti dess egna data, på ett sätt som TypeSafe gjorde synligt och som dess rubriksiffra inte visar.

4. Var lärde sig Jev att döma?

Vårt forskningsprogram ställer en fråga till varje modell: var kom dess vanor ifrån? Tränades den på en annan modells utdata? Delar den bas med en konkurrent? För modeller som skriver finns en förvånande stark ledtråd i själva skrivandet: fördelningar av ordval är särskiljande nog för att skilja fem stora AI-system åt med 97 % träffsäkerhet (Sun m.fl., ICML 2025). Det är maskinens motsvarighet till att känna igen en skrivare på handstilen.

Jev skriver ingenting, så den ledtråden är borta. Kvar finns två svårare metoder: avsiktligt inplanterade markörer, och att jämföra en modell med en tidigare version av sig själv för att se vilken lärare den lärde av. Ingendera är tillgänglig för en utomstående. TypeSafes egen introduktion säger att dess modeller utgår från vanliga förtränade språkmodeller och lägger till ett nytt träningssteg, “Reinforcement learning for calibrated decisions”. TypeSafe berör var träningsdatan kommer ifrån, i ett FAQ-svar i lanseringsinlägget som ingen textåtergivning av sidan visar och som en av våra granskare fann i sidans skriptnyttolast: “We make all the data ourselves” (vi gör all data själva). Det utesluter träning på kunddata. Det namnger ingen basmodell, namnger ingen lärare, och säger inte om självgjord data kan bära andra modellers svar. Samma FAQ säger att Jev är “neither small nor an LLM” (varken liten eller en LLM), vilket sitter illa ihop med introduktionens beskrivning av ett tredje sätt att anpassa förtränade språkmodeller; TypeSafe förenar inte de två, och vi kan det inte. Enligt våra egna regler är Jevs härkomst därmed ett forskningsprogram och inte ett resultat, och ett tunnare sådant än för modeller som skriver.

Kvar står en hypotes vi vill formulera försiktigt. Om Jev hade tränats att matcha samma slags tvåmodellsgenomsnitt som dess riktmärke använder, då skulle en granskningspanel som lade till Jev som en ”fjärde oberoende uppfattning” i själva verket lägga till en ättling till två uppfattningar den redan hade, och varje förfarande som räknade den som oberoende skulle luras utan att veta om det. Två saker berör detta, ingendera avgörande. Jev ligger mitt i fältet på instrumentpanelen, där man av en modell tränad att kopiera bedömarna kanske skulle vänta sig att den stämde överens med dem oftare; men förmåga och överensstämmelse är sammanflätade där, så det är svag evidens. Och på de 31 omtvistade frågorna delade sig Jev fjorton mot fjorton mellan de två bedömarna (tretton mot femton under TypeSafes egen poängsättning av en svarstyp). Det är förenligt med att inte ha någon favorit, och lika förenligt med att följa parets genomsnitt, så det avgör ingenting. Vi håller hypotesen för möjlig och säger vad som skulle avgöra den: att TypeSafe redovisar varifrån dess träningssvar kom, eller en jämförelse som ställer Jevs närhet till de två bedömarnas genomsnitt mot andra kapabla modeller som inte tränats på dem, mätt över alla 711 fall snarare än de 20 vi kan se. Närhet i sig skulle inte avgöra saken: varje kapabel modell tenderar att hamna mellan två kapabla bedömare.

5. Vår egen hand i detta

Den här anteckningen utarbetades med Claude Fable 5.1, en av de två modeller vars genomsnitt TypeSafe behandlar som sanning. En tidigare analys vi rådfrågade kom från en OpenAI-modell, den andra halvan av det genomsnittet. Båda författarna är med andra ord parter i det de bedömde. Därför lät vi, innan den här anteckningen skrevs, den underliggande bedömningen angripas av en granskare från ett tredje företag, Moonshots Kimi. Den rättade tre av våra citat och bröt nitton av våra slutsatser, bland dem ett första utkasts påstående att Jev ”stämmer minst” överens med konsensus. Det gör den inte; den ligger mitt i fältet. En andra Kimi-instans räknade sedan om varje siffra ovan från råfilerna och bekräftade dem, och bröt i sin tur den här anteckningens första utkast: det hade omvandlat TypeSafes ”88 dokument” till en andel av 240 fall, två enheter som filerna inte likställer, och hade skrivit att en bedömare ”bedömde sig själv”, vilket data inte stöder. Båda är borta. En tredje instans, från xAI:s Grok, räknade om siffrorna en tredje gång och visade att vårt säkerhetsexempel bevisade mindre än vi hade antytt, att placeringen av ersättarfaktumet intill Opus 5:s placering inbjöd till en slutsats vi hade avvisat, och att en av våra siffror beror på ett poängsättningsval. En fjärde, från DeepSeek, räknade om dem igen och tog oss på bar gärning när vi behandlade en jämn fördelning som evidens mot en hypotes den inte kan skilja den från. En femte, ännu en Kimi-instans, fann ett FAQ-svar om träningsdata som fyra sidläsare, vår egen inräknad, hade rapporterat som frånvarande. En sjätte, Alibabas Qwen, körd av författaren och inte av oss, bekräftade varje siffra och blev den fjärde att säga att ersättarstycket fortfarande insinuerade; det läses nu som en rak redovisning. Allt är rättat ovan. En anteckning om korrelerade bedömare skriven av en korrelerad bedömare är värd exakt så mycket som sin utomstående kontroll.

Den 17 september granskade två ytterligare granskare, en OpenAI Codex-instans och en Moonshot Kimi-instans, vår plan att testa Jev direkt och visade att det test vi föreslog i §4 inte kunde avgöra frågan på egen hand. Meningen i §4 säger nu vad som skulle krävas.

Vad vi inte säger

Vi säger inte att typade beslut är en dålig idé; för dirigering och triage är de förmodligen en bra. Vi säger inte att TypeSafes riktmärke är oärligt; det redovisar mer än de flesta, och allt ovan är räknat ur det som redovisas. Vi säger inte att Jev tränades på sina bedömares svar; det enda test vi kunde köra kan inte avgöra det. Vi säger tre saker. Ett riktmärke vars sanning är ett genomsnitt av två vittnen ärver allt som de vittnena har fel om tillsammans. TypeSafes egna publicerade fall visar de två vittnena oense om svaret i åtta av nitton. Och en klass av modeller som inte kan skriva har tagit ifrån oss den evidens vi annars skulle använda för att fråga varifrån dess omdöme kom.

Varför vi bryr oss

CounterProof granskar AI-skriven kod som en motståndare skulle göra. Vår arbetsregel är att ett fynd avgörs genom att köra koden, aldrig genom att ta en omröstning bland modeller. Den nya klassen av beslutsmodeller kommer att bedömas, och tränas, mot modellkonsensus, eftersom konsensus är billigt och verkliga utfallsetiketter är dyra. Hela vår metod är det dyra alternativet: frysta fall, reproduktioner ni kan köra, och etiketter som kommer från vad koden faktiskt gjorde snarare än från vad två modeller kom överens om att den skulle göra. Om modeller med typade beslut blir det lager som AI-agenter agerar genom, då blir frågan om vems omdöme det lagret bär decenniets härkomstfråga. Det enda hederliga svaret kommer från kontroll mot utfall. Det är arbetet.

Den tekniska akten. Metod, schema, den fullständiga sifferttabellen, vad exemplaret tillåter och inte tillåter, och gränserna: Field Note 1, Consensus as oracle: TypeSafe’s Jev benchmark as a type specimen, på vår forskningssajt.


Redovisning, som vi inte drar något av. Claude Opus 5, ersättaren för en del av säkerhetsarbetsflödets facit, är också en av de nio modeller som bedöms. Filen säger inte vilka dokument som ersattes, och ett ersättarsvar måste fortfarande vinna genomsnittet mot Astra innan det blir facit. Vi drar ingen slutsats om någon modells poäng av detta, och fyra utomstående granskare sade oss att placeringen av faktumet inne i argumentationen ovan inbjöd till en ändå; därför står det här.

Källor. TypeSafes lanseringsinlägg, dokumentation (introduction, introduction/machine-learning-primer, confidence, System One concepts, HTTP API, primitives/choice) och evals.typesafe.ai, lästa den 16 september 2026; de fem sidorna och fyra fallfilerna (*-cases.js) som den sajten levererar, arkiverade med SHA-256-summor i vårt rapportförråd. Kim, Garg, Peng och Garg, Correlated Errors in Large Language Models, ICML 2025, arXiv:2506.07962. Sun, Yin, Xu, Kolter och Liu, Idiosyncrasies in Large Language Models, ICML 2025, arXiv:2502.12150. Rawat m.fl., Reference-Based Distillation Detection in LLMs, arXiv:2607.09692. Soons, Agentic Stemmatics, v1.29, doi:10.5281/zenodo.22790100. Räkningarna i §3 avser enbart de tjugo publicerade fallen; slutliga beslut jämfördes som oordnade mängder av åtgärder; ett fall bär endast en bedömares svar och är undantaget från de åtta av nitton.

← Alla anteckningar