Come è stata verificata questa nota. Prima della pubblicazione è stata attaccata, con confutazione per prima cosa, da otto istanze di revisione esterne appartenenti a quattro famiglie di modelli (Moonshot Kimi, xAI Grok, DeepSeek, Alibaba Qwen), ciascuna ricalcolando ogni conteggio dai file del fornitore. Ciò che hanno rotto e come è stato corretto è al §5. Il compagno tecnico, con metodo, conteggi completi e limiti, è Field Note 1. I verbali delle istanze e l’archivio dati con i suoi hash sono conservati nel nostro deposito rapporti e disponibili su richiesta.
In un minuto. Un’azienda chiamata TypeSafe AI ha rilasciato Jev, un modello di IA che non scrive mai una frase. Ponetegli una domanda con un insieme fisso di risposte e restituisce una risposta, più una probabilità per ciascuna opzione. Per un modello di questa classe di capacità è una novità, e acuisce una domanda che i classificatori non ci hanno mai imposto: come si verifica un testimone che non sa spiegarsi? La risposta di TypeSafe è valutare Jev contro l’opinione media di altri due modelli di IA. Abbiamo aperto i venti casi che TypeSafe pubblica per illustrare il proprio banco di prova e abbiamo trovato che, in otto dei diciannove in cui entrambi i valutatori hanno risposto, quei due modelli divergevano tra loro su quale fosse la risposta giusta. Questa nota spiega perché ciò conta ben oltre una sola azienda.
1. Un modello che non parla
Per tre anni, quando un modello di IA di frontiera ci dava una risposta, ci dava parole. Potevamo leggerle, discuterle e cogliere il modello in contraddizione. I classificatori più piccoli hanno sempre restituito etichette nude; la novità è un modello con capacità di frontiera che non restituisce altro. TypeSafe AI, un’azienda di San Francisco senza alcun legame con il linguaggio di programmazione TypeScript, ha rilasciato un modello che non fa nulla di tutto questo. Si chiama Jev, e TypeSafe lo presenta come il primo di una nuova categoria, i «System One models», dal pensiero rapido e intuitivo descritto da Daniel Kahneman in Pensieri lenti e veloci.
Ecco come funziona Jev. Gli date del materiale, poniamo il ticket di assistenza di un cliente. Gli date un insieme di domande tipizzate: questo cliente sta chiedendo un rimborso? (sì o no, con una probabilità). Quale squadra deve occuparsene? (una da un elenco). Quanto è esasperato il cliente, da 0 a 4? (un punteggio). Jev restituisce le risposte, ciascuna con una distribuzione di probabilità, in una frazione di secondo. Niente prosa, nessuna spiegazione, nessun codice. Il vostro software agisce direttamente sulle risposte.
Per automatizzare decisioni di routine questo è attraente, e non siamo qui per dire il contrario. Togliere il testo libero elimina un’intera classe di guasti, e una probabilità su cui si può fissare una soglia serve a un programma più di un paragrafo. Ciò che ci interessa è un effetto collaterale. Un modello che sceglie soltanto dal vostro elenco non potrà mai dirvi che all’elenco manca qualcosa. Un revisore umano, o un modello che scrive, può dire «avete posto la domanda sbagliata». Jev non può. Può far intendere che nessuna opzione calza bene, perché le sue probabilità risulteranno sparse anziché concentrate, e la documentazione di TypeSafe lo dice essa stessa. Ma non può mai nominare l’opzione che avete dimenticato. Qualunque cosa abbiate lasciato fuori dall’insieme di domande resta fuori, per ogni testimone che vi risponda.
Arriviamo a questo da un’angolatura insolita. Il nostro documento di lavoro tratta gli output dell’IA come gli studiosi trattano i manoscritti antichi: come testimonianza di testimoni che possono condividere fonti, copiarsi a vicenda e commettere gli stessi errori per le stesse ragioni. In quella cornice, Jev è un testimone che ha smesso di scrivere.
2. Chi valuta il valutatore?
Ogni modello di IA riceve un punteggio di banco di prova. La domanda che vale la pena porre davanti a qualunque punteggio è: confrontato con cosa? Per un problema di matematica la risposta è facile: il numero corretto. Per «questo allarme di sicurezza va scalato?» non esiste una griglia di risposte. Qualcuno deve decidere quale fosse la risposta giusta.
TypeSafe pubblica il proprio banco di prova su evals.typesafe.ai. La sezione di metodologia spiega
come ha deciso:
“Instead of debating the correctness of the harness and labels, we assume that the code is correct, and measure against the current smartest large models. For this eval, the reference labels are generated via an average of the responses of GPT-6 Astra and Claude Fable 5.1, both at high thinking, answering every question in the harness. All other models are evaluated using the provider’s default reasoning settings.”
Nostra traduzione: anziché discutere la correttezza dell’imbracatura e delle etichette, assumiamo che il codice sia corretto e misuriamo contro i grandi modelli attualmente più capaci; per questa valutazione le etichette di riferimento sono generate come media delle risposte di GPT-6 Astra e Claude Fable 5.1, entrambi in modalità di ragionamento elevato.
In parole povere: la «risposta giusta» a ogni domanda è ciò che due modelli di IA di primo piano, il GPT-6 Astra di OpenAI e il Claude Fable 5.1 di Anthropic, hanno detto in media. L’accuratezza di Jev è quanto spesso concorda con quella media. Quella di tutti gli altri pure.
TypeSafe è schietto sul problema evidente. Il post di lancio dice che questo “biases answers towards OpenAI and Anthropic’s models. We likely underestimate the relative performance of our model and DeepSeek’s models” (distorce le risposte a favore dei modelli di OpenAI e Anthropic, e sottostima probabilmente la prestazione relativa del proprio modello e di quelli di DeepSeek). È una riserva onesta. Ma c’è un problema più profondo che non viene nominato.
Quando due modelli di IA sbagliano entrambi, tendono a sbagliare allo stesso modo. Uno studio del 2025 su più di 350 modelli ha trovato che, quando due modelli mancano entrambi una domanda, danno la stessa risposta sbagliata assai più spesso di quanto il caso predirebbe. L’effetto si rafforza man mano che i modelli diventano più capaci, e tiene attraverso aziende e architetture diverse (Kim, Garg, Peng e Garg, ICML 2025). Fare la media di due giudici attenua gli errori che commettono separatamente; al livello di una decisione finale si schiera semplicemente dalla parte di uno dei due, come mostriamo più avanti. Non fa nulla contro gli errori che commettono insieme e, in cima al campo, proprio quegli errori condivisi sono i grossi.
Una media di due modelli di frontiera non è dunque un arbitro neutrale. È la loro opinione condivisa, promossa a verità di riferimento. Un modello che copia il loro errore comune viene segnato come corretto. Un modello che ha ragione quando entrambi sbagliano viene segnato come fallimento. Lo abbiamo chiamato la trappola del consenso quando abbiamo scritto dei banchi di prova in agosto. Il banco di prova di TypeSafe è l’esempio dichiarato più netto che abbiamo visto. Una nota di onestà che ci riguarda: lo studio ha misurato questo su due classifiche pubbliche e su un compito di selezione del personale. Che la stessa cosa accada dentro un banco di prova di flussi di lavoro privo di verità indipendente è una nostra inferenza, non un risultato dello studio.
3. Abbiamo aperto i casi. Ecco cosa abbiamo trovato.
Il cruscotto valuta nove modelli su quattro flussi di lavoro: allarmi di sicurezza, supervisione di agenti di assistenza, trattamento fatture e servizio clienti, 711 casi in tutto. Jev si colloca a metà del gruppo: 67,8 % di accordo con il riferimento in media, contro il 74,1 % del modello migliore. Si piazza sotto i modelli di punta di OpenAI e Anthropic, un decimo di punto dietro GPT-5.6 Terra, alla pari con Claude Sonnet 5, e sopra entrambi i modelli DeepSeek. Se siete arrivati chiedendovi se Jev «allucina», il post di lancio di TypeSafe è franco anche su questo: lo 0 % che traccia è, con le sue parole, “not empirical. Schema matching is guaranteed, thus we can confidently add 0% into the plots” (non empirico; la corrispondenza di schema è garantita). Jev non può restituire una risposta malformata. È cosa diversa dal restituirne una corretta.
La parte che ci riguarda è più piccola e più rivelatrice. TypeSafe pubblica anche venti casi lavorati, cinque per flusso, scelti per illustrare cinque situazioni: ciascuno dei tre modelli confrontati che diverge a turno dagli altri due, tutti e tre che mancano il riferimento, e tutti e tre che concordano. Per diciannove di quei casi pubblica ciò che ciascuno dei due modelli valutatori ha detto, domanda per domanda, e non solo la loro media; in uno dei diciannove la maggior parte delle risposte di seguito del secondo valutatore manca dal file, e in due dei quattro flussi la media stessa non è pubblicata affatto. È più trasparenza di quanta ne offra la maggior parte dei banchi di prova, e ci ha permesso di contare.
I due valutatori hanno divergito tra loro sulla decisione finale in 8 dei 19 casi. Abbiamo confrontato l’elenco completo delle azioni cui è giunto ciascun valutatore; in alcuni casi l’elenco dell’uno era quello dell’altro più passaggi aggiuntivi, e contiamo anche questo come divergenza. Domanda per domanda hanno dato risposte diverse 31 volte sulle 356 domande cui entrambi i valutatori hanno risposto, tutte presenti nei file archiviati; in altri sei casi uno dei due non ha dato risposta alcuna. Questi venti casi sono stati scelti a mano da TypeSafe per mostrare divergenze tra i modelli valutati, dunque questa non è una misura di quanto spesso i valutatori divergano sui 711. È ciò che TypeSafe ha scelto di pubblicare, letto dall’altro lato.
Ogni singolo caso che TypeSafe etichetta «tutti e tre mancano il riferimento» è un caso in cui anche
i due valutatori divergevano tra loro. Prendete l’esempio di sicurezza. Un valutatore ha detto
ISOLATE HOST. L’altro ha detto REVOKE SESSIONS. La media è risultata ISOLATE HOST. Tutti e tre i
modelli valutati hanno detto QUARANTINE FILE. Tre modelli sono stati dunque segnati come errati
contro una risposta che nemmeno uno dei due modelli che scrivono la griglia aveva dato. Per essere
esatti su cosa questo mostri: i tre modelli sarebbero stati segnati come errati sotto il giudizio
dell’uno come dell’altro valutatore, si tratta quindi di una griglia contestata e non di una risposta
corretta punita. Nessuno può dire quale valutatore avesse ragione: questi flussi non hanno una griglia
indipendente, che è appunto il punto. Due dei quattro casi etichettati «tutti e tre concordano»
tagliano nel senso opposto. In uno, i due valutatori si sono divisi tra ISOLATE HOST ed
ESCALATE TIER2, la media ha scelto ESCALATE TIER2, e tutti e tre i modelli valutati hanno detto la
stessa cosa, sicché concordare con un valutatore contro l’altro è contato come corretto. Ovunque
TypeSafe pubblichi la media, essa coincide con la risposta dell’uno o dell’altro valutatore, mai con
una terza. Non è un caso: le probabilità mediate passano per le stesse regole di decisione delle
risposte di qualunque modello, quindi la media deve atterrare su una qualche azione, e in ogni caso
pubblicato atterra dalla parte di uno dei valutatori.
Uno dei valutatori era in parte un sostituto. Nel flusso di sicurezza, il file che descrive il
secondo valutatore recita, parola per parola: “Claude Fable 5.1 high, one question per request; Claude
Opus 5 high on the 88 documents Fable refused or failed”. Così, per i documenti che Fable non voleva o
non poteva trattare, è subentrato un altro modello di Anthropic, Claude Opus 5. Il file conta 240 casi
in quel flusso ma non dice come i documenti corrispondano ai casi, e quindi non trasformeremo gli 88
in una percentuale. Ne segue una cosa sola: un valutatore per un flusso è una miscela la cui ricetta
non è dichiarata oltre un conteggio di documenti. Il file registra il sostituto; la classifica non lo
menziona. E poiché il file non dice su quali documenti Fable abbia fallito, non possiamo stabilire se
quel REVOKE SESSIONS di sopra venisse da Fable o da Opus 5.
Anche le risposte di Jev sono pubblicate, e non pendono da nessuna parte. Sulle 31 domande in cui i due valutatori divergevano, Jev si è schierato con Astra 14 volte, con il secondo valutatore 14 volte, e con nessuno dei due 3 volte. Per un punteggio da 0 a 4, la convenzione propria di TypeSafe è la media ponderata per le probabilità anziché il solo livello più probabile; valutata così, una risposta si ribalta e diventa 13 a 15. In un modo o nell’altro, su questo campione minuscolo e selezionato non c’è segno che Jev penda verso uno dei modelli la cui media lo valuta. Ma attenzione a cosa questo mostri. Una divisione pari è ciò a cui somiglia «nessun favorito». È anche, come ha osservato uno dei nostri revisori esterni, ciò a cui somiglierebbe un modello addestrato a seguire la media dei due. Questo conteggio non può distinguere le due storie. Tenete a mente il pensiero per la sezione seguente.
Nulla di questo rende Jev migliore o peggiore di quanto dica il cruscotto. Mostra che la definizione di «corretto» in questo banco di prova è contestata dentro i suoi stessi dati, in un modo che TypeSafe ha reso visibile e che la sua cifra di testata non mostra.
4. Dove ha imparato a giudicare, Jev?
Il nostro programma di ricerca pone una domanda a ogni modello: da dove vengono le sue abitudini? È stato addestrato sull’output di un altro modello? Condivide una base con un concorrente? Per i modelli che scrivono c’è un indizio sorprendentemente forte nella scrittura stessa: le distribuzioni delle scelte lessicali sono abbastanza distintive da separare cinque grandi sistemi di IA con il 97 % di accuratezza (Sun et al., ICML 2025). È l’equivalente meccanico del riconoscere un copista dalla mano.
Jev non scrive nulla, quindi quell’indizio sparisce. Restano due metodi più difficili: marcatori impiantati deliberatamente, e confrontare un modello con una versione precedente di sé stesso per vedere da quale maestro abbia imparato. Nessuno dei due è a disposizione di un esterno. L’introduzione di TypeSafe dice che i suoi modelli partono da comuni modelli linguistici preaddestrati e aggiungono una nuova fase di addestramento, “Reinforcement learning for calibrated decisions”. TypeSafe affronta in effetti la provenienza dei propri dati di addestramento, in una risposta delle domande frequenti del post di lancio che nessuna resa testuale della pagina mostra e che uno dei nostri revisori ha trovato nel payload di script della pagina: “We make all the data ourselves” (facciamo tutti i dati da noi). Questo esclude l’addestramento su dati dei clienti. Non nomina un modello di base, non nomina un maestro, e non dice se dati fatti in casa possano trasportare le risposte di altri modelli. Le stesse domande frequenti dicono che Jev non è “neither small nor an LLM” (né piccolo né un LLM), il che si concilia male con la descrizione, nella introduzione, di una terza via per adattare modelli linguistici preaddestrati; TypeSafe non concilia le due cose, e noi non possiamo. Secondo le nostre stesse regole, dunque, l’ascendenza di Jev è un programma di ricerca e non un risultato, e più sottile di quella dei modelli che scrivono.
Resta un’ipotesi che vogliamo enunciare con cura. Se Jev fosse stato addestrato ad allinearsi allo stesso tipo di media a due modelli che il suo banco di prova impiega, allora un panel di revisione che aggiungesse Jev come «quarta opinione indipendente» starebbe in realtà aggiungendo un discendente di due opinioni che già possedeva, e qualunque procedura che lo contasse come indipendente sarebbe ingannata senza saperlo. Due elementi toccano la questione, nessuno in modo decisivo. Jev sta a metà del gruppo nel cruscotto, dove da un modello addestrato a copiare i valutatori ci si potrebbe attendere un accordo maggiore con loro; ma lì capacità e accordo sono intrecciati, dunque è una prova debole. E sulle 31 domande contestate Jev si è diviso quattordici a quattordici tra i due valutatori (tredici a quindici sotto la valutazione propria di TypeSafe per un tipo di risposta). Ciò è compatibile con il non avere alcun favorito, ed egualmente compatibile con il seguire la media della coppia, quindi non risolve nulla. Teniamo l’ipotesi per possibile e diciamo cosa la risolverebbe: che TypeSafe dichiari da dove vengano le sue risposte di addestramento, oppure un confronto che metta la vicinanza di Jev alla media dei due valutatori contro altri modelli capaci che non siano stati addestrati su di essi, misurata su tutti i 711 casi anziché sui 20 che possiamo vedere. La vicinanza da sola non risolverebbe: qualunque modello capace tende a collocarsi tra due valutatori capaci.
5. La nostra mano in questa vicenda
Questa nota è stata redatta con Claude Fable 5.1, uno dei due modelli la cui media TypeSafe tratta come verità. Un’analisi precedente che abbiamo consultato veniva da un modello di OpenAI, l’altra metà di quella media. Entrambi gli autori sono, in altre parole, parti in causa rispetto a ciò che stavano valutando. Perciò, prima che questa nota fosse scritta, abbiamo fatto attaccare la valutazione sottostante da un revisore di una terza azienda, il Kimi di Moonshot. Ha corretto tre delle nostre citazioni e rotto diciannove delle nostre conclusioni, tra cui l’affermazione di una prima stesura secondo cui Jev «concorda meno» con il consenso. Non è così; sta a metà del gruppo. Una seconda istanza Kimi ha poi ricalcolato ogni conteggio di cui sopra dai file grezzi e li ha confermati, e ha rotto a sua volta la prima stesura di questa nota: aveva convertito gli «88 documenti» di TypeSafe in una quota di 240 casi, due unità che i file non equiparano, e aveva scritto che un valutatore «stava valutando sé stesso», cosa che i dati non sostengono. Entrambe sono sparite. Una terza istanza, dal Grok di xAI, ha ricalcolato i conteggi una terza volta e ha mostrato che il nostro esempio di sicurezza provava meno di quanto avessimo lasciato intendere, che collocare il fatto del sostituto accanto alla posizione di Opus 5 invitava a una conclusione che avevamo respinto, e che uno dei nostri conteggi dipende da una scelta di valutazione. Una quarta, da DeepSeek, li ha ricalcolati ancora e ci ha colti a trattare una divisione pari come prova contro un’ipotesi dalla quale non può distinguerla. Una quinta, un’altra istanza Kimi, ha trovato una risposta delle domande frequenti sui dati di addestramento che quattro lettori di pagina, il nostro compreso, avevano riportato come assente. Una sesta, il Qwen di Alibaba, eseguita dall’autore e non da noi, ha confermato ogni conteggio ed è stata la quarta a dire che il paragrafo sul sostituto ancora insinuava; ora si legge come una dichiarazione piana. Tutto è corretto sopra. Una nota su giudici correlati scritta da un giudice correlato vale esattamente quanto vale il suo controllo esterno.
Il 17 settembre due ulteriori revisori, un’istanza Codex di OpenAI e un’istanza Kimi di Moonshot, hanno esaminato il nostro piano di testare Jev direttamente e hanno mostrato che il test che proponevamo al §4 non poteva risolvere la questione da solo. La frase del §4 ora dice cosa servirebbe.
Cosa non stiamo dicendo
Non stiamo dicendo che le decisioni tipizzate siano una cattiva idea; per instradamento e triage sono probabilmente una buona. Non stiamo dicendo che il banco di prova di TypeSafe sia disonesto; dichiara più della maggior parte, e tutto quanto sopra è contato da ciò che dichiara. Non stiamo dicendo che Jev sia stato addestrato sulle risposte dei suoi valutatori; l’unico test che potevamo condurre non può dirlo. Diciamo tre cose. Un banco di prova la cui verità è una media di due testimoni eredita tutto ciò su cui quei testimoni sbagliano insieme. Gli stessi casi pubblicati da TypeSafe mostrano i due testimoni in disaccordo sulla risposta in otto casi su diciannove. E una classe di modelli che non sa scrivere ci ha tolto la prova che altrimenti useremmo per chiedere da dove venga il suo giudizio.
Perché ci riguarda
CounterProof rivede il codice scritto dall’IA come farebbe un avversario. La nostra regola operativa è che un rilievo si risolve eseguendo il codice, mai prendendo un voto tra modelli. La nuova classe di modelli decisionali sarà valutata, e addestrata, contro il consenso dei modelli, perché il consenso costa poco e le etichette reali di esito costano care. L’intero nostro metodo è l’alternativa costosa: casi congelati, riproduzioni che potete eseguire, ed etichette che vengono da ciò che il codice ha davvero fatto anziché da ciò che due modelli hanno concordato che avrebbe fatto. Se i modelli a decisione tipizzata diventeranno lo strato attraverso cui gli agenti di IA agiscono, allora la domanda su quale giudizio quello strato porti diventa la domanda di provenienza del decennio. L’unica risposta onesta verrà dal verificare contro gli esiti. Questo è il lavoro.
Il fascicolo tecnico. Metodo, schema, la tabella completa dei conteggi, cosa l’esemplare consente e cosa no, e i limiti: Field Note 1, Consensus as oracle: TypeSafe’s Jev benchmark as a type specimen, sul nostro sito di ricerca.
Dichiarazione, dalla quale non traiamo nulla. Claude Opus 5, il sostituto per una parte della griglia di risposte del flusso di sicurezza, è anche uno dei nove modelli valutati. Il file non dice quali documenti siano stati sostituiti, e una risposta di sostituto deve comunque vincere la media contro Astra prima di diventare la griglia. Non ne traiamo alcuna conclusione sul punteggio di alcun modello, e quattro revisori esterni ci hanno detto che collocare il fatto dentro l’argomentazione di sopra vi invitava comunque; perciò sta qui.
Fonti. Post di lancio di TypeSafe, documentazione (introduction,
introduction/machine-learning-primer, confidence, System One concepts, HTTP API, primitives/choice) e
evals.typesafe.ai, letti il 16 settembre 2026; le cinque pagine e i quattro file di casi
(*-cases.js) serviti da quel sito, archiviati con i loro hash SHA-256 nel nostro deposito rapporti.
Kim, Garg, Peng e Garg, Correlated Errors in Large Language Models, ICML 2025, arXiv:2506.07962.
Sun, Yin, Xu, Kolter e Liu, Idiosyncrasies in Large Language Models, ICML 2025, arXiv:2502.12150.
Rawat et al., Reference-Based Distillation Detection in LLMs, arXiv:2607.09692. Soons, Agentic
Stemmatics, v1.29, doi:10.5281/zenodo.22790100. I conteggi al §3 riguardano soltanto i venti casi
pubblicati; le decisioni finali sono state confrontate come insiemi non ordinati di azioni; un caso
porta la risposta di un solo valutatore ed è escluso dagli otto su diciannove.