# Che cosa stabiliscono le divulgazioni sull'addestramento di Kolibri-1, e che cosa no

> Modelli di altri fornitori hanno contribuito a scrivere, selezionare e giudicare i dati di addestramento di Kolibri-1. Il riepilogo europeo elenca sette nomi; il rapporto tecnico spiega i diversi ruoli. Queste divulgazioni mostrano come un modello costruito per un dispiegamento sovrano e specializzato possa attingere a modelli di altri fornitori durante l'addestramento. Non stabiliscono quali comportamenti, se ve ne sono, siano stati ereditati.

Source: https://counterproof.io/it/notes/cosa-stabiliscono-le-divulgazioni-sull-addestramento-di-kolibri-1/ · Published 5 October 2026 · CounterProof è una practice di Clavestra Capital Limited (Malta, C 113987).


**Il 3 ottobre 2026 Aleph Alpha ha pubblicato i pesi di Kolibri-1, un modello in tedesco e inglese.** Ha pubblicato anche un rapporto tecnico e il riepilogo dei contenuti di addestramento che il regolamento europeo sull'IA chiede ai fornitori di modelli per finalità generali.

Il rapporto nomina i modelli di altre aziende che hanno contribuito a costruire i dati di addestramento di Kolibri-1 e spiega che cosa ha fatto ciascuno. Il riepilogo ne elenca sette. Abbiamo letto entrambi per capire che cosa stabiliscono le divulgazioni, che cosa lasciano aperto e che cosa il fornitore intende con «sovrano».

La distinzione importante riguarda i ruoli. Alcuni modelli hanno fornito testo di addestramento. Altri hanno contribuito a decidere quale materiale conservare. Questi ruoli descrivono relazioni diverse con Kolibri-1.

## Che cosa ha divulgato il fornitore

Il riepilogo europeo chiede: «If yes, specify the general-purpose AI model(s) used to generate the synthetic data if available on the market:» (in caso affermativo, indicare i modelli di IA per finalità generali disponibili sul mercato usati per generare i dati sintetici). Aleph Alpha risponde con sette nomi: Gemma-4-26B-A4B, Qwen3-32B, Qwen3.8-27B, Mistral-Nemo-12B, GLM-5.3, GLM-5.2-fp8 e Kimi-K2.6.

Il rapporto tecnico e la scheda del modello descrivono che cosa hanno fatto questi modelli, e alcuni altri. La tabella conserva la formulazione dei documenti, tradotta; la colonna della fase segue la struttura delle sezioni del rapporto.

| modello | che cosa dicono i documenti del suo ruolo | fase dell'addestramento |
|---|---|---|
| Gemma-4-26B-A4B | ha riformulato documenti di partenza, «usando cinque schemi di prompt applicati a ciascun documento di partenza» | dati di pre-addestramento (rapporto §2.3.2) |
| Mistral-NeMo-12B | «Le riformulazioni sintetiche in tedesco di dati del web sono state prodotte con Mistral-NeMo-12B» | fase non indicata nella frase citata della scheda (scheda del modello) |
| Qwen3-32B | ha valutato «un campione fisso di un milione di documenti in inglese» dei «nostri dati CC curati» «usando più di 20 prompt»; sono poi stati usati «classificatori distillati dal giudice, basati su Luxical» «nella costruzione del nostro insieme di dati Kolibri» | dati di pre-addestramento (rapporto pp. 28 a 29) |
| GLM-5.2, GLM-5.3, Qwen3.8-27B | «i principali modelli che usiamo per generare questi dati e per rigenerare parti degli insiemi di dati aperti» | dati di post-addestramento, messa a punto supervisionata (rapporto p. 53) |
| GLM-5.2 | «scrive due domande con sei opzioni» per documento; una domanda entra nell'addestramento «solo se GLM-5.2 l'ha risolta almeno una volta e Kolibri al massimo sei volte» | ambiente a contesto lungo (rapporto appendice I.1.2) |
| Kimi K2.6 | «quando i tentativi di Kolibri concordano su una risposta diversa o risolvono la domanda al massimo una volta, Kimi K2.6 … decide sulle opzioni controverse senza vedere la chiave» | ambiente a contesto lungo (rapporto appendice I.1.2) |
| Kimi-K2.7 | «applichiamo Kimi-K2.7 … per produrre il rollout di ogni domanda dell'ambiente, e questi rollout guidano un passaggio di filtraggio e riparazione» | l'ambiente, prima dell'addestramento (rapporto p. 176) |
| Gemma-4-31B | «Conserviamo un rollout quando un giudice LLM, Gemma-4-31B (Gemma Team 2026), ne accetta la risposta, la risposta di riferimento compare nel testo recuperato e la trascrizione termina con una risposta» | ambiente di recupero (rapporto p. 58) |
| Command A+ | «Conserviamo un seme quando i suoi completamenti rispondono correttamente nei primi due contesti, si astengono in quello di Morgana e superano un giudice Command A+ …» | dati di recupero e ricerca (rapporto p. 58) |
| gpt-oss-120b | «giudichiamo l'intera conversazione, tracce di ragionamento comprese, con gpt-oss-120b …, per classificare ciascuna come portatrice di una narrazione del PCC, come un rifiuto per motivi generali di sicurezza o come equilibrata. Le conversazioni del primo tipo vengono scartate.» | cura dei dati di post-addestramento (rapporto p. 60) |

Il rapporto spiega lo scopo dell'ultima riga: «Riconosciamo che diversi dei nostri modelli insegnanti sono stati costruiti in Cina, e quindi portano distorsioni politiche note su temi sensibili, mentre il nostro modello dovrebbe aderire ai valori del consenso democratico in Europa».

Descrive anche tre meccanismi che contano per ogni tentativo successivo di ricostruire relazioni di addestramento dalle uscite del modello:

- **Filtraggio delle dichiarazioni di identità.** «Un filtro di pattern scarta ogni conversazione in cui l'assistente afferma di essere un altro modello o di provenire da un altro laboratorio, a meno che non nomini anche il nostro modello, e ignora le smentite come “I am not Llama”».
- **Vincolo sui sistemi di scrittura.** Un vincolo di formato nell'apprendimento per rinforzo stabilisce: «Nessuna fuga di scrittura. Nessun testo cinese, giapponese o coreano (CJK) trapela in una risposta che per il resto non è CJK».
- **Variazione degli incipit del ragionamento.** Nella «distillazione con pre-riempimento del ragionamento», il ragionamento in tedesco di un insegnante comincia con un incipit come «Gegeben ist:». L'incipit viene «scelto a caso per ogni esempio da un elenco curato per dominio di compito, in modo che il modello non impari una frase di apertura fissa».

## I nomi non sono meccanismi

Il modulo europeo chiede un elenco sotto un'unica voce. La sua definizione di dati sintetici copre «la distillazione di modelli o l'allineamento di modelli (ad esempio il feedback di IA …)», sicché i sette nomi di Kolibri-1 rappresentano più tipi di relazione.

Riformulare testo di pre-addestramento e generare dati di post-addestramento introducono il testo di un altro modello nell'insieme di addestramento. Valutare documenti, giudicare rollout e decidere casi controversi influiscono su quale materiale viene conservato. I documenti non stabiliscono se questi ruoli di selezione e giudizio lascino tracce nelle uscite del modello addestrato, né quali. Noi non lo affermiamo.

Questa distinzione determina che cosa può essere verificato. I metodi che cercano di ricostruire l'origine di un modello dalle sue uscite cercano parole, formulazioni e abitudini ereditate. Le relazioni che coinvolgono testo generato sono quelle che tali metodi possono sperare di rilevare.

Una divulgazione che identifica sia il meccanismo sia la fase di addestramento aiuta un ricercatore indipendente a capire che cosa sia verificabile. Il rapporto tecnico fornisce questo dettaglio; il modulo sarebbe più utile se lo chiedesse anch'esso.

## Che cosa copre «sovrano»

Il rapporto si intitola «Kolibri: A Sovereign European Model on the Pareto Frontier». Il suo abstract spiega che cosa significhi sovrano in questo contesto: «Abbiamo costruito Kolibri per un dispiegamento sovrano e specializzato, con particolare attenzione al tedesco e ai settori regolamentati come la pubblica amministrazione, l'industria e l'aerospazio».

La scheda del modello aggiunge che i pesi «sono pubblicati da Aleph Alpha GmbH sotto licenza Apache 2.0» e che «Aleph Alpha è firmataria del Codice di buone pratiche dell'UE per i modelli di IA per finalità generali».

Sono affermazioni sul dispiegamento e sull'esercizio. La tabella descrive come sono stati costruiti i dati di addestramento. Il rapporto presenta entrambe le cose.

Leggere «sovrano» come l'affermazione che nessun modello di un altro fornitore abbia partecipato all'addestramento sarebbe una lettura errata del rapporto. Trattare quei contributi come una confutazione dell'affermazione sul dispiegamento andrebbe anch'esso oltre ciò che i documenti stabiliscono.

## Che cosa la divulgazione non può stabilire

Le divulgazioni identificano relazioni candidate. Non stabiliscono quali caratteristiche, se ve ne sono, Kolibri-1 abbia ereditato dai modelli coinvolti.

Il rapporto e il riepilogo differiscono anche per copertura. Quattro modelli della tabella (Gemma-4-31B, Command A+, Kimi-K2.7 e gpt-oss-120b) compaiono nel rapporto ma non nell'elenco del riepilogo. Due dei sette nomi del riepilogo, Qwen3-32B e Kimi-K2.6, hanno agito come giudice e come arbitro, non come generatori di testo.

Le cifre dell'addestramento si presentano in due forme. L'abstract del rapporto indica 24 000 miliardi di token «attraverso il pre-addestramento, l'addestramento intermedio e l'estensione del contesto lungo»; la scheda del modello li scompone in «20T token di un corpus bilingue filtrato (~62,5 % inglese, ~23,9 % tedesco, ~13,6 % codice)» e «addestrato inoltre su 3,44T in addestramento intermedio e 201B per l'estensione del contesto lungo».

Il predecessore, Kolibri Origin, è descritto come «un'iterazione precedente che ha validato la nostra intera pipeline su larga scala» e «non è pubblicato». Un terzo non può quindi eseguirlo. La tabella 28 confronta i suoi punteggi di benchmark dopo il post-addestramento con quelli di Kolibri.

I tre meccanismi descritti sopra limitano anche le prove disponibili nelle uscite. Le dichiarazioni di identità e le scritture estranee sono escluse come prove da quei meccanismi; i tentativi di ricostruire le relazioni devono lavorare su tratti più sottili.

Questi limiti fanno parte di ciò che rende il caso utile per noi. La nostra ricerca sulla provenienza dei modelli sostiene che la somiglianza tra modelli non è discendenza. Un metodo che pretenda di ricostruire relazioni deve essere messo alla prova dove la risposta è nota. Kolibri-1 offre un elenco di candidati pubblicato dal fornitore.

Stiamo preparando un test preregistrato per verificare se le relazioni divulgate possano essere ricostruite, anche solo in parte, dalle uscite. Pubblicheremo il disegno, regole di arresto comprese, prima di eseguire qualsiasi modello, e riporteremo il risultato nei termini del disegno stesso. Questa nota è una lettura di documenti, non un risultato sperimentale.

## A che cosa serve una divulgazione come questa

Gli acquirenti dei settori regolamentati cominciano a chiedere da dove provenga un modello. Una risposta utile dovrebbe spiegare quali modelli hanno scritto il suo testo di addestramento, quali lo hanno selezionato, quali lo hanno giudicato e in quale fase ciascuno è stato usato. Il modulo europeo chiede un elenco; il rapporto di Kolibri-1 mostra che si può dare un resoconto più completo.

Per i ricercatori, quel resoconto fornisce un elenco noto di candidati su cui mettere alla prova i metodi di provenienza. È un terreno più solido che inferire le fonti dal comportamento e poi discutere l'inferenza, dove si trova ancora buona parte del settore.

Non abbiamo alcuna relazione con Aleph Alpha e non abbiamo parlato con loro. Questa nota si basa sul rapporto tecnico pubblico, sulla scheda del modello e sul riepilogo europeo. Le citazioni provengono dai punti indicati sotto e sono tradotte dall'inglese. Non abbiamo eseguito alcun modello né effettuato alcuna misurazione. Correggeremo qualsiasi lettura errata che ci venga segnalata.

## Fonti

- Aleph Alpha, «Kolibri: A Sovereign European Model on the Pareto Frontier», rapporto tecnico, 2026: https://aleph-alpha.com/downloads/tech-report.pdf. Punti: abstract (dispiegamento sovrano; Kolibri Origin); §2.3.2 (riformulazione di Gemma-4-26B-A4B); pp. 28 a 29 (valutazione di Qwen3-32B e classificatori distillati); p. 53 (generatori di post-addestramento); p. 54 (distillazione con pre-riempimento del ragionamento); p. 58 (rollout di recupero, giudici Gemma-4-31B e Command A+); p. 59 (distorsioni dei modelli insegnanti); p. 60 (filtro di identità; classificazione di gpt-oss-120b); vincoli di formato dell'apprendimento per rinforzo (fuga di scrittura); appendice I.1.2 (ambiente a contesto lungo: domande di GLM-5.2, decisione di Kimi K2.6); p. 176 (rollout di Kimi-K2.7); tabella 1 (Kolibri Origin non pubblicato).
- Aleph Alpha, scheda del modello Kolibri-1: https://huggingface.co/Aleph-Alpha/Kolibri-1 (licenza; ripartizione delle lingue; Codice di buone pratiche; riformulazioni di Mistral-NeMo-12B).
- Aleph Alpha, «Public Summary of Training Content for General-Purpose AI models», Kolibri-1, il modulo previsto dall'articolo 53, paragrafo 1, lettera d), del regolamento (UE) 2024/1689: https://aleph-alpha.com/downloads/Kolibri_1_-_Sufficiently_Detailed_Summary.pdf (§2.5).
- La nostra ricerca sulla provenienza e sull'indipendenza dei revisori: https://research.counterproof.io/agentic-stemmatics.md


## Questions this page answers

**Aleph Alpha ha addestrato Kolibri-1 sui modelli di altre aziende?**

Il rapporto descrive l'addestramento dei propri pesi; non descrive l'uso dei pesi di un altro modello. Modelli di altri fornitori hanno contribuito a costruire i dati di addestramento: hanno riformulato testi del web, valutato documenti, generato e rigenerato dati di post-addestramento, giudicato rollout e deciso casi controversi. Il rapporto tecnico descrive questi ruoli, e il riepilogo europeo dei contenuti di addestramento elenca sette dei modelli coinvolti.

**Questo contraddice l'etichetta «sovrano»?**

Il rapporto usa «sovrano» per il dispiegamento a cui il modello è destinato: pesi aperti sotto Apache 2.0, con particolare attenzione al tedesco e ai settori regolamentati. È un'affermazione sull'esercizio. Quali altri modelli abbiano partecipato alla costruzione dei dati di addestramento è un'affermazione distinta, e il rapporto le fa entrambe.

**Si può capire dalle uscite di un modello quali modelli abbiano partecipato al suo addestramento?**

È una questione aperta, e può essere verificata solo dove la risposta è nota. Kolibri-1 è un caso in cui il fornitore ha pubblicato l'elenco dei candidati. Stiamo preparando un test preregistrato e ne pubblicheremo il disegno prima di eseguire qualsiasi modello.

**Che cosa dovrebbe chiedere un acquirente a un fornitore?**

Chieda quali modelli hanno scritto il testo di addestramento, quali lo hanno selezionato, quali lo hanno giudicato e in quale fase ciascuno è stato usato. Il modulo europeo chiede un elenco di nomi. Il rapporto tecnico di Kolibri-1 spiega i ruoli che vi stanno dietro.

