# Qué establecen las divulgaciones sobre el entrenamiento de Kolibri-1, y qué no

> Modelos de otros proveedores ayudaron a escribir, seleccionar y juzgar los datos de entrenamiento de Kolibri-1. El resumen europeo enumera siete nombres; el informe técnico explica las distintas funciones. Estas divulgaciones muestran cómo un modelo construido para un despliegue soberano y especializado puede apoyarse en modelos de otros proveedores durante el entrenamiento. No establecen qué comportamientos, si alguno, se heredaron.

Source: https://counterproof.io/es/notes/que-establecen-las-divulgaciones-sobre-el-entrenamiento-de-kolibri-1/ · Published 5 October 2026 · CounterProof es una práctica de Clavestra Capital Limited (Malta, C 113987).


**El 3 de octubre de 2026, Aleph Alpha publicó los pesos de Kolibri-1, un modelo en alemán e inglés.** Publicó también un informe técnico y el resumen de contenidos de entrenamiento que el Reglamento europeo de IA pide a los proveedores de modelos de uso general.

El informe nombra los modelos de otras empresas que ayudaron a construir los datos de entrenamiento de Kolibri-1 y explica qué hizo cada uno. El resumen enumera siete de ellos. Hemos leído ambos para entender qué establecen las divulgaciones, qué dejan abierto y qué entiende el proveedor por «soberano».

La distinción importante está en las funciones. Algunos modelos aportaron texto de entrenamiento. Otros ayudaron a decidir qué material se conservaba. Esas funciones describen relaciones distintas con Kolibri-1.

## Qué divulgó el proveedor

El resumen europeo pregunta: «If yes, specify the general-purpose AI model(s) used to generate the synthetic data if available on the market:» (en caso afirmativo, especifique los modelos de IA de uso general disponibles en el mercado que se usaron para generar los datos sintéticos). Aleph Alpha responde con siete nombres: Gemma-4-26B-A4B, Qwen3-32B, Qwen3.8-27B, Mistral-Nemo-12B, GLM-5.3, GLM-5.2-fp8 y Kimi-K2.6.

El informe técnico y la ficha del modelo describen qué hicieron esos modelos, y algunos más. La tabla conserva la redacción de los documentos, traducida; su columna de fase sigue la estructura de secciones del informe.

| modelo | qué dicen los documentos que hizo | fase del entrenamiento |
|---|---|---|
| Gemma-4-26B-A4B | reformuló documentos semilla, «usando cinco plantillas de prompt aplicadas a cada documento semilla» | datos de preentrenamiento (informe §2.3.2) |
| Mistral-NeMo-12B | «Las reformulaciones sintéticas en alemán de datos de la web se produjeron con Mistral-NeMo-12B» | fase no indicada en la frase citada de la ficha (ficha del modelo) |
| Qwen3-32B | puntuó «una muestra fija de un millón de documentos en inglés» de «nuestros datos CC curados» «usando más de 20 prompts»; después se usaron «clasificadores destilados del juez, basados en Luxical» «al construir nuestro conjunto de datos Kolibri» | datos de preentrenamiento (informe pp. 28 a 29) |
| GLM-5.2, GLM-5.3, Qwen3.8-27B | «los principales modelos que usamos para generar estos datos y para regenerar partes de los conjuntos de datos abiertos» | datos de post-entrenamiento, ajuste fino supervisado (informe p. 53) |
| GLM-5.2 | «escribe dos preguntas con seis opciones» por documento; una pregunta entra en el entrenamiento «solo si GLM-5.2 la resolvió al menos una vez y Kolibri como máximo seis veces» | entorno de contexto largo (informe apéndice I.1.2) |
| Kimi K2.6 | «cuando los intentos de Kolibri coinciden en una respuesta distinta o resuelven la pregunta como máximo una vez, Kimi K2.6 … decide sobre las opciones en disputa sin ver la clave» | entorno de contexto largo (informe apéndice I.1.2) |
| Kimi-K2.7 | «aplicamos Kimi-K2.7 … para generar el rollout de cada pregunta del entorno, y esos rollouts dirigen una pasada de filtrado y reparación» | el entorno, antes del entrenamiento (informe p. 176) |
| Gemma-4-31B | «Conservamos un rollout cuando un juez LLM, Gemma-4-31B (Gemma Team 2026), acepta su respuesta, la respuesta de referencia aparece en el texto recuperado y la transcripción termina en una respuesta» | entorno de recuperación (informe p. 58) |
| Command A+ | «Conservamos una semilla cuando sus completaciones responden correctamente en los dos primeros contextos, se abstienen en el de Morgana y superan un juez Command A+ …» | datos de recuperación y búsqueda (informe p. 58) |
| gpt-oss-120b | «juzgamos la conversación completa, incluidas las trazas de razonamiento, con gpt-oss-120b …, para clasificar cada una como portadora de una narrativa del PCCh, como una negativa por motivos generales de seguridad o como equilibrada. Las conversaciones del primer tipo se descartan.» | curación de datos de post-entrenamiento (informe p. 60) |

El informe explica el propósito de la última fila: «Reconocemos que varios de nuestros modelos docentes se construyeron en China, por lo que arrastran sesgos políticos conocidos en temas sensibles, mientras que nuestro modelo debería adherirse a los valores del consenso democrático en Europa».

También describe tres mecanismos que importan para cualquier intento posterior de recuperar relaciones de entrenamiento a partir de las salidas del modelo:

- **Filtrado de afirmaciones de identidad.** «Un filtro de patrones descarta toda conversación en la que el asistente afirma ser otro modelo o proceder de otro laboratorio, salvo que también nombre a nuestro propio modelo, e ignora negaciones como “I am not Llama”».
- **Restricción de sistemas de escritura.** Una restricción de formato del aprendizaje por refuerzo establece: «Sin fuga de escritura. Ningún texto chino, japonés o coreano (CJK) se cuela en una respuesta que por lo demás no es CJK».
- **Variación de los inicios del razonamiento.** En la «destilación con relleno previo del razonamiento», el razonamiento en alemán de un maestro empieza con un inicio como «Gegeben ist:». El inicio se «elige al azar por muestra de una lista curada por dominio de tarea, para que el modelo no aprenda una frase de apertura fija».

## Los nombres no son mecanismos

La plantilla europea pide una lista bajo un solo epígrafe. Su definición de datos sintéticos abarca «la destilación de modelos o la alineación de modelos (por ejemplo, retroalimentación de IA …)», de modo que los siete nombres de Kolibri-1 representan varios tipos de relación.

Reformular texto de preentrenamiento y generar datos de post-entrenamiento introducen el texto de otro modelo en el conjunto de entrenamiento. Puntuar documentos, juzgar rollouts y decidir casos en disputa influyen en qué material se conserva. Los documentos no establecen si esas funciones de selección y juicio dejan rastros en las salidas del modelo entrenado, ni cuáles. No lo afirmamos.

Esta distinción determina qué puede ponerse a prueba. Los métodos que intentan recuperar el origen de un modelo a partir de sus salidas buscan palabras, giros y hábitos heredados. Las relaciones que implican texto generado son las que tales métodos pueden aspirar a detectar.

Una divulgación que identifica tanto el mecanismo como la fase de entrenamiento ayuda a un investigador independiente a determinar qué es comprobable. El informe técnico aporta ese detalle; la plantilla sería más útil si también lo pidiera.

## Qué abarca «soberano»

El informe se titula «Kolibri: A Sovereign European Model on the Pareto Frontier». Su abstract explica qué significa soberano en este contexto: «Construimos Kolibri para un despliegue soberano y especializado, con especial atención al alemán y a los sectores regulados, como la administración pública, la industria y el sector aeroespacial».

La ficha del modelo añade que los pesos «los publica Aleph Alpha GmbH bajo licencia Apache 2.0» y que «Aleph Alpha es firmante del Código de buenas prácticas de la UE para modelos de IA de uso general».

Son afirmaciones sobre el despliegue y la operación. La tabla describe cómo se construyeron los datos de entrenamiento. El informe presenta ambas cosas.

Leer «soberano» como la afirmación de que ningún modelo de otro proveedor participó en el entrenamiento sería malinterpretar el informe. Tratar esas contribuciones como una refutación de la afirmación sobre el despliegue también iría más allá de lo que los documentos establecen.

## Qué no puede establecer la divulgación

Las divulgaciones identifican relaciones candidatas. No establecen qué características, si alguna, heredó Kolibri-1 de los modelos implicados.

El informe y el resumen también difieren en cobertura. Cuatro modelos de la tabla (Gemma-4-31B, Command A+, Kimi-K2.7 y gpt-oss-120b) aparecen en el informe pero no en la lista del resumen. Dos de los siete nombres del resumen, Qwen3-32B y Kimi-K2.6, actúan como juez y como árbitro, no como generadores de texto.

Las cifras de entrenamiento se presentan de dos formas. El abstract del informe da 24 billones de tokens «a lo largo del preentrenamiento, del entrenamiento intermedio y de la extensión de contexto largo»; la ficha del modelo lo desglosa en «20T tokens de un corpus bilingüe filtrado (~62,5 % inglés, ~23,9 % alemán, ~13,6 % código)» y «entrenado adicionalmente con 3,44T en entrenamiento intermedio y 201B para la extensión de contexto largo».

El predecesor, Kolibri Origin, se describe como «una iteración anterior que validó toda nuestra pipeline a escala» y «no está publicado». Por tanto, un tercero no puede ejecutarlo. La tabla 28 compara sus puntuaciones de benchmark tras el post-entrenamiento con las de Kolibri.

Los tres mecanismos descritos arriba también limitan la evidencia disponible en las salidas. Esos mecanismos excluyen como evidencia las afirmaciones de identidad y las escrituras extraviadas; los intentos de recuperar las relaciones deben trabajar con rasgos más sutiles.

Esos límites forman parte de lo que hace útil el caso para nosotros. Nuestra investigación sobre la procedencia de los modelos sostiene que la similitud entre modelos no es descendencia. Un método que afirme reconstruir relaciones debe ponerse a prueba donde la respuesta se conoce. Kolibri-1 ofrece una lista de candidatos publicada por el proveedor.

Estamos preparando una prueba prerregistrada sobre si las relaciones divulgadas pueden siquiera recuperarse a partir de las salidas. Publicaremos el diseño, incluidas sus reglas de parada, antes de ejecutar ningún modelo, e informaremos del resultado en los términos del propio diseño. Esta nota es una lectura de documentos, no un resultado experimental.

## Para qué sirve una divulgación así

Los compradores de sectores regulados empiezan a preguntar de dónde procede un modelo. Una respuesta útil debería explicar qué modelos escribieron su texto de entrenamiento, cuáles lo seleccionaron, cuáles lo juzgaron y en qué fase se usó cada uno. La plantilla europea pide una lista; el informe de Kolibri-1 muestra que puede darse una cuenta más completa.

Para los investigadores, esa cuenta aporta una lista conocida de candidatos contra la que poner a prueba los métodos de procedencia. Es un terreno más firme que inferir las fuentes a partir del comportamiento y discutir luego la inferencia, que es donde sigue buena parte del campo.

No tenemos relación con Aleph Alpha y no hemos hablado con ellos. Esta nota se basa en el informe técnico público, la ficha del modelo y el resumen europeo. Las citas proceden de los lugares indicados abajo y están traducidas del inglés. No ejecutamos ningún modelo ni hicimos ninguna medición. Corregiremos cualquier lectura errónea que se nos señale.

## Fuentes

- Aleph Alpha, «Kolibri: A Sovereign European Model on the Pareto Frontier», informe técnico, 2026: https://aleph-alpha.com/downloads/tech-report.pdf. Lugares: abstract (despliegue soberano; Kolibri Origin); §2.3.2 (reformulación por Gemma-4-26B-A4B); pp. 28 a 29 (puntuación por Qwen3-32B y clasificadores destilados); p. 53 (generadores de post-entrenamiento); p. 54 (destilación con relleno previo del razonamiento); p. 58 (rollouts de recuperación, jueces Gemma-4-31B y Command A+); p. 59 (sesgos de los modelos docentes); p. 60 (filtro de identidad; clasificación por gpt-oss-120b); restricciones de formato del aprendizaje por refuerzo (fuga de escritura); apéndice I.1.2 (entorno de contexto largo: preguntas de GLM-5.2, decisión de Kimi K2.6); p. 176 (rollouts de Kimi-K2.7); tabla 1 (Kolibri Origin no publicado).
- Aleph Alpha, ficha del modelo Kolibri-1: https://huggingface.co/Aleph-Alpha/Kolibri-1 (licencia; reparto de idiomas; Código de buenas prácticas; reformulaciones por Mistral-NeMo-12B).
- Aleph Alpha, «Public Summary of Training Content for General-Purpose AI models», Kolibri-1, la plantilla prevista en el artículo 53, apartado 1, letra d), del Reglamento (UE) 2024/1689: https://aleph-alpha.com/downloads/Kolibri_1_-_Sufficiently_Detailed_Summary.pdf (§2.5).
- Nuestra investigación sobre procedencia e independencia de los revisores: https://research.counterproof.io/agentic-stemmatics.md


## Questions this page answers

**¿Entrenó Aleph Alpha a Kolibri-1 sobre modelos de otras empresas?**

Su informe describe el entrenamiento de sus propios pesos; no describe el uso de los pesos de otro modelo. Modelos de otros proveedores ayudaron a construir los datos de entrenamiento: reformularon texto de la web, puntuaron documentos, generaron y regeneraron datos de post-entrenamiento, juzgaron rollouts y resolvieron casos en disputa. El informe técnico describe esas funciones, y el resumen europeo de contenidos de entrenamiento enumera siete de los modelos implicados.

**¿Contradice eso la etiqueta «soberano»?**

El informe usa «soberano» para el despliegue al que está destinado el modelo: pesos abiertos bajo Apache 2.0, con especial atención al alemán y a los sectores regulados. Es una afirmación sobre la operación. Qué otros modelos participaron en la construcción de los datos de entrenamiento es una afirmación distinta, y el informe hace ambas.

**¿Se puede saber, a partir de las salidas de un modelo, qué modelos participaron en su entrenamiento?**

Es una cuestión abierta, y solo puede ponerse a prueba donde la respuesta se conoce. Kolibri-1 es un caso en el que el proveedor publicó la lista de candidatos. Estamos preparando una prueba prerregistrada y publicaremos su diseño antes de ejecutar ningún modelo.

**¿Qué debería preguntar un comprador a un proveedor?**

Pregunte qué modelos escribieron el texto de entrenamiento, cuáles lo seleccionaron, cuáles lo juzgaron y en qué fase se usó cada uno. La plantilla europea pide una lista de nombres. El informe técnico de Kolibri-1 explica las funciones que hay detrás.

