
Un consorcio de investigación alemán ha lanzado Soofi S, un modelo de lenguaje abierto de 30.000 millones de parámetros que, según afirma, lidera a rivales totalmente abiertos en benchmarks combinados en inglés y alemán, al tiempo que funciona con el coste de inferencia de un sistema mucho más pequeño. El lanzamiento importa más allá de ser simplemente otro modelo porque el equipo está defendiendo de forma directa la idea de modelos fundacionales construidos en Europa y centrados en alemán que puedan competir en rendimiento sin depender de APIs de hiperescaladores estadounidenses.
El lanzamiento también llega con una advertencia inusual. Según la cobertura de The Decoder y el informe técnico actualizado del consorcio citado allí, el equipo descubrió que preguntas de prueba del benchmark científico GPQA habían entrado accidentalmente en los datos de entrenamiento debido a un error en la separación del conjunto de datos. Tras ser identificado el problema por la comunidad, el consorcio eliminó GPQA de su evaluación, recalculó los resultados de todos los modelos comparados y afirmó que la clasificación no cambió. Esa combinación de ambiciosas afirmaciones de benchmark y una corrección pública de contaminación hace que Soofi S destaque tanto por su diseño técnico como por la prueba de transparencia a la que se enfrenta ahora.
Según The Decoder, Soofi S 30B-A3B es un sistema de mezcla de expertos con 31.600 millones de parámetros totales, pero solo unos 3.200 millones activos por token. El consorcio habría adoptado el diseño híbrido de Nemotron 3 Nano de Nvidia, combinando capas Mamba-2 con capas de atención tradicionales en lugar de usar un transformer denso estándar en toda la red.
Esa elección arquitectónica es central para la propuesta del proyecto. En los modelos transformer habituales, los prompts largos aumentan la carga sobre la caché KV utilizada para la atención, lo que puede reducir el rendimiento cuando las ventanas de contexto se amplían o cuando se atienden más solicitudes en paralelo. El diseño de Soofi S, según se informa, limita ese efecto porque solo una pequeña parte de las capas mantiene esa caché. The Decoder dice que el consorcio midió un rendimiento casi plano desde 4.000 hasta 256.000 tokens y señaló que, a 40.000 tokens con 32 solicitudes paralelas, Soofi S generó aproximadamente ocho veces más tokens por segundo por GPU que los modelos densos de entre 14B y 24B.
Esas cifras proceden de mediciones reportadas por el consorcio, no de benchmarks independientes de terceros. Aun así, si se sostienen en producción, harían que Soofi S fuera relevante para equipos que construyen aplicaciones con muchos documentos, copilotos de largo contexto y sistemas empresariales donde la latencia y la utilización de GPU importan tanto como las puntuaciones brutas de benchmark.
Según The Decoder, el modelo se entrenó íntegramente en la infraestructura de Deutsche Telekom, concretamente en la Industrial AI Cloud de la empresa en Múnich. Eso importa por otra razón: los proyectos de IA soberana en Europa a menudo han tenido dificultades para demostrar tanto acceso creíble a cómputo como resultados técnicos creíbles. Soofi S se posiciona explícitamente como prueba de que un modelo entrenado regionalmente y publicado de forma abierta puede usar infraestructura local y aun así competir en evaluaciones convencionales.
La mayor apuesta estratégica del consorcio parece estar más en la mezcla de datos que en la arquitectura por sí sola. The Decoder informa que el alemán representó el 7,2 % de la primera fase de entrenamiento y el 15,3 % de la segunda, frente a aproximadamente un 5 % para todas las lenguas no inglesas combinadas en la receta de referencia Nemotron de Nvidia.
Según ese informe, el entrenamiento abarcó unos 27 billones de tokens en tres fases: una primera pasada amplia sobre textos web, código, matemáticas y dominios especializados; una segunda pasada sobre material de mayor calidad; y una fase más corta de largo contexto con documentos de hasta un millón de tokens. La parte alemana procedió de fuentes como HPLT, German Commons, FinePDFs, FineWiki y el archivo comercialmente licenciado Genios de contenidos periodísticos alemanes. El equipo también utilizó texto alemán traducido automáticamente y sintético.
Ese peso de los datos parece haber dado resultado en la evaluación propia del consorcio. The Decoder dice que Soofi S lidera a todos los modelos totalmente abiertos en la puntuación agregada en inglés y alemán frente a 16 rivales abiertos, entre ellos OLMo 3 32B y Apertus 70B. En conocimiento específico de Alemania, habría empatado con Qwen3.5 35B-A3B en INCLUDE-DE. En pruebas de programación, las puntuaciones reportadas de 73,8 en HumanEval, 70,2 en MBPP y 84,2 en MBPP en alemán colocan al modelo por delante de sus pares de código abierto en la batería de benchmarks del consorcio.
Para los equipos europeos de IA, ese es el verdadero gancho comercial. Un modelo capaz de manejar flujos de trabajo empresariales bilingües, generación de código y contexto factual o regulatorio local sin sacrificar la capacidad en inglés es más fácil de justificar que un modelo estrictamente nacional que solo rinde bien en tareas domésticas. Si Soofi S demuestra ser robusto en la práctica, podría resultar atractivo para asistentes internos, herramientas de búsqueda y resumen, productos de asistente de programación y sistemas sectoriales para trabajadores del conocimiento germanohablantes.
La razón más fuerte para tratar con cuidado la historia de los benchmarks es que el problema de contaminación no era hipotético. The Decoder informa de que preguntas de prueba reformuladas de GPQA y GPQA Diamond acabaron dentro del conjunto QA-base usado durante el entrenamiento, incluidas versiones en inglés y versiones en alemán traducidas automáticamente.
Según el informe, la causa fue una peculiaridad de etiquetado en Hugging Face: GPQA no tenía una partición de entrenamiento separada y su contenido de prueba estaba bajo la etiqueta predeterminada "train". Como la canalización seleccionaba el material por el nombre de la partición, el benchmark se filtró al corpus de entrenamiento. Una auditoría posterior habría encontrado otros tres benchmarks con el mismo patrón —TruthfulQA, BLiMP e Inverse Scaling— aunque The Decoder dice que no formaban parte de la evaluación de Soofi S.
La respuesta del consorcio, según describe The Decoder, fue retirar GPQA por completo de la evaluación y recalcular los rankings comparativos de los 16 modelos. El equipo también afirmó que ahora coteja directamente los datos de entrenamiento con las preguntas de benchmark en lugar de confiar en las etiquetas de las particiones. Participantes del consorcio citados por The Decoder argumentaron que la publicación pública de los datos permitió que la comunidad detectara el problema y por tanto validó el enfoque abierto.
Ese es un punto defendible, pero no borra el episodio. Para compradores y desarrolladores de modelos, el incidente refuerza una lección más amplia: liderar benchmarks es útil, pero solo si la canalización de datos y el proceso de evaluación resisten el escrutinio externo. La disponibilidad reportada de unos 152.000 resultados individuales y una evaluación separada por el socio Ellamind sobre datos internos reservados ayudan al caso del consorcio, pero siguen estando estrechamente vinculadas a participantes del proyecto y no a laboratorios externos neutrales.
El relato de The Decoder sugiere que Soofi S tiene un perfil de fortalezas claro, en lugar de una superioridad universal. Según se informa, el modelo rinde especialmente bien en pruebas agregadas en alemán e inglés y en benchmarks de código, al tiempo que se beneficia de un comportamiento eficiente al servir contextos largos. Esos rasgos encajan mejor con cargas de trabajo empresariales prácticas que con demostraciones puntuales de chatbot para consumidores.
Pero el mismo informe señala debilidades. En matemáticas competitivas en alemán, Soofi S habría obtenido 56 en Minerva MATH-DE, por detrás de Qwen3.5 35B-A3B y Gemma 3 27B. También quedó por detrás en NaturalQuestions, algo que los autores habrían vinculado a una menor capacidad de almacenamiento factual al tener solo unos 3.000 millones de parámetros activos por token.
También hubo un patrón de fallo notable en la prueba RULER de largo contexto. Según The Decoder, cuando se le pidió extraer palabras frecuentes de un texto largo, la tasa de acierto de Soofi S cayó a alrededor del 3 % más allá de los 32.000 tokens, mientras que el modelo Nemotron comparable se mantuvo en el 60 al 64 %. Los autores habrían atribuido esa debilidad a datos de entrenamiento de largo contexto que incluían documentos largos pero no suficientes tareas sintéticas de tipo extracción.
Esa distinción importa para los desarrolladores de IA. "Largo contexto" no es una sola capacidad. Un modelo puede procesar entradas largas de forma eficiente y aun así tener dificultades con comportamientos específicos de recuperación o extracción dentro de esas entradas. Los equipos de producto que consideren Soofi S para IA empresarial deberían probar la forma exacta de su flujo de trabajo: revisión legal, resumen de atención al cliente, uso como asistente de programación, copilotos de investigación o recuperación de conocimiento multilingüe pueden exigir diferentes partes del sistema.
La mayoría de los detalles de rendimiento, eficiencia y entrenamiento de esta historia proceden del informe de The Decoder sobre los materiales técnicos del consorcio. Eso significa que las principales afirmaciones de benchmark y rendimiento siguen siendo reportadas por el consorcio y no replicadas de forma independiente.
Lo que parece mejor respaldado por la evidencia disponible es la existencia del lanzamiento en sí, la elección arquitectónica basada en Nvidia Nemotron, el uso de la infraestructura de Deutsche Telekom, la mezcla de entrenamiento fuertemente orientada al alemán y la revelación del consorcio de que contenido de prueba de GPQA se filtró a los datos de entrenamiento y luego se retiró de la evaluación.
Lo que resulta más difícil de verificar a partir de la fuente actual son los márgenes comparativos precisos frente a OLMo 3 32B, Apertus 70B y Qwen3.5 35B-A3B, así como las ventajas reales de servicio en cargas de producción. Esas afirmaciones podrían ser direccionalmente correctas, pero las reproducciones externas importarán más que los gráficos del día del lanzamiento.
El calendario de licencias también merece seguimiento. The Decoder dice que las variantes instruct y reasoning están en beta y se espera que lleguen con una licencia permisiva en las próximas semanas, mientras que ya se está entrenando un modelo Soofi L de mayor tamaño. Hasta que esas variantes se publiquen y los desarrolladores puedan probarlas directamente, la utilidad comercial de la familia sigue siendo solo parcialmente visible.
Primero, vigila si evaluadores independientes reproducen el titular de que Soofi S lidera entre los modelos totalmente abiertos en alemán e inglés. Las pruebas de terceros en HumanEval, MBPP, RULER y baterías en alemán tendrán ahora más peso dado que el problema de GPQA es público.
Segundo, vigila los benchmarks de despliegue más que las fichas estáticas del modelo. Si Soofi S realmente mantiene mejor el rendimiento a través de contextos largos que sus pares densos, eso podría importar para los presupuestos de IA empresarial y para equipos que intentan servir a muchos usuarios concurrentes con capacidad GPU limitada.
Tercero, vigila las señales de adopción en industrias germanohablantes. Un modelo entrenado en la infraestructura de Deutsche Telekom y optimizado para alemán puede atraer a clientes con requisitos de residencia de datos, compras o IA soberana, pero esos compradores también querrán evidencia sobre fiabilidad, seguridad y soporte.
Por último, vigila si Soofi L y los próximos modelos instruct mantienen el mismo estándar de transparencia. El argumento de apertura del consorcio se vuelve más fuerte solo si los lanzamientos futuros siguen exponiendo conjuntos de datos, métodos y correcciones posteriores al lanzamiento al escrutinio externo.
Soofi S es interesante no porque Europa haya lanzado otro modelo abierto, sino porque apunta a un nicho más práctico: rendimiento empresarial bilingüe más eficiencia de largo contexto sobre infraestructura local. Esa es una propuesta de valor más útil que la soberanía abstracta por sí sola. Si las afirmaciones de rendimiento sobreviven a la replicación, Soofi S podría atraer a desarrolladores que necesitan sistemas de gran contexto sin pagar los costes de servicio que suelen asociarse a modelos densos de frontera.
Sin embargo, la revelación de la contaminación forma parte de la historia y no es una simple nota al pie. En el mercado actual de modelos, la transparencia se está convirtiendo en una característica competitiva por sí misma. Soofi S puede acabar beneficiándose de haber corregido el error en público, pero seguirá necesitando validación independiente. Para fundadores y equipos empresariales, la conclusión correcta no es "ignorar el modelo" ni "confiar en los benchmarks", sino "probar los pesos abiertos con tus propias cargas de trabajo". Ahí es donde Soofi S se convertirá en un serio candidato a plataforma regional o se quedará como un informe técnico impresionante.
El modelo abierto Soofi S de Alemania afirma liderar los benchmarks totalmente abiertos en inglés y alemán, mientras sus creadores también revelaron y corrigieron una fuga de datos de prueba.