
Thinking Machines, el laboratorio de IA fundado por la ex CTO de OpenAI Mira Murati, ha lanzado un segundo modelo llamado Inkling Small, desplazando la atención del tamaño bruto a la eficiencia. Según la cobertura de The Decoder, el nuevo modelo utiliza muchos menos parámetros activos que el anterior modelo Inkling de la empresa, al tiempo que se aproxima a él en un amplio índice de benchmarks y lo supera en algunas pruebas de programación y razonamiento.
Ese posicionamiento importa porque aborda directamente un punto de presión en el mercado actual de modelos: muchos desarrolladores y compradores empresariales quieren un rendimiento sólido de razonamiento sin pagar los costos de inferencia, la latencia y la complejidad de despliegue que a menudo acompañan a los sistemas frontier más grandes. Si Thinking Machines puede demostrar que un modelo abierto más pequeño puede seguir siendo competitivo en tareas significativas, refuerza el caso a favor de despliegues ajustados y específicos de dominio en lugar de una carrera uniforme hacia modelos cada vez más grandes.
La noticia principal es directa. Thinking Machines ha presentado Inkling Small como un modelo de razonamiento de pesos abiertos, y The Decoder informa que es menos de un tercio del tamaño de Inkling en las cifras clave de parámetros que se citan. Según el seguimiento de benchmarks de Artificial Analysis, Inkling Small obtiene 40 en el Intelligence Index de la firma, frente a 41 de Inkling.
El mismo informe señala que el modelo tiene 276 mil millones de parámetros totales y 12 mil millones de parámetros activos. La distinción importa. En el diseño actual de modelos, especialmente en sistemas dispersos o de tipo mixture, el recuento de parámetros activos puede ser un mejor indicador del costo de ejecución que el total de parámetros por sí solo, porque refleja cuánto de la red realmente se activa para un token dado. Aunque el material de origen disponible no detalla la arquitectura detrás de Inkling Small, la diferencia entre parámetros totales y activos sugiere que Thinking Machines está poniendo énfasis en la eficiencia no solo en el marketing del modelo, sino también en la forma en que probablemente se gestiona la inferencia.
VentureBeat, en un informe aparte, enmarcó el lanzamiento de forma similar, describiendo Inkling Small como un modelo de IA de código abierto que se acerca al rendimiento de su predecesor con aproximadamente una cuarta parte del tamaño. Dado que el texto completo de ese informe no estaba disponible en la evidencia fuente, las descripciones técnicas y de benchmarks más detalladas aquí se basan principalmente en la cobertura de The Decoder y en las referencias de terceros que cita.
Según The Decoder, Inkling Small supera a su hermano mayor en varias evaluaciones orientadas al razonamiento y la programación. Entre los ejemplos citados figuran Humanity's Last Exam, donde Inkling Small obtuvo un 32 % frente al 30 % de Inkling, y GPQA Diamond, donde marcó un 89 % frente al 87 %.
No son victorias triviales. Humanity's Last Exam se ha usado como un benchmark difícil diseñado para evaluar una capacidad de razonamiento más avanzada, mientras que GPQA Diamond se cita con frecuencia en discusiones sobre preguntas y respuestas de alto nivel científico y experto. Las mejoras ahí sugieren que Thinking Machines puede haber ajustado Inkling Small para rendir bien en tareas de razonamiento compactas y difíciles, más que para preservar simplemente una capacidad base amplia.
Al mismo tiempo, se informa que el modelo queda por detrás del Inkling más grande en tareas basadas en agentes y en conocimiento factual. Ese intercambio es importante. Para los equipos que crean productos de asistente de programación, copilotos internos de investigación o flujos de trabajo de razonamiento estrechos, un mejor rendimiento por token puede ser más valioso que una mayor amplitud de conocimiento. Pero para agentes de propósito general que deben recuperar hechos, usar herramientas en horizontes más largos u operar de forma fiable en muchas tareas empresariales, esas carencias podrían seguir importando.
El otro ángulo de rendimiento es la eficiencia de salida. The Decoder informa que Inkling Small promedia 24K tokens de salida por tarea, frente a 45K para Deepseek V4 Flash y 78K para GPT-5.4 mini. Si esa comparación se mantiene en condiciones similares, apunta a una ventaja práctica: un modelo que alcanza un resultado con menos tokens generados puede reducir costos y disminuir la latencia visible para el usuario. Como ocurre con muchas comparaciones de eficiencia de tipo benchmark, sin embargo, importan mucho la mezcla exacta de tareas y la configuración de evaluación, y los compradores deberían evitar sacar demasiadas conclusiones de una sola cifra de eficiencia de tokens sin pruebas independientes.
La publicación también destaca por la forma en que Thinking Machines presenta el modelo. The Decoder dice que Inkling Small admite entradas de texto, imagen y voz, lo que le da un perfil multimodal en lugar de posicionarlo como un motor de razonamiento solo de texto. Además, tiene una ventana de contexto de 256K tokens, lo que lo sitúa en el rango esperado para análisis de documentos grandes, trabajo sobre bases de código y sesiones conversacionales prolongadas.
En cuanto al acceso, el modelo se distribuye bajo Apache 2.0, con pesos disponibles en Hugging Face. Esa elección de licencia es importante para la adopción comercial. Apache 2.0 suele considerarse favorable para las empresas porque permite un uso, modificación y distribución amplios sin parte de la incertidumbre legal que puede acompañar a licencias comunitarias más restrictivas.
Thinking Machines también está haciendo que Inkling Small esté disponible a través de Tinker Playground, donde los usuarios pueden ajustar el modelo en el navegador, según The Decoder. Eso encaja con una estrategia de producto menos centrada en vender un único endpoint canónico de modelo y más en convertir el modelo base en un punto de partida personalizable. La empresa, tal como se describe en el informe, está posicionando sus modelos como una base que los usuarios pueden adaptar con sus propios datos.
Ese mensaje encaja en un mercado cada vez más interesado en la propiedad y la especialización. Muchos equipos de producto quieren ahora control sobre la latencia, la topología de despliegue, el comportamiento de seguridad y la adaptación al dominio. Un modelo de pesos abiertos distribuido a través de Hugging Face y combinado con herramientas ligeras de ajuste da a Thinking Machines una vía más clara hacia ese segmento de compradores que una oferta cerrada solo por API.
La evidencia detrás del lanzamiento de Inkling Small es prometedora, pero todavía relativamente escasa. La fuente más detallada de este conjunto es The Decoder, que a su vez atribuye el principal marco de rendimiento a Artificial Analysis. Eso significa que la afirmación principal —capacidad cercana a Inkling con un tamaño activo mucho menor— se basa en el seguimiento de benchmarks de terceros y no en un documento técnico completo incluido en la evidencia proporcionada.
Algunas afirmaciones son directas y probablemente fáciles de verificar de forma independiente, entre ellas la licencia Apache 2.0, la presencia de pesos en Hugging Face, la ventana de contexto de 256K y la disponibilidad a través de Tinker Playground. Otras requieren más cautela. Puntuaciones de benchmark como el Intelligence Index, Humanity's Last Exam y GPQA Diamond dependen de protocolos de evaluación, decisiones de prompting y versiones del modelo. La afirmación de que ningún modelo abierto de igual o menor tamaño obtiene una puntuación más alta procede de Artificial Analysis, citada por The Decoder, no de una auditoría de mercado reproducida de forma independiente en el material proporcionado aquí.
Tampoco hay datos detallados de despliegue en la evidencia fuente. Aún no tenemos cifras directas sobre rendimiento, costes reales de servicio, uso empresarial, estabilidad del ajuste fino o comportamiento de seguridad bajo pruebas adversarias. Así que, aunque Inkling Small parece convincente sobre el papel como una publicación eficiente de pesos abiertos, los compradores deberían considerar el panorama actual como guiado por benchmarks y no como demostrado en el campo.
Para los desarrolladores de IA, la señal más fuerte de esta publicación no es simplemente que Thinking Machines haya lanzado otro modelo. Es que la empresa está defendiendo un objetivo de optimización diferente. En un mercado todavía dominado por anuncios de modelos estrella, Inkling Small sugiere que hay espacio para una estrategia de producto basada en un razonamiento útil con menor tamaño activo, menor consumo de tokens y personalización más sencilla.
Eso podría resonar en varios flujos de trabajo. Un asistente de programación que necesita sugerencias iterativas rápidas puede beneficiarse más de la eficiencia de tokens que del conocimiento más amplio posible del mundo. Los sistemas internos de IA empresarial construidos sobre documentos propietarios pueden preferir un modelo que pueda ajustarse con datos de la empresa y desplegarse bajo una licencia permisiva. Los equipos que manejan entradas multimodales pueden ver valor en un único modelo que pueda procesar texto, imágenes y voz sin recurrir por defecto a una pila propietaria más grande.
El ángulo competitivo también es claro. Al comparar la eficiencia de tokens de salida con Deepseek V4 Flash y GPT-5.4 mini, el lanzamiento entra en una concurrida gama media de modelos que compiten en relación costo-rendimiento, no solo en liderazgo absoluto de benchmarks. Ahí es donde en realidad se deciden muchos presupuestos de IA empresarial. La cuestión es menos “¿cuál es el modelo más inteligente disponible?” y más “¿qué es lo suficientemente bueno, controlable y asequible como para ponerlo en producción?”
Para Thinking Machines, esta publicación ayuda a definir su identidad. En lugar de intentar superar con pura espectacularidad a los mayores proveedores de modelos cerrados, la empresa parece apostar por que el despliegue abierto, el razonamiento eficiente y la flexibilidad del ajuste fino puedan labrarse una posición duradera.
Las próximas señales a vigilar son prácticas más que promocionales. Primero, las pruebas independientes de Inkling Small en tareas de asistente de programación, fiabilidad de agentes y fundamentación factual mostrarán si la narrativa de benchmarks se traduce en uso de producción.
Segundo, habrá que ver si el lanzamiento en Hugging Face genera tracción significativa en la comunidad: checkpoints derivados, recetas de ajuste, integraciones de frameworks e informes reproducibles de latencia. Los lanzamientos de pesos abiertos importan más cuando atraen un ecosistema y no solo descargas.
Tercero, merecerá seguimiento el papel de Tinker Playground. Si el ajuste fino basado en navegador reduce la barrera de la especialización, Thinking Machines podría ganar adopción entre equipos pequeños que carecen de una infraestructura pesada de ML.
Por último, cualquier futura divulgación técnica de Thinking Machines será importante. Más detalle sobre arquitectura, métodos de entrenamiento, comportamiento de seguridad y economía de inferencia ayudaría a las empresas a evaluar si Inkling Small es principalmente un modelo eficiente en benchmarks o una alternativa realmente operativa a sistemas propietarios más grandes.
Inkling Small encaja en un cambio más amplio en la compra de IA empresarial: la optimización se está moviendo desde el prestigio bruto del modelo hacia la matemática del despliegue. Un modelo que es ligeramente peor en una clasificación, pero materialmente mejor en uso de tokens, flexibilidad de ajuste y licencias, puede ser el producto más importante.
La pregunta abierta es si Thinking Machines puede convertir esa tesis en adopción. Inkling Small le da a la empresa una entrada creíble en el mercado de pesos abiertos, especialmente a través de Apache 2.0, Hugging Face y Tinker Playground. Pero para despegar necesitará más que proximidad a Inkling en benchmarks. Necesitará pruebas de que los equipos pueden construir de forma fiable verdadera IA empresarial y agentes de IA sobre ella con mejor coste, control y velocidad que las alternativas cerradas.
Thinking Machines ha lanzado Inkling Small, un modelo de razonamiento de pesos abiertos bajo Apache 2.0 que se acerca a los resultados de Inkling con muchos menos parámetros activos.