AI News

Thinking Machines, le laboratoire d’IA fondé par l’ancienne directrice technique d’OpenAI Mira Murati, a publié un deuxième modèle appelé Inkling Small, déplaçant l’attention de la taille brute vers l’efficacité. Selon la couverture de The Decoder, le nouveau modèle utilise beaucoup moins de paramètres actifs que le modèle Inkling précédent de l’entreprise, tout en s’en approchant sur un large index de benchmarks et en le surpassant sur certains tests de code et de raisonnement.

Ce positionnement compte, car il répond directement à un point de tension du marché actuel des modèles : de nombreux développeurs et acheteurs d’entreprise veulent de solides performances de raisonnement sans payer les coûts d’inférence, la latence et la complexité de déploiement qui accompagnent souvent les grands systèmes de pointe. Si Thinking Machines peut montrer qu’un plus petit modèle ouvert peut rester compétitif sur des tâches significatives, cela renforce l’argument en faveur de déploiements adaptés à un domaine plutôt que d’une course universelle vers des modèles toujours plus grands.

Un modèle plus petit avec des ambitions de quasi-parité

L’information principale est simple. Thinking Machines a présenté Inkling Small comme un modèle de raisonnement à poids ouverts, et The Decoder rapporte qu’il fait moins du tiers de la taille d’Inkling sur les principaux chiffres de paramètres cités. D’après le suivi des benchmarks de Artificial Analysis, Inkling Small obtient un score de 40 sur l’Intelligence Index de l’entreprise, contre 41 pour Inkling.

Le même rapport indique que le modèle compte 276 milliards de paramètres au total et 12 milliards de paramètres actifs. La distinction est importante. Dans la conception actuelle des modèles, en particulier pour les systèmes clairsemés ou de type mixture, le nombre de paramètres actifs peut être un meilleur indicateur du coût d’exécution que le nombre total de paramètres seul, car il reflète la part du réseau réellement mobilisée pour un token donné. Même si les éléments de source disponibles ne détaillent pas l’architecture derrière Inkling Small, l’écart entre paramètres totaux et paramètres actifs suggère que Thinking Machines met l’accent sur l’efficacité non seulement dans le marketing du modèle, mais aussi dans la manière dont l’inférence est probablement gérée.

VentureBeat, dans un rapport distinct, a présenté le lancement de façon similaire, décrivant Inkling Small comme un modèle d’IA open source qui se rapproche des performances de son prédécesseur avec environ un quart de la taille. Comme le texte intégral de ce rapport n’était pas disponible dans les éléments de preuve fournis, les descriptions techniques et de benchmarks plus détaillées ici s’appuient principalement sur le reportage de The Decoder et sur les références tierces qu’il cite.

Là où Inkling Small semble plus fort

Selon The Decoder, Inkling Small surpasse son grand frère sur plusieurs évaluations orientées raisonnement et code. Les exemples rapportés incluent Humanity's Last Exam, où Inkling Small a obtenu 32 % contre 30 % pour Inkling, et GPQA Diamond, où il a atteint 89 % contre 87 %.

Ce ne sont pas des victoires anecdotiques. Humanity's Last Exam est utilisé comme benchmark difficile conçu pour tester des capacités de raisonnement plus avancées, tandis que GPQA Diamond est souvent cité dans les discussions sur les questions-réponses scientifiques et expertes de haut niveau. Les gains observés là suggèrent que Thinking Machines a peut-être ajusté Inkling Small pour bien performer sur des tâches de raisonnement compactes et difficiles, plutôt que de simplement préserver une capacité de base large.

En même temps, le modèle serait en retrait par rapport à l’Inkling plus grand sur les tâches agentiques et les connaissances factuelles. Ce compromis est important. Pour les équipes qui construisent des assistants de code, des copilotes de recherche internes ou des workflows de raisonnement restreints, une meilleure performance par token peut être plus précieuse qu’une connaissance plus large du monde. Mais pour des agents généralistes qui doivent récupérer des faits, utiliser des outils sur des horizons plus longs ou fonctionner de manière fiable dans de nombreuses tâches d’entreprise, ces lacunes pourraient encore compter.

L’autre angle de performance est l’efficacité de sortie. The Decoder rapporte qu’Inkling Small produit en moyenne 24K tokens de sortie par tâche, contre 45K pour Deepseek V4 Flash et 78K pour GPT-5.4 mini. Si cette comparaison tient dans des conditions similaires, elle indique un avantage pratique : un modèle qui atteint un résultat avec moins de tokens générés peut réduire les coûts et la latence perceptible par l’utilisateur. Comme pour de nombreuses comparaisons d’efficacité de type benchmark, toutefois, la composition exacte des tâches et le cadre d’évaluation comptent, et les acheteurs devraient éviter de trop lire un seul chiffre d’efficacité des tokens sans tests indépendants.

Publication à poids ouverts et emballage produit

La publication est également remarquable par la façon dont Thinking Machines présente le modèle. The Decoder indique qu’Inkling Small prend en charge les entrées texte, image et voix, lui donnant ainsi un profil multimodal plutôt que de le positionner comme un moteur de raisonnement uniquement textuel. Il dispose aussi d’une fenêtre de contexte de 256K tokens, ce qui le place dans la gamme attendue pour l’analyse de longs documents, le travail sur des bases de code et les sessions de conversation prolongées.

Côté accès, le modèle est distribué sous Apache 2.0, avec des poids disponibles sur Hugging Face. Ce choix de licence est important pour l’adoption commerciale. Apache 2.0 est généralement considéré comme favorable aux entreprises, car il permet un usage, une modification et une distribution larges, sans une partie de l’incertitude juridique qui peut accompagner des licences communautaires plus restrictives.

Thinking Machines rend également Inkling Small disponible via Tinker Playground, où les utilisateurs peuvent affiner le modèle dans le navigateur, selon The Decoder. Cela s’inscrit dans une stratégie produit moins centrée sur la vente d’un endpoint modèle canonique unique et davantage sur la transformation du modèle de base en point de départ personnalisable. L’entreprise, telle que décrite dans le rapport, positionne ses modèles comme une fondation que les utilisateurs peuvent adapter avec leurs propres données.

Ce message trouve un écho dans un marché de plus en plus intéressé par la propriété et la spécialisation. De nombreuses équipes produit veulent désormais contrôler la latence, la topologie de déploiement, le comportement de sécurité et l’adaptation au domaine. Un modèle à poids ouverts distribué via Hugging Face et associé à des outils de réglage légers donne à Thinking Machines une voie plus claire vers ce segment d’acheteurs qu’une offre fermée uniquement via API.

Ce que les preuves soutiennent — et ce qu’elles ne soutiennent pas

Les éléments de preuve derrière le lancement d’Inkling Small sont prometteurs, mais encore relativement minces. La source la plus détaillée de cet ensemble est The Decoder, qui attribue à son tour l’essentiel du cadrage des performances à Artificial Analysis. Cela signifie que l’affirmation principale — des capacités proches d’Inkling avec une taille active beaucoup plus faible — repose sur un suivi de benchmarks tiers plutôt que sur un document technique complet inclus dans les preuves fournies.

Certaines affirmations sont directes et probablement faciles à vérifier, notamment la licence Apache 2.0, la présence des poids sur Hugging Face, la fenêtre de contexte de 256K et la disponibilité via Tinker Playground. D’autres nécessitent plus de prudence. Les scores de benchmark tels que l’Intelligence Index, Humanity's Last Exam et GPQA Diamond dépendent des protocoles d’évaluation, des choix de prompting et des versions du modèle. L’affirmation selon laquelle aucun modèle ouvert de taille égale ou inférieure n’obtient un score plus élevé provient d’Artificial Analysis, telle que citée par The Decoder, et non d’un audit du marché reproduit de manière indépendante dans le matériel fourni ici.

Il n’y a pas non plus de données détaillées de déploiement dans les éléments de preuve source. Nous n’avons pas encore de chiffres directs sur le débit, les coûts réels de service, l’usage en entreprise, la stabilité du fine-tuning ou les performances de sécurité sous tests adversariaux. Ainsi, même si Inkling Small paraît séduisant sur le papier comme publication efficiente à poids ouverts, les acheteurs devraient considérer le tableau actuel comme guidé par les benchmarks plutôt que comme prouvé sur le terrain.

Pourquoi ce lancement compte pour les développeurs et les entreprises

Pour les développeurs d’IA, le signal le plus fort de cette publication n’est pas simplement que Thinking Machines ait livré un autre modèle. C’est que l’entreprise plaide pour une cible d’optimisation différente. Dans un marché encore dominé par les annonces de modèles phares, Inkling Small suggère qu’il y a de la place pour une stratégie produit construite autour d’un raisonnement utile avec une taille active plus faible, une consommation de tokens réduite et une personnalisation plus facile.

Cela pourrait résonner dans plusieurs workflows. Un assistant de code qui a besoin de suggestions itératives rapides peut davantage bénéficier de l’efficacité en tokens que de la connaissance du monde la plus large possible. Les systèmes d’IA internes d’entreprise construits autour de documents propriétaires peuvent préférer un modèle qui peut être affiné sur les données de l’entreprise et déployé sous une licence permissive. Les équipes traitant des entrées multimodales peuvent voir de la valeur dans un seul modèle capable de traiter du texte, des images et de la voix sans basculer par défaut vers une pile propriétaire plus lourde.

L’angle concurrentiel est également clair. En comparant l’efficacité des tokens de sortie à Deepseek V4 Flash et GPT-5.4 mini, le lancement entre dans une catégorie intermédiaire très encombrée de modèles qui se font concurrence sur le rapport coût-performance, et pas seulement sur le leadership absolu des benchmarks. C’est là que de nombreux budgets d’IA d’entreprise sont réellement décidés. La question est moins « quel est le modèle le plus intelligent disponible ? » que « qu’est-ce qui est assez bon, assez contrôlable et assez abordable pour être mis en production ? »

Pour Thinking Machines, cette publication aide à définir son identité. Plutôt que d’essayer de surpasser les plus grands fournisseurs de modèles fermés par le seul spectacle, l’entreprise semble parier que le déploiement ouvert, un raisonnement efficace et la flexibilité du fine-tuning peuvent lui tailler une position durable.

Ce qu’il faut surveiller ensuite

Les prochains signaux à suivre sont plus pratiques que promotionnels. D’abord, des tests indépendants d’Inkling Small sur des tâches d’assistant de code, la fiabilité agentique et l’ancrage factuel montreront si le récit des benchmarks se traduit en usage de production.

Ensuite, il faudra voir si la publication sur Hugging Face suscite une traction communautaire significative : checkpoints dérivés, recettes de réglage, intégrations de frameworks et rapports de latence reproductibles. Les lancements à poids ouverts comptent davantage lorsqu’ils attirent un écosystème, et pas seulement des téléchargements.

Troisièmement, le rôle de Tinker Playground vaudra la peine d’être suivi. Si le fine-tuning basé dans le navigateur abaisse la barrière de la spécialisation, Thinking Machines pourrait gagner l’adoption de petites équipes qui ne disposent pas d’une infrastructure ML lourde.

Enfin, toute future publication technique de Thinking Machines comptera. Davantage de détails sur l’architecture, les méthodes d’entraînement, le comportement de sécurité et l’économie de l’inférence aideraient les entreprises à évaluer si Inkling Small est surtout un modèle efficient en benchmark ou une véritable alternative opérationnelle à de plus grands systèmes propriétaires.

Point de vue de Creati.ai

Inkling Small s’inscrit dans une évolution plus large des achats d’IA en entreprise : l’optimisation passe du prestige brut du modèle à l’arithmétique du déploiement. Un modèle légèrement moins performant au classement, mais nettement meilleur en consommation de tokens, en flexibilité de réglage et en licence, peut être le produit le plus important.

La grande question est de savoir si Thinking Machines peut transformer cette thèse en adoption. Inkling Small donne à l’entreprise une entrée crédible sur le marché des poids ouverts, en particulier via Apache 2.0, Hugging Face et Tinker Playground. Mais pour percer, il faudra plus qu’une simple proximité avec Inkling dans les benchmarks. Il faudra des preuves que des équipes peuvent construire de manière fiable une véritable IA d’entreprise et des agents d’IA au-dessus, avec de meilleurs coûts, un meilleur contrôle et une plus grande vitesse que les alternatives fermées.

Vedettes

Thinking Machines lance Inkling Small, un modèle à poids ouverts visant une meilleure efficacité de raisonnement

Thinking Machines a publié Inkling Small, un modèle de raisonnement à poids ouverts sous Apache 2.0 qui s’approche des résultats d’Inkling avec beaucoup moins de paramètres actifs.