AI News

Liquid AI a publié deux nouveaux petits modèles encodeurs, LFM2.5-Encoder-230M et LFM2.5-Encoder-350M, sur Hugging Face, en les positionnant comme des modèles de NLP à long contexte capables de gérer des charges de travail à l’échelle documentaire sur des CPU plutôt que de nécessiter des déploiements plus importants et gourmands en GPU. Selon l’annonce de l’entreprise sur le Hugging Face Blog, les nouveaux modèles prennent en charge des entrées de 8 192 tokens et sont conçus pour des tâches de production telles que la classification, les vérifications de politiques, le routage et la détection de PII.

Ce lancement est important car de nombreuses tâches NLP d’entreprise s’exécutent encore en dehors du projecteur actuel des grands modèles de langage. Les filtres de sécurité, les classificateurs d’entrée, les routeurs d’intention et les outils de conformité traitent souvent de longs documents en continu et avec de faibles marges, ce qui rend le coût matériel et la latence plus importants que la qualité de génération de type chatbot. La proposition de Liquid AI est que ces charges de travail d’encodeur peuvent être transférées sur l’infrastructure CPU existante tout en restant compétitives face à des alternatives plus grandes ou mieux connues comme ModernBERT.

Ce que Liquid AI a publié et où cela se situe

La publication comprend deux modèles : LFM2.5-Encoder-230M et LFM2.5-Encoder-350M. Liquid AI les décrit comme des encodeurs généralistes plutôt que comme des modèles de récupération étroits, bien qu’ils proviennent de la même famille que ses précédents LFM2.5-Retrievers. L’entreprise indique que les nouveaux modèles ont été préentraînés avec un objectif de langage masqué afin de pouvoir être affinés sur un ensemble plus large de tâches, notamment la classification de texte, l’étiquetage de tokens et la recherche.

Cette distinction compte pour les équipes produit qui choisissent entre embeddings, retrievers et encodeurs. Un modèle de récupération peut suffire pour la recherche multilingue, mais les workflows d’entreprise exigent souvent un jugement au niveau du document entier ou du token : acheminer des tickets de support, vérifier des violations de politiques ou trouver des informations personnelles identifiables. Les exemples de Liquid AI s’orientent fortement vers ces cas d’usage. Dans son annonce, l’entreprise a mis en avant des démonstrations de routage de prompts zero-shot, de vérification de politiques zero-shot, de détection multilingue de PII et même une expérience de génération de texte par diffusion masquée, le tout exécuté dans des Hugging Face Spaces uniquement sur CPU.

Les modèles sont dérivés de l’architecture LFM2 de Liquid AI. Selon l’entreprise, elle a initialisé les encodeurs à partir des backbones décodeurs LFM2.5-230M et LFM2.5-350M, puis a converti ces décodeurs causaux en encodeurs bidirectionnels en modifiant le masque d’attention, en rendant les courtes convolutions non causales et en entraînant avec du masked language modeling. Liquid AI indique avoir d’abord entraîné la compétence linguistique à court contexte à 1 024 tokens, puis adapté les modèles à un contexte de 8 192 tokens avec un mélange de données plus large afin de renforcer les performances factuelles, juridiques et multilingues.

Pourquoi la performance CPU est l’histoire principale

L’affirmation phare ne porte pas seulement sur la qualité des benchmarks, mais sur le débit à de longues séquences. Liquid AI affirme que ses encodeurs sont particulièrement performants sur CPU, où la latence en long contexte devient souvent le facteur décisif pour le coût de déploiement. Dans la comparaison de l’entreprise, LFM2.5-Encoder-230M était plus rapide que ModernBERT-base sur toutes les longueurs de séquence testées et était environ 3,7 fois plus rapide à 8 192 tokens.

L’exemple concret du Hugging Face Blog est notable parce qu’il traduit la vitesse de benchmark en message opérationnel : un contrat complet, une transcription ou un long fil de support pourrait être traité en moins de 30 secondes sur un CPU d’ordinateur portable, contre plus d’une minute et demie pour ModernBERT-base à la même longueur de contexte. Pour de nombreuses équipes d’entreprise, cela change la question de savoir si la classification de longs documents est suffisamment peu coûteuse pour être exécutée régulièrement.

Sur GPU, Liquid AI rapporte un avantage plus limité. Selon l’entreprise, ModernBERT-base reste en tête en dessous d’environ 1 000 tokens sur GPU Apple, tandis que les modèles LFM2.5-Encoder prennent l’avantage autour de 2 000 tokens et au-delà. Ce schéma renforce la position de marché visée : ce ne sont pas nécessairement les options les plus rapides pour tous les workflows à entrée courte, mais elles sont commercialisées pour l’inférence à long contexte et toujours active, où l’économie CPU compte.

Ce positionnement reflète également une séparation plus large dans l’infrastructure IA. Les modèles génératifs continuent d’absorber l’essentiel de l’attention, mais de nombreux systèmes de production reposent sur des modèles plus petits qui notent, classent, filtrent et acheminent le texte avant ou autour d’un appel à un grand modèle. Si ces modèles peuvent s’exécuter localement ou sur des CPU standards, les développeurs peuvent réduire les coûts, améliorer les options de résidence des données et diminuer la dépendance à la disponibilité des GPU.

L’histoire de l’architecture s’aligne sur les tendances plus larges du design long contexte

Même si l’annonce de Liquid AI se concentre sur des modèles encodeurs, la deuxième source de ce groupe, un article du NVIDIA Developer Blog sur la conception de l’attention à long contexte, aide à expliquer pourquoi cette publication arrive maintenant. NVIDIA soutient que, à mesure que les charges de travail agentiques et à long contexte deviennent plus courantes, l’attention domine de plus en plus le coût d’inférence, faisant des choix d’architecture du modèle un déterminant majeur de la performance.

L’article de NVIDIA ne concerne pas Liquid AI spécifiquement et se concentre sur l’inférence GPU plutôt que sur des déploiements d’abord sur CPU. Néanmoins, son idée centrale est directement pertinente : la performance à long contexte est façonnée par des décisions architecturales telles que la taille des groupes, la dimension des têtes et la gestion de l’état KV, et pas seulement par l’ingénierie des kernels. L’article recommande des conceptions d’attention conscientes du matériel, notamment une taille de groupe plus élevée pour l’efficacité du décodage, des dimensions de tête alignées sur la mémoire du GPU et les tailles de tuiles, ainsi qu’un état KV effectif réduit grâce à la compression ou à des approches d’attention clairsemée et hybride. NVIDIA cite TensorRT-LLM et des architectures comme NVIDIA Nemotron 3 comme exemples de cette approche de co-conception.

Ce contexte plus large fait du lancement de Liquid AI plus qu’un simple dépôt de modèle. L’entreprise soutient en effet que la même logique d’efficacité de l’attention qui alimente la co-conception GPU peut aussi produire des gains pratiques pour les charges de travail d’encodeur contraintes par CPU. Liquid AI affirme que les LFM2.5-Encoders héritent du backbone LFM2.5 de la propriété selon laquelle le coût augmente lentement lorsque la longueur d’entrée croît. Pour les utilisateurs qui évaluent des systèmes d’IA d’entreprise, cela est souvent plus précieux que la performance maximale sur de courtes tâches synthétiques.

Preuves, benchmarks et ce qui reste rapporté par le fournisseur

Les revendications de performance les plus fortes dans cette histoire sont rapportées par le fournisseur. Les résultats de qualité et les comparaisons de vitesse proviennent du propre article de Liquid AI sur le Hugging Face Blog, et non d’un laboratoire de benchmarks indépendant ni d’une étude tierce sur le déploiement en entreprise. Liquid AI indique avoir entièrement ajusté chaque modèle sur chaque tâche et évalué 14 modèles sur 17 tâches issues de GLUE, SuperGLUE et de la classification multilingue, en rapportant des moyennes sur cinq graines laissées de côté. L’entreprise dit aussi que le cadre d’évaluation complet et les résultats bruts sont open source.

Selon ces résultats, LFM2.5-Encoder-350M s’est classé quatrième parmi les 14 modèles testés, seuls des modèles plus grands le devançant, dont un modèle de 3,5B. Liquid AI affirme également que LFM2.5-Encoder-230M a surpassé ModernBERT-base et tous les modèles EuroBERT dans sa configuration rapportée, tout en étant plus petit que la plupart d’entre eux. Ce sont des affirmations importantes, mais les lecteurs devraient les considérer comme rapportées par l’entreprise jusqu’à ce que des réplications externes apparaissent.

Le NVIDIA Developer Blog fournit un contexte technique plutôt qu’une validation indépendante des modèles de Liquid AI. Son analyse est elle aussi rédigée par le fournisseur et repose sur des hypothèses matérielles NVIDIA, y compris le comportement mesuré des kernels avec calcul d’attention FP8 et cache KV. Cela le rend utile pour comprendre pourquoi la conception de l’attention à long contexte est importante, mais cela ne doit pas être interprété comme une confirmation par un tiers de l’avantage de benchmark CPU de Liquid AI.

Il existe aussi des inconnues pratiques. Les sources ne fournissent pas de tarifs d’entreprise détaillés, de conditions d’assistance ni d’études de cas de production. Elles n’établissent pas non plus comment les modèles se comportent face au bruit documentaire réel, aux contraintes de latence multi-locataires ou à des jeux de données juridiques et de conformité décalés par domaine. Les équipes intéressées par le déploiement devront probablement tester LFM2.5-Encoder-230M et LFM2.5-Encoder-350M sur leurs propres corpus et objectifs de niveau de service.

Ce que cela signifie pour les développeurs et les acheteurs d’entreprise

Pour les développeurs d’IA, l’attrait immédiat réside dans la conception du workflow. Un encodeur plus petit, toujours utilisable à 8 192 tokens sur CPU, peut être intégré dans des systèmes qui exigeraient autrement troncature, découpage en fragments ou inférence GPU coûteuse. Cela est pertinent pour les pipelines de revue de contrats, le tri du support client, le filtrage trust and safety, l’onboarding multilingue et l’application des politiques. Cela concerne aussi les stacks hybrides où un modèle compact filtre ou route les requêtes avant l’appel à un modèle plus grand.

Pour les équipes d’IA d’entreprise, l’histoire des coûts peut compter encore plus que le classement. Une inférence compatible CPU peut simplifier le déploiement dans des environnements réglementés ou soumis à des contraintes budgétaires, surtout lorsque la capacité GPU est rare ou lorsque les données doivent rester dans l’infrastructure on-prem existante. Les encodeurs à long contexte peuvent aussi réduire la complexité d’ingénierie s’ils suppriment le besoin de découper les documents en de nombreux fragments et de réassembler les résultats en aval.

Pour les développeurs de modèles, cette publication montre encore que le marché s’étend au-delà des grands modèles de chat vers des primitives d’inférence spécialisées. ModernBERT reste un point de comparaison important, mais Liquid AI tente de concurrencer avec une promesse plus spécifique : une meilleure économie du long contexte pour des tailles de modèles réduites. Si cette affirmation tient dans la pratique, les développeurs pourraient considérer les encodeurs moins comme des utilitaires de base et davantage comme des choix d’architecture ayant un impact direct sur les budgets de latence et les coûts système.

Ce qu’il faut surveiller ensuite

Le prochain signal important sera la réplication indépendante. Si des développeurs externes confirment l’écart rapporté par Liquid AI face à ModernBERT-base, en particulier sur des CPU standards et des charges documentaires réelles, le lancement pourrait influencer la manière dont les équipes architecturent des systèmes NLP d’entreprise à faible coût.

Un autre signal est l’adoption dans l’écosystème Hugging Face. Si LFM2.5-Encoder-230M et LFM2.5-Encoder-350M commencent à apparaître dans des démonstrations de production, des classificateurs affinés ou des stacks d’évaluation d’entreprise, cela suggérerait que les modèles résolvent un vrai problème opérationnel plutôt que de simplement afficher de bons benchmarks internes.

Il faudra aussi surveiller si Liquid AI étend davantage la famille LFM2. La relation entre LFM2.5-Retrievers et ces nouveaux encodeurs suggère une stratégie plus large autour de petits modèles efficaces à long contexte pour différentes couches de workflow : recherche, routage, étiquetage et filtrage. Du côté de l’infrastructure, les principes exposés par NVIDIA et mis en œuvre dans TensorRT-LLM continueront de déterminer quelles architectures sont pratiques à des fenêtres de contexte plus longues.

Point de vue Creati.ai

Cette publication est intéressante non pas parce qu’elle cherche à battre les plus grands modèles, mais parce qu’elle s’attaque à une partie négligée de la pile : la compréhension de longs documents qui doit fonctionner en continu et à faible coût. Dans de nombreux systèmes réels, cette couche décide si l’appel au modèle coûteux a lieu ou non. Si les affirmations CPU de Liquid AI se confirment, LFM2.5-Encoders pourraient devenir des briques utiles pour les équipes d’IA d’entreprise cherchant à maîtriser les dépenses d’inférence sans renoncer à la couverture long contexte.

La leçon principale est architecturale. Le marché dépasse le simple récit « modèle plus grand égale meilleur produit ». Que ce soit sur CPU avec LFM2.5-Encoder-230M ou sur des stacks GPU façonnées par les recommandations de co-conception de NVIDIA, la performance dépend de plus en plus de l’adéquation entre la structure du modèle, la charge de travail et le matériel. Pour les développeurs, cela signifie que l’avantage concurrentiel pourrait venir moins du fait de posséder un foundation model que du choix du bon petit modèle au bon endroit.

Vedettes

Liquid AI lance LFM2.5-Encoders sur Hugging Face, pariant que le NLP long contexte d’abord sur CPU peut concurrencer des modèles plus grands

Liquid AI a publié les modèles LFM2.5-Encoder sur Hugging Face, mettant en avant une inférence CPU plus rapide pour le NLP à long contexte à l’échelle documentaire, sans matériel plus puissant.