
Liquid AI ha publicado dos nuevos modelos pequeños de codificador, LFM2.5-Encoder-230M y LFM2.5-Encoder-350M, en Hugging Face, presentándolos como modelos de NLP de largo contexto capaces de manejar cargas de trabajo a escala documental en CPUs en lugar de requerir implementaciones más grandes y pesadas en GPU. Según el anuncio de la empresa en el Hugging Face Blog, los nuevos modelos admiten entradas de 8.192 tokens y están diseñados para tareas de producción como clasificación, comprobaciones de políticas, enrutamiento y detección de PII.
El lanzamiento importa porque muchos trabajos empresariales de NLP todavía se ejecutan fuera del foco actual de los grandes modelos de lenguaje. Los filtros de seguridad, los clasificadores de entrada, los enrutadores de intención y las herramientas de cumplimiento suelen procesar documentos largos de forma continua y con márgenes bajos, lo que hace que el coste de hardware y la latencia sean más importantes que la calidad de generación al estilo chatbot. La propuesta de Liquid AI es que estas cargas de trabajo de codificador pueden trasladarse a la infraestructura de CPU existente y seguir siendo competitivas frente a alternativas más grandes o más conocidas como ModernBERT.
El lanzamiento incluye dos modelos: LFM2.5-Encoder-230M y LFM2.5-Encoder-350M. Liquid AI los describe como codificadores de propósito general en lugar de modelos de recuperación estrechos, aunque provienen de la misma familia que sus anteriores LFM2.5-Retrievers. La empresa afirma que los nuevos modelos fueron preentrenados con un objetivo de lenguaje enmascarado para que puedan ajustarse a una gama más amplia de tareas, incluyendo clasificación de texto, etiquetado de tokens y búsqueda.
Esa distinción importa para los equipos de producto que eligen entre embeddings, retrievers y encoders. Un modelo de recuperación puede ser suficiente para la búsqueda multilingüe, pero los flujos de trabajo empresariales a menudo requieren juicio a nivel de documento completo o de token: enrutar tickets de soporte, comprobar infracciones de políticas o encontrar información de identificación personal. Los ejemplos de Liquid AI se inclinan fuertemente hacia esos casos de uso. En su anuncio, la empresa destacó demostraciones de enrutamiento de prompts zero-shot, revisión de políticas zero-shot, detección multilingüe de PII e incluso un experimento de generación de texto con difusión enmascarada, todo ejecutándose en Hugging Face Spaces solo con CPU.
Los modelos derivan de la arquitectura LFM2 de Liquid AI. Según la empresa, inicializó los codificadores a partir de las bases decodificadoras LFM2.5-230M y LFM2.5-350M, y luego convirtió esos decodificadores causales en codificadores bidireccionales cambiando la máscara de atención, haciendo que las convoluciones cortas no fueran causales y entrenando con modelado de lenguaje enmascarado. Liquid AI dice que primero entrenó para competencia de lenguaje de contexto corto a 1.024 tokens y luego adaptó los modelos a un contexto de 8.192 tokens con una mezcla de datos más amplia para reforzar el rendimiento factual, legal y multilingüe.
La afirmación principal no es solo la calidad de los benchmarks, sino el rendimiento por secuencia larga. Liquid AI dice que sus codificadores son especialmente fuertes en CPU, donde la latencia en contextos largos suele convertirse en el factor decisivo para el coste de implementación. En la comparación propia de la empresa, LFM2.5-Encoder-230M fue más rápido que ModernBERT-base en todas las longitudes de secuencia probadas y fue aproximadamente 3,7 veces más rápido a 8.192 tokens.
El ejemplo concreto del Hugging Face Blog es notable porque traduce la velocidad de benchmark en un mensaje operativo: un contrato completo, una transcripción o un hilo largo de soporte podría procesarse en menos de 30 segundos en la CPU de un portátil, frente a más de un minuto y medio para ModernBERT-base con la misma longitud de contexto. Para muchos equipos empresariales, eso cambia si la clasificación de documentos largos es lo bastante barata como para ejecutarse de forma rutinaria.
En GPU, Liquid AI informa de una ventaja más estrecha. Según la empresa, ModernBERT-base sigue por delante por debajo de aproximadamente 1.000 tokens en GPU de Apple, mientras que los modelos LFM2.5-Encoder toman la delantera alrededor de 2.000 tokens y por encima. Ese patrón refuerza la posición de mercado prevista: no son necesariamente la opción más rápida para cualquier flujo de trabajo de entrada corta, pero se comercializan para inferencia de largo contexto y siempre activa donde importa la economía de CPU.
Este posicionamiento también refleja una división más amplia en la infraestructura de IA. Los modelos generativos siguen absorbiendo la mayor parte de la atención, pero muchos sistemas de producción dependen de modelos más pequeños que puntúan, clasifican, filtran y enrutan texto antes de o alrededor de una llamada a un modelo grande. Si esos modelos pueden ejecutarse localmente o en CPUs de uso general, los desarrolladores pueden reducir costes, mejorar las opciones de residencia de datos y disminuir la dependencia de la disponibilidad de GPU.
Aunque el anuncio de Liquid AI se centra en modelos codificadores, la segunda fuente de este grupo, una publicación del NVIDIA Developer Blog sobre el diseño de atención de largo contexto, ayuda a explicar por qué el lanzamiento llega ahora. NVIDIA argumenta que, a medida que las cargas de trabajo agénticas y de largo contexto se vuelven más comunes, la atención domina cada vez más el coste de inferencia, convirtiendo las decisiones de arquitectura del modelo en un determinante importante del rendimiento.
La publicación de NVIDIA no trata específicamente de Liquid AI y se centra en la inferencia en GPU en lugar de en implementaciones primero en CPU. Aun así, su punto central es directamente relevante: el rendimiento de largo contexto está moldeado por decisiones arquitectónicas como el tamaño de grupo, la dimensión de la cabeza y la gestión del estado KV, no solo por la ingeniería de kernels. La publicación recomienda diseños de atención conscientes del hardware, incluyendo un mayor tamaño de grupo para la eficiencia de decodificación, dimensiones de cabeza alineadas con la memoria de la GPU y los tamaños de bloque, y un estado KV efectivo reducido mediante compresión o enfoques de atención dispersa e híbrida. NVIDIA cita TensorRT-LLM y arquitecturas como NVIDIA Nemotron 3 como ejemplos de este enfoque de co-diseño.
Ese contexto más amplio hace que el lanzamiento de Liquid AI sea más que una subida rutinaria de un modelo. La empresa está argumentando, en efecto, que la misma lógica de eficiencia de la atención que impulsa el co-diseño para GPU también puede producir ganancias prácticas para cargas de trabajo de codificador limitadas por CPU. Liquid AI dice que los LFM2.5-Encoders heredan de la base LFM2.5 la propiedad de que el coste crece lentamente a medida que aumenta la longitud de entrada. Para los usuarios que evalúan sistemas de IA empresarial, eso suele ser más valioso que el rendimiento máximo en tareas sintéticas cortas.
Las afirmaciones de rendimiento más sólidas en esta historia son las informadas por el vendedor. Los resultados de calidad y las comparaciones de velocidad provienen de la propia publicación de Liquid AI en el Hugging Face Blog, no de un laboratorio de benchmarks independiente ni de un estudio externo de implementación empresarial. Liquid AI dice haber afinado completamente cada modelo en cada tarea y evaluado 14 modelos en 17 tareas de GLUE, SuperGLUE y clasificación multilingüe, informando medias a partir de cinco semillas retenidas. También dice que el marco de evaluación completo y los resultados en bruto son de código abierto.
Según esos resultados, LFM2.5-Encoder-350M quedó en cuarto lugar entre los 14 modelos probados, con solo modelos más grandes por delante, incluido uno de 3,5B. Liquid AI también afirma que LFM2.5-Encoder-230M superó a ModernBERT-base y a todos los modelos EuroBERT en su configuración reportada, siendo más pequeño que la mayoría de ellos. Son afirmaciones significativas, pero los lectores deberían tratarlas como informadas por la empresa hasta que aparezcan réplicas externas.
El NVIDIA Developer Blog proporciona contexto técnico en lugar de validación independiente de los modelos de Liquid AI. Su análisis también está escrito por el vendedor y se basa en supuestos de hardware de NVIDIA, incluido el comportamiento medido de kernels con cálculo de atención FP8 y caché KV. Eso lo hace útil para entender por qué importa el diseño de la atención de largo contexto, pero no debe leerse como confirmación de terceros de la ventaja de benchmark de Liquid AI en CPU.
También hay incógnitas prácticas. Los materiales fuente no proporcionan precios empresariales detallados, términos de soporte ni estudios de caso de producción. Tampoco establecen cómo se comportan los modelos bajo ruido documental del mundo real, restricciones de latencia en entornos multiinquilino o conjuntos de datos legales y de cumplimiento desplazados por dominio. Los desarrolladores interesados en el despliegue probablemente tendrán que probar LFM2.5-Encoder-230M y LFM2.5-Encoder-350M frente a sus propios corpus y objetivos de nivel de servicio.
Para los desarrolladores de IA, el atractivo inmediato es el diseño del flujo de trabajo. Un codificador más pequeño que siga siendo utilizable con 8.192 tokens en CPU puede encajar en sistemas que de otro modo necesitarían truncamiento, fragmentación o inferencia costosa en GPU. Eso es relevante para canales de revisión de contratos, triaje de atención al cliente, filtrado de confianza y seguridad, entrada multilingüe y aplicación de políticas. También es relevante para pilas híbridas donde un modelo compacto filtra o enruta solicitudes antes de invocar a un modelo más grande.
Para los equipos de IA empresarial, la historia del coste puede importar incluso más que la posición en una clasificación. La inferencia compatible con CPU puede simplificar el despliegue en entornos regulados o con restricciones presupuestarias, especialmente cuando la capacidad de GPU es escasa o cuando los datos deben permanecer dentro de la infraestructura local existente. Los codificadores de largo contexto también pueden reducir la complejidad de ingeniería si eliminan la necesidad de dividir documentos en muchos fragmentos y volver a ensamblar los resultados aguas abajo.
Para los desarrolladores de modelos, el lanzamiento es otra señal de que el mercado se está ampliando más allá de los modelos de chat de vanguardia hacia primitivas de inferencia especializadas. ModernBERT sigue siendo un punto de comparación importante, pero Liquid AI intenta competir con una promesa más específica: una mejor economía de largo contexto en tamaños de modelo pequeños. Si esa afirmación se sostiene en la práctica, los desarrolladores podrían tratar a los encoders menos como utilidades de commodity y más como decisiones de arquitectura con impacto directo en presupuestos de latencia y costes del sistema.
La siguiente señal importante será la réplica independiente. Si desarrolladores externos confirman la brecha reportada por Liquid AI frente a ModernBERT-base, especialmente en CPUs de uso general y cargas de trabajo documentales reales, el lanzamiento podría influir en cómo los equipos diseñan sistemas de NLP empresarial de bajo coste.
Otra señal es la adopción dentro del ecosistema de Hugging Face. Si LFM2.5-Encoder-230M y LFM2.5-Encoder-350M comienzan a aparecer en demostraciones de producción, clasificadores afinados o pilas de evaluación empresarial, eso sugeriría que los modelos están resolviendo un problema operativo real y no solo publicando benchmarks internos sólidos.
También vale la pena observar si Liquid AI amplía aún más la familia LFM2. La relación entre LFM2.5-Retrievers y estos nuevos codificadores sugiere una estrategia más amplia en torno a modelos pequeños y eficientes de largo contexto para distintas capas del flujo de trabajo: búsqueda, enrutamiento, etiquetado y filtrado. En el lado de la infraestructura, los principios descritos por NVIDIA e implementados en TensorRT-LLM seguirán determinando qué arquitecturas son prácticas en ventanas de contexto más largas.
Este lanzamiento es interesante no porque intente vencer a los modelos más grandes, sino porque apunta a una parte descuidada de la pila: la comprensión de documentos largos que tiene que funcionar de forma constante y barata. En muchos sistemas reales, esa capa decide si la llamada al modelo caro se produce en absoluto. Si las afirmaciones de CPU de Liquid AI se sostienen, LFM2.5-Encoders podrían convertirse en bloques de construcción útiles para equipos de IA empresarial que intentan controlar el gasto de inferencia sin renunciar a la cobertura de largo contexto.
La lección más grande es arquitectónica. El mercado se está moviendo más allá de una historia simple de “modelo más grande igual a mejor producto”. Ya sea en CPU con LFM2.5-Encoder-230M o en pilas de GPU moldeadas por la guía de co-diseño de NVIDIA, el rendimiento depende cada vez más de ajustar la estructura del modelo a la carga de trabajo y al hardware. Para los desarrolladores, eso significa que la ventaja competitiva puede provenir menos de tener un modelo fundacional y más de elegir el modelo pequeño adecuado en el lugar adecuado.
Liquid AI publicó los modelos LFM2.5-Encoder en Hugging Face, proponiendo una inferencia más rápida de largo contexto en CPU para NLP a escala documental sin hardware más grande.