MiMo-V2.6-Pro de Xiaomi lidera las clasificaciones de modelos abiertos en costo y rendimiento, mientras Anthropic alega que datos de Claude ayudaron a entrenar el modelo.

Xiaomi afirma que su nuevo MiMo-V2.6-Pro se ha convertido en el modelo de IA de acceso abierto más potente en las clasificaciones actuales, combinando una puntuación reportada de 46 en el Intelligence Index con costos de inferencia inusualmente bajos. El lanzamiento sitúa a Xiaomi en el centro de una creciente carrera de modelos abiertos, pero también llega en medio de acusaciones de Anthropic de que la empresa china utilizó intercambios generados por Claude para mejorar sus propios modelos.
El rendimiento reportado del modelo se acompaña de un precio de 0,435 dólares por millón de tokens de entrada y 0,87 dólares por millón de tokens de salida. Según el análisis citado por The Decoder, eso equivale aproximadamente a 0,13 dólares por una sola tarea de benchmark, una cifra importante para desarrolladores que evalúan modelos capaces para programación, agentes y otras cargas de trabajo de gran volumen.
El mayor MiMo-V2.6-Pro se describe como un modelo de mezcla de expertos con 1,02 billones de parámetros totales, aunque solo unos 42.000 millones están activos para una petición individual. Xiaomi también lanza MiMo-V2.6-Flash, un modelo más pequeño destinado a ofrecer una opción más eficiente, y una variante Pro-UltraSpeed que, según la empresa, puede producir resultados hasta 20 veces más rápido que la versión estándar.
The Decoder informó que MiMo-V2.6-Pro se situó por delante de modelos como Kimi K3 y Qwen en la comparación de sistemas disponibles públicamente de Artificial Analysis. Un titular aparte de Unite.AI también identificó una puntuación de 46 como el resultado líder del modelo entre los modelos de pesos abiertos, mientras que The Next Web informó sobre el hito en la clasificación sin proporcionar más detalles técnicos en el material fuente disponible.
Estos resultados importan porque Xiaomi no está posicionando MiMo-V2.6 solo como un lanzamiento de investigación. Los bajos precios por token pueden cambiar la economía de productos que realizan llamadas frecuentes al modelo, incluidos asistentes de programación, sistemas de recuperación, automatización de flujos de trabajo y agentes de IA. El diseño de mezcla de expertos del modelo también puede permitir a Xiaomi anunciar una gran capacidad sin asumir el costo computacional completo de activar todos los parámetros en cada solicitud.
Xiaomi atribuye la mejora a una fase de aprendizaje por refuerzo considerablemente ampliada. La empresa afirma que aumentó la cantidad de datos procesados en cada paso de entrenamiento, amplió la gama de entornos de tareas y dedicó más recursos de cómputo a evaluar las salidas del modelo.
Según las cifras reportadas por The Decoder, la ejecución de aprendizaje por refuerzo duró menos de seis días y costó aproximadamente 2,62 millones de dólares para MiMo-V2.6-Pro y 850.000 dólares para MiMo-V2.6-Flash. En la evaluación de programación DeepSWE, Xiaomi informó que Pro mejoró de 58,4 a 72,6, mientras que Flash pasó de 48,8 a 65,7.
La empresa también describió medidas destinadas a mantener estable el entrenamiento. Xiaomi congeló el mecanismo interno de distribución del modelo y añadió protecciones contra el reward hacking, en el que un modelo maximiza una señal de calificación sin completar realmente la tarea prevista.
Xiaomi está publicando más que pesos del modelo. Su paquete incluye un informe técnico, un marco de aprendizaje por refuerzo, un modelo más pequeño para entrenamiento adicional y unas 7.000 tareas con evaluadores automáticos. Las tareas abarcan desarrollo de software, ciberseguridad, trabajo de oficina y diseño web, con alrededor de 1.000 tareas adicionales centradas en composición musical.
Las fuentes de tareas reportadas son mixtas. Algunos ejemplos de programación procedían de pull requests de empleados en GitHub y consultas de usuarios, mientras que otras descripciones fueron generadas por un modelo de lenguaje. Las tareas de ciberseguridad se basan en OSS-Fuzz, una colección de vulnerabilidades reales de software, y los entornos de oficina se reconstruyeron sintéticamente. Para los creadores, el acceso al marco de entrenamiento y a los evaluadores puede ser tan significativo como el acceso al propio modelo, porque ofrece un punto de partida para reproducir o ampliar el enfoque de Xiaomi.
Las cifras destacadas de rendimiento y costo deben tratarse como afirmaciones reportadas y no como un veredicto independiente sobre la calidad general del modelo. Xiaomi proporcionó las cifras de costo de entrenamiento, aprendizaje por refuerzo y mejora, mientras que Artificial Analysis proporcionó la comparación del Intelligence Index citada, tal como describió The Decoder. El material fuente disponible no ofrece una metodología completa para la clasificación, un conjunto amplio de evaluaciones independientes ni un desglose completo del comportamiento de seguridad y fiabilidad del modelo.
La incertidumbre más seria se refiere a cómo Xiaomi reunió los datos de entrenamiento. En el informe de inteligencia de amenazas de Anthropic, que cubre casos de abuso de Claude desde diciembre de 2025 hasta agosto de 2026, Xiaomi fue nombrada entre siete laboratorios chinos de IA supuestamente implicados en campañas para extraer capacidades de Claude. Anthropic se refirió a la práctica como destilación ilegal. Las otras empresas nombradas fueron Alibaba, Moonshot AI, DeepSeek, Zhipu, MiniMax y SenseTime.
En el caso identificado como GTG-16008, Anthropic dijo haber observado más de 400.000 intercambios durante 20 días en marzo y abril de 2026. El informe alegó que Xiaomi canalizó conversaciones y sesiones de programación de sus modelos MiMo a Claude a través de OpenClaw y OpenCode, con el objetivo de generar datos de entrenamiento para modelos posteriores.
Estas son acusaciones de Anthropic, no hallazgos establecidos de forma independiente en el material disponible para esta noticia. The Decoder informó que Anthropic proporcionó documentación limitada sobre los orígenes de los datos anteriores del teacher model utilizados en el proceso interno de destilación. El lanzamiento público por parte de Xiaomi de herramientas de aprendizaje por refuerzo no resuelve por sí mismo las preguntas sobre la procedencia de los datos utilizados en otras partes de su canal de desarrollo.
Si el precio y la clasificación reportados se mantienen en pruebas independientes, MiMo-V2.6-Pro podría presionar a los proveedores de modelos cuyos productos cobran sustancialmente más por cargas de trabajo comparables de programación o razonamiento. Las startups podrían usar el precio para ejecutar conjuntos de evaluación más grandes, bucles de agentes más frecuentes o flujos de trabajo de clientes de mayor volumen. Los equipos empresariales podrían ver la disponibilidad abierta y el kit de entrenamiento como una oportunidad para personalizar el sistema en lugar de depender por completo de una API alojada.
La contrapartida es que un bajo costo de inferencia no significa automáticamente bajo riesgo de implementación. Los compradores aún necesitan evaluar por su cuenta los términos de licencia, la gobernanza de datos, la latencia, el tiempo de actividad, el comportamiento de seguridad, el manejo del contexto y la fiabilidad de las salidas en sus propias tareas. Las acusaciones sobre datos derivados de Claude añaden otra capa: las empresas que consideren MiMo-V2.6 para uso en producción podrían querer documentación clara sobre la procedencia de los datos de entrenamiento y garantías legales antes de integrarlo en flujos de trabajo sensibles.
Para los investigadores, el lanzamiento de Xiaomi también destaca un cambio práctico en el desarrollo de modelos abiertos. La ventaja competitiva puede provenir cada vez más de entornos de aprendizaje por refuerzo, evaluadores y diseño de tareas, y no solo de la escala del preentrenamiento. Las herramientas abiertas pueden acelerar el progreso, pero su valor depende de si las tareas miden comportamientos útiles y de si los sistemas de recompensa resisten atajos.
La primera señal será la replicación independiente del resultado del Intelligence Index y de las ganancias reportadas en DeepSWE. Los desarrolladores también deberían comparar MiMo-V2.6-Pro con Kimi K3 y Qwen bajo prompts, precios, hardware y condiciones de latencia idénticos, en lugar de confiar en una sola tabla de clasificación.
Una segunda señal es la documentación de Xiaomi sobre los datos de entrenamiento y las prácticas de desarrollo del modelo. Las acusaciones de Anthropic podrían conducir a más pruebas, a una respuesta de Xiaomi o a cambios en cómo las empresas de modelos abiertos divulgan la destilación y el uso de teacher models.
Por último, el mercado revelará si el kit de herramientas de Xiaomi es utilizable fuera de su propia infraestructura. La adopción por investigadores y equipos de producto, la calidad de los evaluadores automáticos y el rendimiento real en programación, ciberseguridad, automatización de oficina y flujos de trabajo de agentes mostrarán si MiMo-V2.6 es más que un fuerte lanzamiento de benchmark.
MiMo-V2.6 es notable porque vincula tres presiones que están dando forma al mercado de modelos abiertos: rendimiento en benchmarks, economía de inferencia e infraestructura accesible de aprendizaje por refuerzo. Los resultados reportados por Xiaomi sugieren que un modelo puede competir cerca de la cima de las clasificaciones abiertas sin igualar los precios más altos de los sistemas propietarios.
Pero las acusaciones sobre Claude convierten la procedencia en parte de la historia del producto, no en una nota al pie. Para desarrolladores de IA y compradores empresariales, la prueba práctica es, por tanto, doble: si MiMo-V2.6 ofrece un valor fiable en cargas de trabajo reales y si Xiaomi puede proporcionar suficiente transparencia para que las organizaciones entiendan lo que están desplegando y cómo fue entrenado.