MiMo-V2.6 da Xiaomi lidera rankings de modelos abertos enquanto Anthropic alega destilação de Claude

O MiMo-V2.6-Pro da Xiaomi lidera os rankings de modelos abertos em custo e desempenho, enquanto a Anthropic alega que dados do Claude ajudaram a treinar o modelo.

AI News

A Xiaomi diz que seu novo MiMo-V2.6-Pro se tornou o mais forte modelo de IA disponível abertamente nos rankings atuais, combinando uma pontuação reportada de 46 no Intelligence Index com custos de inferência inusualmente baixos. O lançamento coloca a Xiaomi no centro de uma crescente corrida de modelos abertos, mas também chega em meio a acusações da Anthropic de que a empresa chinesa usou trocas geradas pelo Claude para melhorar seus próprios modelos.

O desempenho reportado do modelo é acompanhado por um preço de US$ 0,435 por milhão de tokens de entrada e US$ 0,87 por milhão de tokens de saída. De acordo com a análise citada pelo The Decoder, isso equivale a cerca de US$ 0,13 para uma única tarefa de benchmark — um número importante para desenvolvedores que avaliam modelos capazes para programação, agentes e outras cargas de trabalho de alto volume.

MiMo-V2.6 mira a fronteira de custo dos modelos abertos

O maior MiMo-V2.6-Pro é descrito como um modelo mixture-of-experts com 1,02 trilhão de parâmetros totais, embora apenas cerca de 42 bilhões estejam ativos para uma solicitação individual. A Xiaomi também está lançando o MiMo-V2.6-Flash, um modelo menor destinado a oferecer uma opção mais eficiente, e uma variante Pro-UltraSpeed que, segundo a empresa, pode produzir saídas até 20 vezes mais rápido que a versão padrão.

O The Decoder informou que o MiMo-V2.6-Pro ficou à frente de modelos como Kimi K3 e Qwen na comparação de sistemas disponíveis abertamente da Artificial Analysis. Uma manchete separada do Unite.AI também identificou uma pontuação de 46 como o resultado líder do modelo entre os modelos de pesos abertos, enquanto o The Next Web reportou o marco no ranking sem fornecer detalhes técnicos adicionais no material-fonte disponível.

Esses resultados importam porque a Xiaomi não está posicionando o MiMo-V2.6 apenas como um lançamento de pesquisa. Preços baixos por token podem mudar a economia de produtos que fazem chamadas frequentes ao modelo, incluindo assistentes de programação, sistemas de recuperação, automação de fluxos de trabalho e agentes de IA. O design mixture-of-experts do modelo também pode permitir que a Xiaomi anuncie uma grande capacidade sem pagar o custo computacional total de ativar todos os parâmetros a cada solicitação.

Aprendizado por reforço trouxe o salto de desempenho reportado

A Xiaomi atribui a melhoria a uma fase de aprendizado por reforço substancialmente ampliada. A empresa diz ter aumentado a quantidade de dados processados em cada etapa de treinamento, ampliado a gama de ambientes de tarefas e dedicado mais recursos computacionais à avaliação das saídas do modelo.

Segundo os números reportados pelo The Decoder, a execução de aprendizado por reforço durou menos de seis dias e custou aproximadamente US$ 2,62 milhões para o MiMo-V2.6-Pro e US$ 850 mil para o MiMo-V2.6-Flash. Na avaliação de codificação DeepSWE, a Xiaomi informou que o Pro melhorou de 58,4 para 72,6, enquanto o Flash subiu de 48,8 para 65,7.

A empresa também descreveu medidas destinadas a manter o treinamento estável. A Xiaomi congelou o mecanismo interno de distribuição do modelo e adicionou proteções contra reward hacking, no qual um modelo maximiza um sinal de avaliação sem realmente concluir a tarefa pretendida.

A Xiaomi está lançando mais do que pesos de modelo. O pacote inclui um relatório técnico, uma estrutura de aprendizado por reforço, um modelo menor para treinamento adicional e cerca de 7.000 tarefas com avaliadores automáticos. As tarefas cobrem desenvolvimento de software, cibersegurança, trabalho de escritório e web design, com cerca de 1.000 tarefas adicionais focadas em composição musical.

As origens das tarefas reportadas são mistas. Alguns exemplos de programação vieram de pull requests de funcionários no GitHub e consultas de usuários, enquanto outras descrições foram geradas por um modelo de linguagem. As tarefas de cibersegurança usam o OSS-Fuzz, uma coleção de vulnerabilidades reais de software, e os ambientes de escritório foram reconstruídos sinteticamente. Para os construtores, o acesso à estrutura de treinamento e aos avaliadores pode ser tão significativo quanto o acesso ao próprio modelo, pois oferece um ponto de partida para reproduzir ou ampliar a abordagem da Xiaomi.

Fortes alegações de benchmark encontram uma séria disputa sobre uso de dados

Os números de desempenho e custo que foram manchete devem ser tratados como alegações reportadas, e não como um veredito independente sobre a qualidade geral do modelo. A Xiaomi forneceu as cifras de custo de treinamento, aprendizado por reforço e melhoria, enquanto a Artificial Analysis forneceu a comparação do Intelligence Index citada, conforme descrito pelo The Decoder. O material-fonte disponível não oferece uma metodologia completa para o ranking, um amplo conjunto de avaliações independentes ou uma divisão completa do comportamento de segurança e confiabilidade do modelo.

A incerteza mais séria diz respeito a como a Xiaomi reuniu os dados de treinamento. No relatório de inteligência de ameaças da Anthropic, cobrindo casos de abuso do Claude de dezembro de 2025 a agosto de 2026, a Xiaomi foi citada entre sete laboratórios chineses de IA supostamente envolvidos em campanhas para extrair capacidades do Claude. A Anthropic se referiu à prática como destilação ilegal. As outras empresas nomeadas foram Alibaba, Moonshot AI, DeepSeek, Zhipu, MiniMax e SenseTime.

No caso identificado como GTG-16008, a Anthropic disse ter observado mais de 400.000 trocas ao longo de 20 dias em março e abril de 2026. O relatório alegou que a Xiaomi encaminhou conversas e sessões de codificação de seus modelos MiMo por meio da OpenClaw e da OpenCode para o Claude, com o objetivo de gerar dados de treinamento para modelos posteriores.

Essas são alegações da Anthropic, e não conclusões estabelecidas de forma independente no material disponível para esta reportagem. O The Decoder informou que a Anthropic forneceu documentação limitada sobre as origens dos dados anteriores do teacher model usados no processo interno de destilação. O lançamento público da Xiaomi de ferramentas de aprendizado por reforço não resolve, por si só, questões sobre a procedência dos dados usados em outras partes de seu pipeline de desenvolvimento.

O que o MiMo-V2.6 significa para construtores e empresas

Se os preços e o ranking reportados se mantiverem em testes independentes, o MiMo-V2.6-Pro poderá pressionar fornecedores de modelos cujos produtos cobram substancialmente mais por cargas de trabalho comparáveis de programação ou raciocínio. Startups poderiam usar o preço para executar suítes de avaliação maiores, loops de agentes mais frequentes ou fluxos de trabalho de clientes de maior volume. Equipes corporativas podem ver a disponibilidade aberta e o kit de treinamento como uma oportunidade de personalizar o sistema em vez de depender totalmente de uma API hospedada.

A compensação é que um baixo custo de inferência não significa automaticamente baixo risco de implantação. Os compradores ainda precisam avaliar por conta própria os termos de licença, a governança de dados, a latência, o tempo de atividade, o comportamento de segurança, o tratamento de contexto e a confiabilidade das saídas em suas próprias tarefas. As alegações sobre dados derivados do Claude adicionam outra camada: empresas que consideram o MiMo-V2.6 para uso em produção podem querer documentação clara sobre a procedência dos dados de treinamento e garantias legais antes de integrá-lo a fluxos de trabalho sensíveis.

Para pesquisadores, o lançamento da Xiaomi também destaca uma mudança prática no desenvolvimento de modelos abertos. A vantagem competitiva pode vir cada vez mais de ambientes de aprendizado por reforço, avaliadores e design de tarefas, e não apenas da escala de pré-treinamento. Ferramentas abertas podem acelerar o progresso, mas seu valor depende de as tarefas medirem comportamento útil e de os sistemas de recompensa resistirem a atalhos.

O que observar a seguir

O primeiro sinal será a replicação independente do resultado do Intelligence Index e dos ganhos reportados no DeepSWE. Os desenvolvedores também devem comparar o MiMo-V2.6-Pro com Kimi K3 e Qwen sob prompts, preços, hardware e condições de latência idênticos, em vez de confiar em um único ranking.

Um segundo sinal é a documentação da Xiaomi sobre dados de treinamento e práticas de desenvolvimento do modelo. As alegações da Anthropic podem levar a mais evidências, uma resposta da Xiaomi ou mudanças na forma como as empresas de modelos abertos divulgam a destilação e o uso de teacher models.

Por fim, o mercado mostrará se o kit de ferramentas da Xiaomi é utilizável fora de sua própria infraestrutura. A adoção por pesquisadores e equipes de produto, a qualidade dos avaliadores automáticos e o desempenho real em programação, cibersegurança, automação de escritório e fluxos de trabalho de agentes mostrarão se o MiMo-V2.6 é mais do que um forte lançamento de benchmark.

Perspectiva da Creati.ai

O MiMo-V2.6 é notável porque conecta três pressões que moldam o mercado de modelos abertos: desempenho em benchmark, economia de inferência e infraestrutura acessível de aprendizado por reforço. Os resultados reportados da Xiaomi sugerem que um modelo pode competir próximo ao topo dos rankings abertos sem igualar os preços mais altos dos sistemas proprietários.

Mas as alegações sobre o Claude tornam a procedência parte da história do produto, e não uma nota de rodapé. Para construtores de IA e compradores corporativos, o teste prático é, portanto, duplo: se o MiMo-V2.6 entrega valor confiável em cargas de trabalho reais e se a Xiaomi consegue oferecer transparência suficiente para que as organizações entendam o que estão implantando e como foi treinado.

Anúncios