Vals levanta US$ 40 milhões para tornar a avaliação de IA mais resistente a manipulações

A Vals, apoiada pela Andreessen Horowitz, levantou US$ 40 milhões para construir benchmarking confidencial de IA baseado em tarefas para empresas e agências federais, enquanto testes mais antigos s…

AI News

A startup de benchmarking de IA Vals está tentando transformar a avaliação de modelos em uma camada mais prática e confiável do mercado de IA depois de levantar uma rodada Série A de US$ 40 milhões liderada pela Andreessen Horowitz. A empresa argumenta que muitos testes estabelecidos já não são suficientes para julgar modelos cada vez mais capazes, especialmente quando as empresas podem ver o material do teste com antecedência.

A Vals avalia sistemas de IA em tarefas complexas e específicas de domínio, em vez de depender apenas de exames públicos de conhecimento geral. Sua abordagem foi projetada para ajudar desenvolvedores de modelos a identificar fraquezas, ajudar compradores a comparar sistemas para trabalho real e dar a reguladores ou investidores evidências mais significativas sobre desempenho e risco.

Um modelo diferente para avaliação de IA

Fundada em 2024, a Vals foi criada depois que o cofundador e CEO Rayan Krishnan observou que os benchmarks acadêmicos estavam tendo dificuldade para acompanhar as novas capacidades dos modelos. Em comentários relatados pela TechCrunch, Krishnan disse que o setor estava lançando modelos capazes mais rápido do que os sistemas tradicionais de avaliação conseguiam medi-los.

Os testes da empresa têm a intenção de se assemelhar ao trabalho profissional em áreas como direito, finanças e programação. Em vez de perguntar apenas se um modelo consegue responder a perguntas difíceis, a Vals diz que examina se o sistema pode produzir trabalho de qualidade comparável à de um humano em um campo específico.

Um aspecto notável é que a Vals não divulga publicamente os materiais específicos usados em seus testes. O raciocínio da empresa é que benchmarks totalmente públicos podem se tornar alvos de otimização ou treinamento. Um modelo pode parecer melhorar em um teste sem demonstrar melhora comparável em um trabalho mais amplo e inédito.

A Vals também afirma que suas avaliações consideram resultados prejudiciais ou indesejados, e não apenas a conclusão bem-sucedida de tarefas. Suas áreas de interesse relatadas incluem cibersegurança, biossegurança, saúde mental, autoaperfeiçoamento recursivo e a lei dos conflitos armados. As evidências fornecidas não detalham a metodologia, os sistemas de pontuação ou a validação independente para cada um desses programas.

O que os números de financiamento e crescimento mostram

A Série A sucede uma rodada semente anterior liderada por 8VC e Bloomberg Beta. A TechCrunch informou que o financiamento mais recente da Vals foi concluído no mês anterior ao artigo de setembro de 2026 e que a empresa agora tem uma equipe de 25 pessoas, ante oito no início do ano.

Esses números de crescimento, juntamente com a alegação da empresa de que a receita está oito vezes maior do que no ano passado, foram relatados por Krishnan e devem ser tratados como métricas reportadas pela empresa, e não como evidências auditadas de forma independente. O material de origem disponível não identifica os clientes da Vals, a receita total, o volume de testes ou o número de modelos avaliados.

A empresa ganha dinheiro cobrando dos desenvolvedores de IA pela avaliação de seus modelos. Isso cria uma relação potencialmente útil, mas delicada: a parte que paga pelo teste também é a parte cujo sistema está sendo julgado. A Vals apresenta o serviço como uma ferramenta de desenvolvimento e controle de qualidade, comparando-o a pagar por um exame padronizado que revela onde é necessário melhorar.

A empresa também lançou um programa focado em fornecer avaliações de modelos para agências federais. O material de origem não especifica quais agências estão participando nem se o programa produziu resultados públicos.

Por que a neutralidade dos benchmarks importa para os compradores

Para os criadores de IA, o valor de uma avaliação depende de ela prever o desempenho fora do ambiente de teste. Um benchmark público pode ser fácil de comunicar, mas pode ser menos útil se os modelos tiverem sido ajustados às suas perguntas ou se o teste medir conhecimento abstrato em vez de um fluxo de trabalho real.

O modelo baseado em tarefas da Vals pode ser mais relevante para compradores de IA empresarial que escolhem sistemas para revisão jurídica, análise financeira, desenvolvimento de software ou outras tarefas operacionais. Um comprador pode se importar menos com a posição de um modelo em um ranking geral do que com o fato de ele concluir um fluxo de trabalho definido com precisão, consistência e modos de falha aceitáveis.

Isso torna a qualidade da avaliação uma questão de implantação, e não apenas de marketing. As equipes de produto precisam saber onde um modelo falha, com que frequência ele exige intervenção humana e se um resultado aparentemente forte esconde problemas de segurança ou confiabilidade. Testes confidenciais podem reduzir a manipulação de benchmarks, mas também dificultam o escrutínio externo. Os compradores precisarão de transparência metodológica suficiente para entender o que uma pontuação significa sem receber as respostas do teste.

Os riscos comerciais podem crescer à medida que os sistemas de IA se tornam embutidos em processos de negócios. Se as avaliações de modelos começarem a influenciar compras, registros públicos, decisões de investimento ou revisões regulatórias, as organizações que produzem essas avaliações enfrentarão pressão para demonstrar independência, repetibilidade e resistência a conflitos de interesse.

Evidências, limites e pressão competitiva

O caso da Vals se apoia principalmente no problema que identifica e na abordagem declarada pela empresa. A TechCrunch relatou a descrição de Krishnan de um mercado em que benchmarks mais antigos estão ficando para trás em relação aos modelos modernos, mas a fonte não apresenta resultados comparativos mostrando que os testes da Vals são mais preditivos ou mais difíceis de manipular do que os de sistemas concorrentes.

Também não há evidência independente na cobertura disponível de que a Vals tenha se tornado a avaliadora preferida do setor. Seu financiamento da Andreessen Horowitz e de apoiadores anteriores é um sinal de confiança dos investidores, não prova de precisão de benchmark ou adoção de mercado. Da mesma forma, o crescimento de receita relatado e a expansão para avaliações para agências federais indicam impulso reivindicado pela empresa, mas não estabelecem aceitação ampla por parte dos clientes.

A Vals também enfrentará concorrência de desenvolvedores de modelos, laboratórios de pesquisa, comunidades de benchmarks abertos, empresas especializadas em testes e equipes internas de avaliação. Algumas organizações podem preferir testes públicos transparentes, enquanto outras pagarão por avaliações privadas que reflitam seus próprios dados e fluxos de trabalho. O desafio da empresa é mostrar que seu processo controlado produz insights que os clientes não conseguem obter por meio de testes internos ou plataformas de avaliação existentes.

O que observar a seguir

Os sinais mais claros serão evidências públicas de como a Vals pontua modelos e se essas pontuações se correlacionam com o desempenho em produção. Os compradores devem observar a metodologia divulgada, estudos de repetibilidade, comparações de modelos conduzidas sob condições consistentes e exemplos de avaliações que alteraram decisões de implantação ou aquisição.

Seu programa para agências federais é outro teste importante. Participantes nomeados, resultados publicados ou relações formais de aquisição forneceriam evidências mais fortes do que um simples anúncio. A contratação planejada e a expansão de escritórios da empresa podem indicar atividade comercial contínua, mas a retenção de clientes e o volume recorrente de avaliações importarão mais do que o número de funcionários.

O mercado também deve observar se a Vals consegue preservar a confidencialidade sem se tornar uma caixa-preta. Se suas avaliações influenciarem alegações sobre segurança, capacidade ou valor de investimento, a supervisão independente e explicações claras da pontuação se tornarão centrais para sua credibilidade.

Perspectiva da Creati.ai

A Vals entra no mercado em um momento oportuno: empresas de IA precisam cada vez mais de avaliações que reflitam o trabalho que as pessoas realmente realizam, enquanto compradores ficam mais céticos em relação a ganhos em rankings que não se traduzem em implantações confiáveis. Seu foco em testes ocultos e tarefas específicas de domínio aborda fraquezas reais do benchmarking público.

Mas se tornar um padrão confiável exige mais do que apoio de capital de risco e crescimento rápido. A Vals precisará demonstrar que suas avaliações privadas são rigorosas, reproduzíveis e transparentes o suficiente para que clientes e observadores externos possam avaliar seu significado. A próxima fase da empresa será definida menos pela ambição de seu catálogo de benchmarks do que por se seus resultados melhoram de forma confiável as decisões sobre quais modelos de IA construir, comprar e implantar.

Anúncios