AIUC capta US$ 40 milhões para testar e certificar agentes de IA corporativos

A AIUC levantou US$ 40 milhões para certificar agentes de IA para segurança empresarial, usando milhares de testes para avaliar jailbreaks, alucinações e vazamentos de dados.

AI News

A Artificial Intelligence Underwriting Company (AIUC), uma startup fundada por um dos primeiros funcionários da Anthropic e pelo ex-COO da organização de segurança em IA METR, levantou US$ 40 milhões para construir uma camada independente de testes e certificação para agentes de IA.

A Série A foi liderada pela Ribbit Capital, com participação da First Harmonic, segundo a TechCrunch. A rodada eleva o financiamento total da AIUC para US$ 55 milhões, após uma rodada seed de US$ 15 milhões já divulgada anteriormente, apoiada pela NFDG de Nat Friedman, Emergence, Terrain e Ben Mann, cofundador da Anthropic.

A AIUC está mirando uma preocupação crescente nas empresas: se um sistema de IA pode ser confiável para operar dentro de fluxos de trabalho de negócio, e não apenas se ele consegue concluir tarefas. Seu padrão proposto AIUC-1 é parcialmente inspirado no SOC 2, a estrutura amplamente usada para avaliar controles relacionados à segurança e aos processos de negócios.

Uma camada de certificação para agentes de IA

A AIUC foi fundada por Rune Kvist, um dos primeiros funcionários da Anthropic, e Rajiv Dattani, que atuou como COO da METR de 2024 a 2025 e continua no conselho da organização, segundo a TechCrunch. Os fundadores estão posicionando a empresa como uma avaliadora independente para companhias que constroem ou implantam agentes de IA.

A startup afirma ter reunido um consórcio de cerca de 250 líderes de segurança e risco para ajudar a definir o que compradores corporativos querem saber antes de adquirir um agente. Essas discussões informam os testes usados pela AIUC para avaliar sistemas, disse Dattani à TechCrunch.

A AIUC diz que seu serviço de testes executa um agente em aproximadamente 5.000 cenários cobrindo áreas como jailbreaks, alucinações e vazamento de dados. O processo produz um relatório de cerca de 100 páginas, identificando onde o sistema se comporta de forma confiável e onde os compradores devem aplicar restrições ou controles adicionais.

Os testes em si são executados com a ajuda de agentes de IA, e a IA também é usada para analisar os dados resultantes. Segundo Kvist, pessoas verificam a auditoria final. Essa revisão humana é importante porque um avaliador automatizado pode herdar os mesmos pontos cegos, interpretar mal o comportamento do modelo ou deixar de reconhecer um problema de segurança sutil.

Da capacidade do modelo ao risco operacional

A proposta da empresa reflete uma mudança na forma como as companhias avaliam a IA empresarial. Um agente que tem bom desempenho em um benchmark ainda pode ser inadequado para um fluxo de trabalho de finanças, saúde, governo ou atendimento ao cliente se puder expor informações confidenciais, seguir instruções maliciosas ou tomar uma ação fora de sua autorização.

Kvist disse à TechCrunch que muitas organizações já não estão recuando apenas porque os modelos de IA carecem de capacidade. Em vez disso, elas precisam de garantias de que os sistemas se comportarão dentro dos compromissos assumidos com clientes e reguladores. A abordagem da AIUC pretende fornecer evidências que possam ser revisadas antes da implantação, em vez de depender apenas dos testes internos de um fornecedor.

A empresa lista Cursor, Lovable, Harvey e ElevenLabs entre seus clientes. A fonte não fornece detalhes sobre o escopo dessas relações, quais produtos foram avaliados ou se as empresas concluíram a certificação AIUC-1. Esses sinais de adoção devem, portanto, ser tratados como declarações da empresa, e não como resultados de clientes verificados de forma independente.

O modelo de negócios da AIUC também difere do seguro tradicional, apesar da palavra “underwriting” em seu nome. As evidências descrevem um serviço de testes e certificação, não cobertura para perdas causadas por um sistema de IA. Seu produto imediato é uma camada de avaliação destinada a apoiar decisões de compra e implantação.

Como a AIUC se compara com avaliações no estilo METR

A experiência de Dattani na METR dá à AIUC uma conexão com uma área estabelecida de avaliação de IA. A METR trabalhou com laboratórios de IA de fronteira para medir se agentes conseguem concluir tarefas de forma confiável. Sua pesquisa também foi usada em investigações envolvendo o comportamento de modelos, incluindo trabalho relacionado ao incidente do Hugging Face da OpenAI.

A AIUC diz que seu foco é mais amplo e mais voltado para empresas. Em vez de se concentrar principalmente no desempenho em tarefas, o processo AIUC-1 foi projetado para examinar falhas de segurança e confiabilidade que podem surgir quando agentes interagem com dados, ferramentas e usuários reais de negócios.

Essa distinção importa para compradores. Um sistema pode concluir uma tarefa com sucesso em uma avaliação controlada e ainda assim exigir permissões restritas, monitoramento, aprovação humana ou um ambiente operacional limitado em produção. Testes independentes poderiam ajudar equipes de compras a comparar sistemas, embora uma certificação não possa garantir que um agente permanecerá seguro após uma atualização de modelo, uma mudança de ferramenta ou uma nova técnica de ataque.

A ideia mais ampla de avaliação externa também vem ganhando atenção entre empresas de modelos de fronteira. O CEO da Anthropic, Dario Amodei, pediu maior cautela no desenvolvimento de fronteira e sugeriu que avaliadores independentes poderiam observar e verificar o trabalho de segurança em laboratórios de IA. A AIUC não propõe colocar avaliadores nas instalações dos clientes, mas seus fundadores estão perseguindo um princípio relacionado: as organizações devem ter acesso a evidências independentes antes de confiar em sistemas poderosos.

O que as alegações mostram — e o que ainda não foi provado

O financiamento é um evento de negócios confirmado e reportado pela TechCrunch, assim como os fundadores da AIUC, seu padrão AIUC-1 e o processo de testes declarado pela empresa. Os nomes de clientes divulgados, o tamanho do consórcio, o número de testes e o tamanho do relatório vêm das próprias divulgações da AIUC na entrevista e devem ser entendidos como alegações da empresa.

Ainda não há evidências suficientes para determinar quão bem o AIUC-1 prevê incidentes em produção, quão consistentemente diferentes avaliadores pontuariam o mesmo agente, ou se as empresas tratarão a certificação como um requisito de aquisição. A fonte também não identifica resultados públicos de auditoria, taxas de falha, resultados de correção, preços ou a proporção de testes que os agentes passam.

Essas lacunas são significativas. Certificações de segurança se tornam úteis quando os compradores entendem seu escopo e quando as avaliações são repetíveis ao longo do tempo. Agentes de IA podem mudar de comportamento após atualizações de modelo, integrações com ferramentas, mudanças em prompts ou alterações nos dados aos quais podem acessar. Um relatório pontual pode, portanto, ser menos valioso do que uma avaliação contínua vinculada a controles de implantação.

O que observar a seguir

O primeiro sinal será se a AIUC publicar detalhes das avaliações AIUC-1 concluídas, incluindo metodologia, critérios de pontuação e exemplos de falhas descobertas durante os testes. Os compradores também vão querer saber como a empresa lida com atualizações de modelo e se a certificação precisa ser renovada quando as ferramentas ou permissões de um agente mudam.

Outro sinal importante é a validação independente. Evidências de clientes corporativos, pesquisadores de segurança ou auditores não afiliados à AIUC ajudariam a estabelecer se os testes identificam riscos do mundo real e não apenas falhas sintéticas.

O mercado também revelará se a abordagem da AIUC passa a fazer parte das compras. A adoção por grandes bancos, hospitais, agências governamentais ou grandes plataformas de software sugeriria que a avaliação de agentes por terceiros está se tornando um controle padrão. Por outro lado, se as empresas usarem a certificação apenas como um selo de marketing sem publicar resultados significativos, seu valor para criadores e compradores permanecerá limitado.

Perspectiva da Creati.ai

A AIUC está atacando um gargalo real na IA corporativa: as organizações precisam de uma forma defensável de decidir onde um agente pode agir de forma autônoma e onde ele precisa de limites. Uma avaliação externa estruturada poderia tornar essas decisões mais concretas do que afirmações amplas sobre a segurança do modelo ou sua capacidade geral.

Mas a certificação deve ser tratada como evidência, não como permissão para remover salvaguardas. A versão mais forte desse mercado combinará testes independentes com monitoramento em tempo real, acesso com privilégio mínimo, escalonamento humano e reavaliações após mudanças materiais no sistema. O financiamento da AIUC dá espaço para esse modelo se desenvolver; sua credibilidade dependerá de demonstrar que os relatórios melhoram, na prática, as decisões de implantação.

Anúncios