Base Labs, Hugging Face e Goodfire estão construindo infraestrutura aberta de segurança para IA, com o objetivo de tornar as salvaguardas mais transparentes à medida que os riscos dos modelos crescem.

Base Labs, o grupo de pesquisa criado pela empresa de inferência de IA Baseten, está fazendo parceria com a Hugging Face e a Goodfire AI para desenvolver infraestrutura de segurança para modelos de peso aberto. A iniciativa pretende incorporar a avaliação e o monitoramento de segurança ao processo de desenvolvimento e implantação do modelo, em vez de tratá-los como uma camada separada adicionada posteriormente.
O anúncio acontece em meio ao debate entre desenvolvedores e formuladores de políticas sobre como lidar com modelos cujos pesos podem ser baixados, modificados e despojados de suas salvaguardas embutidas. Para construtores de IA e equipes corporativas, a parceria pode se tornar um teste inicial de se os ecossistemas de modelos abertos conseguem estabelecer práticas de segurança confiáveis sem depender do controle centralizado de um pequeno número de provedores de modelos.
A Base Labs diz que irá desenvolver e publicar métodos para treinar e monitorar modelos abertos, com a meta de longo prazo de criar um “padrão” de segurança transparente para o ecossistema de peso aberto. A Hugging Face, uma importante plataforma de hospedagem para modelos de código aberto e de peso aberto, está participando do esforço, enquanto a Goodfire AI traz expertise em interpretabilidade de modelos.
As empresas não divulgaram o desenho técnico da parceria. Isso deixa em aberto questões básicas sobre se o trabalho produzirá benchmarks de avaliação, ferramentas de implantação, métodos de treinamento, sistemas de monitoramento ou uma combinação desses componentes.
O foco declarado da Goodfire em tornar o comportamento dos modelos mais compreensível sugere que a interpretabilidade pode fazer parte do arcabouço proposto. Em resposta ao anúncio da Baseten, a Goodfire disse que a segurança deve ser incorporada aos modelos abertos e fornecida pelas organizações que os servem. Esse é um objetivo amplo, ainda não uma especificação publicada.
A Baseten lançou a Base Labs no início de 2026 como seu braço de pesquisa. A empresa também convidou desenvolvedores e outros membros da comunidade de pesquisa a contribuir para o arcabouço, indicando que quer que o projeto vá além dos três parceiros fundadores.
O pano de fundo imediato é a preocupação crescente de que salvaguardas possam ser removidas de modelos baixáveis. A TechCrunch informou que uma técnica conhecida como “abliteration” está sendo cada vez mais usada para desativar ou enfraquecer o comportamento de recusa e outros controles de segurança. A Hugging Face atualmente lista mais de 6.000 modelos identificados como abliterated, de acordo com o relatório.
Esse número reflete o conteúdo e a rotulagem de um catálogo de plataforma, não uma medição independente de todo o mercado de modelos abertos. Ainda assim, ilustra a dificuldade prática de tratar o comportamento de segurança original de um modelo como permanente uma vez que seus pesos estão publicamente disponíveis.
Para desenvolvedores de modelos, a questão de segurança deixa de ser se um fornecedor adicionou proteções e passa a ser se essas proteções continuam relevantes após redistribuição ou modificação. As ferramentas de monitoramento também podem precisar avaliar como um modelo se comporta sob prompts alterados, fine-tuning, quantização ou outras alterações feitas por usuários downstream.
A Base Labs argumenta que a abertura pode ajudar a pesquisa em segurança porque terceiros podem inspecionar o comportamento do modelo e desenvolver controles mais transparentes. Essa é a posição da empresa, não uma conclusão demonstrada por esta parceria. O acesso aberto pode melhorar o escrutínio, mas também pode facilitar a remoção de proteções ou a reprodução de variantes inseguras.
O anúncio confirmado se limita à formação da parceria e à intenção declarada das empresas de construir e publicar métodos de segurança. Nenhuma arquitetura técnica, cronograma de lançamento, resultados de avaliação, lista de modelos ou processo de governança foi fornecido na cobertura disponível.
O sinal de mercado mais concreto é o catálogo da Hugging Face com mais de 6.000 modelos abliterated, conforme relatado pela TechCrunch. O catálogo indica a escala do desafio enfrentado por qualquer esforço que busque manter propriedades de segurança em uma rede aberta de distribuição, mas não estabelece quantos desses modelos são amplamente usados ou representam um risco real mensurável.
Os recursos financeiros dos participantes também fornecem contexto, mas não provam progresso técnico. A Baseten levantou US$ 1,5 bilhão em uma rodada Série F em junho, alcançando uma avaliação reportada de US$ 13 bilhões. A Goodfire AI levantou US$ 150 milhões em uma rodada Série B liderada pela B Capital no início deste ano. Esses números podem dar ao projeto acesso a capacidade de engenharia e pesquisa, mas não validam o padrão proposto nem sua provável adoção.
Como os detalhes disponíveis vêm principalmente do anúncio das empresas e da cobertura da mídia, afirmações sobre transparência, participação do ecossistema e futuras melhorias de segurança devem ser tratadas como metas declaradas. Ainda não há resultados independentes de benchmarks mostrando que a abordagem reduz saídas prejudiciais ou resiste à modificação do modelo.
Se Base Labs, Hugging Face e Goodfire produzirem ferramentas utilizáveis, criadores de modelos poderão ganhar um processo comum para testar o comportamento antes do lançamento e monitorar os modelos após a implantação. Isso pode ajudar as equipes a documentar avaliações de segurança, comparar versões de modelos e identificar mudanças causadas por fine-tuning ou distribuição downstream.
Para compradores corporativos, o valor prático dependerá de o arcabouço produzir evidências que se encaixem em fluxos de compra, revisão de risco e conformidade. Um model card ou um benchmark pontual pode ser insuficiente para organizações que implantam modelos atualizados, customizados ou hospedados por fornecedores diferentes. Os compradores provavelmente precisarão de testes reproduzíveis, trilhas de auditoria, controle de versões e informações claras sobre quais proteções permanecem em um modelo derivado.
A parceria também coloca a Hugging Face em uma posição potencialmente influente. Como uma grande plataforma de distribuição e descoberta, ela pode ajudar a determinar se metadados de segurança e resultados de avaliação se tornam visíveis no ponto em que os desenvolvedores escolhem modelos. Mas a infraestrutura de hospedagem sozinha não pode garantir que um modelo baixado mantenha suas salvaguardas originais.
Para Base Labs e Goodfire, o projeto também pode estabelecer uma posição competitiva em um mercado em que inferência de modelos, interpretabilidade e ferramentas de segurança estão cada vez mais conectadas. As empresas precisarão mostrar que sua abordagem é prática para desenvolvedores de código aberto, não apenas para equipes de pesquisa bem financiadas. Ferramentas caras, lentas ou difíceis de integrar podem limitar a adoção, mesmo que suas avaliações sejam tecnicamente fortes.
O primeiro sinal será um lançamento técnico público: uma especificação, um conjunto de benchmarks, uma receita de treinamento, uma ferramenta de monitoramento ou uma implementação de referência. Seu escopo revelará se a parceria é principalmente um programa de pesquisa ou um padrão operacional voltado para uso em produção.
Os desenvolvedores também devem observar avaliações independentes de modelos testados dentro do arcabouço, especialmente após fine-tuning ou remoção de controles de segurança. Evidências de que os métodos continuam detectando comportamento arriscado em modelos modificados seriam mais significativas do que alegações de lançamento por si só.
Outros sinais importantes incluem participação de criadores de modelos fora do grupo fundador, integração com fluxos de trabalho da Hugging Face, custos e latência documentados e um processo para atualizar avaliações à medida que novas técnicas de ataque surgem. A governança também será importante: os parceiros ainda não explicaram quem definirá o comportamento aceitável, resolverá disputas ou manterá o arcabouço.
A parceria aborda uma fraqueza real da IA de peso aberto: os controles de segurança são difíceis de preservar quando os modelos podem ser copiados e alterados. Sua proposição central — que transparência e ferramentas compartilhadas podem melhorar a segurança — é plausível, mas continua não comprovada até que as empresas publiquem métodos que outras pessoas possam reproduzir e contestar.
Para builders e equipes corporativas, o anúncio é melhor visto como uma proposta de infraestrutura, e não como uma solução de segurança concluída. A credibilidade de Base Labs, Hugging Face e Goodfire dependerá menos da parceria em si do que de entregarem avaliações abertas, resultados mensuráveis e controles que continuem funcionando depois que os modelos deixarem seu ambiente original de desenvolvimento.