Base Labs, Hugging Face y Goodfire están construyendo infraestructura abierta de seguridad para IA, con el objetivo de hacer que las salvaguardas sean más transparentes a medida que crecen los riesgos de los modelos.

Base Labs, el grupo de investigación creado por la empresa de inferencia de IA Baseten, se está asociando con Hugging Face y Goodfire AI para desarrollar infraestructura de seguridad para modelos de peso abierto. La iniciativa pretende convertir la evaluación y la supervisión de la seguridad en parte del proceso de desarrollo y despliegue del modelo, en lugar de una capa separada que se añade después.
El anuncio llega en un momento en que desarrolladores y responsables políticos debaten cómo gestionar modelos cuyos pesos pueden descargarse, modificarse y despojarse de sus salvaguardas integradas. Para los creadores de IA y los equipos empresariales, la alianza podría convertirse en una prueba temprana de si los ecosistemas de modelos abiertos pueden establecer prácticas de seguridad creíbles sin depender del control centralizado de un pequeño número de proveedores de modelos.
Base Labs afirma que desarrollará y publicará métodos para entrenar y supervisar modelos abiertos, con el objetivo a largo plazo de crear un “estándar” de seguridad transparente para el ecosistema de peso abierto. Hugging Face, una importante plataforma de alojamiento para modelos de código abierto y de peso abierto, participa en el esfuerzo, mientras que Goodfire AI aporta experiencia en interpretabilidad de modelos.
Las empresas no han revelado el diseño técnico de la alianza. Eso deja abiertas preguntas básicas sobre si el trabajo producirá puntos de referencia de evaluación, herramientas de despliegue, métodos de entrenamiento, sistemas de monitoreo o una combinación de esos componentes.
El enfoque declarado de Goodfire en hacer que el comportamiento de los modelos sea más comprensible sugiere que la interpretabilidad podría formar parte del marco propuesto. En una respuesta al anuncio de Baseten, Goodfire dijo que la seguridad debe integrarse en los modelos abiertos y ser proporcionada por las organizaciones que los sirven. Ese es un objetivo amplio, no todavía una especificación publicada.
Baseten lanzó Base Labs a principios de 2026 como su brazo de investigación. La empresa también ha invitado a desarrolladores y a otros miembros de la comunidad investigadora a contribuir al marco, lo que indica que quiere que el proyecto vaya más allá de los tres socios fundadores.
El trasfondo inmediato es la creciente preocupación de que las salvaguardas puedan eliminarse de los modelos descargables. TechCrunch informó que una técnica conocida como “abliteration” se está usando cada vez más para desactivar o debilitar el comportamiento de rechazo y otros controles de seguridad. Hugging Face muestra actualmente más de 6.000 modelos identificados como abliterated, según el informe.
Esa cifra refleja el contenido y el etiquetado de un catálogo de plataforma, no una medición independiente de todo el mercado de modelos abiertos. Sin embargo, ilustra la dificultad práctica de tratar el comportamiento de seguridad original de un modelo como algo permanente una vez que sus pesos están disponibles públicamente.
Para los desarrolladores de modelos, el problema cambia la pregunta de seguridad: ya no se trata de si un proveedor ha añadido barandillas, sino de si esas barandillas siguen siendo significativas tras la redistribución o la modificación. Las herramientas de monitoreo también pueden necesitar evaluar cómo se comporta un modelo bajo prompts alterados, ajuste fino, cuantización u otras modificaciones realizadas por usuarios posteriores.
Base Labs sostiene que la apertura puede ayudar a la investigación en seguridad porque terceros pueden inspeccionar el comportamiento del modelo y desarrollar controles más transparentes. Esa es la posición de la empresa, no una conclusión demostrada por esta alianza. El acceso abierto puede mejorar el escrutinio, pero también puede facilitar la eliminación de protecciones o la reproducción de variantes inseguras.
El anuncio confirmado se limita a la formación de la alianza y a la intención declarada de las empresas de construir y publicar métodos de seguridad. No se proporcionó una arquitectura técnica, un calendario de lanzamiento, resultados de evaluación, una lista de modelos ni un proceso de gobernanza en la información disponible.
La señal de mercado más concreta es el catálogo de Hugging Face con más de 6.000 modelos abliterated, según informó TechCrunch. El catálogo indica la escala del desafío al que se enfrenta cualquier esfuerzo que busque mantener propiedades de seguridad a través de una red de distribución abierta, pero no establece cuántos de esos modelos se usan ampliamente o representan un riesgo real medible.
Los recursos financieros de los participantes también aportan contexto, pero no prueban progreso técnico. Baseten recaudó 1.500 millones de dólares en una ronda Serie F en junio, alcanzando una valoración reportada de 13.000 millones de dólares. Goodfire AI recaudó 150 millones de dólares en una ronda Serie B liderada por B Capital a principios de este año. Esas cifras pueden dar al proyecto acceso a capacidad de ingeniería e investigación, pero no validan el estándar propuesto ni su probable adopción.
Dado que los detalles disponibles provienen principalmente del anuncio de las empresas y de informes de medios, las afirmaciones sobre transparencia, participación del ecosistema y futuras mejoras de seguridad deben considerarse como objetivos declarados. Todavía no hay resultados independientes de puntos de referencia que muestren que el enfoque reduce salidas dañinas o sobrevive a la modificación del modelo.
Si Base Labs, Hugging Face y Goodfire producen herramientas utilizables, los creadores de modelos podrían obtener un proceso común para probar el comportamiento antes del lanzamiento y monitorear los modelos después del despliegue. Eso podría ayudar a los equipos a documentar evaluaciones de seguridad, comparar versiones de modelos e identificar cambios causados por el ajuste fino o la distribución posterior.
Para los compradores empresariales, el valor práctico dependerá de si el marco produce pruebas que puedan integrarse en flujos de trabajo de compras, revisión de riesgos y cumplimiento. Una model card o un punto de referencia puntual pueden ser insuficientes para las organizaciones que despliegan modelos actualizados, personalizados o alojados por distintos proveedores. Es probable que los compradores necesiten pruebas reproducibles, trazabilidad de auditoría, seguimiento de versiones e información clara sobre qué protecciones permanecen en un modelo derivado.
La alianza también coloca a Hugging Face en una posición potencialmente influyente. Como gran plataforma de distribución y descubrimiento, puede ayudar a determinar si los metadatos de seguridad y los resultados de evaluación se vuelven visibles en el punto en que los desarrolladores seleccionan modelos. Pero la infraestructura de alojamiento por sí sola no puede garantizar que un modelo descargado conserve sus salvaguardas originales.
Para Base Labs y Goodfire, el proyecto también podría establecer una posición competitiva en un mercado donde la inferencia de modelos, la interpretabilidad y las herramientas de seguridad están cada vez más conectadas. Las empresas tendrán que demostrar que su enfoque es práctico para los desarrolladores de código abierto, no solo para equipos de investigación bien financiados. Las herramientas que sean caras, lentas o difíciles de integrar podrían limitar la adopción incluso si sus evaluaciones son técnicamente sólidas.
La primera señal será un lanzamiento técnico público: una especificación, una suite de puntos de referencia, una receta de entrenamiento, una herramienta de monitoreo o una implementación de referencia. Su alcance revelará si la alianza es principalmente un programa de investigación o un estándar operativo destinado a uso en producción.
Los desarrolladores también deberían vigilar evaluaciones independientes de modelos probados bajo el marco, especialmente después del ajuste fino o de la eliminación de controles de seguridad. La evidencia de que los métodos siguen detectando comportamientos de riesgo en modelos modificados sería más significativa que las simples afirmaciones de lanzamiento.
Otras señales importantes incluyen la participación de creadores de modelos fuera del grupo fundador, la integración con los flujos de trabajo de Hugging Face, los costes y la latencia documentados, y un proceso para actualizar las evaluaciones a medida que surgen nuevas técnicas de ataque. La gobernanza también importará: los socios aún no han explicado quién definirá el comportamiento aceptable, resolverá disputas o mantendrá el marco.
La alianza aborda una debilidad real de la IA de peso abierto: los controles de seguridad son difíciles de preservar una vez que los modelos pueden copiarse y modificarse. Su propuesta central —que la transparencia y las herramientas compartidas pueden mejorar la seguridad— es plausible, pero sigue sin demostrarse hasta que las empresas publiquen métodos que otros puedan reproducir y cuestionar.
Para creadores y equipos empresariales, el anuncio se ve mejor como una propuesta de infraestructura y no como una solución de seguridad terminada. La credibilidad de Base Labs, Hugging Face y Goodfire dependerá menos de la alianza en sí que de si entregan evaluaciones abiertas, resultados medibles y controles que sigan funcionando después de que los modelos abandonen su entorno de desarrollo original.