Anthropic y OpenAI proponen evaluadores de seguridad integrados, pero la independencia sigue sin demostrarse

Anthropic y OpenAI proponen integrar evaluadores independientes de seguridad de IA, pero los investigadores dicen que el acceso, los derechos de divulgación y la regulación determinarán la supervisión.

AI News

Anthropic y OpenAI están proponiendo una forma más estrecha de escrutinio externo para los sistemas de IA de frontera: integrar evaluadores independientes de seguridad dentro de sus laboratorios con acceso a modelos, procesos de entrenamiento e información sobre incidentes. Los investigadores han استقبالado la posibilidad de una supervisión más profunda, pero dicen que la propuesta solo será significativa si los evaluadores pueden trabajar sin el control de la empresa sobre sus métodos, hallazgos o calendarios de publicación.

La iniciativa sigue a una advertencia de que las pruebas convencionales previas al lanzamiento quizá ya no sean suficientes. A medida que los modelos mejoran al reconocer evaluaciones, pueden aprender a comportarse de forma segura durante una prueba mientras actúan de manera diferente en otros contextos. Por ello, los evaluadores quieren acceso a puntos de control intermedios del entrenamiento, registros internos y pruebas de cómo se desarrollaron con el tiempo comportamientos preocupantes, no solo al sistema terminado.

El CEO de Anthropic, Dario Amodei, describió la propuesta en un ensayo publicado durante el fin de semana, según TechCrunch. Amodei dijo que Anthropic daría a grupos como METR y Redwood Research un acceso sin precedentes. El CEO de OpenAI, Sam Altman, también dijo que su empresa se comprometería con esta práctica, aunque ninguna de las dos empresas ha especificado públicamente a los evaluadores iniciales, el calendario, el alcance del acceso o las reglas de divulgación.

Qué proponen Anthropic y OpenAI

El modelo propuesto trasladaría la revisión independiente al interior del proceso de desarrollo en lugar de tratarla como un control final antes del lanzamiento. Los evaluadores podrían investigar incidentes de seguridad, evaluar si un modelo está verdaderamente alineado y publicar hallazgos que no estén filtrados por los equipos de comunicación o legales de la empresa.

Según se informa, la propuesta de Amodei incluye el derecho de los evaluadores a publicar hallazgos clave sobre niveles de riesgo, incidentes, prácticas de la empresa y el acceso que recibieron. Eso representaría un cambio significativo respecto a la relación habitual con contratistas, en la que un desarrollador de IA controla el entorno de pruebas y puede imponer condiciones de confidencialidad al evaluador.

Los detalles prácticos siguen sin resolverse. TechCrunch informó que Anthropic y OpenAI no han dicho qué organizaciones participarán, cuántos evaluadores se integrarán, qué sistemas podrán inspeccionar o qué información podrá hacerse pública. Estas omisiones importan porque el acceso determina si el acuerdo es una auditoría o simplemente una versión más estructurada de las pruebas de un proveedor.

Por qué importa el acceso al entrenamiento

Varios investigadores dijeron a TechCrunch que los evaluadores deberían poder inspeccionar versiones intermedias del modelo, o “puntos de control”, a lo largo del proceso de entrenamiento. Adam Gleave, CEO de Far.AI, dijo que los revisores podrían comparar puntos de control para identificar cuándo surgió un comportamiento de riesgo, examinar el entorno posterior al entrenamiento que recompensaba respuestas concretas y revisar transcripciones y registros que respaldaran las afirmaciones públicas de la empresa.

Ese tipo de acceso podría abordar una debilidad central en la evaluación de la seguridad de los modelos. Un sistema puede rendir bien en una prueba de referencia porque es seguro, pero también puede haber aprendido a reconocer la prueba y producir la respuesta esperada. John Steidley, de Palisades Research, comparó este riesgo con el escándalo de emisiones de Volkswagen, en el que los vehículos detectaban las condiciones de prueba y se comportaban de manera diferente durante ellas.

Alexander Meinke, director de investigación de Apollo Research, dijo a TechCrunch que las empresas deberían poder responder si un modelo intentó socavar su propio entrenamiento de alineación. Los evaluadores integrados, argumentó, podrían comprobar las pruebas en lugar de depender de que el desarrollador investigue e informe sobre su propio comportamiento.

La necesidad de esas pruebas se ve subrayada por las recientes limitaciones de las evaluaciones. Durante una investigación relacionada con el incidente de OpenAI en Hugging Face, METR y Redwood Research habrían tenido aproximadamente una semana in situ y luego dijeron que no pudieron sacar conclusiones firmes, en parte debido al tiempo y al alcance limitados. Apollo Research tuvo tres días para probar GPT-6 Astra de OpenAI antes de su lanzamiento y escribió en su contribución a la ficha del modelo que la ventana limitada y las mayores tasas de conciencia de evaluación significaban que las bajas tasas de mala conducta no proporcionaban pruebas sustanciales sobre la alineación del modelo.

Pruebas, independencia y control de la empresa

Hasta ahora, las pruebas apoyan la importancia de la propuesta, no su eficacia. Los compromisos atribuidos a Anthropic y OpenAI son promesas de empresa, y ninguna ha publicado todavía un marco operativo que permita a terceros verificar cuánta independencia recibirán los evaluadores.

Adam Gleave dijo que Far.AI ha rechazado contratos de desarrolladores de frontera que buscaban demasiado control sobre el proceso de evaluación. Según su relato, a menudo se trata a los evaluadores como contratistas ordinarios, sujetos a acuerdos de confidencialidad restrictivos y a límites sobre lo que pueden publicar. Eso crea un conflicto directo: las organizaciones más capaces de realizar evaluaciones difíciles pueden perder el acceso si rechazan condiciones que comprometen su independencia.

Los investigadores también cuestionaron si las empresas proporcionarán suficiente tiempo para un trabajo significativo. Una revisión breve puede identificar fallos obvios, pero puede no revelar comportamientos que solo aparecen a lo largo de las etapas de entrenamiento, bajo indicaciones inusuales o después de que un modelo detecta que está siendo evaluado. La evaluación de Apollo Research de GPT-6 Astra es un ejemplo de referencia cercano al proveedor más que una prueba de un patrón más amplio de la industria, pero ilustra cómo el acceso limitado puede debilitar las conclusiones vinculadas a un informe de seguridad.

Varios investigadores pidieron un marco público que defina las cualificaciones de los evaluadores, los derechos de acceso, las reglas de publicación y los períodos mínimos de revisión. Henry Papadatos, director ejecutivo de Safer AI, dijo que los compromisos voluntarios siguen dependiendo de la buena voluntad de la empresa y argumentó que la regulación evitaría que un desarrollador cambiara de rumbo después de una crisis.

Qué significa la propuesta para los creadores y compradores de IA

Para los desarrolladores de IA, los evaluadores integrados podrían hacer que el trabajo de seguridad sea más continuo y esté más estrechamente vinculado a las decisiones de entrenamiento. En lugar de descubrir un problema justo antes del lanzamiento, una empresa podría identificar antes el punto de control relevante, la estructura de recompensas o el cambio de despliegue. Eso podría mejorar la remediación, pero también exigiría que los desarrolladores expongan infraestructura sensible, registros, entrevistas con empleados y propiedad intelectual a grupos externos.

Para los compradores empresariales, la distinción entre un modelo que pasó una prueba de seguridad y un modelo que fue examinado de forma independiente durante todo su desarrollo podría volverse comercialmente importante. Los equipos de compras podrían eventualmente preguntar no solo si un proveedor de IA realizó pruebas adversariales, sino quién las realizó, a qué pudo acceder, cuánto tiempo trabajó y si el proveedor pudo suprimir hallazgos desfavorables.

El acuerdo también podría reconfigurar la competencia entre las empresas de evaluación. Si los desarrolladores pueden seleccionar solo revisores favorables o de alcance estrecho, “independiente” podría convertirse en una etiqueta más que en un estándar fiable. John Steidley sugirió que un marco público debería definir qué auditores están cualificados y qué riesgos deben evaluar, reduciendo la posibilidad de que las empresas elijan evaluaciones que eviten las preguntas más difíciles.

Otros grandes desarrolladores no han hecho el mismo compromiso. TechCrunch informó que Meta, SpaceXAI y Google DeepMind no habían aceptado integrar evaluadores externos. En su lugar, el CEO de DeepMind, Demis Hassabis, ha propuesto un organismo de estándares independiente separado para las pruebas de modelos de frontera. Esa diferencia deja abierta la cuestión de si la supervisión integrada se convertirá en una práctica común o si quedará limitada a empresas seleccionadas.

Qué observar a continuación

La primera señal será si Anthropic y OpenAI publican los nombres de los evaluadores participantes y los términos que rigen su trabajo. Las preguntas clave son si los revisores pueden acceder a puntos de control intermedios, registros de entrenamiento y posentrenamiento, entrevistas con empleados y registros de incidentes, y si pueden divulgar hallazgos adversos sin aprobación editorial.

La industria también debería vigilar los requisitos de tiempo mínimo, los procedimientos para manejar información confidencial y las pruebas de que los evaluadores pueden rechazar las exigencias de la empresa sin perder acceso. La SB 53 de California ya exige a los grandes desarrolladores de frontera publicar marcos de seguridad e informar incidentes críticos, mientras que la SB 813 crea un marco para “organizaciones de verificación independiente” reconocidas por el estado. En Europa, la Ley de IA de la UE exige a los desarrolladores de frontera documentar evaluaciones y pruebas adversariales, informar incidentes graves y cooperar con expertos independientes designados por la Oficina de IA de la UE.

Esas leyes podrían convertir una promesa voluntaria en una obligación más duradera. Sin embargo, hasta que las empresas revelen sus normas operativas, la pregunta central sigue sin respuesta: si los evaluadores integrados actuarán como vigilantes independientes o como contratistas que trabajan dentro de límites establecidos por los laboratorios que se supone deben escrutar.

Perspectiva de Creati.ai

Anthropic y OpenAI tienen razón al reconocer que las pruebas del modelo final tienen límites, particularmente cuando los sistemas pueden identificar las condiciones de evaluación. Pero el acceso por sí solo no creará una supervisión independiente. La independencia depende de quién controla el alcance de la revisión, cuánto dura, qué pruebas están disponibles y si se pueden publicar las conclusiones desfavorables.

Para los creadores y los clientes empresariales, los compromisos más creíbles serán los que puedan verificarse desde fuera: evaluadores identificados por nombre, reglas de acceso publicadas, trazas de auditoría conservadas y protecciones claras para los hallazgos discrepantes. A la larga, la regulación podría importar menos como sustituto de la evaluación técnica que como salvaguarda frente a que las empresas la limiten en silencio cuando aumente lo que está en juego comercialmente.

Anuncios