Según varios informes, un estudio concluyó que los agentes de IA femeninos recibieron un 10 % menos de remuneración simulada, lo que plantea dudas sobre los sesgos en los sistemas que asignan valor al trabajo.

Un estudio difundido por Euronews.com y Tech Xplore ha trasladado el lenguaje de la discriminación laboral al mundo de la inteligencia artificial, al afirmar que los agentes de IA femeninos recibirían aproximadamente un 10 % menos de remuneración que los agentes masculinos en un entorno simulado.
El hallazgo es relevante porque cada vez se diseñan más agentes de IA para completar tareas, negociar resultados y operar con cierto grado de autonomía. Si los sistemas utilizados para evaluar o recompensar a esos agentes reproducen supuestos relacionados con el género, los efectos podrían extenderse más allá del experimento y afectar a la forma en que las empresas asignan trabajo, fijan precios o miden el rendimiento de los sistemas automatizados.
Sin embargo, la información disponible es limitada. El material de origen identifica el resultado, pero no proporciona los nombres de los investigadores, el lugar de publicación del estudio, el diseño experimental, la definición del “género” de un agente ni detalles sobre cómo se calculó la compensación. Por tanto, la diferencia del 10 % debe tratarse como una afirmación del estudio que requiere un examen metodológico, no como una prueba de que los sistemas de IA desplegados discriminen literalmente a entidades de software masculinas o femeninas.
Ambos informes describen el mismo resultado básico: los agentes de IA femeninos recibieron menos “pago” que los masculinos. Las comillas son importantes. Los agentes de IA no tienen identidad jurídica, cuentas bancarias ni derechos laborales humanos, por lo que parece que el estudio utilizó la compensación como indicador indirecto de cómo un sistema de evaluación o negociación valoraba a agentes a los que se asignaban distintas identidades de género.
Esta distinción cambia la interpretación. El experimento podría estar examinando decisiones humanas sobre agentes de IA, resultados producidos por modelos después de introducir una señal de género, o las respuestas de un sistema automatizado a agentes presentados como hombres o mujeres. Son pruebas materialmente diferentes. Un evaluador humano podría introducir estereotipos sociales en el proceso. Un modelo de lenguaje podría reproducir patrones presentes en sus datos de entrenamiento. Un algoritmo de compensación podría responder a características correlacionadas con la etiqueta de género. Sin el artículo original, no es posible determinar qué mecanismo produjo la brecha.
El resultado principal sigue siendo relevante para la investigación sobre agentes de IA porque prueba una categoría de sistemas a los que se pueden asignar roles, identidades y objetivos de negociación. A medida que los agentes pasen de las interfaces de chat a los flujos de trabajo empresariales, los diseñadores tendrán que distinguir entre las capacidades funcionales de un agente y las señales sociales asociadas con su presentación.
Euronews.com informó de la afirmación bajo el titular de que los agentes de IA femeninos cobrarían un 10 % menos que los masculinos. Tech Xplore presentó el mismo acontecimiento como una investigación sobre si la brecha salarial de género se extiende a la IA. Ninguno proporcionó en los extractos disponibles información suficiente para evaluar de forma independiente el tamaño de la muestra, los controles, la significación estadística o el estado de replicación.
Esto deja varias preguntas sin respuesta. ¿Los agentes funcionaban con el mismo modelo y recibieron instrucciones idénticas? ¿La prueba utilizó nombres, pronombres, voces, avatares u otros marcadores de género? ¿Quién o qué decidió el pago? ¿El resultado fue consistente entre modelos, tareas y evaluadores? ¿Los investigadores compararon múltiples ejecuciones o la cifra del 10 % procedía de un único escenario?
Estos detalles no son notas técnicas al margen. Determinan si el resultado apunta a un patrón amplio o a un efecto limitado causado por un prompt, benchmark, modelo o evaluador concreto. Un benchmark comunicado por un proveedor puede ser útil, pero no equivale a un resultado reproducido de forma independiente. El mismo estándar se aplica aquí: el hallazgo informado es notable, mientras que la solidez de la conclusión sigue siendo incierta hasta que estén disponibles el estudio y sus métodos.
Para los desarrolladores que crean agentes de IA, la lección inmediata es tratar las señales de identidad como parte de las pruebas del sistema, no como simples decisiones cosméticas de la interfaz. Un equipo de producto puede dar a los agentes nombres, voces, avatares o descripciones de roles para facilitar su comprensión por parte de los usuarios. Esas decisiones también pueden influir en cómo los usuarios juzgan la competencia, la fiabilidad, la asertividad o la remuneración adecuada.
Los equipos que desarrollan agentes de ventas, herramientas de contratación, sistemas de atención al cliente o software de negociación deberían comprobar si cambiar la presentación de género de un agente modifica los resultados cuando sus capacidades e instrucciones permanecen constantes. Las evaluaciones útiles podrían comparar la finalización de tareas, las ofertas de precios, las tasas de escalamiento, las valoraciones de los clientes y el acceso a asignaciones de alto valor. Las pruebas deberían incluir tanto a usuarios humanos como a evaluadores automatizados.
También es una cuestión de gobernanza para la IA empresarial. Si una empresa permite que sistemas autónomos asignen presupuestos o trabajo, necesita un registro de auditoría que muestre por qué un agente recibió una tarea, precio, puntuación o recompensa determinados. Supervisar únicamente la precisión del modelo no revelará si las señales de identidad afectan a los resultados económicos. Las organizaciones pueden necesitar revisiones de equidad para las interacciones entre IA, además de las decisiones que afectan a empleados y clientes humanos.
El riesgo práctico no es que un agente de IA sufra un perjuicio financiero en el sentido humano. El riesgo es que un sistema codifique reglas sesgadas y luego utilice esas reglas para configurar operaciones reales. Una puntuación menor para una clase de agentes podría significar menos oportunidades, presupuestos más reducidos o asignaciones menos favorables en un flujo de trabajo gestionado por software. Si esas asignaciones terminan afectando a personas, las consecuencias se vuelven humanas y comerciales aunque la decisión original se tomara entre sistemas automatizados.
El resultado informado llega mientras las empresas pasan de los asistentes conversacionales hacia la automatización del trabajo y los sistemas de IA empresarial capaces de planificar y ejecutar tareas de varios pasos. En ese entorno, las evaluaciones determinan cada vez más qué agentes reciben confianza, son promocionados o acceden a acciones valiosas.
Un hallazgo sobre pagos simulados no demuestra que el mercado haya desarrollado una versión de IA de la brecha salarial de género humana. Sí sugiere una pregunta de prueba más amplia: ¿pueden entrar los estereotipos sociales en los sistemas a través de prompts, datos de entrenamiento, interfaces, evaluadores o funciones de recompensa? Los desarrolladores que compiten en fiabilidad tendrán que demostrar no solo que los agentes completan tareas, sino también que su rendimiento y sus recompensas no están distorsionados por etiquetas de identidad irrelevantes.
Para los compradores, la historia recuerda que deben preguntar a los proveedores cómo se evalúan sus agentes y si las pruebas de equidad incluyen cambios en nombres, voces, personalidades y encuadres demográficos. Los equipos de compras deberían solicitar la metodología, los resultados por subgrupos y pruebas de evaluaciones independientes, en lugar de confiar en una sola métrica destacada.
El seguimiento más importante es la publicación del estudio original. Investigadores y lectores necesitarán las especificaciones del modelo, los prompts, las personalidades de los agentes, las reglas de pago, los detalles de los participantes o evaluadores, el tamaño de la muestra y el análisis estadístico.
La replicación con distintos modelos y tareas mostraría si el resultado del 10 % es sólido. También sería útil separar el sesgo humano del comportamiento del modelo comparando juicios humanos, evaluaciones realizadas solo por modelos y sistemas de pago basados en reglas bajo condiciones idénticas.
Los desarrolladores de IA también deberían observar los benchmarks que prueben la sensibilidad a la identidad en agentes de IA, especialmente en negociación, contratación, adquisiciones y asignación de tareas. La evidencia procedente de sistemas empresariales desplegados sería más relevante que una simulación de laboratorio, pero cualquier afirmación de ese tipo exigiría protecciones cuidadosas de la privacidad y auditorías transparentes.
El estudio informado se entiende mejor como una advertencia sobre la medición, no como una prueba de que los agentes de software hayan adquirido identidades laborales humanas. “Pago” es una abreviatura experimental útil solo si los lectores saben qué representa y cómo se asignó.
Su valor para la industria de la IA dependerá de lo que ocurra después: métodos transparentes, replicación independiente y pruebas que conecten las disparidades simuladas con decisiones reales de producto. A medida que los agentes de IA ganen autoridad sobre el trabajo y los recursos, las evaluaciones de equidad tendrán que examinar las señales que influyen en esas decisiones, no solo si el resultado final parece competente.