Vals recauda 40 millones de dólares para hacer que la evaluación comparativa de IA sea más resistente a las trampas

Vals, respaldada por Andreessen Horowitz, recaudó 40 millones de dólares para crear una evaluación comparativa de IA confidencial y basada en tareas para empresas y agencias federales, mientras que las pruebas más antiguas s…

AI News

La startup de evaluación comparativa de IA Vals está tratando de convertir la evaluación de modelos en una capa más práctica y confiable del mercado de la IA después de recaudar una Serie A de 40 millones de dólares liderada por Andreessen Horowitz. La empresa sostiene que muchas pruebas establecidas ya no son suficientes para juzgar modelos cada vez más capaces, especialmente cuando las empresas pueden ver el material de la prueba con antelación.

Vals evalúa sistemas de IA en tareas complejas y específicas de un dominio, en lugar de confiar solo en exámenes públicos de conocimiento general. Su enfoque está diseñado para ayudar a los desarrolladores de modelos a identificar debilidades, ayudar a los compradores a comparar sistemas para trabajos reales y dar a reguladores o inversores pruebas más significativas sobre rendimiento y riesgo.

Un modelo diferente para la evaluación de la IA

Fundada en 2024, Vals nació después de que su cofundador y director ejecutivo, Rayan Krishnan, observara que los benchmarks académicos tenían dificultades para seguir el ritmo de las nuevas capacidades de los modelos. En comentarios recogidos por TechCrunch, Krishnan dijo que la industria estaba lanzando modelos capaces más rápido de lo que los sistemas de evaluación tradicionales podían medirlos.

Las pruebas de la empresa están pensadas para parecerse al trabajo profesional en áreas como derecho, finanzas y programación. En lugar de preguntar solo si un modelo puede responder preguntas difíciles, Vals dice que examina si el sistema puede producir un trabajo comparable en calidad al de una persona dentro de un campo concreto.

Una característica destacada es que Vals no divulga públicamente los materiales específicos utilizados en sus pruebas. El razonamiento de la empresa es que los benchmarks totalmente públicos pueden convertirse en objetivos de optimización o entrenamiento. Un modelo puede parecer mejorar en una prueba sin demostrar una mejora comparable en un trabajo más amplio y no visto.

Vals también afirma que sus evaluaciones consideran resultados dañinos o no deseados, no solo la finalización exitosa de tareas. Sus áreas de interés reportadas incluyen ciberseguridad, bioseguridad, salud mental, auto-mejora recursiva y el derecho de los conflictos armados. La evidencia proporcionada no detalla la metodología, los sistemas de puntuación ni la validación independiente de cada uno de esos programas.

Lo que muestran la financiación y las cifras de crecimiento

La Serie A sigue a una ronda semilla anterior liderada por 8VC y Bloomberg Beta. TechCrunch informó que la financiación más reciente de Vals se completó en el mes anterior a su artículo de septiembre de 2026 y que la empresa ahora tiene un equipo de 25 personas, frente a ocho a comienzos de año.

Esas cifras de crecimiento, junto con la afirmación de la empresa de que sus ingresos son ocho veces mayores que el año pasado, fueron comunicadas a través de Krishnan y deben tratarse como métricas reportadas por la empresa, no como pruebas auditadas de forma independiente. El material de origen disponible no identifica a los clientes de Vals, los ingresos totales, el volumen de pruebas ni el número de modelos evaluados.

La empresa gana dinero cobrando a los desarrolladores de IA por evaluar sus modelos. Eso crea una relación potencialmente útil pero delicada: la parte que paga la prueba es también la parte cuyo sistema está siendo juzgado. Vals presenta el servicio como una herramienta de desarrollo y control de calidad, comparándolo con pagar por un examen estandarizado que revela dónde se necesita mejorar.

La empresa también ha lanzado un programa centrado en proporcionar evaluaciones de modelos a agencias federales. El material de origen no especifica qué agencias están participando ni si el programa ha producido resultados públicos.

Por qué la neutralidad de los benchmarks importa a los compradores

Para los creadores de IA, el valor de una evaluación depende de si predice el rendimiento fuera del entorno de prueba. Un benchmark público puede ser fácil de comunicar, pero puede ser menos útil si los modelos han sido ajustados con sus preguntas o si la prueba mide conocimiento abstracto en lugar de un flujo de trabajo real.

El modelo basado en tareas de Vals podría ser más relevante para los compradores de IA empresarial que eligen sistemas para revisión legal, análisis financiero, desarrollo de software u otras tareas operativas. Un comprador puede preocuparse menos por la posición de un modelo en una clasificación general que por si completa un flujo de trabajo definido de forma precisa, constante y con modos de fallo aceptables.

Eso convierte la calidad de la evaluación en un asunto de implementación, no solo de marketing. Los equipos de producto necesitan saber dónde falla un modelo, con qué frecuencia requiere intervención humana y si un resultado aparentemente sólido oculta problemas de seguridad o fiabilidad. Las pruebas confidenciales pueden reducir las trampas en los benchmarks, pero también dificultan el escrutinio externo. Los compradores necesitarán suficiente transparencia metodológica para entender qué significa una puntuación sin recibir las respuestas de la prueba.

Las apuestas comerciales pueden crecer a medida que los sistemas de IA se integran en los procesos empresariales. Si las evaluaciones de modelos comienzan a influir en la contratación, los informes públicos, las decisiones de inversión o las revisiones regulatorias, las organizaciones que producen esas evaluaciones se verán presionadas para demostrar independencia, repetibilidad y resistencia a los conflictos de interés.

Evidencia, límites y presión competitiva

El caso de Vals se basa principalmente en el problema que identifica y en el enfoque que la empresa describe. TechCrunch informó de la descripción de Krishnan sobre un mercado en el que los benchmarks antiguos se están quedando atrás frente a los modelos modernos, pero la fuente no ofrece resultados comparativos que muestren que las pruebas de Vals son más predictivas o más difíciles de manipular que los sistemas de la competencia.

Tampoco hay evidencia independiente en la cobertura disponible de que Vals se haya convertido en el evaluador preferido de la industria. Su financiación de Andreessen Horowitz y de anteriores inversores es una señal de confianza de los inversores, no una prueba de precisión del benchmark o de adopción en el mercado. Del mismo modo, el crecimiento de ingresos reportado y la expansión a evaluaciones para agencias federales indican un impulso atribuido por la empresa, pero no establecen una aceptación amplia por parte de los clientes.

Vals también tendrá que competir con desarrolladores de modelos, laboratorios de investigación, comunidades de benchmarks abiertos, empresas especializadas en pruebas y equipos internos de evaluación. Algunas organizaciones pueden preferir pruebas públicas transparentes, mientras que otras pagarán por evaluaciones privadas que reflejen sus propios datos y flujos de trabajo. El reto de la empresa es demostrar que su proceso controlado produce información que los clientes no pueden obtener mediante pruebas internas o plataformas de evaluación existentes.

Qué vigilar a continuación

Las señales más claras serán pruebas públicas de cómo Vals califica los modelos y de si esas puntuaciones se correlacionan con el rendimiento en producción. Los compradores deberían fijarse en la metodología divulgada, estudios de repetibilidad, comparaciones de modelos realizadas en condiciones consistentes y ejemplos de evaluaciones que cambien decisiones de despliegue o adquisición.

Su programa para agencias federales es otra prueba importante. Participantes nombrados, hallazgos publicados o relaciones formales de contratación proporcionarían evidencia más sólida que un simple anuncio. La contratación planificada y la expansión de oficinas de la empresa pueden mostrar actividad comercial continua, pero la retención de clientes y el volumen recurrente de evaluaciones importarán más que el número de empleados.

El mercado también debería observar si Vals puede mantener la confidencialidad sin convertirse en una caja negra. Si sus evaluaciones influyen en afirmaciones sobre seguridad, capacidad o valor de inversión, la supervisión independiente y las explicaciones claras de la puntuación se convertirán en elementos centrales de su credibilidad.

Perspectiva de Creati.ai

Vals entra en el mercado en un momento oportuno: las empresas de IA necesitan cada vez más evaluaciones que reflejen el trabajo que realmente realizan las personas, mientras que los compradores se muestran cada vez más escépticos ante las ganancias en los rankings que no se traducen en implementaciones fiables. Su enfoque en pruebas ocultas y tareas específicas de dominio aborda debilidades reales de la evaluación comparativa pública.

Pero convertirse en un estándar de confianza requiere más que respaldo de capital riesgo y rápido crecimiento. Vals tendrá que demostrar que sus evaluaciones privadas son rigurosas, reproducibles y lo bastante transparentes para que clientes y terceros puedan valorar su significado. La siguiente fase de la empresa se definirá menos por la ambición de su catálogo de benchmarks que por si sus resultados mejoran de forma fiable las decisiones sobre qué modelos de IA construir, comprar y desplegar.

Anuncios