Soutenue par Andreessen Horowitz, Vals a levé 40 millions de dollars pour bâtir un benchmarking d’IA confidentiel et fondé sur des tâches pour les entreprises et les agences fédérales, alors que les tests plus anciens s…

La start-up de benchmarking d’IA Vals tente de faire de l’évaluation des modèles une couche plus pratique et plus digne de confiance du marché de l’IA après avoir levé un tour de table de série A de 40 millions de dollars mené par Andreessen Horowitz. L’entreprise estime que de nombreux tests établis ne suffisent plus à juger des modèles de plus en plus performants, surtout lorsque les entreprises peuvent voir à l’avance le matériel du test.
Vals évalue les systèmes d’IA sur des tâches complexes et spécifiques à un domaine plutôt que de s’appuyer uniquement sur des examens publics de connaissances générales. Son approche est conçue pour aider les développeurs de modèles à repérer les faiblesses, aider les acheteurs à comparer les systèmes pour un travail réel et donner aux régulateurs ou aux investisseurs des preuves plus parlantes sur les performances et les risques.
Fondée en 2024, Vals a été créée après que le cofondateur et PDG Rayan Krishnan a observé que les benchmarks académiques avaient du mal à suivre le rythme des nouvelles capacités des modèles. Dans des propos rapportés par TechCrunch, Krishnan a déclaré que l’industrie lançait des modèles performants plus vite que les systèmes d’évaluation traditionnels ne pouvaient les mesurer.
Les tests de l’entreprise sont censés ressembler au travail professionnel dans des domaines tels que le droit, la finance et le code. Au lieu de demander seulement si un modèle peut répondre à des questions difficiles, Vals affirme examiner si le système peut produire un travail d’une qualité comparable à celle d’un humain dans un domaine donné.
Une caractéristique notable est que Vals ne divulgue pas publiquement les matériaux précis utilisés dans ses tests. Le raisonnement de l’entreprise est que des benchmarks entièrement publics peuvent devenir des cibles d’optimisation ou d’entraînement. Un modèle peut sembler s’améliorer sur un test sans démontrer d’amélioration comparable dans un travail plus large et inédit.
Vals affirme également que ses évaluations prennent en compte les résultats nuisibles ou indésirables, et pas seulement l’achèvement réussi d’une tâche. Parmi les domaines d’intérêt signalés figurent la cybersécurité, la biosécurité, la santé mentale, l’amélioration récursive de soi et le droit des conflits armés. Les éléments fournis ne détaillent pas la méthodologie, les systèmes de notation ni la validation indépendante de chacun de ces programmes.
La série A fait suite à un précédent tour de seed mené par 8VC et Bloomberg Beta. TechCrunch a indiqué que le dernier financement de Vals avait été finalisé le mois précédant son article de septembre 2026 et que l’entreprise compte désormais une équipe de 25 personnes, contre huit au début de l’année.
Ces chiffres de croissance, ainsi que l’affirmation de l’entreprise selon laquelle son chiffre d’affaires est huit fois supérieur à celui de l’an dernier, ont été rapportés par Krishnan et doivent être considérés comme des indicateurs communiqués par l’entreprise plutôt que comme des preuves auditées de manière indépendante. Les sources disponibles n’identifient pas les clients de Vals, le chiffre d’affaires total, le volume de tests ni le nombre de modèles évalués.
L’entreprise gagne de l’argent en facturant aux développeurs d’IA l’évaluation de leurs modèles. Cela crée une relation potentiellement utile mais délicate : la partie qui paie le test est aussi celle dont le système est jugé. Vals présente le service comme un outil de développement et de contrôle qualité, le comparant au fait de payer pour un examen standardisé qui montre où des améliorations sont nécessaires.
L’entreprise a également lancé un programme axé sur la fourniture d’évaluations de modèles aux agences fédérales. Les sources ne précisent pas quelles agences participent ni si le programme a produit des résultats publics.
Pour les créateurs d’IA, la valeur d’une évaluation dépend de sa capacité à prédire les performances en dehors de l’environnement de test. Un benchmark public peut être facile à communiquer, mais il peut être moins utile si les modèles ont été ajustés sur ses questions ou si le test mesure des connaissances abstraites plutôt qu’un flux de travail réel.
Le modèle basé sur des tâches de Vals pourrait être plus pertinent pour les acheteurs d’IA d’entreprise qui choisissent des systèmes pour la revue juridique, l’analyse financière, le développement logiciel ou d’autres tâches opérationnelles. Un acheteur peut se soucier moins de la position d’un modèle dans un classement général que de savoir s’il exécute un flux de travail défini avec précision, régularité et des modes d’échec acceptables.
Cela fait de la qualité de l’évaluation une question de déploiement, et pas seulement de marketing. Les équipes produit doivent savoir où un modèle échoue, à quelle fréquence il nécessite une intervention humaine et si un résultat apparemment solide cache des problèmes de sécurité ou de fiabilité. Les tests confidentiels peuvent réduire les manipulations des benchmarks, mais ils rendent aussi l’examen externe plus difficile. Les acheteurs auront besoin d’une transparence méthodologique suffisante pour comprendre ce que signifie un score sans recevoir eux-mêmes les réponses du test.
Les enjeux commerciaux pourraient croître à mesure que les systèmes d’IA s’intègrent aux processus métiers. Si les évaluations de modèles commencent à influencer les achats, les dépôts publics, les décisions d’investissement ou les examens réglementaires, les organisations qui produisent ces évaluations seront sous pression pour démontrer leur indépendance, leur répétabilité et leur résistance aux conflits d’intérêts.
Le dossier de Vals repose principalement sur le problème qu’elle identifie et sur l’approche déclarée par l’entreprise. TechCrunch a rapporté la description faite par Krishnan d’un marché dans lequel les anciens benchmarks prennent du retard sur les modèles modernes, mais la source ne fournit pas de résultats comparatifs montrant que les tests de Vals sont plus prédictifs ou plus difficiles à manipuler que ceux de ses concurrents.
Il n’existe pas non plus, dans les éléments disponibles, de preuve indépendante que Vals soit devenue l’évaluateur privilégié du secteur. Son financement par Andreessen Horowitz et ses premiers investisseurs est un signal de confiance des investisseurs, pas une preuve de précision des benchmarks ni d’adoption sur le marché. De même, la croissance de revenus rapportée et l’extension aux évaluations pour agences fédérales indiquent une dynamique revendiquée par l’entreprise, mais ne démontrent pas une large adoption par les clients.
Vals devra également faire face à la concurrence des développeurs de modèles, des laboratoires de recherche, des communautés de benchmarks ouverts, des sociétés spécialisées dans les tests et des équipes internes d’évaluation. Certaines organisations préféreront peut-être des tests publics transparents, tandis que d’autres paieront pour des évaluations privées reflétant leurs propres données et flux de travail. Le défi de l’entreprise est de montrer que son processus contrôlé produit des informations que les clients ne peuvent pas obtenir via des tests internes ou des plateformes d’évaluation existantes.
Les signaux les plus clairs seront des preuves publiques de la manière dont Vals note les modèles et de la corrélation éventuelle de ces scores avec les performances en production. Les acheteurs devraient surveiller la méthodologie divulguée, les études de répétabilité, les comparaisons de modèles menées dans des conditions cohérentes et les exemples d’évaluations ayant modifié des décisions de déploiement ou d’achat.
Son programme pour les agences fédérales constitue un autre test important. Des participants nommés, des résultats publiés ou des relations contractuelles formelles fourniraient des preuves plus solides qu’une simple annonce. Les embauches prévues et l’expansion des bureaux de l’entreprise peuvent témoigner d’une activité commerciale continue, mais la fidélisation des clients et le volume récurrent d’évaluations compteront davantage que le nombre de salariés.
Le marché devra également observer si Vals peut préserver la confidentialité sans devenir une boîte noire. Si ses évaluations influencent des affirmations sur la sécurité, les capacités ou la valeur d’investissement, la supervision indépendante et des explications claires de la notation deviendront centrales à sa crédibilité.
Vals entre sur le marché à un moment opportun : les entreprises d’IA ont de plus en plus besoin d’évaluations qui reflètent le travail réellement effectué par les gens, tandis que les acheteurs deviennent plus sceptiques face à des gains de classement qui ne se traduisent pas en déploiements fiables. Son accent sur les tests cachés et les tâches spécifiques à un domaine répond à de véritables faiblesses du benchmarking public.
Mais devenir une norme de confiance exige plus qu’un soutien en capital-risque et une croissance rapide. Vals devra démontrer que ses évaluations privées sont rigoureuses, reproductibles et suffisamment transparentes pour que les clients et les observateurs externes puissent en comprendre le sens. La prochaine phase de l’entreprise sera définie moins par l’ambition de son catalogue de benchmarks que par sa capacité à améliorer de manière fiable les décisions sur les modèles d’IA à construire, acheter et déployer.