
La start-up d’IA londonienne Inherent affirme que son nouvel agent, Faraday, a surpassé des systèmes plus grands d’Anthropic et d’OpenAI en reproduisant de manière indépendante les résultats d’articles scientifiques publiés. Cette annonce marque la première démonstration publique de l’entreprise depuis sa sortie du mode furtif avec une levée de fonds d’amorçage de 50 millions de dollars et offre un premier test de son ambition de construire des systèmes d’IA qui contribuent à la découverte scientifique.
La comparaison est notable car Inherent affirme que Faraday fonctionne sur Qwen 3.6, un modèle doté de 27 milliards de paramètres. La start-up l’a mis en concurrence avec Claude Opus 4.8 d’Anthropic et GPT-5.5 d’OpenAI, qu’Inherent décrit comme des modèles frontier beaucoup plus grands. Cependant, les résultats de performance sont rapportés par l’entreprise via TechCrunch, et les éléments disponibles n’incluent ni méthodologie de benchmark publique ni validation indépendante.
Faraday a été conçu pour reproduire les résultats d’articles scientifiques sans recevoir à l’avance la réponse attendue. Edward Hughes, cofondateur et scientifique en chef d’Inherent, a expliqué à TechCrunch que la reproduction d’articles est un exercice initial standard pour les scientifiques humains, y compris les doctorants.
La start-up dit avoir évalué davantage que la simple capacité d’un agent à obtenir un résultat correct. Elle voulait aussi que Faraday démontre ce que Hughes a appelé le « research taste » : la capacité à identifier des expériences pertinentes et à faire des choix sensés sur la manière de les mener.
Cette distinction compte pour l’IA orientée recherche. Un système qui suit une procédure fixe peut vérifier un résultat existant, mais un collaborateur scientifique utile doit décider quelles questions méritent du temps, quelles variables tester et à quel moment les preuves sont suffisamment solides pour justifier une conclusion. L’objectif à long terme d’Inherent est un agent scientifique IA capable d’opérer dans plusieurs domaines scientifiques, plutôt qu’un outil limité à un seul benchmark ou à une seule discipline.
Inherent attribue en partie le résultat rapporté de Faraday à l’utilisation de l’apprentissage par renforcement. Plutôt que de s’appuyer principalement sur des données d’entraînement expliquant comment les scientifiques mènent leurs recherches, l’entreprise dit récompenser les agents pour l’obtention de résultats utiles. Cette approche est destinée à aider le système à acquérir des instincts de décision plus larges, y compris le jugement que la start-up associe au research taste.
Ce choix reflète aussi une stratégie produit délibérée. Inherent ne développe pas d’outil de codage dédié pour Faraday. Selon l’entreprise, l’agent utilise GPT-5.5 Codex d’OpenAI pour les tâches de programmation, de manière similaire à la façon dont les chercheurs humains s’appuient sur des logiciels existants plutôt que de créer eux-mêmes chaque outil.
Cette architecture pourrait être importante pour les équipes qui construisent des agents scientifiques et techniques. Le système le plus performant n’est peut-être pas un seul modèle monolithique. Il pourrait plutôt s’agir d’un modèle de raisonnement plus petit relié à des outils spécialisés, à des systèmes de codage, à des environnements d’expérimentation et à des boucles d’évaluation. La comparaison rapportée de Faraday ne prouve pas que cette approche soit globalement supérieure, mais elle fournit un exemple concret du compromis qu’Inherent explore.
L’affirmation centrale en matière de performance provient d’Inherent et a été relayée par TechCrunch. Les sources disponibles ne précisent ni le nombre d’articles testés, ni les domaines scientifiques représentés, ni les critères de notation, ni le degré de supervision humaine, ni si les systèmes d’Anthropic et d’OpenAI ont été exécutés dans des conditions identiques d’outils et de calcul.
Ces détails sont essentiels lorsqu’on compare des agents de recherche. La reproduction d’articles peut varier considérablement en difficulté selon que le code source, les jeux de données, les protocoles de laboratoire et les ressources de calcul sont disponibles. Les résultats peuvent également dépendre de la manière dont l’agent est sollicité, de la façon dont les expériences échouées sont gérées et de la question de savoir si les évaluateurs jugent uniquement la réponse finale ou la qualité du processus expérimental.
L’utilisation d’un modèle de 27 milliards de paramètres reste néanmoins un signal important rapporté par le fournisseur. Si elle était reproduite indépendamment, cette performance suggérerait que la taille du modèle seule n’est pas un indicateur fiable des performances dans des flux de travail scientifiques à long horizon. Elle pourrait aussi indiquer que l’apprentissage par renforcement et l’orchestration d’outils contribuent autant que l’échelle du modèle de base pour cette tâche précise.
Le discours d’Inherent va volontairement au-delà d’un simple résultat de classement. Hughes a déclaré à TechCrunch que battre les systèmes frontier importait moins pour l’entreprise que la manière dont Faraday a été conçu. Il a décrit l’agent visé comme un collaborateur capable de revenir avec des expériences et des résultats inattendus, plutôt qu’un système qui produit simplement des réponses conçues pour satisfaire son utilisateur.
Pour les développeurs d’IA, Faraday met en lumière une question de conception de plus en plus importante : faut-il optimiser les agents pour la qualité conversationnelle, la précision aux benchmarks, ou la capacité à prendre des décisions et à apprendre sur de მრ nombreuses étapes ? La recherche scientifique révèle des faiblesses plus faciles à masquer dans des flux de travail plus courts, notamment la mauvaise sélection des expériences, une planification fragile, des hypothèses non vérifiées et une tendance à présenter des conclusions confiantes mais non étayées.
Un modèle plus petit pourrait réduire le coût de déploiement des agents de recherche, en particulier lorsque le flux de travail exige de nombreuses expériences ou des appels répétés à un modèle. Mais une taille moindre du modèle ne signifie pas automatiquement un coût total plus faible. L’utilisation d’outils, l’exécution de code, les échecs d’exécution, l’accès aux données, la revue humaine et l’infrastructure peuvent dominer l’économie d’un agent qui fonctionne pendant des heures ou des jours.
Les acheteurs d’entreprise devraient donc considérer Faraday comme un signal précoce plutôt que comme un remplaçant prêt à l’emploi pour les chercheurs. Les questions pratiques seront de savoir si le système produit un travail reproductible, expose ses hypothèses, conserve une piste d’audit et sait quand il ne dispose pas de preuves suffisantes. Ces exigences s’appliquent à la découverte de médicaments, à la recherche sur les matériaux, à l’ingénierie et aux équipes internes de R&D, où un résultat séduisant a moins de valeur qu’un résultat vérifiable.
Les projets de recrutement d’Inherent placent également le produit sur un marché concurrentiel pour les talents avancés en IA. L’entreprise compte environ une douzaine d’employés travaillant en présentiel à Londres et prévoit d’atteindre environ 20 à 25 personnes d’ici la fin de l’année, selon le rapport de TechCrunch. Hughes a également critiqué les restrictions britanniques de garden leave, affirmant qu’elles avaient affecté sa propre capacité à quitter un poste précédent.
Le suivi le plus important sera une évaluation reproductible de manière indépendante de Faraday face à Claude Opus 4.8 et GPT-5.5. Inherent renforcerait sa revendication en publiant l’ensemble des articles, les prompts, les configurations d’outils, les budgets de calcul, les taux d’échec et le processus de notation.
Les chercheurs et les équipes produit devraient également rechercher des preuves allant au-delà de la réplication. Inherent dit que son cap est un agent scientifique IA, mais la démonstration publique actuelle concerne la reproduction de recherches existantes. Le prochain test pertinent serait de savoir si Faraday peut générer de nouvelles hypothèses, concevoir des expériences jugées utiles par des experts et produire des résultats qui résistent à l’examen externe.
D’autres signaux incluent le comportement du système face aux erreurs, sa dépendance à GPT-5.5 Codex et la question de savoir si Inherent ouvre l’accès à des utilisateurs ou évaluateurs externes. La croissance des recrutements à Londres peut indiquer de la confiance et de l’élan, mais l’effectif ne prouve pas que les capacités scientifiques de l’agent se généralisent.
L’annonce d’Inherent est intéressante car elle déplace l’attention de la simple échelle du modèle vers la construction de flux de travail de recherche de longue durée. Un modèle de base plus petit, associé à l’apprentissage par renforcement, à des outils de codage et à des retours d’expérimentation, pourrait être une voie plus pratique vers des agents IA spécialisés que d’attendre que chaque capacité apparaisse dans un seul modèle frontier.
Il faut toutefois lire cette affirmation comme un résultat initial, et non comme un avantage définitivement acquis sur Anthropic ou OpenAI. Pour les développeurs, la vraie question est de savoir si l’avantage rapporté de Faraday résiste à une évaluation transparente et passe de la réplication d’articles à un travail scientifique fiable. C’est cette preuve qui déterminera si Inherent a démontré une approche durable ou simplement un bon résultat sur une tâche étroite.
Inherent affirme que son agent IA Faraday a surpassé les systèmes plus grands d’Anthropic et d’OpenAI dans la réplication d’articles, mettant en avant des modèles plus petits et des agents axés sur la recherche.