AI News

La startup de IA con sede en Londres Inherent dice que su nuevo agente, Faraday, ha superado a sistemas más grandes de Anthropic y OpenAI al reproducir de forma independiente los hallazgos de artículos científicos publicados. La afirmación marca la primera demostración pública de la empresa desde que salió del modo sigiloso con una ronda semilla de 50 millones de dólares y ofrece una prueba temprana de su ambición de construir sistemas de IA que contribuyan al descubrimiento científico.

La comparación es notable porque Inherent dice que Faraday funciona sobre Qwen 3.6, un modelo con 27.000 millones de parámetros. La startup lo midió frente a Claude Opus 4.8 de Anthropic y GPT-5.5 de OpenAI, que Inherent describe como modelos frontier mucho más grandes. Sin embargo, los resultados de rendimiento son reportados por la propia empresa a través de TechCrunch, y la evidencia disponible no incluye una metodología de benchmark pública ni validación independiente.

Faraday apunta a la replicación de investigación

Faraday fue diseñado para reproducir resultados de artículos científicos sin recibir de antemano la respuesta esperada. El cofundador y científico jefe de Inherent, Edward Hughes, dijo a TechCrunch que la replicación de papers es un ejercicio inicial estándar para los científicos humanos, incluidos los estudiantes de doctorado.

La startup dice que evaluó más que si un agente podía llegar a un resultado correcto. También quería que Faraday mostrara lo que Hughes llamó “research taste”: la capacidad de identificar experimentos valiosos y tomar decisiones sensatas sobre cómo ejecutarlos.

Esa distinción importa para la IA orientada a la investigación. Un sistema que sigue un procedimiento fijo puede verificar un resultado existente, pero un colaborador científico útil debe decidir qué preguntas merecen tiempo, qué variables probar y cuándo la evidencia es lo suficientemente sólida como para justificar una conclusión. El objetivo a largo plazo de Inherent es un agente científico de IA que pueda operar en múltiples campos científicos y no una herramienta limitada a un solo benchmark o disciplina.

Un modelo más pequeño y una apuesta de entrenamiento distinta

Inherent atribuye en parte el resultado reportado de Faraday al uso de aprendizaje por refuerzo. En lugar de depender principalmente de datos de entrenamiento sobre cómo los científicos realizan investigación, la empresa dice que recompensa a los agentes por lograr resultados útiles. El enfoque busca ayudar al sistema a adquirir instintos más amplios de toma de decisiones, incluido el juicio que la startup asocia con el research taste.

La elección también refleja una estrategia de producto deliberada. Inherent no está desarrollando una herramienta de codificación dedicada para Faraday. Según la empresa, el agente usa GPT-5.5 Codex de OpenAI para tareas de programación, de forma similar a cómo los investigadores humanos dependen de software existente en lugar de construir ellos mismos cada herramienta.

Esa arquitectura podría ser importante para los equipos que construyen agentes científicos y técnicos. El sistema más capaz quizá no sea un único modelo monolítico. Podría ser, en cambio, un modelo de razonamiento más pequeño conectado a herramientas especializadas, sistemas de codificación, entornos de experimentación y ciclos de evaluación. La comparación reportada de Faraday no demuestra que ese enfoque sea ampliamente superior, pero sí ofrece un ejemplo concreto del equilibrio que Inherent está explorando.

La evidencia es prometedora, pero sigue siendo limitada

La afirmación central de rendimiento proviene de Inherent y fue reportada por TechCrunch. El material fuente disponible no especifica el número de artículos probados, los campos científicos representados, los criterios de puntuación, el grado de supervisión humana ni si los sistemas de Anthropic y OpenAI se ejecutaron bajo condiciones idénticas de herramientas y cómputo.

Esos detalles son esenciales al comparar agentes de investigación. La replicación de papers puede variar considerablemente en dificultad dependiendo de si se dispone de código fuente, conjuntos de datos, protocolos de laboratorio y recursos de cómputo. Los resultados también pueden depender de cómo se le dé instrucciones al agente, de cómo se manejen los experimentos fallidos y de si los evaluadores juzgan solo la respuesta final o la calidad del proceso experimental.

El uso de un modelo de 27.000 millones de parámetros sigue siendo, no obstante, una señal importante reportada por el proveedor. Si se reprodujera de forma independiente, el resultado sugeriría que el tamaño del modelo por sí solo no es un proxy fiable del rendimiento en flujos de trabajo científicos de largo horizonte. También podría indicar que el aprendizaje por refuerzo y la orquestación de herramientas están contribuyendo tanto como la escala del modelo base para esta tarea concreta.

El enfoque de Inherent es deliberadamente más amplio que un resultado de tabla de clasificación. Hughes dijo a TechCrunch que para la empresa era menos importante derrotar a los sistemas frontier que la forma en que Faraday fue construido. Describió al agente previsto como un colaborador que puede volver con experimentos y resultados inesperados, en lugar de uno que simplemente produce respuestas diseñadas para satisfacer a su usuario.

Qué significa la afirmación para los creadores de IA y las empresas

Para los desarrolladores de IA, Faraday resalta una pregunta de diseño creciente: ¿deben optimizarse los agentes para la calidad conversacional, la precisión en benchmarks o la capacidad de tomar decisiones y aprender de ellas a lo largo de muchos pasos? La investigación científica expone debilidades que son más fáciles de ocultar en flujos de trabajo más cortos, como la mala selección de experimentos, la planificación frágil, los supuestos no verificados y la tendencia a reportar conclusiones confiadas pero sin respaldo.

Un modelo más pequeño podría abaratar la implementación de agentes de investigación, especialmente cuando el flujo de trabajo requiere muchos experimentos o llamadas repetidas a un modelo. Pero un menor tamaño del modelo no significa automáticamente un menor coste total. El uso de herramientas, la ejecución de código, las corridas fallidas, el acceso a datos, la revisión humana y la infraestructura pueden dominar la economía de un agente que opera durante horas o días.

Por ello, los compradores empresariales deberían tratar Faraday como una señal temprana y no como un sustituto listo para usar de los investigadores. Las preguntas prácticas serán si el sistema produce trabajo reproducible, expone sus supuestos, conserva una pista de auditoría y sabe cuándo no tiene evidencia suficiente. Esos requisitos se aplican al descubrimiento de fármacos, la investigación de materiales, la ingeniería y los equipos internos de I+D, donde un resultado atractivo vale menos que un resultado que pueda verificarse.

Los planes de contratación de Inherent también sitúan el producto en un mercado competitivo de talento avanzado en IA. La empresa tiene alrededor de una docena de empleados trabajando presencialmente en Londres y planea expandirse a unas 20 a 25 personas para finales de año, según el informe de TechCrunch. Hughes también criticó las restricciones británicas de garden leave, diciendo que habían afectado su propia capacidad para pasar desde un puesto anterior.

Qué vigilar a continuación

El seguimiento más importante será una evaluación reproducible de forma independiente de Faraday frente a Claude Opus 4.8 y GPT-5.5. Inherent fortalecería su afirmación si publicara el conjunto de papers, los prompts, las configuraciones de herramientas, los presupuestos de cómputo, las tasas de fallo y el proceso de puntuación.

Los investigadores y los equipos de producto también deberían buscar evidencia más allá de la replicación. Inherent dice que su estrella del norte es un agente científico de IA, pero la demostración pública actual se refiere a reproducir investigación existente. La siguiente prueba significativa sería si Faraday puede generar hipótesis nuevas, diseñar experimentos que los expertos consideren valiosos y producir hallazgos que sobrevivan a la revisión externa.

Otras señales incluyen el comportamiento del sistema ante errores, su dependencia de GPT-5.5 Codex y si Inherent libera acceso para usuarios o evaluadores externos. El crecimiento de la contratación en Londres puede indicar confianza y tracción, pero la plantilla no es prueba de que las capacidades científicas del agente se generalicen.

Perspectiva de Creati.ai

El anuncio de Inherent es interesante porque desplaza la atención de la escala bruta del modelo hacia la construcción de flujos de trabajo de investigación de larga duración. Un modelo base más pequeño, combinado con aprendizaje por refuerzo, herramientas de codificación y retroalimentación de experimentos, podría ser una vía más práctica hacia agentes de IA especializados que esperar a que cada capacidad aparezca dentro de un solo modelo frontier.

Aun así, la afirmación debe leerse como un resultado inicial, no como una ventaja ya resuelta sobre Anthropic u OpenAI. Para los desarrolladores, la verdadera pregunta es si la ventaja reportada de Faraday resiste una evaluación transparente y se traslada de la replicación de papers al trabajo científico fiable. Esa evidencia determinará si Inherent ha demostrado un enfoque duradero o simplemente un resultado fuerte en una tarea estrecha.

Destacados

Inherent dice que su agente de IA Faraday superó a Anthropic y OpenAI en la replicación de investigación

Inherent dice que su agente de IA Faraday superó a sistemas más grandes de Anthropic y OpenAI en la replicación de artículos, destacando modelos más pequeños y agentes centrados en la investigación.