
Лондонский ИИ-стартап Inherent утверждает, что его новый агент Faraday превзошёл более крупные системы Anthropic и OpenAI в независимом воспроизведении результатов опубликованных научных работ. Это заявление отмечает первую публичную демонстрацию компании с момента выхода из режима скрытности после посевного раунда на 50 миллионов долларов и представляет собой раннюю проверку её амбиции создавать ИИ-системы, способствующие научным открытиям.
Сравнение примечательно тем, что, по словам Inherent, Faraday работает на Qwen 3.6 — модели с 27 миллиардами параметров. Стартап сравнил её с Claude Opus 4.8 от Anthropic и GPT-5.5 от OpenAI, которые Inherent описывает как значительно более крупные frontier-модели. Однако результаты производительности представлены самой компанией через TechCrunch, и доступные доказательства не включают публичную методологию бенчмарка или независимую валидацию.
Faraday был создан для воспроизведения результатов из научных статей без предварительного предоставления ожидаемого ответа. Сооснователь Inherent и главный научный сотрудник Эдвард Хьюз сказал TechCrunch, что воспроизведение статей — это стандартное раннее упражнение для учёных-людей, включая аспирантов.
Стартап говорит, что оценивал не только способность агента прийти к правильному результату. Он также хотел, чтобы Faraday продемонстрировал то, что Хьюз назвал «research taste»: способность определять стоящие эксперименты и разумно решать, как их проводить.
Это различие важно для ИИ, ориентированного на исследования. Система, которая следует фиксированной процедуре, может проверить существующий результат, но полезный научный партнёр должен решать, какие вопросы заслуживают времени, какие переменные тестировать и когда доказательств достаточно, чтобы обосновать вывод. Долгосрочная цель Inherent — это агент-ИИ учёный, который может работать в разных научных областях, а не инструмент, ограниченный одним бенчмарком или дисциплиной.
Inherent объясняет заявленный результат Faraday отчасти использованием обучения с подкреплением. Вместо того чтобы в первую очередь полагаться на обучающие данные о том, как учёные проводят исследования, компания говорит, что вознаграждает агентов за достижение полезных результатов. Такой подход должен помочь системе выработать более широкие инстинкты принятия решений, включая суждение, которое стартап связывает с research taste.
Этот выбор также отражает осознанную продуктовую стратегию. Inherent не разрабатывает для Faraday специализированный инструмент для программирования. По словам компании, агент использует GPT-5.5 Codex от OpenAI для кодинговых задач, подобно тому как исследователи-люди опираются на существующее программное обеспечение вместо того, чтобы создавать каждый инструмент самостоятельно.
Такая архитектура может быть важна для команд, создающих научные и технические агенты. Самая мощная система может оказаться не одной монолитной моделью. Вместо этого это может быть меньшая модель рассуждений, подключённая к специализированным инструментам, системам кодирования, экспериментальным средам и циклам оценки. Сообщённое сравнение Faraday не доказывает, что такой подход в целом лучше, но даёт конкретный пример компромисса, который изучает Inherent.
Ключевое заявление о производительности исходит от Inherent и было опубликовано TechCrunch. Доступные источники не указывают количество протестированных статей, представленные научные области, критерии оценки, степень человеческого контроля или выполнялись ли системы Anthropic и OpenAI при одинаковых условиях инструментов и вычислений.
Эти детали критически важны при сравнении исследовательских агентов. Воспроизведение статей может сильно различаться по сложности в зависимости от доступности исходного кода, наборов данных, лабораторных протоколов и вычислительных ресурсов. Результаты также могут зависеть от того, как агенту задают подсказки, как обрабатываются неудачные эксперименты и оценивают ли эксперты только конечный ответ или качество экспериментального процесса.
Тем не менее использование модели с 27 миллиардами параметров — это важный сигнал, о котором сообщил вендор. Если бы результат был независимо воспроизведён, это означало бы, что размер модели сам по себе не является надёжным прокси для производительности в долгосрочных научных рабочих процессах. Это также могло бы указывать на то, что обучение с подкреплением и оркестрация инструментов в этой конкретной задаче вносят не меньший вклад, чем масштаб базовой модели.
Подача Inherent намеренно шире, чем просто результат в лидерборде. Хьюз сказал TechCrunch, что для компании было менее важно обойти frontier-системы, чем то, как построен Faraday. Он описал предполагаемого агента как партнёра, который может возвращаться с неожиданными экспериментами и результатами, а не как систему, которая просто выдаёт ответы, чтобы угодить пользователю.
Для разработчиков ИИ Faraday подчёркивает растущий вопрос проектирования: должны ли агенты оптимизироваться под качество диалога, точность в бенчмарках или способность принимать решения и учиться на них на протяжении многих шагов? Научные исследования выявляют слабости, которые легче скрыть в коротких рабочих процессах, включая плохой выбор экспериментов, хрупкое планирование, непроверенные предположения и тенденцию сообщать уверенные, но необоснованные выводы.
Меньшая модель может удешевить внедрение исследовательских агентов, особенно когда рабочий процесс требует множества экспериментов или повторных вызовов модели. Но меньший размер модели не означает автоматически меньшую общую стоимость. Использование инструментов, выполнение кода, неудачные запуски, доступ к данным, человеческая проверка и инфраструктура могут определять экономику агента, работающего часами или днями.
Поэтому корпоративным покупателям следует воспринимать Faraday как ранний сигнал, а не как готовую замену исследователям. Практические вопросы будут заключаться в том, производит ли система воспроизводимую работу, раскрывает ли свои предположения, сохраняет ли аудиторский след и понимает ли, когда ей не хватает доказательств. Эти требования применимы к поиску лекарств, материаловедению, инженерии и внутренним R&D-командам, где привлекательный результат менее ценен, чем результат, который можно проверить.
Планы найма Inherent также помещают продукт в конкурентный рынок передовых ИИ-талантов. По данным TechCrunch, в компании работает около дюжины сотрудников, работающих очно в Лондоне, и она планирует расшириться примерно до 20–25 человек к концу года. Хьюз также раскритиковал британские ограничения garden leave, заявив, что они повлияли на его собственную возможность перейти с предыдущей должности.
Самым важным следующим шагом станет независимо воспроизводимая оценка Faraday в сравнении с Claude Opus 4.8 и GPT-5.5. Inherent укрепит своё заявление, если опубликует набор статей, промпты, конфигурации инструментов, вычислительные бюджеты, показатели отказов и процесс оценки.
Исследователям и продуктовым командам также следует искать доказательства, выходящие за рамки репликации. Inherent говорит, что его северная звезда — это агент-ИИ учёный, но нынешняя публичная демонстрация касается воспроизведения существующих исследований. Следующим значимым тестом будет то, сможет ли Faraday генерировать новые гипотезы, проектировать эксперименты, которые эксперты сочтут ценными, и выдавать результаты, выдерживающие внешнюю проверку.
Другие сигналы включают поведение системы при ошибках, её зависимость от GPT-5.5 Codex и то, откроет ли Inherent доступ внешним пользователям или оценщикам. Рост найма в Лондоне может указывать на уверенность и импульс, но численность персонала не является доказательством того, что научные способности агента можно обобщить.
Объявление Inherent интересно тем, что смещает внимание с голого масштаба модели на построение длительных исследовательских рабочих процессов. Меньшая базовая модель в сочетании с обучением с подкреплением, инструментами кодирования и обратной связью от экспериментов может быть более практичным путём к специализированным ИИ-агентам, чем ожидание, что все возможности появятся внутри одной frontier-модели.
Тем не менее это заявление следует читать как начальный результат, а не как окончательно установленное преимущество над Anthropic или OpenAI. Для разработчиков главный вопрос — сохранится ли заявленное преимущество Faraday при прозрачной оценке и перенесётся ли оно с репликации статей на надёжную научную работу. Именно эти данные покажут, продемонстрировала ли Inherent устойчивый подход или просто сильный результат в узкой задаче.
Inherent говорит, что его ИИ-агент Faraday обошёл более крупные системы Anthropic и OpenAI в репликации научных статей, подчёркивая значение меньших моделей и агентов, ориентированных на исследования.