Vals привлекла 40 миллионов долларов, чтобы сделать AI-бенчмарки менее уязвимыми к манипуляциям

Vals, при поддержке Andreessen Horowitz, привлекла 40 миллионов долларов, чтобы создать конфиденциальный AI-бенчмаркинг на основе задач для компаний и федеральных агентств, поскольку старые тесты с…

AI News

Стартап в сфере AI-бенчмаркинга Vals пытается превратить оценку моделей в более практичный и заслуживающий доверия слой рынка ИИ после привлечения 40 миллионов долларов в раунде Series A, возглавленном Andreessen Horowitz. Компания утверждает, что многие устоявшиеся тесты уже недостаточны для оценки все более способных моделей, особенно когда компании могут заранее видеть материалы теста.

Vals оценивает системы ИИ на сложных, специфичных для отрасли задачах, а не полагается только на публичные экзамены на общие знания. Такой подход призван помочь разработчикам моделей выявлять слабые места, покупателям — сравнивать системы для реальной работы, а регуляторам и инвесторам — получать более содержательные доказательства по производительности и рискам.

Другая модель оценки ИИ

Основанная в 2024 году Vals появилась после того, как сооснователь и генеральный директор Райан Кришнан заметил, что академические бенчмарки не успевают за новыми возможностями моделей. В комментариях, о которых сообщил TechCrunch, Кришнан сказал, что отрасль выпускает способные модели быстрее, чем традиционные системы оценки успевают их измерять.

Тестирование компании призвано напоминать профессиональную работу в таких областях, как право, финансы и программирование. Вместо того чтобы просто спрашивать, может ли модель ответить на сложные вопросы, Vals говорит, что проверяет, может ли система производить работу, сопоставимую по качеству с человеческим результатом в конкретной области.

Примечательная особенность заключается в том, что Vals не раскрывает публично конкретные материалы, используемые в тестах. Логика компании состоит в том, что полностью публичные бенчмарки могут становиться объектом оптимизации или обучения. Модель может казаться улучшившейся на тесте, не демонстрируя сопоставимого улучшения в более широкой, невидимой работе.

Vals также заявляет, что её оценки учитывают не только успешное выполнение задач, но и вредные или нежелательные результаты. Среди упомянутых областей интереса — кибербезопасность, биобезопасность, психическое здоровье, рекурсивное самосовершенствование и право вооружённых конфликтов. Представленные сведения не содержат подробностей о методологии, системах оценки или независимой валидации для каждой из этих программ.

Что показывают данные о финансировании и росте

Раунду Series A предшествовал более ранний seed-раунд, возглавленный 8VC и Bloomberg Beta. TechCrunch сообщил, что последнее финансирование Vals было завершено в месяце, предшествующем статье в сентябре 2026 года, и что сейчас в компании работает 25 человек, тогда как в начале года было восемь.

Эти показатели роста, а также заявление компании о том, что выручка выросла в восемь раз по сравнению с прошлым годом, были переданы через Кришнана и должны рассматриваться как метрики, сообщённые компанией, а не как независимо проверенные доказательства. Доступные исходные материалы не указывают клиентов Vals, общую выручку, объём тестирования или количество оценённых моделей.

Компания зарабатывает на том, что взимает плату с разработчиков ИИ за оценку их моделей. Это создаёт потенциально полезные, но тонкие отношения: сторона, оплачивающая тест, одновременно является и той, чья система оценивается. Vals представляет услугу как инструмент разработки и контроля качества, сравнивая её с оплатой стандартизированного экзамена, который показывает, где нужно улучшение.

Компания также запустила программу, ориентированную на предоставление оценок моделей федеральным агентствам. В исходных материалах не указано, какие именно агентства участвуют, и не говорится, дала ли программа публичные результаты.

Почему нейтральность бенчмарков важна для покупателей

Для создателей ИИ ценность оценки зависит от того, предсказывает ли она производительность за пределами тестовой среды. Публичный бенчмарк может быть легко объяснить, но он может быть менее полезен, если модели были настроены под его вопросы или если тест измеряет абстрактные знания, а не реальный рабочий процесс.

Таск-ориентированная модель Vals может быть более актуальна для покупателей корпоративного ИИ, выбирающих системы для юридической проверки, финансового анализа, разработки ПО или других операционных задач. Покупателя может меньше интересовать место модели в общем рейтинге, чем то, выполняет ли она определённый рабочий процесс точно, последовательно и с приемлемыми режимами отказа.

Это делает качество оценки вопросом внедрения, а не только маркетинга. Продуктовым командам нужно знать, где модель ломается, как часто требуется вмешательство человека и не скрывает ли внешне сильный результат проблемы безопасности или надёжности. Конфиденциальное тестирование может снизить возможности для манипуляции бенчмарками, но оно также затрудняет внешнюю проверку. Покупателям потребуется достаточная методологическая прозрачность, чтобы понимать, что означает балл, не получая сами ответы на тест.

Коммерческие ставки могут вырасти по мере того, как системы ИИ будут встраиваться в бизнес-процессы. Если оценки моделей начнут влиять на закупки, публичную отчётность, инвестиционные решения или регуляторные проверки, организациям, создающим такие оценки, придётся доказывать независимость, воспроизводимость и устойчивость к конфликтам интересов.

Доказательства, ограничения и конкурентное давление

Аргументация Vals опирается главным образом на проблему, которую она определяет, и на заявленный компанией подход. TechCrunch сообщил описание Кришнана о рынке, где старые бенчмарки отстают от современных моделей, но источник не приводит сравнительных результатов, показывающих, что тесты Vals более предсказательны или менее подвержены манипуляциям, чем конкурирующие системы.

В доступных материалах также нет независимых доказательств того, что Vals стала предпочтительным оценщиком в отрасли. Финансирование от Andreessen Horowitz и ранних инвесторов — это сигнал доверия инвесторов, а не доказательство точности бенчмарка или рыночного принятия. Аналогично, сообщённый рост выручки и расширение оценок для федеральных агентств указывают на заявленный компанией импульс, но не подтверждают широкое принятие клиентами.

Vals также столкнётся с конкуренцией со стороны разработчиков моделей, исследовательских лабораторий, открытых сообществ бенчмарков, специализированных тестовых компаний и внутренних команд оценки. Некоторые организации могут предпочесть прозрачные публичные тесты, тогда как другие заплатят за частные оценки, отражающие их собственные данные и рабочие процессы. Задача компании — показать, что её контролируемый процесс даёт инсайты, которые клиенты не могут получить с помощью внутреннего тестирования или существующих платформ оценки.

Что отслеживать дальше

Самыми ясными сигналами будут публичные доказательства того, как Vals оценивает модели и коррелируют ли эти оценки с производственной эффективностью. Покупателям стоит следить за раскрытой методологией, исследованиями воспроизводимости, сравнениями моделей в одинаковых условиях и примерами, когда оценки меняли решения о внедрении или закупке.

Программа для федеральных агентств — ещё одна важная проверка. Названные участники, опубликованные выводы или формальные закупочные отношения дали бы более весомые доказательства, чем одно лишь объявление. Планируемый найм и расширение офисов могут свидетельствовать о продолжении коммерческой активности, но удержание клиентов и повторяющийся объём оценок будут важнее, чем численность персонала.

Рынку также следует наблюдать, сможет ли Vals сохранять конфиденциальность, не превращаясь в «чёрный ящик». Если её оценки будут влиять на заявления о безопасности, возможностях или инвестиционной ценности, независимый надзор и ясные объяснения принципов оценки станут ключевыми для её авторитета.

Взгляд Creati.ai

Vals выходит на рынок в удачный момент: компаниям в сфере ИИ всё больше нужны оценки, отражающие ту работу, которую люди действительно выполняют, а покупатели всё более скептически относятся к росту в рейтингах, который не превращается в надёжное внедрение. Фокус на скрытых тестах и специфичных для домена задачах решает реальные слабости публичного бенчмаркинга.

Но стать надёжным стандартом — значит не просто получить венчурную поддержку и быстро расти. Vals придётся доказать, что её частные оценки строгие, воспроизводимые и достаточно прозрачные, чтобы клиенты и внешние наблюдатели могли понять их смысл. Следующая фаза компании будет определяться не столько амбициозностью каталога бенчмарков, сколько тем, насколько надёжно её результаты улучшают решения о том, какие модели ИИ создавать, покупать и внедрять.

Реклама