Rho-1 от Reka AI объединяет текст, видео и управление роботами в модели на 19 млрд параметров

Rho-1 от Reka AI объединяет текст, изображения, видео и управление роботами в одной исследовательской модели на 19 млрд параметров, указывая на движение к унифицированным системам ИИ.

AI News

Reka AI выпустила исследовательскую предварительную версию Rho-1 — модели с 19 млрд параметров, предназначенной для обработки и генерации текста, изображений, видео и команд управления роботами в рамках одной нейронной сети. Релиз важен потому, что нацелен на общую архитектуру для возможностей, которые обычно разделены между языковыми моделями, системами компьютерного зрения, генераторами видео и робототехническими политиками.

Согласно публикации The Decoder, Rho-1 рассматривает различные медиа и действия как токены в общем контекстном окне, а не передаёт задачи отдельным моделям через вызовы инструментов. Reka утверждает, что система может генерировать непрерывное видео в реальном времени и реагировать на новые инструкции по мере развития сцены, не перезапуская процесс генерации.

Анонс относит Reka AI к числу исследователей, изучающих, может ли одна модель служить более универсальным интерфейсом для восприятия, генерации и действия. Однако это по-прежнему исследовательская предварительная версия, и доступные данные не позволяют установить, как Rho-1 работает по сравнению с ведущими коммерческими моделями или реальными роботизированными системами.

Одна модель для восприятия, генерации и действия

Большинство производственных стеков ИИ разделяют мультимодальную работу на компоненты. Языковая модель может интерпретировать запрос пользователя, модель зрения — изучать изображение, видеомодель — генерировать кадры, а отдельная политика — переводить наблюдения в физические движения. Эти компоненты можно соединить, но каждая передача увеличивает инженерную сложность, задержку и число потенциальных точек отказа.

Rho-1 призвана избежать такой организации. Согласно сообщениям, модель представляет текст, изображения, видео и действия робота в одной общей последовательности. В принципе, один и тот же контекст может включать инструкцию, визуальные наблюдения, сгенерированные кадры и выходы действий, позволяя системе связывать увиденное с тем, что она должна сделать.

Этот подход также создаёт у Rho-1 прямую связь между визуальным прогнозированием и управлением. The Decoder сообщает, что те же веса, которые используются для предсказания изображений с камер, управляют и движениями робота. Это не означает, что модель готова к широкому применению в физических средах, но отражает исследовательское направление, в котором прогнозирование видео и планирование действий обучаются совместно, а не рассматриваются как несвязанные задачи.

Как Reka обучала Rho-1

Согласно описанию релиза The Decoder, модель обучалась примерно три месяца на 320 графических процессорах H100. Reka AI также разработала модель обратной динамики, чтобы решить одну из центральных проблем робототехники: качественные данные для управления роботами гораздо более дефицитны, чем обычные интернет-видео.

Обратная динамика обычно пытается определить действие, которое вызвало наблюдаемое изменение сцены. В описанном Reka подходе эта способность используется для извлечения возможных сигналов управления из видео без роботов. Это может увеличить объём обучающих материалов для системы, которой необходимо понять, как действия влияют на мир, хотя интернет-видео не обеспечивают такой же надёжности, воплощённости и детализации сенсоров, как демонстрации, собранные с конкретного робота.

Заявленные вычислительные требования примечательны, поскольку Rho-1 содержит 19 млрд параметров — значительно меньше многих передовых систем, часто обсуждаемых на рынке. Тем не менее использование 320 GPU H100 в течение трёх месяцев представляет собой значительные инвестиции в обучение. Поэтому эту цифру следует воспринимать как описание исследовательского запуска, а не как доказательство того, что модель дёшево обучать или эксплуатировать при любом сценарии развертывания.

Доказательства, лежащие в основе анонса

Наиболее существенные детали, доступные в этом материале, взяты из освещения The Decoder исследовательской предварительной версии Reka AI. MarkTechPost отдельно описал Rho-1 как модель омни-рассуждений на 19 млрд параметров, которая понимает и генерирует видео, одновременно создавая действия для роботов. Однако предоставленный материал MarkTechPost не содержит полной статьи или независимых результатов тестирования.

Доступные данные не включают результаты бенчмарков, условия доступа к модели, измерения задержки, оценки безопасности или демонстрации, которые можно было бы независимо оценить здесь. Поэтому заявления о генерации видео в реальном времени, адаптивных ответах и связи между визуальным прогнозированием и движением робота следует считать заявленными компанией или источниками возможностями, а не окончательно установленными показателями эффективности.

Это различие важно для разработчиков и покупателей. Унифицированная модель может сократить потребность в поддержке множества интерфейсов, но одновременно усложнить локализацию ошибок. Система, создающая беглую речь и убедительное видео, всё равно может принимать небезопасные или физически неверные решения при управлении оборудованием. Статус Rho-1 как исследовательской предварительной версии оставляет открытыми вопросы о надёжности, методологии оценки и доступе к модели и её весам.

Reka AI уже работала над мультимодальными системами. В апреле 2024 года компания выпустила Reka Core, позиционируя её как конкурента GPT-4, Claude 3 и Gemini Ultra в бенчмарк-оценках. Rho-1 развивает это направление от мультимодального понимания к генерации видео и воплощённому действию.

Почему архитектура важна для команд, занимающихся ИИ

Для продуктовых команд главное значение Rho-1 — архитектурное. Если одна модель способна поддерживать общее представление языка, визуального содержания, временных изменений и действий, разработчики смогут строить приложения вокруг единого интерфейса инференса, а не координировать несколько специализированных сервисов. Возможные варианты применения включают интерактивных видеоассистентов, среды симуляции, визуальных агентов и исследовательские инструменты для робототехники.

Компромиссом становится концентрация риска. Специализированные системы можно независимо заменять или настраивать, тогда как унифицированной модели при слабой работе одной модальности может потребоваться повторное обучение или более широкая оценка. Например, модель, сильная в работе с текстом, но слабая во временном рассуждении, может выдавать правдоподобные объяснения и при этом не отслеживать меняющуюся физическую сцену.

Компаниям, рассматривающим такие системы, также придётся изучить инфраструктуру и управление. Непрерывная генерация видео может создавать высокие требования к пропускной способности и хранилищу. Выходы управления роботами требуют жёстких границ безопасности, мониторинга и резервной политики, способной переопределить модель. В регулируемых или чувствительных к безопасности сценариях способность объяснить, какие визуальные данные привели к действию, может быть не менее важна, чем общая результативность модели на бенчмарках.

Более широкий исследовательский спор касается мировых моделей — систем, предназначенных для представления того, как меняются среды и как действия на них влияют. Rho-1 соответствует этому направлению, объединяя визуальное прогнозирование с генерацией действий, но один лишь унифицированный поток токенов не доказывает наличие у модели надёжной физической модели мира. Долгосрочное планирование, необычные условия и перенос между разными роботами остаются сложными испытаниями.

За чем следить дальше

Первым сигналом станет то, опубликует ли Reka AI воспроизводимые оценки каждой способности отдельно и в сочетании. Полезные результаты должны включать качество и временную согласованность видео, следование инструкциям в меняющихся сценах и показатели успешности управления роботами на чётко определённых задачах.

Доступ будет ещё одним ключевым индикатором. Если Rho-1 станет доступна внешним исследователям, независимые испытания смогут показать, даёт ли унифицированная архитектура практические преимущества по сравнению с конвейерами из специализированных моделей. Детали об оборудовании для инференса, длине контекста, лицензировании и задержке определят, полезна ли система за пределами демонстраций.

Для робототехники важнее всего будут свидетельства, полученные на реальном оборудовании, а не результаты интернет-видео или симуляций. Исследователям предстоит проверить безопасность, восстановление после неожиданных событий, работу на разных роботах и влияние зашумлённых данных камер и сенсоров.

Наконец, рынок будет наблюдать, останется ли подход Reka исследовательской предварительной версией или превратится в продуктовую платформу. Ответ покажет, смогут ли омни-модели пройти путь от привлекательной архитектуры до надёжных инструментов для ИИ-агентов, видеоприложений и физической автоматизации.

Взгляд Creati.ai

Rho-1 — важный исследовательский сигнал, поскольку представляет мультимодальность как общую задачу моделирования, включающую действие, а не только текст, изображения и видео. Это может упростить некоторые части стека ИИ и облегчить создание систем, связывающих восприятие с реакцией.

Но анонс пока не доказывает, что одна модель лучше тщательно спроектированного набора специализированных моделей. Пока не появятся независимые оценки и результаты на реальных роботах, разработчикам следует рассматривать Rho-1 как архитектурный эксперимент с многообещающим охватом, а не как проверенную замену производственным мультимодальным или робототехническим системам.

Реклама