Мультимодальный ИИ

Mistral AI расширяется в робототехнику с Robostral Navigate — 8B-моделью для навигации по одной камере

Mistral AI расширяется в робототехнику с Robostral Navigate — 8B-моделью для навигации по одной камере

Mistral AI представила Robostral Navigate, 8B-робототехническую модель для навигации по одной камере, что сигнализирует о движении к более дешевым стекам восприятия для роботов.

Twelve Labs привлекает $100 млн, пока инвесторы поддерживают инфраструктуру для AI-поиска по видео

Twelve Labs привлекает $100 млн, пока инвесторы поддерживают инфраструктуру для AI-поиска по видео

Twelve Labs привлекла $100 млн от Amazon и венчурных инвесторов, что сигнализирует о растущем спросе на AI-системы, способные искать и анализировать видео в масштабе.

Luma AI запускает Uni-1: модель изображений, ориентированная на рассуждение, которая превосходит Google и OpenAI при цене на 30% ниже

Luma AI запускает Uni-1: модель изображений, ориентированная на рассуждение, которая превосходит Google и OpenAI при цене на 30% ниже

Uni-1 от Luma AI использует авторегрессивную архитектуру, чтобы превосходить Google Nano Banana 2 и OpenAI GPT Image 1.5 в бенчмарках по рассуждению, одновременно снижая стоимость для 2K-разрешения до 30%.

Xiaomi запускает три модели ИИ MiMo V2, ориентированные на агентов, робототехнику и синтез речи

Xiaomi запускает три модели ИИ MiMo V2, ориентированные на агентов, робототехнику и синтез речи

Xiaomi представила MiMo-V2-Pro, MiMo-V2-Omni и MiMo-V2-TTS — три модели ИИ с более чем 1 триллионом параметров, мультимодальным восприятием и эмоциональным синтезом речи, конкурирующие с Claude Opus 4.6 в бенчмарках для агентов.

Google выпустила Gemini Embedding 2: первая нативно мультимодальная модель эмбеддингов ИИ

Google выпустила Gemini Embedding 2: первая нативно мультимодальная модель эмбеддингов ИИ

Google представила Gemini Embedding 2, первую нативно мультимодальную модель эмбеддингов, способную совместно отображать текст, изображения и видео в единое векторное пространство для задач поиска и извлечения.

DeepSeek готов выпустить мультимодельную ИИ-модель V4, ограничив ранний доступ для Nvidia и AMD

DeepSeek готов выпустить мультимодельную ИИ-модель V4, ограничив ранний доступ для Nvidia и AMD

Китайская DeepSeek вскоре выпустит мультимодальную модель V4 — способную генерировать текст, изображения и видео — при этом, по сообщениям, она отказывает Nvidia и AMD в раннем доступе для оптимизации, предоставляя его исключительно отечественным производителям чипов Huawei и Cambricon перед ежегодными парламентскими сессиями Китая.

DeepSeek создает поисковую систему с ИИ, чтобы бросить вызов доминированию Google

DeepSeek создает поисковую систему с ИИ, чтобы бросить вызов доминированию Google

Вакансии DeepSeek раскрывают планы по созданию мультимодальной поисковой системы с ИИ, поддерживающей текст, изображения и аудио, напрямую нацеленной на долю Google на рынке поиска.

Kimi K2.5 от Moonshot AI сокращает разрыв в развитии ИИ между США и Китаем до наименьшего уровня в истории

Kimi K2.5 от Moonshot AI сокращает разрыв в развитии ИИ между США и Китаем до наименьшего уровня в истории

Пекинская Moonshot AI выпустила Kimi K2.5 — открытый мультимодальный ИИ‑модель, соперничающую с OpenAI и Anthropic и при этом в четыре раза дешевле в эксплуатации, что вызывает вопросы относительно эффективности экспортных ограничений США на полупроводники в сдерживании развития ИИ в Китае.

Рекомендуемые

Мультимодальный ИИ

Последние Новости и Анализ по Теме Мультимодальный ИИ