Надежность ИИ

Последние Новости и Анализ по Теме Надежность ИИ

Надежность ИИ

Бенчмарк RoboHarm показал, что ведущие ИИ-модели ненадёжно отказываются от опасных команд для роботов

Бенчмарк RoboHarm показал, что ведущие ИИ-модели ненадёжно отказываются от опасных команд для роботов

Тестирование RoboHarm, о котором сообщил The Decoder, показало, что GPT-6 Astra, Claude Fable 5.1 и MolmoAct2 ненадёжно отказывались от опасных команд для роботов.

AI Week in Review 26.09.19: в доступной записи нет проверяемых деталей события

AI Week in Review 26.09.19: в доступной записи нет проверяемых деталей события

Включённая в список запись AI Week in Review не содержит доступного текста статьи, поэтому её заявленные события, утверждения и значение остаются непроверенными для читателей, следящих за индустрией ИИ.

Вирусные заявления о безопасности ИИ показывают разрыв между реальными инцидентами и спекуляциями

Вирусные заявления о безопасности ИИ показывают разрыв между реальными инцидентами и спекуляциями

Два вирусных обсуждения безопасности ИИ показывают, как реальные сбои моделей могут сделать невероятные утверждения правдоподобными, повышая планку для доказательств и сдерживания.

Подтвердить проверяемый запуск AI-агента по списку Buttondown на этой неделе нельзя

Подтвердить проверяемый запуск AI-агента по списку Buttondown на этой неделе нельзя

Три дублирующихся списка Buttondown не подтверждают проверяемый запуск AI-агента, оставляя разработчиков без подтверждённых данных о продукте, бенчмарке или принятии.

D.A.D. Week in Review распространяется без проверяемых подробностей о своём освещении ИИ

D.A.D. Week in Review распространяется без проверяемых подробностей о своём освещении ИИ

Еженедельный обзор D.A.D. циркулирует, но недоступный исходный текст оставляет его заявления об ИИ, продуктах и рыночной значимости неподтверждёнными для читателей.

The Sequence Radar #906 указывает на открытые модели и роботов, но его доказательства недоступны

The Sequence Radar #906 указывает на открытые модели и роботов, но его доказательства недоступны

Radar #906 от TheSequence выстраивает неделю вокруг открытых моделей и роботов, но отсутствие исходного текста делает его базовые утверждения непроверенными для AI-команд.

Кластер AI Week in Review предлагает слишком мало проверяемых доказательств для сообщаемой новости

Кластер AI Week in Review предлагает слишком мало проверяемых доказательств для сообщаемой новости

Кластер этой недели AI Week in Review не содержит достаточно проверяемых подробностей источника, чтобы подтвердить фактическую новостную статью, что подчеркивает пробелы в доказательствах, на которые читателям следует обратить внимание.

Новая доверительность китайского ИИ возвращает спор об open-weight моделях в центр внимания

Новая доверительность китайского ИИ возвращает спор об open-weight моделях в центр внимания

Китайские ИИ-лаборатории укрепляют доверие к себе, и CNBC пишет, что их прогресс снова привлекает внимание к open-weight моделям для разработчиков и бизнеса.

KPMG отзывает отчет о преимуществах ИИ после галлюцинаций, породивших вымышленные заявления клиентов

KPMG отзывает отчет о преимуществах ИИ после галлюцинаций, породивших вымышленные заявления клиентов

KPMG убрала свой отчет об agentic ИИ после того, как UBS, NHS и другие заявили, что утверждения об их использовании ИИ были ложными, а GPTZero объяснила ошибки галлюцинациями ИИ.

500 инвестиционных банкиров не нашли ни одного результата ИИ, готового для передачи клиенту, в новом бенчмарке

500 инвестиционных банкиров не нашли ни одного результата ИИ, готового для передачи клиенту, в новом бенчмарке

Новый строгий бенчмарк протестировал ведущие модели ИИ на задачах инвестиционного банкинга; ни один результат не был признан готовым для клиента, хотя половина банкиров сочла их полезной отправной точкой.

Microsoft Copilot в собственных условиях использования обозначен как «только для развлекательных целей»

Microsoft Copilot в собственных условиях использования обозначен как «только для развлекательных целей»

В условиях использования Microsoft для Copilot прямо указано, что ИИ предназначен только для развлечения и может допускать ошибки, что вызывает вопросы о доверии бизнеса к инструментам ИИ.

Реклама