DiscoBench показывает, что AI search-агенты срываются на неоднозначных запросах, потому что не просят пользователей уточнить
Новый бенчмарк от Tencent Hunyuan и Университета Цинхуа показывает, что AI search-агенты проваливаются из-за неоднозначности, а не из-за самого поиска, что ограничивает надежность в реальном мире.
