DiscoBench descubre que los agentes de búsqueda de IA se desmoronan ante consultas ambiguas porque no piden aclaraciones a los usuarios
Un nuevo benchmark de Tencent Hunyuan y la Universidad de Tsinghua sugiere que los agentes de búsqueda de IA fallan por la ambigüedad, no por la búsqueda en sí, lo que limita su fiabilidad en el mundo real.
