Claude Opus 5 de Anthropic logra un fuerte avance en ARC-AGI-3, pero el debate sobre los benchmarks solo se intensifica
Claude Opus 5 de Anthropic marcó una nueva mejor puntuación en ARC-AGI-3, reavivando las preguntas sobre mejoras reales de razonamiento frente a la optimización para el benchmark.
