NVIDIA pousse la co-conception des modèles d’IA, exhortant les développeurs de LLM à adapter les architectures aux contraintes d’inférence de l’ère Blackwell
NVIDIA incite les développeurs de LLM à co-concevoir des modèles pour une inférence favorable aux GPU, pariant que des architectures conscientes du matériel réduiront les coûts et la latence à grande échelle.
