AI News

OpenAI affirme que sa première puce d’inférence personnalisée, Jalapeño, peut fournir sensiblement plus de travail IA par watt tout en réduisant la latence de réponse sur plusieurs grands modèles de langage. L’entreprise indique que le système est conçu pour éviter le compromis habituel entre débit et réactivité, une affirmation qui pourrait compter à mesure que les agents IA augmentent le nombre d’appels au modèle nécessaires pour accomplir une tâche.

Les résultats reposent sur les tests d’OpenAI avec le benchmark public InferenceX et sur des comparaisons avec des systèmes d’accélération disponibles dans le commerce. OpenAI prévoit de commencer à déployer Jalapeño au sein de son infrastructure de calcul d’ici la fin de l’année, tout en poursuivant la qualification de production, le développement logiciel et les tests sur d’autres modèles.

Gains de performance rapportés par OpenAI

Selon OpenAI, Jalapeño a produit entre 1,5 et 1,9 fois plus de travail IA par watt au débit maximal que les systèmes de comparaison sur GPT‑OSS 120B, DeepSeek R1 670B et Kimi K2.5 1T. L’entreprise rapporte également une latence de bout en bout 1,7 à 3,6 fois plus faible sur les charges de travail testées.

Pour les charges de travail très interactives, OpenAI affirme que les performances étaient 2,1 à 4,1 fois supérieures. Sur Kimi K2.5, décrit par l’entreprise comme le plus grand modèle public dans l’ensemble de test, Jalapeño aurait fourni environ 1,5 fois plus de performances de pointe par watt et une latence de bout en bout 3,4 fois plus faible que le système de comparaison.

Ces chiffres sont des résultats rapportés par OpenAI, et non une validation indépendante présentée dans les éléments disponibles. L’entreprise indique que les tests utilisaient InferenceX, un benchmark public de SemiAnalysis qui mesure l’ensemble du processus de mise à disposition d’une requête IA plutôt que de se concentrer uniquement sur les spécifications au niveau de la puce.

OpenAI a normalisé les comparaisons en utilisant la puissance nominale publiée de chaque accélérateur. Jalapeño est donné pour 700 watts, bien qu’OpenAI indique que la puissance soutenue mesurée était à 550 watts ou moins pendant les charges de travail testées. Les comparaisons listées par OpenAI incluent des systèmes construits autour des plateformes GB200 et GB300 de NVIDIA, avec des valeurs de puissance thermique de conception de boîtier de 1 200 et 1 400 watts respectivement.

Un système conçu autour des charges de travail d’inférence

L’argument d’OpenAI est que l’avantage de Jalapeño vient de plus que de l’accélérateur lui-même. L’entreprise dit avoir conçu ensemble la puce, la mémoire, la mise en réseau, le logiciel et le système à l’échelle du rack autour du comportement de l’inférence moderne des modèles de langage.

Ce comportement est inégal. La phase de préremplissage (prefill), lorsque qu’un prompt est traité, tend à être gourmande en calcul. Le decode, lorsque le modèle génère une réponse jeton par jeton, est davantage limité par la bande passante mémoire. La communication entre puces peut ajouter une autre source de retard, en particulier lorsque l’état du modèle doit circuler entre des ressources distinctes.

Jalapeño a pour but de maintenir les données, y compris le cache clé-valeur utilisé pendant la génération, à proximité des ressources de calcul qui en ont besoin. OpenAI explique que son architecture réseau permet à une charge de travail de rester au sein d’un seul système connecté, réduisant les déplacements de données et aidant le système à gérer efficacement à la fois le préremplissage et le decode.

Cet objectif de conception est particulièrement pertinent pour les agents IA. Les agents effectuent souvent plusieurs appels séquentiels au modèle, utilisent des outils et évaluent des résultats intermédiaires. Un léger retard à chaque étape peut s’accumuler et rendre la tâche nettement plus lente. Un débit plus élevé peut aussi aider les opérateurs d’infrastructure à servir davantage de requêtes simultanées, mais seulement si la latence reste acceptable pour un usage interactif.

L’IA a aidé à construire et à programmer la puce

OpenAI affirme que des outils d’IA ont participé directement au développement de Jalapeño. L’entreprise indique être passée de la conception initiale au tape-out en neuf mois en utilisant l’IA pour explorer des implémentations, raccourcir les cycles de conception et de vérification, et itérer face aux charges de travail des modèles. Elle dit également que le travail assisté par l’IA a aidé à optimiser des circuits arithmétiques et à intégrer des performances de calcul supplémentaires dans le calendrier de la puce.

L’effort de programmation fournit un autre élément du dossier d’OpenAI en faveur du matériel personnalisé. En utilisant Codex avec GPT‑Astra, des ingénieurs ont amené trois modèles à poids ouverts qui n’étaient pas inclus dans le plan de production initial de Jalapeño à un haut niveau de performance en deux mois, selon l’entreprise.

OpenAI affirme que des implémentations générées par l’IA pour des blocs sélectionnés d’attention et de mixture-of-experts de GPT‑OSS fonctionnaient 1,5 à 1,8 fois plus vite que les implémentations existantes écrites par des experts humains. L’entreprise limite explicitement cette affirmation à des blocs sélectionnés et non à des modèles complets ; il ne faut donc pas l’interpréter comme une accélération de l’ensemble du modèle.

La prise en charge de nouvelles familles de modèles nécessite encore de nouveaux kernels et des optimisations spécifiques aux modèles. Cette précision est importante pour les acheteurs et les équipes infrastructure qui évaluent si un accélérateur personnalisé peut s’adapter à mesure que les architectures des modèles changent.

Ce que Jalapeño signifie pour l’infrastructure IA

Pour OpenAI, le bénéfice immédiat est le levier opérationnel. Obtenir davantage de sortie utile du modèle avec la même capacité électrique et matérielle pourrait réduire le coût de traitement des requêtes ou permettre à l’entreprise de gérer une demande plus importante sans augmenter l’infrastructure au même rythme. Une latence plus faible pourrait également rendre plus pratiques des workflows d’agents plus interactifs.

La puce ne marque pas un retrait des fournisseurs commerciaux de matériel. OpenAI indique qu’elle continuera à déployer des accélérateurs de NVIDIA et d’autres partenaires pour l’entraînement comme pour l’inférence. Jalapeño semble donc se positionner comme une plateforme supplémentaire au sein d’une stratégie d’infrastructure mixte, plutôt que comme un remplacement immédiat des puces externes.

Pour les développeurs d’IA et les acheteurs d’entreprise, la question centrale sera de savoir si les gains rapportés résistent aux conditions de production. Les performances en benchmark peuvent différer des performances déployées en raison de la maturité logicielle, de la compilation des modèles, de la capacité mémoire, de la surcharge réseau, des schémas d’utilisation et de la difficulté à prendre en charge de nouvelles familles de modèles.

L’approche full-stack d’OpenAI pourrait lui donner un contrôle plus étroit sur ces variables pour ses propres charges de travail. Elle crée aussi un compromis : le matériel personnalisé peut offrir d’excellents résultats pour les modèles et les modes de service pour lesquels il a été conçu, mais sa valeur à long terme dépend de la vitesse à laquelle la pile logicielle peut intégrer des modèles qui n’étaient pas anticipés lors de la conception.

Ce qu’il faut surveiller ensuite

Le premier signal sera le déploiement. OpenAI indique que Jalapeño doit entrer dans son infrastructure de calcul d’ici la fin de l’année, mais les éléments ne précisent ni l’échelle initiale, ni les produits, ni les charges de travail clients qui l’utiliseront.

Le marché devrait également surveiller des mesures indépendantes ou vérifiables par les clients au-delà des résultats InferenceX d’OpenAI. Des détails utiles incluraient les performances soutenues sous utilisation de production, la surcharge logicielle, le coût par requête aboutie, la couverture des modèles et des comparaisons prenant en compte la puissance totale du système plutôt que les seules valeurs publiées pour le boîtier.

OpenAI indique que Gen 2 est déjà en développement et que Gen 3 prend forme. Les progrès de ces générations, ainsi que le rythme de développement des kernels pour les nouveaux modèles, montreront si Jalapeño devient une plateforme durable ou principalement une optimisation pour la pile interne d’OpenAI.

Perspective Creati.ai

Jalapeño est important parce qu’OpenAI passe de l’achat de capacité d’inférence à la structuration d’une plus grande partie de la pile matériel-logiciel qui détermine l’efficacité de mise à disposition de ses modèles. La combinaison rapportée de débit et de latence est stratégiquement plus utile qu’un seul chiffre de vitesse de pointe, en particulier pour les produits construits autour des agents IA.

Néanmoins, les affirmations les plus fortes restent celles du fournisseur, et la puce n’a pas encore été démontrée dans un déploiement de production à grande échelle dans les éléments fournis. Le prochain test est opérationnel : voir si OpenAI peut transformer l’efficacité des benchmarks en un service fiable, flexible et rentable à travers des modèles changeants et une demande client réelle.

Vedettes

OpenAI annonce d’importants gains de vitesse et d’efficacité énergétique avec sa puce d’inférence Jalapeño

OpenAI affirme que sa puce Jalapeño améliore la vitesse d’inférence de l’IA et l’efficacité énergétique sur plusieurs modèles, mais les résultats restent fournis par le vendeur avant le déploiement.