OpenAI co-conçoit avec Broadcom Jalapeño, sa première puce d'inférence

OpenAI et Broadcom co-conçoivent Jalapeño, une puce d'inférence pour grands modèles de langage dont la production à l'échelle du gigawatt est visée pour 2026.

OpenAI et Broadcom co-conçoivent Jalapeño, le premier accélérateur d'inférence d'OpenAI, qu'OpenAI qualifie d'« Intelligence Processor ». La puce a été pensée non comme un accélérateur généraliste recyclé d'anciennes charges, mais de zéro autour de l'inférence des grands modèles de langage, à partir de ce qu'OpenAI dit savoir des besoins de ses propres modèles, de leurs kernels, de leurs systèmes de service et de ses produits. Broadcom apporte la gravure du silicium et les technologies réseau, dont sa puce Tomahawk, et Celestica l'intégration en cartes et en racks.

OpenAI reste prudente sur les performances finales, encore en cours de mesure, mais avance que les premiers tests donnent une performance par watt nettement supérieure à l'état de l'art actuel, l'architecture réduisant les déplacements de données pour s'approcher du pic théorique. Des échantillons font déjà tourner des charges en laboratoire à la fréquence et à la consommation visées, dont GPT-5.3-Codex-Spark. Les deux entreprises revendiquent un cycle bouclé en neuf mois, du dessin initial à la fabrication, qu'elles estiment être le plus rapide jamais atteint pour un ASIC de ce niveau, en partie grâce au recours aux modèles d'OpenAI pour accélérer la conception.

Jalapeño ouvre une plateforme de calcul que les partenaires veulent décliner sur plusieurs générations, avec un premier passage en production visé d'ici fin 2026, à l'échelle du gigawatt. Hock Tan, patron de Broadcom, évoque des centres de données montés avec Microsoft et d'autres partenaires à partir de 2026.