In Breve
- Cosa è Jalapeño?
- Jalapeño è un chip per l'inferenza sviluppato da OpenAI, progettato per migliorare le prestazioni e l'efficienza energetica.
- Quali sono i vantaggi di Jalapeño rispetto ai chip attuali?
- Jalapeño offre un numero maggiore di token per utente e una maggiore throughput per kilowatt rispetto ai chip di inferenza attualmente in uso.
- Quando sarà disponibile Jalapeño?
- Il primo dispiegamento di Jalapeño è previsto entro la fine del 2026, con una distribuzione più ampia nel 2027.
Durante la conferenza Hot Chips, OpenAI ha presentato Jalapeño, un chip innovativo progettato per ottimizzare le prestazioni nell’inferenza. I primi risultati dei benchmark condotti su InferenceX di Semianalysis mostrano che Jalapeño offre un numero maggiore di token per utente e una maggiore throughput per kilowatt rispetto ai processori di inferenza attualmente considerati all’avanguardia, come il sistema Nvidia Blackwell.
OpenAI ha sviluppato Jalapeño in collaborazione con Broadcom, integrando i propri modelli nel processo di progettazione. L’azienda prevede che questa piattaforma diventi multigenerazionale, in grado di coordinare chip, memoria e modelli in modo efficiente.
L’architettura di Jalapeño è stata studiata per ridurre i ritardi nelle fasi di prefill e comunicazione, che spesso rappresentano colli di bottiglia durante l’inferenza. Come dichiarato nel comunicato aziendale, “Abbiamo progettato Jalapeño per minimizzare il movimento dei dati e i ritardi di comunicazione.” Questo approccio consente di mantenere lo stato del modello, inclusa la KV cache utilizzata durante la generazione delle risposte, allocato e mantenuto localmente. In questo modo, il sistema può attivare la combinazione adeguata di calcolo, memoria e rete per ogni fase di inferenza.
Richard Ho, responsabile hardware di OpenAI, ha commentato i risultati ottenuti: “In sostanza, i risultati mostrano un avanzamento delle prestazioni molto significativo rispetto allo stato dell’arte. Jalapeño può gestire più lavoro di intelligenza artificiale per unità di potenza, restituendo risposte più rapidamente. È molto efficiente nel servire un gran numero di clienti, ma può anche garantire una latenza molto bassa.”
OpenAI prevede un primo dispiegamento di Jalapeño in volumi molto ridotti entro la fine del 2026, con una distribuzione più significativa attesa per il 2027. Questa innovazione potrebbe rappresentare un passo importante nel campo dell’intelligenza artificiale, migliorando non solo le prestazioni ma anche l’efficienza energetica dei processi di inferenza.

