GPT-6 Astra Ultrafast è fino a 8 volte più veloce

GPT-6 Astra Ultrafast è fino a 8 volte più veloce

GPT-6 Astra Ultrafast accelera l'inferenza, ma il decode resta il collo di bottiglia: la KV cache diventa la risorsa chiave.

Il decode domina il tempo di esecuzione degli agenti, e OpenAI cerca silicon dedicato tra GPU programmabili e chip custom

Il decode è il collo di bottiglia

Dopo l’annuncio, la domanda non è “quanto più veloce”, ma “dove si nasconde il collo di bottiglia”. La risposta è nel decode. In un agente LLM che esegue più turni di un task — un agente ReAct in stile Codex, per intenderci — la maggior parte dei token di input viene riutilizzata da un turno all’altro. La fase di prefill, quella che processa il contesto in ingresso e popola la KV cache, incide poco sul tempo totale proprio perché il contesto si ripete tra i turni. È il decode, cioè la generazione token per token, a dominare tra il 91,0% e il 98,6% del tempo di esecuzione. Questo cambia il problema di ottimizzazione alla radice: non serve una GPU che processi più token al secondo in prefill, serve un sistema che riduca il tempo per token generato in decode e che tratti la KV cache come una risorsa da riusare, non da ricalcolare da zero a ogni turno.

Secondo Uday Ruddarraju, chief technology officer of compute at OpenAI, l’azienda ha usato i propri modelli interni per ottimizzare l’inferenza sulle GPU NVIDIA: «Abbiamo usato i nostri modelli interni per ottimizzare l’inferenza sulle GPU NVIDIA, e la programmabilità di NVIDIA ci ha aiutato a ottenere l’accelerazione dietro Astra Ultrafast». Il punto tecnico è che una piattaforma programmabile consente a sviluppatori e ricercatori di riutilizzare la stessa infrastruttura per training, inferenza e reinforcement learning man mano che i modelli evolvono. Ma se il decode è il vero costo, la risposta infrastrutturale non può limitarsi a una GPU più veloce: servono scala e architetture dedicate.

Il paradosso dell’accordo NVIDIA

Ed è qui che emerge il paradosso. OpenAI sta espandendo la collaborazione con NVIDIA su scala gigawatt: 3 GW di capacità di inferenza dedicata e 2 GW di training su sistemi Vera Rubin, con i sistemi Hopper e Blackwell già operativi attraverso Microsoft, OCI e CoreWeave. In totale OpenAI distribuirà almeno 10 gigawatt di sistemi NVIDIA, inclusa la piattaforma Vera Rubin, mentre NVIDIA intende investire fino a 100 miliardi di dollari in OpenAI progressivamente man mano che ogni gigawatt viene distribuito. Un impegno che sembrerebbe blindare la strada della GPU programmabile per anni.

Eppure, in parallelo, OpenAI è insoddisfatta della velocità dei chip AI di Nvidia per i compiti di inferenza e cerca alternative dall’anno scorso. L’attenzione è su chip con più memoria integrata per un’elaborazione più rapida, soprattutto per lo sviluppo software. Tra l’espansione massiccia su GPU programmabile e la ricerca di silicon specializzato, resta aperta una domanda: quale architettura vincerà il serving agentico?

Memoria integrata, latenza e il futuro dello stack

La risposta si legge nei dettagli architetturali delle alternative. OpenAI ha annunciato Jalapeño, il suo primo chip di inferenza personalizzato, e da allora sta testando il chip e il sistema costruito attorno ad esso. Jalapeño può servire più lavoro AI per unità di potenza e restituire risposte più rapidamente: due obiettivi che puntano direttamente al costo per token in decode e alla latenza percepita dall’utente. La scelta di investire in un chip custom non è un dettaglio: significa che OpenAI considera il serving di inferenza abbastanza strategico da giustificare un silicon dedicato, progettato attorno al proprio carico di lavoro piuttosto che adattato a un’architettura generica.

Poi c’è l’accordo pluriennale da 750MW con Cerebras, specialista wafer-scale non-NVIDIA, per l’inferenza a bassissima latenza. Anche qui il segnale architetturale è preciso: memoria integrata e latenza diventano i fattori decisivi, non i teraflop grezzi. Per chi sviluppa o serve modelli, questo significa che ogni scelta di stack — GPU programmabile, chip custom o wafer-scale — è una scommessa sul collo di bottiglia che verrà dopo. E la partita è apertissima.

Il serving agentico non è più un problema di potenza di calcolo, ma di memoria e latenza. GPT-6 Astra Ultrafast è il sintomo: l’ottimizzazione del decode e il riuso della KV cache valgono più di qualsiasi incremento di picco. Per chi costruisce, scegliere tra flessibilità programmabile e specializzazione per il decode significa decidere in anticipo quale collo di bottiglia affronterà tra sei mesi.

🍪 Impostazioni Cookie