L'hardware ha cambiato le leggi dello scaling

L’hardware ha cambiato le leggi dello scaling

NVIDIA B300 con 13,5 PFLOPS e AWS EFA ridefiniscono lo scaling AI, spostando il focus da parametri a hardware e rete.

Le tre leggi di scaling si basano ora su banda memoria, precisione e interconnessione

Il dato che ridefinisce il dibattito è il FP4 Tensor peak della B300: B300 peak performance raggiunge 13,5 PFLOPS per GPU, mentre la H100 peak performance si ferma a 1,979 PFLOPS in FP8. Il salto non è solo numerico: ogni nuova generazione di hardware ridisegna i trade-off tra precisione, memoria e throughput, e con essi le leggi empiriche che governano lo scaling dei modelli. Mentre il settore guarda ai parametri e ai dataset, NVIDIA e AWS stanno riscrivendo le regole dal basso — dal silicio e dalla rete.

Le tre leggi di scaling e l’hardware che le abilita

Nel 2020 Kaplan et al. avevano dimostrato che la loss segue trend prevedibili di power-law scaling trends in funzione di parametri, dati e compute di training. Oggi le cose sono più articolate: accanto al pre-training, si sono cristallizzate altre due dimensioni — post-training (SFT, RL) e test‑time compute (long thinking, search/verification, multi‑sample). Amazon Web Services, che ha pubblicato una panoramica tecnica su questi foundation model building blocks, descrive esattamente three scaling laws for AI applicate a ogni fase. Ma ogni fase ha un collo di bottiglia diverso: il pre‑training richiede banda memoria e FLOP sostenuti, il post‑training fa leva su rapidi cicli di fine‑tuning, il test‑time compute esige latenza ultra‑bassa e throughput elevato. Ed è qui che l’hardware fa la differenza: una GPU B300 con 288 GB di HBM3e e 8 TB/s di banda può gestire batch di inferenza lunghi senza spillare su CPU, mentre la B200 peak performance in FP8 (4,5 PFLOPS) bilancia costi energetici e capacità. Chi costruisce modelli oggi non sceglie più solo l’architettura del modello, ma il profilo di calcolo — e la GPU diventa il vero parametro di scaling.

Dalla GPU al cluster: EFA e le architetture di interconnessione

Un singolo acceleratore, per quanto potente, non scala se la rete non tiene il passo.

AWS ha risolto il problema con Elastic Fabric Adapter, un building block per i suoi EFA UltraClusters building block che garantisce comunicazioni a bassa latenza e alta banda tra migliaia di GPU. Senza una rete efficiente, le leggi di scaling si infrangono contro il muro della sincronizzazione dei gradienti. AlphaEvolve, l’agente di codice basato su Gemini, ha dimostrato come un’infrastruttura ben orchestrata possa migliorare strumenti esistenti: il team di Google DeepMind ha usato AlphaEvolve per ottimizzare DeepConsensus, un modello per la correzione degli errori di sequenziamento del DNA, e ha documentato l’AlphaEvolve impact su diverse discipline. Dietro quel risultato c’è un’architettura di calcolo che combina GPU di ultima generazione e interconnessioni a bassa latenza — non è il singolo chip a fare la differenza, ma il cluster progettato come sistema.

L’infrastruttura come nuova legge di scaling

Jensen Huang, CEO di NVIDIA, ha definito l’AI come il più grande beginning of the AI revolution infrastrutturale della storia umana, e ha aggiunto che si tratta di un’once-in-a-generation AI opportunity per reindustrializzare gli Stati Uniti. Tradotto in termini tecnici: chiunque costruisca applicazioni AI oggi deve considerare l’infrastruttura di calcolo non come un semplice costo, ma come il vero fattore di scaling. Le leggi di scaling non sono più solo una funzione di parametri e dati; sono una funzione della banda memoria, della precisione aritmetica, della capacità di HBM, dell’interconnessione tra nodi. La decisione di usare FP4 invece di FP8 non è un dettaglio di implementazione — è una scelta architetturale che determina quanti token puoi processare al secondo e quanto a lungo puoi far “pensare” il modello a test‑time. Per chi costruisce, lo stack cambia: non più “modello + dataset”, ma “modello + profilo di calcolo + rete”. E l’unico modo per stare al passo è conoscere le specifiche — a partire da quelle di una semplice GPU.

🍪 Impostazioni Cookie