Yandex ha addestrato un modello da zero in sei mesi

Yandex ha addestrato un modello da zero in sei mesi

Modello addestrato da Yandex senza pesi Qwen, licenza Apache 2.0 e 3 miliardi di parametri attivi.

Il rilascio di ieri su Hugging Face ha un dettaglio che non si può ignorare: 80 miliardi di parametri totali, ma solo 3 miliardi attivati per token, e zero pesi ereditati da Qwen. È una scommessa architetturale che va letta in controluce rispetto al precedente Alice AI LLM. Secondo l’annuncio tecnico pubblicato da Yandex, i pesi di AliceAI-Foundation-80B-A3B-Base sono ora open weight sotto licenza Apache 2.0.

La notizia tecnica è duplice. Da un lato c’è il passaggio a un’architettura Mixture-of-Experts: di 80 miliardi di parametri totali, solo 3 miliardi vengono attivati per ogni token. Dall’altro c’è la rottura più netta: l’addestramento interamente interno, senza utilizzare i pesi di modelli open-source di terze parti.

Non è un Qwen: la scommessa dei 3B attivi su 80B

Il precedente modello di punta, Alice AI LLM, era stato inizializzato dai pesi open di Qwen3-235B lo scorso ottobre. Non era un dettaglio: si partiva da un checkpoint già addestrato, con miliardi di pesi che avevano già visto enormi quantità di testo. Ora la storia cambia. AliceAI-Foundation-80B-A3B-Base è stato addestrato interamente da Yandex, senza utilizzare i pesi di alcun modello open-source di terze parti.

I numeri aiutano a capire la portata del salto. Il nuovo modello supera il precedente Alice AI LLM 235B su conoscenza fattuale, matematica, programmazione e lavoro su contesto lungo, usando circa un terzo dei parametri totali e circa un settimo di quelli attivi. In un MoE, la metrica che conta non è il totale: è quanti parametri vengono realmente consultati per generare ogni token. Tre miliardi è una cifra bassa, con implicazioni dirette sul costo di inferenza.

Resta una domanda aperta: cosa ha permesso a Yandex di ripartire da zero in soli sei mesi?

Sei mesi per ripartire da zero: il prezzo e il valore dell’indipendenza

Il progetto è durato circa sei mesi dalla partenza al rilascio, un tempo breve per un modello di questa scala. La domanda è diretta: perché abbandonare l’approccio del passato, quando l’inizializzazione dai pesi Qwen3-235B aveva già dimostrato di richiedere molto meno tempo rispetto a un avvio con pesi casuali, consentendo di eseguire più esperimenti?

La risposta è anche strategica. Ad agosto, secondo quanto dichiarato da Yandex AI Studio, Qwen era il modello straniero più utilizzato sulla piattaforma, con una quota del 21,2% del consumo di token. Dipendere da un modello che domina il proprio stesso marketplace è un rischio concreto: ogni aggiornamento della base, ogni cambiamento di licenza, ogni scelta di instradamento dei pesi diventa una variabile esterna. Addestrare da zero significa riprendere il controllo dello stack, anche al prezzo di un tempo iniziale più lungo.

Lo stack cambia: Apache 2.0, dipendenze e il benchmark del mercato

La licenza è l’altro pezzo del puzzle. Apache 2.0 è permissiva in senso pieno: uso commerciale, modifica, ridistribuzione, nessun obbligo di condividere le proprie modifiche. È la scelta giusta per chi vuole che un modello diventi una base di lavoro, non un esperimento osservato da lontano.

Il confronto con il mercato, però, non è banale. Ad aprile, DeepSeek V4-Pro aveva già alzato l’asticella: un’architettura Mixture-of-Experts da 1,6 trilioni di parametri con 49 miliardi di parametri attivi per passaggio di inferenza e una finestra di contesto da 1 milione di token. Numeri enormi, ma con 49 miliardi di parametri attivi contro i 3 miliardi del modello Yandex. La scommessa di AliceAI-Foundation-80B-A3B-Base è che l’efficienza, non la scala assoluta, diventi il vero fattore competitivo per chi costruisce applicazioni reali.

La prossima mossa dirà se Yandex trasformerà quei 3 miliardi di parametri attivi in un vantaggio di costo accessibile — per inferenza più economica, per fine-tuning più rapido, per deployment meno oneroso — o se resterà una vittoria da benchmark. La direzione tecnica è chiara: conta il numero di parametri attivi, non il totale, e con Apache 2.0 il modello diventa una base reale su cui lavorare senza vincoli.

🍪 Impostazioni Cookie