OpenAI ha portato Sol e Luna su Bedrock

OpenAI ha portato Sol e Luna su Bedrock

OpenAI annuncia GPT-6 Sol e Luna su Amazon Bedrock: su AutomationBench Sol supera Claude Opus 5 con costo per task ridotto.

Su AutomationBench il modello supera Claude Opus 5 completando i task a un costo per task pari al 9%

Non guardare il nome del modello: guarda il costo per task. Martedì 22 settembre, OpenAI ha annunciato la disponibilità generale di GPT-6 Sol e GPT-6 Luna su Amazon Bedrock — secondo l’annuncio ufficiale di AWS, i due modelli girano su un inference engine progettato per alte prestazioni, sicurezza e affidabilità su larga scala. Il dato che ha fatto rumore non è la taglia della rete, ma il benchmark: su AutomationBench, un test di flussi di lavoro aziendali tra applicazioni, GPT-6 Sol con effort xhigh supera Claude Opus 5 portato al massimo effort e completa ogni task al 9% del costo per task di Opus 5.

Il 9% che cambia i conti

Su AutomationBench, la metrica è quella che conta per chi automatizza processi: flussi di lavoro tra applicazioni diverse, non punteggi sintetici. Il confronto pubblicato da OpenAI non è simmetrico: GPT-6 Sol è configurato con effort xhigh, mentre Claude Opus 5 è portato al massimo effort. Nonostante questo, Sol supera Opus 5 completando i task a un costo pari al 9% del costo per task di Opus 5. L’unità di misura della competizione cambia: non più parametri addestrati o punteggi generici, ma il costo per task completato.

Sotto il cofano della generazione GPT-6

Se il costo per task scende così tanto, è perché dietro c’è un cambio di generazione, non un semplice repricing. Lo scorso 9 luglio, la disponibilità generale della famiglia GPT-5.6 — Sol, Terra e Luna su Bedrock è stata annunciata; GPT-6 Astra è seguito a settembre. Ora il laboratorio estende la generazione GPT-6 con versioni aggiornate dei modelli più piccoli. Come si legge su TechCrunch, Astra è arrivato per primo e Sol e Luna sono i livelli più economici che completano la stessa generazione.

Il salto generazionale si misura anche in affidabilità fattuale. Secondo OpenAI, GPT-6 Sol commette circa la metà degli errori fattuali di GPT-5.6 Sol in una valutazione interna; per Luna, le valutazioni mostrano miglioramenti nell’affidabilità fattuale e una comunicazione più chiara dei risultati. Non è un repricing: è un cambio di generazione che tocca anche la qualità delle risposte. Resta da chiedersi quali carichi potranno davvero sfruttare questa doppia leva di prezzo e affidabilità su Bedrock.

Cosa cambia per chi costruisce su Bedrock

Se prezzo e affidabilità si muovono insieme, la domanda per chi progetta su Bedrock diventa operativa. L’inference engine su cui girano Sol e Luna è progettato per alte prestazioni, sicurezza e affidabilità su larga scala. C’è poi un vincolo di governance da mettere in conto: per il rilevamento automatizzato degli abusi, il traffico segnalato dai classificatori viene conservato da AWS per un massimo di 30 giorni e processato in modo programmatico. Conviene davvero migrare i workload da Claude Opus 5 ora, o la mossa di OpenAI è solo l’apertura di una guerra di prezzi più lunga?

Per chi costruisce su Bedrock, la scelta non è più tra modelli, ma tra costi per task, soglie di affidabilità e governance dei dati: il vantaggio va a chi saprà leggere il benchmark, non il nome.

🍪 Impostazioni Cookie