Il prezzo di GPT-5.6 su Bedrock non è quello che vedi
Il prezzo di GPT-5.6 su Bedrock nasconde un rapporto 10:1 sui token di output. L'inferenza globale costa meno, ma la sovranità dei dati è a rischio.
La contabilità asimmetrica dei token e il premio per la residenza dei dati cambiano il calcolo del costo reale
Dieci a uno. È il rapporto nascosto tra ciò che leggi e ciò che paghi quando usi GPT-5.6 su Amazon Bedrock. Da ieri i modelli GPT-5.6 di OpenAI sono disponibili su Amazon Bedrock in più di 25 regioni AWS con inferenza cross-Region. Il prezzo che vedi non è il prezzo che paghi. E la distanza tra le due cifre si allarga quando il traffico comincia a viaggiare tra regioni diverse.
Dieci contro uno
Prima della geografia, c’è un numero scomodo. Per i modelli GPT-5.6, il tasso di consumo dei token di output è 10x: un token di output consuma 10 token dalla quota TPM. Non è un dettaglio tecnico. È il modo in cui viene conteggiato ciò che paghi, e riduce a un decimo la capacità che credi di avere a disposizione. Le tre varianti del modello, Sol, Terra e Luna, ciascuna ottimizzata per un diverso equilibrio tra capacità e costo, condividono questa contabilità asimmetrica.
L’inferenza cross-Region funziona tramite profili di inferenza, che definiscono un modello e le regioni AWS a cui Amazon Bedrock può instradare una richiesta. L’annuncio di ieri allarga la promessa di flessibilità su scala planetaria. Ma se un token ne consuma dieci, cosa succede quando il traffico viene instradato in più di 25 regioni?
La geografia del risparmio
Non basta contare i token: bisogna capire dove passano. Ed è qui che la geografia diventa una questione di prezzo. Nei giorni scorsi AWS ha confermato un dato che inverte l’intuizione: l’inferenza globale cross-Region per i modelli OpenAI è prezzata più bassa per token rispetto a quella in-Region e geografica. Far viaggiare i dati oltre i confini costa meno che trattenerli. Il cloud, insomma, paga per spedire i tuoi prompt lontano.
Per chi ha requisiti di residenza dei dati, AWS offre la variante geografica dell’inferenza cross-Region, che garantisce l’elaborazione entro confini geografici specifici. Ma quel controllo si paga: un premio rispetto alla variante globale. Lo scorso 13 luglio, i modelli GPT-5.6 Sol, Terra e Luna erano diventati generalmente disponibili su Bedrock con inferenza solo in-Region. Cinque settimane dopo, la scelta si è invertita: il risparmio sta dalla parte di chi accetta che i dati escano dal perimetro.
Non è un movimento improvviso. Già ad aprile OpenAI e AWS avevano ampliato la loro partnership strategica per aiutare le imprese a utilizzare le capacità di OpenAI nei loro ambienti AWS. Quella partnership oggi si traduce in un’architettura di prezzi con un incentivo incorporato: spingere il traffico lontano dal perimetro. A chi conviene questa geografia? A chi non deve rispondere a un regolatore. A chi non deve chiedere ai propri clienti dove vogliono che i dati restino. Se far viaggiare i dati oltre i confini costa meno, chi paga davvero il costo della residenza?
Sovranità in coda
Il paradosso del prezzo si scontra con la promessa dei confini. E i confini, nel cloud, hanno una coda lunga. Per GPT-5.6, i contenuti segnalati dai classificatori automatizzati di rilevamento abusi di Amazon Bedrock vengono conservati fino a 30 giorni per il rilevamento offline degli abusi. Trenta giorni. Non è residenza dei dati. È conservazione post-hoc, decisa da algoritmi che non scegli, su contenuti che pensavi di aver elaborato e lasciato andare.
Il precedente non rassicura. Già a settembre 2025, Claude Sonnet 4 di Anthropic era stato il primo modello su Bedrock a ricevere l’inferenza globale cross-Region. Un anno dopo, la stessa architettura si estende ai modelli OpenAI. La domanda non è se l’inferenza cross-Region convenga. È chi decide davvero dove finiscono i tuoi prompt quando il modello corre in più di 25 regioni.
Il prezzo più basso dell’inferenza globale è una scelta di architettura, non un regalo. È la differenza tra ciò che vedi — un costo per token dichiarato — e ciò che accetti: un controllo dei dati che si sposta lontano dal tuo perimetro. Il conto, dieci a uno, lo paghi due volte. In token. E in controllo.