OpenAI taglia i prezzi di GPT-5.6, spostando l'attenzione sull'efficienza dei costi dell'AI
AI News

OpenAI taglia i prezzi di GPT-5.6, spostando l'attenzione sull'efficienza dei costi dell'AI

4 min
31/07/2026
OpenAIGPT-5.6AI pricingcost efficiency

OpenAI ha ridefinito drasticamente l'economia della sua famiglia di modelli GPT-5.6, annunciando tagli di prezzo fino all'80% sul suo modello più piccolo e veloce, Luna, mentre introduce una modalità Fast premium per il suo modello di punta Sol. La mossa, dettagliata in un post sul blog il 30 luglio 2026, segna una svolta strategica nel settore dell'AI: la competizione non riguarda più solo chi ha il modello più capace, ma chi è in grado di offrire quell'intelligenza al costo più basso.

I nuovi livelli di prezzo

Il cambiamento più eclatante è la riduzione dell'80% del prezzo per GPT-5.6 Luna, portando il suo costo a $0,20 per milione di token in input e $1,20 per milione di token in output. Questo colloca Luna in diretta concorrenza con i modelli di inferenza a basso costo di rivali come DeepSeek e Xiaomi MiMo-V2.5 Flash, sebbene non sia il più economico in assoluto sul mercato. GPT-5.6 Terra ha ricevuto un taglio del 20%, ora al prezzo di $2 per milione di token in input e $12 per milione di token in output.

Per il modello di punta GPT-5.6 Sol, i prezzi rimangono invariati, ma OpenAI ha introdotto una nuova modalità Fast nell'API. Questa opzione offre prestazioni fino a 2,5 volte più veloci al doppio del prezzo standard, mantenendo lo stesso livello di intelligenza. Sostituisce la precedente offerta Priority Processing, con retrocompatibilità per le richieste già taggate.

Guadagni di efficienza dal basso verso l'alto

Queste riduzioni di prezzo non sono arbitrarie; sono il risultato diretto di miglioramenti sistematici dell'efficienza su tutta la pila del modello. OpenAI ha dettagliato che lo stesso GPT-5.6 è stato determinante nel trovare questi guadagni. All'interno di un processo guidato da umani, il modello ha riscritto e ottimizzato in modo autonomo i kernel di produzione, progettato ed eseguito centinaia di esperimenti per migliorare la generazione di token e monitorato l'addestramento, intervenendo quando sorgevano problemi.

Questo lavoro sui kernel da solo ha ridotto il costo end-to-end di servizio del modello del 20%, mentre i suoi esperimenti hanno aumentato l'efficienza di generazione dei token di oltre il 15%. Il vantaggio in termini di efficienza dell'azienda deriva dal miglioramento di tre livelli: i modelli stessi, i sistemi di inferenza che li eseguono e l'harness agentica che li collega a strumenti e contesto. Un routing migliore mantiene produttivo l'hardware, software di produzione ottimizzato genera token in modo più efficiente e una gestione più intelligente del contesto aiuta gli agenti a evitare di ripetere lavoro già completato.

continua a leggere sotto...

Metriche di performance nel mondo reale

L'impatto di questi miglioramenti è convalidato sia da benchmark interni che da testimonianze dei clienti. Su SWE-bench Verified, utilizzando GPT-5.5, il sistema agente NOOA ha raggiunto un'accuratezza dell'82,2% utilizzando 29 chiamate LLM e circa 1,1 milioni di token per attività, circa la metà dei token richiesti da harness di confronto per prestazioni simili o migliori. Sul più impegnativo benchmark ARC-AGI-3, un singolo agente NOOA con GPT-5.6-sol ha raggiunto una media RHAE dell'85,1% a meno di $20 per partita, avanzando la frontiera Pareto punteggio-costo del benchmark.

Le citazioni dei clienti dall'annuncio evidenziano i vantaggi pratici. Michele Catasta, Presidente e Responsabile AI di Replit, ha definito Luna "la cosa più vicina a un'intelligenza troppo economica per essere misurata". Il CTO di Blitzy ha riferito che Luna li ha portati da una singola chiamata di output strutturato a un ciclo completo di agente con chiamate a strumenti, aumentando il riutilizzo della cache dei prompt dal 24% al 90%, riducendo al contempo i costi dell'87% rispetto a GPT-5.4 mini.

Implicazioni strategiche e contesto di mercato

I tagli di prezzo arrivano mentre il settore dell'AI attraversa un cambiamento fondamentale. La competizione tra i fornitori di frontiera è andata oltre quale modello sia più capace. La domanda ora è quale fornitore offra il percorso più prevedibile ed economicamente efficiente per eseguire l'AI su scala produttiva. I tagli di OpenAI sono una risposta diretta a questo cambiamento, ridefinendo la serie GPT-5.6 da un prodotto di accesso premium a una piattaforma di distribuzione economicamente competitiva.

Tuttavia, OpenAI non ha il mercato per sé. Claude Opus 5 di Anthropic rimane circa performante come GPT-5.6 Sol, ma è più economico del 6% a $5 per milione di token in input e $25 per milione di token in output. Il modello flash di DeepSeek e Xiaomi MiMo-V2.5 Flash sottocostano anche Luna su base puramente di token. La guerra dei prezzi nell'AI si sta intensificando e i vincitori saranno le imprese che ora possono permettersi di scalare applicazioni AI che prima non erano economicamente sostenibili.

Disponibilità e prospettive

GPT-5.6 Terra e Luna rimangono disponibili in ChatGPT Work, Codex e nell'API OpenAI. Gli utenti Free e Go possono accedere a Terra, mentre gli utenti Plus, Pro, Business ed Enterprise possono scegliere Terra e Luna. I nuovi prezzi sono entrati in vigore il 30 luglio, con modifiche implementate su AWS più tardi lo stesso giorno. La modalità Fast per Sol sostituisce Priority Processing nell'API e si allinea con /fast in Codex.

La strategia di OpenAI è chiara: far progredire sia le capacità che l'efficienza in modo che ogni generazione di intelligenza possa svolgere più lavoro a un costo inferiore. Come ha osservato l'azienda, "i guadagni possono accumularsi": modelli più capaci aiutano a trovare la prossima generazione di miglioramenti, accorciando il percorso verso prestazioni migliori e costi inferiori. Per le imprese, il messaggio è altrettanto chiaro: l'era dell'AI troppo costosa per essere scalata sta finendo.