OpenAI ha apportato una modifica significativa ai prezzi e alla latenza della sua gamma di API GPT-5.6, tagliando i prezzi dell'API GPT-5.6 Luna dell'80%, riducendo i prezzi di GPT-5.6 Terra del 20% e sostituendo l'elaborazione prioritaria per GPT-5.6 Sol con una nuova modalità Veloce.

L'aggiornamento, pubblicato il 30 luglio 2026, cambia gli aspetti economici di base per gli sviluppatori e le aziende che eseguono carichi di lavoro di inferenza ad alto volume. Il prezzo dell'API Terra è ora di 2 dollari per milione di token di input e di 12 dollari per milione di token di output. Il prezzo di Luna è ora di 0,20 dollari per milione di token di input e 1,20 dollari per milione di token di output. OpenAI afferma che Terra e Luna rimangono disponibili in ChatGPT Work, Codex e API OpenAI, con modifiche ai prezzi che inizieranno a essere implementate anche in AWS più tardi lo stesso giorno.

La modifica non è solo uno sconto. Altera il modo in cui i team dovrebbero pensare alla selezione del livello di modello, alle regole di fallback, ai budget di latenza e al controllo dei costi delle API AI. Luna è ora posizionata in modo molto più aggressivo per carichi di lavoro a basso costo, mentre Terra diventa meno costosa per attività che richiedono capacità maggiori ma che non giustificano il livello di latenza più elevato o il livello di costo più elevato. Sol, nel frattempo, ora ha un'opzione di velocità premium più chiara tramite la modalità Veloce.

Cosa è cambiato nei prezzi delle API di OpenAI

Il numero principale è la riduzione dell'80% per GPT-5.6 Luna. Con 0,20 dollari per milione di token di input e 1,20 dollari per milione di token di output, Luna diventa un candidato molto più rilevante per riepiloghi, classificazioni, estrazioni su larga scala, bozze di supporto clienti, assistenza leggera nella codifica e lavori di elaborazione in background in cui il costo unitario conta più della massima qualità del ragionamento.

La riduzione del 20% di GPT-5.6 Terra è minore, ma comunque significativa per i sistemi di produzione che già utilizzano Terra per risposte più capaci. Il suo nuovo prezzo API è di 2 dollari per milione di token di input e 12 dollari per milione di token di output. Per le applicazioni con un'elevata generazione di output, come la stesura di report, la generazione di codici, il tutoraggio o la pianificazione degli agenti, il lato token di output della fattura rimane la variabile principale. Anche una modesta riduzione percentuale può diventare materiale su larga scala.

OpenAI ha anche modificato il prodotto di latenza attorno a GPT-5.6 Sol. La modalità veloce sostituisce l'elaborazione prioritaria nell'API, rimane compatibile con le versioni precedenti con le richieste contrassegnate come prioritarie ed è descritta da OpenAI come fino a 2,5 volte più veloce dell'elaborazione standard al doppio del prezzo. Ciò crea un compromesso più esplicito: gli sviluppatori possono pagare di più per una minore latenza sulle richieste urgenti mantenendo i carichi di lavoro di routine sull'elaborazione Standard.

Per i team che confrontano le opzioni API del modello AI più economiche, il taglio Luna è la parte che con maggiore probabilità forza un ricalcolo. I carichi di lavoro sensibili al prezzo che in precedenza potevano essere indirizzati a modelli più piccoli di altri fornitori, modelli OpenAI precedenti o implementazioni open-weight potrebbero ora aver bisogno di un altro passaggio di benchmark rispetto al nuovo profilo di costo di Luna.

Perché questo è importante per sviluppatori e team di prodotto

I costi delle applicazioni AI sono raramente determinati dal prezzo di un solo modello. Il conto reale dipende dalla strategia di routing, dalle dimensioni dei prompt, dalla durata del completamento, dal comportamento dei tentativi, dalla memorizzazione nella cache, dalla concorrenza degli utenti e dalla frequenza con cui un sistema passa da un modello più economico a uno più potente. I nuovi prezzi di OpenAI rendono le decisioni relative al routing più importanti, non meno.

Un modello di produzione comune prevede l'utilizzo di un modello a basso costo per la maggior parte delle richieste e l'intensificazione solo quando l'attività richiede un ragionamento più approfondito, migliori prestazioni di codifica, una maggiore precisione nel seguire le istruzioni o una maggiore precisione. Dato che Luna è ora molto più economica, i team possono scegliere di inviare più traffico di primo passaggio su Luna, riservare Terra per attività di media complessità e utilizzare Sol per i percorsi più sensibili alla latenza o alle capacità.

La modalità veloce aggiunge una seconda dimensione a questa decisione. Un chatbot di supporto, ad esempio, potrebbe non aver bisogno di una latenza premium per il riepilogo del back-office, ma potrebbe richiedere tempi di risposta più rapidi quando un cliente pagante attende in una chat dal vivo. Un assistente di codifica può eseguire l'elaborazione standard per i refactoring in background ma utilizzare la modalità Veloce quando uno sviluppatore è bloccato in una sessione interattiva.

È qui che un gateway API AI o un livello API multi-modello diventa operativamente utile. Invece di codificare i nomi dei modelli e i flag di priorità in tutta un'applicazione, i team possono centralizzare le policy: instradare le richieste di routine a Luna, inoltrare casi ambigui a Terra, riservare la modalità Sol Fast per percorsi di alto valore o rivolti agli utenti e applicare massimali di budget per prodotto, team o cliente. Model Gate ha un collegamento pratico qui perché il routing compatibile con OpenAI, la fatturazione unificata, la gestione delle chiavi API e l'analisi dell'utilizzo sono esattamente i punti di controllo di cui i team hanno bisogno quando un fornitore modifica i prezzi o le modalità di latenza.

L'opportunità di controllo dei costi è reale, ma non automatica

I prezzi dei modelli più bassi non garantiscono una fattura più bassa.Molti team rispondono a un'inferenza più economica aumentando l'utilizzo: richieste più lunghe, più passaggi dell'agente, più tentativi, più alternative generate o implementazioni di funzionalità più ampie. Questa potrebbe essere la decisione giusta sul prodotto, ma può cancellare i risparmi attesi se l'utilizzo non viene misurato attentamente.

Il compito immediato dei team di ingegneria e finanza è confrontare i vecchi e i nuovi costi combinati. I carichi di lavoro con input brevi e output lunghi trarranno vantaggi in modo diverso dai carichi di lavoro dominati dal contesto di recupero o da prompt di grandi dimensioni. Le applicazioni che già fanno molto affidamento su Terra vedranno una riduzione diretta, mentre le applicazioni che possono spostare in sicurezza il traffico da livelli più costosi a Luna potrebbero vedere guadagni maggiori.

Gli sviluppatori dovrebbero anche testare nuovamente la qualità, la latenza e il comportamento in caso di errori con richieste realistiche. Un modello più economico è più economico solo se risolve il compito in modo affidabile. Se Luna richiede più tentativi, richieste più lunghe o passaggi di convalida aggiuntivi per un particolare caso d'uso, il vantaggio in termini di costi effettivi potrebbe essere inferiore a quanto suggerito dal prezzo di listino. Al contrario, se funziona abbastanza bene per gran parte del lavoro di routine, il nuovo prezzo potrebbe cambiare materialmente l'architettura dei prodotti IA sensibili ai costi.

L'analisi dell'utilizzo diventa particolarmente importante dopo una modifica dei prezzi. I team devono vedere quali modelli vengono utilizzati, quali percorsi generano la maggior parte dei token di output, quali clienti o team interni guidano la spesa e dove vengono attivate le modalità di latenza premium. Senza tale visibilità, la modalità Veloce potrebbe diventare un moltiplicatore di costi inosservato.

Ciò che rimane incerto

OpenAI attribuisce parte del miglioramento dei costi di servizio a GPT-5.6 Sol che aiuta a ottimizzare l'infrastruttura di produzione. Si tratta di un'affermazione operativa di prima parte e i materiali pubblici non forniscono un audit indipendente dei risparmi infrastrutturali dietro le riduzioni dei prezzi.

È anche troppo presto per sapere come risponderanno i concorrenti. I grandi tagli ai prezzi di Luna mettono sotto pressione altri fornitori di modelli ospitati, piattaforme a modello aperto e pagine dei prezzi dei gateway. La reazione più ampia del mercato dipenderà dalla qualità comparativa, dalla latenza, dai limiti di throughput, dai termini aziendali e dal fatto che altri fornitori seguano le proprie riduzioni.

Per le aziende, la risposta più sicura non è considerare l'aggiornamento come una semplice vittoria nell'approvvigionamento. Dovrebbe innescare una revisione del routing. Quali attività possono essere spostate su Luna? Quale dovrebbe restare sulla Terra? Chi ha bisogno della modalità Sol Fast? Quali clienti o team interni possono utilizzare la latenza premium? Tali decisioni determineranno se i nuovi prezzi diventeranno un miglioramento duraturo del margine o semplicemente un altro modo per espandere la domanda di inferenza.