OpenAI dokonało znaczącej zmiany w zakresie cen i opóźnień w swojej ofercie API GPT-5.6, obniżając ceny interfejsu API GPT-5.6 Luna o 80%, obniżając ceny GPT-5.6 Terra o 20% i zastępując priorytetowe przetwarzanie dla GPT-5.6 Sol nowym trybem szybkim.
Aktualizacja opublikowana 30 lipca 2026 r. zmienia podstawowe zasady ekonomiczne dla programistów i firm prowadzących wnioskowanie na dużą skalę obciążenia. Ceny Terra API wynoszą obecnie 2 USD za milion tokenów wejściowych i 12 USD za milion tokenów wyjściowych. Ceny Luny wynoszą obecnie 0,20 USD za milion tokenów wejściowych i 1,20 USD za milion tokenów wyjściowych. OpenAI twierdzi, że Terra i Luna pozostają dostępne w ChatGPT Work, Codex i OpenAI API, a zmiany cenowe zaczną być wprowadzane również w AWS jeszcze tego samego dnia.
Zmiana to nie tylko zniżka. Zmienia to sposób, w jaki zespoły powinny myśleć o wyborze warstwy modelu, zasadach awaryjnych, budżetach opóźnień i kontroli kosztów interfejsu API AI. Luna jest teraz pozycjonowana znacznie bardziej agresywnie w przypadku tańszych obciążeń, podczas gdy Terra staje się tańsza w przypadku zadań, które wymagają większych możliwości, ale nie uzasadniają najwyższego opóźnienia lub najwyższego poziomu kosztów. Tymczasem Sol ma teraz wyraźniejszą opcję prędkości premium w trybie szybkim.
Co zmieniło się w cenach API OpenAI
Głównym numerem jest 80% obniżka dla GPT-5.6 Luna. Przy cenie 0,20 USD za milion tokenów wejściowych i 1,20 USD za milion tokenów wyjściowych Luna staje się znacznie bardziej odpowiednim kandydatem do podsumowań, klasyfikacji, ekstrakcji na dużą skalę, wersji roboczych obsługi klienta, lekkiej pomocy w kodowaniu i zadań przetwarzania w tle, gdzie koszt jednostkowy jest ważniejszy niż najwyższa jakość wnioskowania.
20% redukcja w przypadku GPT-5.6 Terra jest mniejsza, ale nadal znacząca dla systemów produkcyjnych, które już korzystają z Terra w celu uzyskania bardziej wydajnych odpowiedzi. Nowa cena API wynosi 2 USD za milion tokenów wejściowych i 12 USD za milion tokenów wyjściowych. W przypadku zastosowań generujących duże ilości danych wyjściowych, takich jak sporządzanie raportów, generowanie kodu, nauczanie lub planowanie agentowe, główną zmienną pozostaje strona rachunku zawierająca wyniki. Nawet skromne cięcie procentowe może okazać się istotne na dużą skalę.
OpenAI zmieniło także produkt dotyczący opóźnień wokół GPT-5.6 Sol. Tryb szybki zastępuje przetwarzanie priorytetowe w API, pozostaje kompatybilny wstecz z żądaniami oznaczonymi jako priorytetowe i jest opisywany przez OpenAI jako do 2,5 razy szybszy niż przetwarzanie standardowe za dwukrotnie wyższą cenę. Daje to bardziej wyraźny kompromis: programiści mogą płacić więcej za mniejsze opóźnienia w przypadku pilnych żądań, zachowując jednocześnie rutynowe obciążenie przetwarzania standardowego.
W przypadku zespołów porównujących najtańsze opcje API modelu AI, wycięcie Luny jest częścią, która najprawdopodobniej wymusi ponowne obliczenia. Obciążenia wrażliwe na cenę, które wcześniej mogły być kierowane do mniejszych modeli innych dostawców, starszych modeli OpenAI lub wdrożeń o otwartej wadze, mogą teraz potrzebować kolejnego testu porównawczego w porównaniu z nowym profilem kosztów Luny.
Dlaczego ma to znaczenie dla programistów i zespołów produktowych
Koszty aplikacji AI rzadko są określane wyłącznie na podstawie ceny jednego modelu. Rzeczywisty rachunek zależy od strategii routingu, rozmiaru podpowiedzi, długości zakończenia, zachowania podczas ponownych prób, buforowania, współbieżności użytkowników i częstotliwości eskalacji systemu z tańszego modelu do bardziej wydajnego. Nowe ceny OpenAI sprawiają, że decyzje dotyczące routingu są ważniejsze, a nie mniej.
Powszechnym wzorcem produkcyjnym jest stosowanie tańszego modelu w przypadku większości żądań i eskalacja tylko wtedy, gdy zadanie wymaga głębszego rozumowania, lepszej wydajności kodowania, lepszego przestrzegania instrukcji lub większej dokładności. Ponieważ Luna jest teraz znacznie tańsza, zespoły mogą zdecydować się na wysyłanie do Luny większego ruchu pierwszego przejścia, rezerwowanie Terry do zadań o średniej złożoności i używanie Sol do ścieżek najbardziej wrażliwych na opóźnienia lub możliwości.
Tryb szybki dodaje drugi wymiar tej decyzji. Na przykład chatbot wsparcia może nie potrzebować dodatkowego opóźnienia do podsumowania zaplecza, ale może potrzebować krótszego czasu reakcji, gdy płacący klient czeka na czacie na żywo. Asystent kodowania może uruchamiać standardowe przetwarzanie dla refaktorów w tle, ale używać trybu szybkiego, gdy programista jest zablokowany w sesji interaktywnej.
W tym miejscu brama API AI lub wielomodelowa warstwa API staje się użyteczna operacyjnie. Zamiast kodować na stałe nazwy modeli i flagi priorytetów w aplikacji, zespoły mogą scentralizować zasady: kierować rutynowe żądania do Luny, eskalować niejednoznaczne przypadki do Terra, rezerwować tryb Sol Fast dla ścieżek o dużej wartości lub dostępnych dla użytkownika oraz stosować pułapy budżetowe według produktu, zespołu lub klienta. Model Gate ma tu praktyczne powiązanie, ponieważ routing zgodny z OpenAI, ujednolicone fakturowanie, zarządzanie kluczami API i analityka użytkowania to dokładnie te punkty kontrolne, których potrzebują zespoły, gdy dostawca zmienia ceny lub tryby opóźnień.
Możliwość kontroli kosztów jest realna, ale nie automatyczna
Niższe ceny modeli nie gwarantują niższych rachunków.Wiele zespołów reaguje na tańsze wnioskowanie poprzez zwiększenie wykorzystania: dłuższe monity, więcej kroków agenta, więcej ponownych prób, więcej generowanych alternatyw lub szersze wdrażanie funkcji. Może to być właściwa decyzja dotycząca produktu, ale może spowodować utratę oczekiwanych oszczędności, jeśli użycie nie zostanie dokładnie zmierzone.
Bezpośrednim zadaniem zespołów inżynieryjnych i finansowych jest porównanie starych i nowych kosztów mieszanych. Obciążenia z krótkimi danymi wejściowymi i długimi wynikami przyniosą inne korzyści niż obciążenia zdominowane przez kontekst pobierania lub duże podpowiedzi. Aplikacje, które już w dużym stopniu opierają się na Terra, odnotują bezpośrednie zmniejszenie, podczas gdy aplikacje, które mogą bezpiecznie przenieść ruch z droższych warstw do Luny, mogą odnotować większe zyski.
Programiści powinni również ponownie przetestować jakość, opóźnienia i zachowanie w przypadku awarii, korzystając z realistycznych podpowiedzi. Tańszy model jest tańszy tylko wtedy, gdy rzetelnie rozwiązuje zadanie. Jeśli Luna wymaga większej liczby ponownych prób, dłuższych podpowiedzi lub dodatkowych kroków weryfikacyjnych dla konkretnego przypadku użycia, efektywna przewaga kosztowa może być mniejsza, niż sugeruje cena katalogowa. I odwrotnie, jeśli będzie działać wystarczająco dobrze w przypadku dużej części rutynowych prac, nowa cena może znacząco zmienić architekturę wrażliwych na koszty produktów AI.
Analiza użytkowania staje się szczególnie ważna po zmianie cen. Zespoły muszą zobaczyć, które modele są używane, które trasy generują najwięcej tokenów wyjściowych, jakie wydatki wydają klienci lub zespoły wewnętrzne oraz gdzie wyzwalane są tryby opóźnień premium. Bez tej widoczności tryb szybki mógłby stać się niezauważonym mnożnikiem kosztów.
Co pozostaje niepewne
OpenAI przypisuje część poprawy kosztów obsługi GPT-5.6 Sol pomagając w optymalizacji infrastruktury produkcyjnej. Jest to twierdzenie operacyjne pierwszej strony, a materiały publiczne nie zapewniają niezależnego audytu oszczędności w infrastrukturze wynikających z obniżek cen.
Jest też zbyt wcześnie, aby wiedzieć, jak zareagują konkurenci. Duże obniżki cen Luny wywierają presję na innych dostawców modeli hostowanych, platformy modeli otwartych i strony z cenami bramek. Szersza reakcja rynku będzie zależała od jakości porównawczej, opóźnień, limitów przepustowości, warunków korporacyjnych i tego, czy inni dostawcy zastosują się do nich, wprowadzając własne obniżki.
Dla firm najbezpieczniejszą reakcją nie jest traktowanie aktualizacji jako zwykłego wygranego przetargu. Powinno to spowodować przegląd routingu. Jakie zadania można przenieść na Lunę? Które powinny pozostać na Terrze? Które wymagają trybu Sol Fast? Którzy klienci lub zespoły wewnętrzne mogą korzystać z opóźnień premium? Od tych decyzji zadecyduje, czy nowe ceny staną się trwałą poprawą marży, czy po prostu kolejnym sposobem na zwiększenie popytu na wnioskowanie.