OpenAI je izvršio značajnu promjenu cijena i latencije svoje GPT-5.6 API linije, snizivši cijene GPT-5.6 Luna API-ja za 80%, smanjivši cijene GPT-5.6 Terra za 20% i zamijenivši prioritetnu obradu za GPT-5.6 Sol novim brzim načinom rada.

Ažuriranje, objavljeno 30. srpnja 2026., mijenja osnovnu ekonomiju za programere i tvrtke koje izvode velika opterećenja zaključivanja. Cijena Terra API-ja sada je 2 USD za milijun ulaznih tokena i 12 USD za milijun izlaznih tokena. Cijena Lune sada iznosi 0,20 USD za milijun ulaznih tokena i 1,20 USD za milijun izlaznih tokena. OpenAI kaže da Terra i Luna ostaju dostupni u ChatGPT Work-u, Codex-u i OpenAI API-ju, a promjene cijena također počinju izlaziti u AWS kasnije istog dana.

Promjena nije samo popust. Mijenja način na koji timovi trebaju razmišljati o odabiru razine modela, rezervnim pravilima, proračunima latencije i kontroli troškova AI API-ja. Luna je sada pozicionirana mnogo agresivnije za radna opterećenja s nižim troškovima, dok Terra postaje jeftinija za zadatke koji zahtijevaju jače mogućnosti, ali ne opravdavaju najvišu latenciju ili najskuplju razinu. Sol, u međuvremenu, sada ima jasniju opciju vrhunske brzine putem brzog načina rada.

Što se promijenilo u cijenama API-ja OpenAI-ja

Naslovna brojka je smanjenje od 80% za GPT-5.6 Luna. S 0,20 USD za milijun ulaznih tokena i 1,20 USD za milijun izlaznih tokena, Luna postaje mnogo relevantniji kandidat za sažimanje velikih razmjera, klasifikaciju, izdvajanje, nacrte korisničke podrške, laganu pomoć kodiranja i poslove pozadinske obrade gdje je jedinična cijena važnija od vrhunske kvalitete obrazloženja.

GPT-5.6 Terra-ovo smanjenje od 20% je manje, ali još uvijek značajno za proizvodne sustave koji već koriste Terra za sposobnije odgovore. Njegova nova API cijena je 2 USD za milijun ulaznih tokena i 12 USD za milijun izlaznih tokena. Za aplikacije s generiranjem velikih izlaznih podataka, kao što je izrada izvješća, generiranje koda, podučavanje ili agencijsko planiranje, izlazna strana računa ostaje glavna varijabla. Čak i skromni postotak smanjenja može postati značajan u razmjeru.

OpenAI je također promijenio proizvod latencije oko GPT-5.6 Sol. Brzi način rada zamjenjuje prioritetnu obradu u API-ju, ostaje kompatibilan sa zahtjevima koji su označeni kao prioritetni, a OpenAI ga opisuje kao do 2,5 puta brži od standardne obrade po dvostruko višoj cijeni. To stvara eksplicitniji kompromis: programeri mogu platiti više za manju latenciju na hitnim zahtjevima, dok rutinska radna opterećenja zadržavaju na standardnoj obradi.

Za timove koji uspoređuju najjeftinije API opcije modela AI, Luna rez je dio koji će najvjerojatnije natjerati na ponovno izračunavanje. Radna opterećenja osjetljiva na cijenu koja su prije mogla biti preusmjerena na manje modele drugih pružatelja usluga, starije modele OpenAI ili implementacije otvorene težine sada mogu trebati još jedno usporedno ispitivanje s Luninim novim profilom troškova.

Zašto je to važno za programere i timove proizvoda

Troškovi AI aplikacije rijetko se određuju samo cijenom jednog modela. Pravi račun ovisi o strategiji usmjeravanja, veličini odziva, duljini završetka, ponašanju ponovnog pokušaja, predmemoriranju, konkurentnosti korisnika i koliko često sustav eskalira od jeftinijeg modela do sposobnijeg. Nove cijene OpenAI-ja čine te odluke o usmjeravanju važnijima, a ne manje.

Uobičajeni proizvodni obrazac je upotreba jeftinijeg modela za većinu zahtjeva i eskalacija samo kada zadatak zahtijeva dublje razmišljanje, bolju izvedbu kodiranja, snažnije praćenje uputa ili veću točnost. Budući da je Luna sada mnogo jeftinija, timovi mogu odlučiti poslati više prometa prvog prolaza na Lunu, rezervirati Terru za zadatke srednje složenosti i koristiti Sol za staze koje su najosjetljivije na latenciju ili mogućnosti.

Brzi način rada dodaje drugu dimenziju toj odluci. Chatbot za podršku, na primjer, možda neće trebati vrhunsku latenciju za sažimanje pozadinskog ureda, ali će možda trebati brže vrijeme odgovora kada korisnik koji plaća čeka u chatu uživo. Pomoćnik za kodiranje može pokrenuti standardnu ​​obradu za pozadinske refaktore, ali koristiti brzi način rada kada je razvojni programer blokiran u interaktivnoj sesiji.

Ovdje AI API pristupnik ili višemodelni API sloj postaje operativno koristan. Umjesto tvrdog kodiranja naziva modela i oznaka prioriteta u cijeloj aplikaciji, timovi mogu centralizirati politike: usmjeravati rutinske zahtjeve na Lunu, eskalirati dvosmislene slučajeve na Terru, rezervirati Sol Fast način rada za puteve visoke vrijednosti ili korisnike te primijeniti gornje granice proračuna po proizvodu, timu ili kupcu. Model Gate ovdje ima praktičnu vezu jer su usmjeravanje kompatibilno s OpenAI-jem, objedinjena naplata, upravljanje ključevima API-ja i analitika korištenja upravo one kontrolne točke koje timovi trebaju kada pružatelj promijeni cijene ili načine kašnjenja.

Mogućnost kontrole troškova je stvarna, ali nije automatska

Niže cijene modela ne jamče niži račun.Mnogi timovi odgovaraju na jeftinije zaključivanje povećanjem upotrebe: duljim uputama, više koraka agenta, više ponovnih pokušaja, više generiranih alternativa ili širim uvođenjem značajki. To može biti ispravna odluka o proizvodu, ali može poništiti očekivane uštede ako se korištenje ne mjeri pažljivo.

Neposredni zadatak inženjerskih i financijskih timova je usporediti stare i nove kombinirane troškove. Radna opterećenja s kratkim ulazima i dugim izlazima imat će drugačije koristi od radnih opterećenja u kojima dominira kontekst dohvaćanja ili veliki prompti. Aplikacije koje se već uvelike oslanjaju na Terru doživjet će izravno smanjenje, dok bi aplikacije koje mogu sigurno premjestiti promet sa skupljih razina na Lunu mogle ostvariti veće dobitke.

Razvojni programeri bi također trebali ponovno testirati kvalitetu, latenciju i ponašanje kvara prema realnim upitima. Jeftiniji model je jeftiniji samo ako pouzdano rješava zadatak. Ako Luna zahtijeva više ponovnih pokušaja, duže upite ili dodatne korake provjere valjanosti za određeni slučaj upotrebe, efektivna troškovna prednost može biti manja nego što sugerira cijena u maloprodaji. Suprotno tome, ako radi dovoljno dobro za velik dio rutinskog posla, nova bi cijena mogla značajno promijeniti arhitekturu troškovno osjetljivih AI proizvoda.

Analitika upotrebe postaje posebno važna nakon promjene cijena. Timovi trebaju vidjeti koji se modeli koriste, koje rute generiraju najviše izlaznih tokena, koji klijenti ili interni timovi potiču potrošnju i gdje se pokreću premium modovi kašnjenja. Bez te vidljivosti, brzi način rada mogao bi postati nezamijećen multiplikator troškova.

Ono što ostaje neizvjesno

OpenAI pripisuje dio poboljšanja troškova posluživanja GPT-5.6 Solu koji pomaže optimizirati proizvodnu infrastrukturu. To je operativna tvrdnja prve strane, a javni materijali ne pružaju neovisnu reviziju ušteda infrastrukture iza smanjenja cijena.

Također je prerano znati kako će odgovoriti konkurenti. Velika smanjenja cijena Lune vrše pritisak na druge pružatelje hostiranih modela, platforme otvorenog modela i stranice s cijenama pristupnika. Šira tržišna reakcija ovisit će o usporednoj kvaliteti, kašnjenju, ograničenjima protoka, poslovnim uvjetima i hoće li ih drugi pružatelji slijediti s vlastitim sniženjima.

Za tvrtke je najsigurniji odgovor ne tretirati ažuriranje kao jednostavnu pobjedu u nabavi. Trebao bi pokrenuti pregled usmjeravanja. Koji se zadaci mogu premjestiti na Lunu? Koji bi trebao ostati na Terri? Koji trebaju Sol Fast mod? Koji klijenti ili interni timovi smiju koristiti premium latenciju? Te će odluke odrediti hoće li nove cijene postati trajno poboljšanje marže ili samo još jedan način za povećanje potražnje za zaključivanjem.