OpenAI je znatno spremenil ceno in zakasnitev svoje linije API-jev GPT-5.6, znižal cene API-ja GPT-5.6 Luna za 80 %, znižal cene GPT-5.6 Terra za 20 % in nadomestil prednostno obdelavo za GPT-5.6 Sol z novim hitrim načinom.

Posodobitev, objavljena 30. julija 2026, spreminja osnovno ekonomiko za razvijalce in podjetja, ki izvajajo velike količine sklepanja. Cene Terra API so zdaj 2 USD na milijon vhodnih žetonov in 12 USD na milijon izhodnih žetonov. Cena Lune je zdaj 0,20 USD na milijon vhodnih žetonov in 1,20 USD na milijon izhodnih žetonov. OpenAI pravi, da Terra in Luna ostajata na voljo v ChatGPT Work, Codexu in API-ju OpenAI, s spremembami cen pa se začnejo uvajati tudi v AWS kasneje istega dne.

Sprememba ni le popust. Spremeni, kako naj ekipe razmišljajo o izbiri ravni modela, nadomestnih pravilih, proračunih zakasnitev in nadzoru stroškov API-ja AI. Luna je zdaj postavljena veliko bolj agresivno za delovne obremenitve z nižjimi stroški, medtem ko postane Terra cenejša za naloge, ki zahtevajo močnejše zmogljivosti, vendar ne upravičujejo najvišje stopnje zakasnitve ali najvišjih stroškov. Sol pa ima zdaj jasnejšo možnost vrhunske hitrosti prek hitrega načina.

Kaj se je spremenilo pri določanju cen API-ja OpenAI

Glavna številka je 80-odstotno znižanje za GPT-5.6 Luna. Z 0,20 USD na milijon vhodnih žetonov in 1,20 USD na milijon izhodnih žetonov postane Luna veliko bolj relevanten kandidat za obsežno povzemanje, klasifikacijo, ekstrakcijo, osnutke za podporo strankam, pomoč pri lahkem kodiranju in obdelavo v ozadju, kjer je cena na enoto pomembnejša od vrhunske kakovosti sklepanja.

20-odstotno znižanje GPT-5.6 Terra je manjše, a še vedno pomembno za proizvodne sisteme, ki že uporabljajo Terra za bolj zmogljive odzive. Njegova nova cena API-ja je 2 USD na milijon vhodnih žetonov in 12 USD na milijon izhodnih žetonov. Pri aplikacijah z obsežnim ustvarjanjem izhodnih podatkov, kot so priprava poročil, ustvarjanje kode, poučevanje ali agentsko načrtovanje, ostaja glavna spremenljivka izhodni žeton. Celo skromen odstotek zmanjšanja lahko postane pomemben v obsegu.

OpenAI je spremenil tudi produkt zakasnitve okoli GPT-5.6 Sol. Hitri način nadomešča prednostno obdelavo v API-ju, ostaja nazaj združljiv z zahtevami, označenimi kot prednostne, in ga OpenAI opisuje kot do 2,5-krat hitrejšo od standardne obdelave po dvakratni ceni. To ustvari bolj ekspliciten kompromis: razvijalci lahko plačajo več za nižjo zakasnitev pri nujnih zahtevah, medtem ko rutinske delovne obremenitve ohranijo pri standardni obdelavi.

Za ekipe, ki primerjajo najcenejše možnosti API modela AI, je izrez Luna tisti del, ki bo najverjetneje prisilil k ponovnemu izračunu. Cenovno občutljive delovne obremenitve, ki so bile prej morda usmerjene k manjšim modelom drugih ponudnikov, starejšim modelom OpenAI ali uvedbam odprte teže, bodo morda zdaj potrebovale še en primerjalni prehod v primerjavi z novim profilom stroškov Lune.

Zakaj je to pomembno za razvijalce in skupine izdelkov

Stroške aplikacije AI le redko določa cena enega modela. Pravi račun je odvisen od strategije usmerjanja, velikosti poziva, dolžine dokončanja, vedenja ponovnega poskusa, predpomnjenja, sočasnosti uporabnikov in kako pogosto sistem stopnjuje od cenejšega modela do zmogljivejšega. Zaradi novih cen OpenAI so te odločitve o usmerjanju pomembnejše, ne manj.

Običajni produkcijski vzorec je uporaba cenejšega modela za večino zahtev in stopnjevanje le, ko naloga zahteva globlje razmišljanje, boljšo zmogljivost kodiranja, strožje sledenje navodilom ali večjo natančnost. Ker je Luna zdaj veliko cenejša, se lahko ekipe odločijo, da pošljejo več prometa prvega prehoda na Luno, rezervirajo Terro za srednje zapletene naloge in uporabijo Sol za poti, ki so najbolj občutljive na zakasnitve ali zmogljivosti.

Hitri način tej odločitvi doda drugo dimenzijo. Klepetalni robot za podporo na primer morda ne bo potreboval premijske zakasnitve za povzemanje zaledne pisarne, morda pa bo potreboval hitrejše odzivne čase, ko stranka, ki plača, čaka v klepetu v živo. Pomočnik za kodiranje lahko zažene standardno obdelavo za refaktorje v ozadju, vendar uporabi hitri način, ko je razvijalec blokiran v interaktivni seji.

Tukaj postane prehod AI API ali plast API-ja z več modeli operativno uporabna. Namesto trdega kodiranja imen modelov in prednostnih zastavic po vsej aplikaciji lahko ekipe centralizirajo politike: usmerjajo rutinske zahteve na Luno, eskalirajo dvoumne primere na Terro, rezervirajo način Sol Fast za poti z visoko vrednostjo ali uporabnikom in uporabljajo zgornje meje proračuna glede na izdelek, ekipo ali stranko. Model Gate ima tukaj praktično povezavo, ker so usmerjanje, združljivo z OpenAI, poenoteno zaračunavanje, upravljanje ključev API in analitika uporabe natanko tiste kontrolne točke, ki jih skupine potrebujejo, ko ponudnik spremeni cene ali načine zakasnitve.

Možnost nadzora nad stroški je resnična, vendar ni samodejna

Nižje cene modela ne zagotavljajo nižjega računa.Številne ekipe se na cenejše sklepanje odzovejo s povečano uporabo: daljši pozivi, več korakov agenta, več ponovnih poskusov, več ustvarjenih alternativ ali širše uvedbe funkcij. To je morda pravilna odločitev o izdelku, vendar lahko izniči pričakovane prihranke, če se uporaba ne meri skrbno.

Neposredna naloga inženirskih in finančnih ekip je primerjati stare in nove mešane stroške. Delovne obremenitve s kratkimi vhodi in dolgimi izhodi bodo imele drugačne koristi od delovnih obremenitev, v katerih prevladuje kontekst pridobivanja ali veliki pozivi. Aplikacije, ki so že v veliki meri odvisne od Terre, bodo opazile neposredno zmanjšanje, medtem ko bodo aplikacije, ki lahko varno premaknejo promet z dražjih ravni na Luno, morda opazile večje dobičke.

Razvijalci bi morali prav tako ponovno preizkusiti kakovost, zakasnitev in vedenje pri napakah pod realističnimi pozivi. Cenejši model je cenejši le, če nalogo rešuje zanesljivo. Če Luna zahteva več ponovnih poskusov, daljše pozive ali dodatne korake preverjanja veljavnosti za določen primer uporabe, je lahko dejanska stroškovna prednost manjša, kot predlaga cena po ceniku. Nasprotno, če deluje dovolj dobro za velik del rutinskega dela, bi lahko nova cena bistveno spremenila arhitekturo stroškovno občutljivih izdelkov AI.

Analitika uporabe postane še posebej pomembna po spremembi cen. Ekipe morajo videti, kateri modeli se uporabljajo, katere poti ustvarijo največ izhodnih žetonov, katere stranke ali notranje ekipe spodbujajo porabo in kje se sprožijo načini premijske zakasnitve. Brez te vidnosti bi lahko hitri način postal neopazen multiplikator stroškov.

Kar ostaja negotovo

OpenAI pripisuje del izboljšanja stroškov strežbe GPT-5.6 Sol, ki pomaga optimizirati proizvodno infrastrukturo. To je operativna trditev prve stranke in javni materiali ne zagotavljajo neodvisne revizije prihrankov infrastrukture, ki stojijo za znižanjem cen.

Prav tako je prezgodaj vedeti, kako se bodo odzvali konkurenti. Veliko znižanje cen Lune je povzročilo pritisk na druge ponudnike gostujočih modelov, platforme odprtega modela in strani s cenami prehodov. Odziv širšega trga bo odvisen od primerjalne kakovosti, zakasnitve, omejitev prepustnosti, pogojev podjetja in tega, ali jim drugi ponudniki sledijo z lastnimi znižanji.

Za podjetja je najvarnejši odgovor, da posodobitve ne obravnavajo kot preprosto zmago pri javnem naročilu. Moral bi sprožiti pregled usmerjanja. Katere naloge se lahko premaknejo na Luno? Katera naj ostane na Terri? Kateri potrebujejo način Sol Fast? Katere stranke ali interne ekipe lahko uporabljajo premium zakasnitev? Te odločitve bodo določile, ali bodo nove cene postale trajno izboljšanje marže ali le še en način za razširitev sklepanja povpraševanja.