Google Cloud je dodao novu fleksibilnost naplate i alate za upravljanje troškovima za Gemini Enterprise, stavljajući kontrole potrošnje AI bliže timovima za izgradnju i pokretanje agenata.

Promjena je važna jer se radna opterećenja agenta ne ponašaju kao tradicionalna SaaS mjesta. Agent za kodiranje, agent za podršku ili agent za tijek rada može pozivati ​​više modela, više puta pozivati ​​alate i generirati varijabilnu upotrebu među korisnicima, projektima i okruženjima. Zbog toga je troškove kasnije teže objasniti. Google sada taj problem tretira kao površinu proizvoda unutar Gemini Enterprisea i njegovog razvojnog ekosustava, umjesto da ga u potpunosti prepusti standardnim izvozima naplate u oblaku.

Prema Google Cloudu, kvota alata za razvojne programere uključena u pretplate na Gemini Enterprise sada se objedinjuje na razini projekta Google Cloud. Tvrtka također opisuje proširenu fleksibilnost naplate za radna opterećenja agenata u Gemini Enterprise i alatima za razvojne programere, uključujući Google Antigravity u Gemini Enterprise i Android Studio. Zasebno, Google Cloud dokumentacija opisuje AI Cost Summary Agent koji može analizirati korištenje Geminija, uključujući potrošnju Gemini API-ja i Vertex AI-a, te raščlaniti AI potrošnju prema API ključu.

Što se promijenilo

Najkonkretnija operativna promjena je udruživanje na razini projekta za kvotu alata za razvojne programere vezanu uz pretplate na Gemini Enterprise. Umjesto da razmišljaju samo o pojedinačnim korisnicima koji troše zasebne naknade, organizacije mogu upravljati uključenom kvotom na razini projekta. Za inženjerske timove to je bliže načinu na koji je zapravo organiziran rad umjetne inteligencije: prema proizvodu, okruženju, timu, aplikaciji ili tijeku rada okrenutom prema korisniku.

Agent sažetka troškova AI drugi je značajan dio. Google ga opisuje kao alat za analizu korištenja Geminija i potrošnje AI-ja kroz Gemini API i Vertex AI. Dokumentacija kaže da može rastaviti potrošnju prema API ključu, što je ključna razina atribucije za moderne AI sustave. API ključevi često se preslikavaju na usluge, interne alate, eksperimente, stanare ili tijekove rada agenata. Kad računi rastu, korisno pitanje rijetko je samo "koji je model bio skup?" To je "koje je radno opterećenje, ključ, aplikacija ili tim uzrokovao promjenu?"

Ta je razlika posebno važna za radna opterećenja agenata. Jedan korisnički zahtjev može pokrenuti planiranje, dohvaćanje, pozive alata, korake razmišljanja, izvršavanje koda ili pozive modela za praćenje. Bez atribucije, financijski timovi vide račun, inženjerski timovi vide zapise, a nijedna strana nema jasan zajednički pogled na ono što se dogodilo.

Zašto je ovo važno za agentske platforme

AI naplata postaje konkurentna značajka. Tijekom prvog vala usvajanja API-ja, pristup modelu i referentna izvedba dominirali su razgovorom o kupnji. Kako je korištenje prešlo u proizvodnju, neriješeni problemi postali su svakodnevniji i skuplji: proračuni, fakture, atribucija, računovodstvo predmemorije, ograničenja projekta, otkrivanje anomalija i usporedba pružatelja usluga.

Googleov potez signal je da hiperrazmjerne platforme očekuju da kupci zahtijevaju te kontrole izravno unutar AI proizvoda. Gemini Enterprise se ne postavlja samo kao mjesto za korištenje modela. To je sve više mjesto za upravljanje operativnim posljedicama korištenja modela u velikom obimu.

To mijenja očekivanja za ostatak tržišta. Ako paketi umjetne inteligencije koji su izvorni u oblaku mogu objasniti potrošnju projektom i ključem API-ja, od platformi s više modela i pristupnika očekuje se da će učiniti barem isto toliko kod svih pružatelja usluga. Tim koji pokreće OpenAI, Anthropic, Google, modele hostirane na AWS-u i implementacije otvorene težine kroz jedan skup aplikacija ne može se osloniti samo na FinOps sloj jednog oblaka. Potreban mu je normalizirani prikaz upotrebe, izbora modela i cijene u cijelom posjedu.

Za Model Gate i slične OpenAI-kompatibilne pristupnike, praktična veza je izravna. Objedinjena naplata i analitika upotrebe umjetne inteligencije više nisu pogodnosti pozadinskog ureda. Oni su dio kontrolne razine koju programeri i vlasnici tvrtki koriste za odlučivanje koji bi modeli trebali biti dostupni, koji ih timovi mogu koristiti i kada je radno opterećenje postalo preskupo za pokretanje kako je zamišljeno.

Tko je pogođen

Enterprise programeri koji koriste Gemini API ili Vertex AI najneposrednija su publika. Timovi s više API ključeva, računima usluga, okruženjima ili internim agentima trebali bi dobiti bolje signale o tome odakle dolazi potrošnja povezana s Geminijem, pod pretpostavkom da usvoje nove alate i organiziraju svoje projekte na čist način.

Timovi za financije i nabavu također su pogođeni. Troškove umjetne inteligencije može biti teško predvidjeti jer se korištenje mjeri s opsegom zadataka i ponašanjem agenata, a ne samo s brojem zaposlenih. Udruživanje kvota na razini projekta i izvješćivanje na razini ključa API-ja mogu učiniti interni stornirani iznos, pregled proračuna i planiranje obnove manje ovisnim o ručnom radu s proračunskom tablicom.

Proizvodni timovi koji grade značajke umjetne inteligencije imaju drugu brigu: maržu. Ako agent koji se obraća klijentu prečesto koristi premium model ili ako pozadinski radni tijek pretjerano pokušava, trošak može tiho premašiti prihod povezan s tom značajkom. Bolja atribucija pomaže timovima da uhvate te obrasce prije nego što postanu strukturni gubici.

Agencije, preprodavači i pružatelji upravljanih usluga također bi trebali obratiti pozornost. Kupci se sve više pitaju ne samo radi li značajka umjetne inteligencije, već i može li se njezinom upotrebom upravljati. Za partnere koji grade usluge na temelju API-ja s više modela, izvješćivanje o troškovima po korisniku, projektu, API ključu i modelu postaje dio ponude.

Ograničenja Googleova pristupa

Otvoreno je pitanje koliko ovi alati smanjuju ukupnu potrošnju umjetne inteligencije u praksi. Googleovo slanje poruka oko izbjegavanja AI "šokiranja naljepnicama" je razumljivo, ali uštede ovise o ponašanju korisnika: postavljaju li timovi proračune, djeluju na anomalije, mijenjaju izbor modela, popravljaju neučinkovite agente ili redizajniraju tijekove rada. Vidljivost je neophodna, ali nije isto što i optimizacija.

Postoji i pitanje zaključavanja. Izvorni alati za obračun troškova u oblaku korisni su unutar vlastitog ekosustava, ali mnoge tvrtke namjerno šire radna opterećenja umjetne inteligencije među pružateljima usluga. Pogled specifičan za Gemini ili Google Cloud ne može objasniti punu cijenu aplikacije koja također poziva OpenAI-kompatibilne krajnje točke negdje drugdje, koristi Bedrock za regionalno usmjeravanje ili privatno pokreće otvorene modele.

Tu pristupnici još mogu dodati vrijednost. Pružatelj usluga u oblaku može izložiti bogate detalje za vlastite usluge. Gateway može normalizirati korištenje i naplatu preko dobavljača modela, API ključeva, timova, aplikacija i kupaca. Što više dobavljača u oblaku učini AI FinOps vidljivim, to će više kupaca tražiti istu vidljivost za svaki model koji koriste.

Što bi programeri sada trebali učiniti

Timovi koji koriste Gemini Enterprise trebali bi pregledati kako su strukturirani projekti i API ključevi. Ako se ključevi dijele u previše aplikacija ili okruženja, izvješćivanje o potrošnji na razini API ključa bit će manje korisno. Čista atribucija počinje odvajanjem proizvodnje od razvoja, usluga usmjerenih na korisnike od eksperimenata i visokorizičnih agenata od uobičajene interaktivne upotrebe.

Programeri bi podatke o cijeni također trebali tretirati kao inženjerski signal. Skokovi u potrošnji modela mogu otkriti neučinkovito promptiranje, petlje odbjeglog agenta, neočekivane ponovne pokušaje, prekomjerne kontekstualne prozore ili izbore modela koji više ne odgovaraju zadatku. Promatranje troškova pripada uz kašnjenje, stopu pogreške i procjenu kvalitete, a ne u mjesečnom pregledu računa nakon što je šteta učinjena.

Googleova najava nije samo još jedno ažuriranje naplate. Odražava širi pomak u infrastrukturi umjetne inteligencije: kako agenti postaju autonomniji, a korištenje API-ja sve promjenjivije, sposobnost objašnjenja i kontrole potrošnje postaje temeljni zahtjev platforme.