Google Cloud ir pievienojis jaunus norēķinu elastības un izmaksu pārvaldības rīkus Gemini Enterprise, padarot AI tēriņu kontroli tuvāk komandām, kas veido un pārvalda aģentus.

Izmaiņas ir svarīgas, jo aģentu darba slodzes nedarbojas kā tradicionālās SaaS vietas. Kodēšanas aģents, atbalsta aģents vai darbplūsmas aģents var izsaukt vairākus modeļus, atkārtoti izsaukt rīkus un ģenerēt mainīgu lietojumu dažādiem lietotājiem, projektiem un vidēm. Tas padara izmaksas grūtāk izskaidrojamas pēc fakta. Google tagad šo problēmu uztver kā produkta virsmu Gemini Enterprise un tā izstrādātāju ekosistēmā, nevis atstāj to tikai standarta mākoņa norēķinu eksportēšanai.

Saskaņā ar pakalpojumu Google Cloud, izstrādātāja rīku kvota, kas iekļauta Gemini Enterprise abonementos, tagad ir apvienota Google Cloud projekta līmenī. Uzņēmums arī apraksta paplašināto norēķinu elastību aģentu darba slodzei visos Gemini Enterprise un izstrādātāju rīkos, tostarp Google Antigravity programmā Gemini Enterprise un Android Studio. Atsevišķi Google Cloud dokumentācijā ir aprakstīts AI izmaksu kopsavilkuma aģents, kas var analizēt Gemini lietojumu, tostarp tēriņus no Gemini API un Vertex AI, un sadalīt AI izdevumus pēc API atslēgas.

Kas mainījies

Viskonkrētākās darbības izmaiņas ir projekta līmeņa apvienošana izstrādātāja rīku kvotām, kas saistītas ar Gemini Enterprise abonementiem. Tā vietā, lai domātu tikai par atsevišķiem lietotājiem, kuri patērē atsevišķas kvotas, organizācijas var pārvaldīt iekļauto kvotu projekta līmenī. Inženieru komandām tas ir tuvāk tam, kā faktiski tiek organizēts AI darbs: pēc produkta, vides, komandas, lietojumprogrammas vai klientiem paredzētas darbplūsmas.

Otrs ievērojamais elements ir AI izmaksu kopsavilkuma aģents. Google to raksturo kā rīku Gemini lietojuma un AI izdevumu analīzei Gemini API un Vertex AI. Dokumentācijā teikts, ka tas var sadalīt izdevumus pēc API atslēgas, kas ir būtisks attiecinājuma līmenis mūsdienu AI sistēmām. API atslēgas bieži atbilst pakalpojumiem, iekšējiem rīkiem, eksperimentiem, nomniekiem vai aģentu darbplūsmām. Kad rēķini pieaug, noderīgs jautājums reti ir tikai "kurš modelis bija dārgs?" Tas ir “kura darba slodze, atslēga, lietotne vai komanda izraisīja izmaiņas?”

Šī atšķirība ir īpaši svarīga aģentu darba slodzei. Viens lietotāja pieprasījums var izraisīt plānošanu, izguvi, rīku izsaukumus, argumentācijas darbības, koda izpildi vai papildu modeļa izsaukumus. Bez attiecinājuma finanšu komandas redz rēķinu, inženieru komandas redz žurnālus, un nevienai pusei nav skaidra kopīga priekšstata par notikušo.

Kāpēc tas ir svarīgi aģentu platformām

AI norēķini kļūst par konkurētspējīgu līdzekli. Pirmajā API ieviešanas viļņā pirkšanas sarunā dominēja modeļa piekļuve un etalona veiktspēja. Kad lietojums pārcēlās uz ražošanu, neatrisinātās problēmas kļuva ikdienišķākas un dārgākas: budžeti, rēķini, attiecinājums, kešatmiņas uzskaite, projektu ierobežojumi, anomāliju noteikšana un pakalpojumu sniedzēju salīdzināšana.

Google rīcība ir signāls, ka hipermēroga platformas sagaida, ka pircēji pieprasīs šīs vadīklas tieši AI produktos. Gemini Enterprise netiek pozicionēts tikai kā vieta, kur izmantot modeļus. Tā arvien vairāk ir vieta, kur pārvaldīt darbības sekas, ko rada modeļu izmantošana mērogā.

Tas maina cerības uz pārējo tirgu. Ja mākoņdatošanas mākslīgā intelekta komplekti var izskaidrot tēriņus pēc projekta un API atslēgas, sagaidāms, ka vairāku modeļu platformas un vārtejas darīs vismaz tikpat daudz dažādu pakalpojumu sniedzēju. Komanda, kurā darbojas OpenAI, Anthropic, Google, AWS mitinātie modeļi un atvērtā svara izvietošana, izmantojot vienu lietojumprogrammu kopu, nevar paļauties tikai uz viena mākoņa FinOps slāni. Tam ir nepieciešams normalizēts skats par lietojumu, modeļa izvēli un izmaksām visā īpašumā.

Model Gate un līdzīgām ar OpenAI saderīgām vārtejām praktiskais savienojums ir tiešs. Vienotie norēķini un mākslīgā intelekta izmantošanas analīze vairs nav atbalsta biroja ērtības. Tie ir daļa no vadības plaknes, ko izstrādātāji un uzņēmumu īpašnieki izmanto, lai izlemtu, kuriem modeļiem jābūt pieejamiem, kuras komandas var tos izmantot un kad darba slodze ir kļuvusi pārāk dārga, lai darbinātu, kā paredzēts.

Kas tiek ietekmēts

Uzņēmumu izstrādātāji, kas izmanto Gemini API vai Vertex AI, ir vistiešākā mērķauditorija. Komandām ar vairākām API atslēgām, pakalpojumu kontiem, vidēm vai iekšējiem aģentiem ir jāsaņem labāki signāli par to, no kurienes nāk ar Gemini saistītie tēriņi, pieņemot, ka tās pieņem jaunos rīkus un tīri organizē savus projektus.

Ietekmē arī finanšu un iepirkumu komandas. AI izmaksas var būt grūti prognozēt, jo lietojuma skala ir atkarīga no uzdevumu apjoma un aģenta uzvedības, nevis tikai ar darbinieku skaitu. Projekta līmeņa kvotu apvienošana un API atslēgas līmeņa pārskati var padarīt iekšējo atmaksu, budžeta pārskatīšanu un atjaunošanas plānošanu mazāk atkarīgu no manuālas izklājlapu darba.

Produktu komandām, kas veido AI funkcijas, ir citas problēmas: rezerve. Ja ar klientu vērsts aģents pārāk bieži izmanto augstākās kvalitātes modeli vai ja fona darbplūsma atkārtoti mēģina pārmērīgi, izmaksas var klusi pārsniegt ar šo līdzekli saistītos ieņēmumus. Labāks attiecinājums palīdz komandām uztvert šos modeļus, pirms tie kļūst par strukturāliem zaudējumiem.

Aģentūrām, tālākpārdevējiem un pārvaldīto pakalpojumu sniedzējiem arī jāpievērš uzmanība. Klienti arvien biežāk jautā ne tikai par to, vai AI funkcija darbojas, bet arī par to, vai tās lietošanu var regulēt. Partneriem, kuri veido pakalpojumus papildus vairāku modeļu API, izmaksu atskaites pēc klienta, projekta, API atslēgas un modeļa kļūst par daļu no piedāvājuma.

Google pieejas robežas

Atklātais jautājums ir par to, cik daudz šie rīki samazina kopējos AI izdevumus praksē. Google ziņojumi par izvairīšanos no AI “uzlīmju šoka” ir saprotami, taču ietaupījumi ir atkarīgi no klientu uzvedības: vai komandas nosaka budžetu, rīkojas, lai novērstu anomālijas, mainītu modeļu izvēli, labotu neefektīvus aģentus vai pārveidotu darbplūsmas. Redzamība ir nepieciešama, taču tā nav tas pats, kas optimizācija.

Ir arī bloķēšanas jautājums. Vietējie mākoņa izmaksu rīki ir noderīgi savā ekosistēmā, taču daudzi uzņēmumi apzināti sadala AI darba slodzi starp pakalpojumu sniedzējiem. Gemini vai Google Cloud centrēts skats var neizskaidrot visas izmaksas par lietojumprogrammu, kas arī izsauc ar OpenAI saderīgus galapunktus citur, izmanto Bedrock reģionālajai maršrutēšanai vai privāti palaiž atvērtā svara modeļus.

Šajā vietā vārtejas joprojām var pievienot vērtību. Mākoņpakalpojumu sniedzējs var atklāt detalizētu informāciju par saviem pakalpojumiem. Vārteja var normalizēt lietojumu un norēķinus starp modeļu nodrošinātājiem, API atslēgām, komandām, lietotnēm un klientiem. Jo vairāk mākoņpakalpojumu sniedzēju padara AI FinOps redzamus, jo vairāk pircēju prasīs vienādu redzamību visos izmantotajos modeļos.

Kas izstrādātājiem tagad jādara

Komandām, kuras izmanto Gemini Enterprise, ir jāpārskata, kā ir strukturēti projekti un API atslēgas. Ja atslēgas tiek koplietotas pārāk daudzām lietotnēm vai vidēm, API atslēgas līmeņa tēriņu pārskati būs mazāk noderīgi. Tīra attiecināšana sākas ar ražošanas nošķiršanu no izstrādes, klientu apkalpošanu no eksperimentiem un augsta riska aģentu nodalīšanu no parastas interaktīvas lietošanas.

Izstrādātājiem arī jāuzskata izmaksu dati kā inženierijas signāls. Modeļa tēriņu pieaugums var atklāt neefektīvu uzvedni, bēguļojošas aģenta cilpas, negaidītus atkārtotus mēģinājumus, pārmērīgus konteksta logus vai modeļa izvēles, kas vairs neatbilst uzdevumam. Izmaksu novērojamība ir saistīta ar latentumu, kļūdu īpatsvaru un kvalitātes novērtējumu, nevis ikmēneša rēķinu pārskatīšanu pēc bojājuma nodarīšanas.

Google paziņojums nav tikai kārtējais norēķinu atjauninājums. Tas atspoguļo plašākas izmaiņas AI infrastruktūrā: aģentiem kļūstot autonomākiem un API lietojumam mainīgākam, spēja izskaidrot un kontrolēt tēriņus kļūst par platformas pamatprasību.