Cloudflare je dodao stope tokena za čitanje i pisanje u predmemoriju prilagođenom obračunu troškova AI Gatewaya, malu stavku dnevnika promjena s velikim posljedicama naplate za timove koji preprodaju, usmjeravaju ili usklađuju korištenje modela među pružateljima usluga.
Ažuriranje od 9. rujna znači da razvojni programeri sada mogu proslijediti per_cache_read_token i Vrijednosti per_cache_write_token u zaglavlju cf-aig-custom-cost. Kada je prisutna bilo koja stopa specifična za predmemoriju, Cloudflare kaže da AI Gateway aktivira određivanje cijene tokena za predmemoriju i uzima u obzir razlike pružatelja tako da se ista upotreba predmemorije ne broji dvaput.
To zvuči pretjerano. Nije. Cijene predmemorije postale su jedan od težih dijelova objedinjene naplate AI API-ja, osobito jer pružatelji usluga koriste različite nazive, jedinice i pravila naplate za ponovno korišteni kontekst. Tretiranje svakog predmemoriranog tokena kao uobičajenog ulaznog tokena može biti jednostavno, ali može biti dovoljno pogrešno da izbriše maržu preprodavača ili zavara kupce o tome koja su radna opterećenja zapravo skupa.
Što se promijenilo
AI Gateway već je omogućio prilaganje prilagođenih podataka o troškovima zahtjevima, dajući timovima način da predstavljaju dogovorene stope ili interne cjenike umjesto da se oslanjaju samo na cijene javnih pružatelja usluga. Nova promjena proširuje taj mehanizam na kategorije tokena specifične za predmemoriju.
U praksi, operater pristupnika sada može reći Cloudflareu ne samo koliko košta ulazni ili izlazni token, već i koliko košta čitanje ili pisanje u predmemoriju. Ta je razlika važna jer pružatelji sve više cijene brzo predmemoriranje kao vlastiti ekonomski sloj. Pisanje u predmemoriju može koštati više od čitanja u predmemoriju. Čitanje predmemorije može biti znatno jeftinije od novog unosa. Neki davatelji mogu izložiti stvaranje predmemorije i dohvaćanje predmemorije drugačije u zapisima o korištenju.
Važna je i napomena Cloudflarea da obrađuje razlike u pružateljima kako bi se izbjeglo dvostruko brojanje. Polja predmemorije nisu uvijek jasno odvojena od ukupnih tokena unosa. Ako sustav naplate naivno dodaje tokene predmemorije povrh upotrebe unosa koju je prijavio pružatelj, može pretjerano naplatiti korisnicima ili povećati interne troškove. Ako zanemaruje polja predmemorije, može podcijeniti trošak aplikacija dugog konteksta koje često stvaraju unose u predmemoriju.
Zašto je obračunavanje predmemorije sada važno
Brzo predmemoriranje je nekada bio detalj optimizacije. Za mnoga produkcijska radna opterećenja, to je sada dio arhitekture cijena.
Dugački upiti sustava, kontekst proširen dohvaćanjem, repozitoriji agenata za kodiranje, paketi pravnih dokumenata i baze znanja za podršku imaju koristi od ponovne upotrebe konteksta. Što više ponovljenog konteksta sustav šalje, to više cijena predmemorije mijenja ekonomiju stvarne jedinice. Dva zahtjeva sa sličnim brojem tokena mogu imati vrlo različite troškove ako jedan piše unos predmemorije, a drugi čita iz njega.
Zbog toga je vidljivost predmemorije financijski problem, a ne samo inženjerski problem. Tim koji pokreće interne agente možda će morati znati je li novi tijek rada skup jer generira previše svježih upita, propušta predmemoriju ili prečesto zapisuje velike blokove predmemorije. Prodavač će možda morati pokazati korisnicima zašto je naplaćena upotreba jedne aplikacije niža od očekivane iako je njezina prividna veličina upita velika. Dobavljač pristupnika možda će trebati sačuvati polja predmemorije u zapisima, analitici i evidenciji glavne knjige kako bi usklađivanje na kraju mjeseca odgovaralo fakturama dobavljača.
Ovdje također AI API analitika troškova postaje zahtjevnija. Ukupni trošak zahtjeva više nije dovoljan. Timovi trebaju zasebno vidjeti ulaz, izlaz, pisanje u predmemoriju i čitanje u predmemoriju, a zatim povezati te kategorije s API ključevima, klijentima, modelima i rutama.
Tko je pogođen
Neposredna publika su korisnici Cloudflare AI Gatewaya koji se oslanjaju na prilagođene troškove, a ne na zadane javne cijene. To uključuje poduzeća s dogovorenim cijenama modela, platforme koje označavaju korištenje pružatelja usluga za klijente i timove koji koriste Cloudflare kao zajedničku kontrolnu razinu među više pružatelja modela.
Preprodavači su posebno izloženi. Ako preprodavač naplaćuje klijentima koristeći pojednostavljeni model tokena, dok pružateljima plaća prema cijenama koje su svjesne predmemorije, razlika se može tiho akumulirati. Nedovoljno naplaćeno upisivanje u predmemoriju ili prenaplaćeno čitanje u predmemoriju možda se neće pojaviti u jednom zahtjevu, ali može biti važno za sesije agenta, skupnu obradu ili radna opterećenja dohvaćanja velikog volumena.
Razvojni programeri koji izrađuju slojeve pristupnika kompatibilne s OpenAI-om pogođeni su čak i kada ne koriste izravno Cloudflare. Promjena odražava širi smjer na tržištu: površine za naplatu pružatelja usluga postaju preciznije, dok korisnici i dalje očekuju čistu fakturu i predvidljiva izvješća o korištenju.Proizvodi kao što je Model Gate trebaju tretirati polja tokena predmemorije kao podatke prve klase ako žele točno izvješćivanje prema korisniku, ograničenja upotrebe i analizu margine kod više pružatelja.
Praktične posljedice
Gateway timovi bi trebali pregledati kako njihovi zapisnici zahtjeva, kalkulatori troškova i fakture predstavljaju aktivnost predmemorije. Ako se čitanje i pisanje predmemorije spljošti u obične promptne tokene, analitika može izgledati jednostavnija od temeljnog računa. Ako zapisi o korištenju pružatelja usluga sadrže polja predmemorije koja su ispuštena tijekom unosa, kasnije će usklađivanje biti teško.
Mehanizmi za određivanje cijena također moraju podržavati više od jedne cijene po smjeru. Stara podjela input-versus-output više nije dovoljna za napredni model računovodstva. Vjerodostojnom modelu glavne knjige sada je potreban prostor za nove ulazne tokene, izlazne tokene, upisivanja u predmemoriju, čitanja u predmemoriju i moguće varijante tih kategorija specifične za pružatelja usluga.
Nadzorne ploče okrenute korisnicima trebale bi pažljivo izložiti ove razlike. Većina korisnika ne želi čitati sirovu telemetriju pružatelja usluga, ali moraju razumjeti zašto se troškovi mijenjaju kada aplikacija počne učinkovitije ponovno koristiti kontekst. Najbolje sučelje može biti raščlamba troškova koja pokazuje uštedu predmemorije i troškove stvaranja predmemorije bez prisiljavanja korisnika da nauče terminologiju svakog pružatelja usluga.
Također postoje operativne implikacije za upozorenja i ograničenja. Ograničenje proračuna korisnika koje se temelji samo na ukupnim tokenima možda neće uspjeti uhvatiti radno opterećenje koje upisuje skupe unose u predmemoriju. Upozorenje o margini koje se temelji samo na broju zahtjeva može propustiti neusklađenost cijena pružatelja usluga. Za timove koji prodaju pristup putem ključeva po korisniku, računovodstvo s obzirom na predmemoriju trebalo bi biti povezano s istim identifikatorima korisnika, projekta ili aplikacije koji se koriste za kontrolu potrošnje.
Što ostaje otvoreno
Zapis promjena uspostavlja podršku za prilagođene stope čitanja i pisanja u predmemoriju, ali ne rješava sva pitanja implementacije za operatere pristupnika. Timovi još moraju testirati kako njihovi specifični pružatelji izvješćuju o korištenju predmemorije, kako se Cloudflareovi izračunati troškovi pojavljuju u zapisnicima i izvozima i kako bi se postojeće fakture trebale usporediti s novim prilagođenim poljima troškova.
No, veći smjer je jasan. Naplata pristupnika umjetne inteligencije prelazi s jednostavnog mjerača tokena na detaljnu knjigu korištenja. Cache cijene sada su dio te knjige. Timovi koji čuvaju detalje imat će čišće usklađivanje i bolju analitiku kupaca. Timovi koji to skupe možda neće primijetiti problem sve dok njihov račun pružatelja usluga i faktura korisnika ne prestanu pričati istu priču.