Cloudflare pridal sadzby tokenov čítania a zápisu do vyrovnávacej pamäte do vlastného účtovníctva nákladov AI Gateway, čo je malá položka denníka zmien s veľkými dôsledkami na fakturáciu tímov, ktoré predávajú, smerujú alebo zosúlaďujú používanie modelov medzi poskytovateľmi.
Aktualizácia z 9. septembra znamená, že vývojári teraz môžu odovzdávať hodnoty per_cache_read_token a token v hodnote per_ca. cf-aig-custom-cost. Keď je prítomná ktorákoľvek rýchlosť špecifická pre vyrovnávaciu pamäť, Cloudflare hovorí, že AI Gateway aktivuje ceny tokenov vyrovnávacej pamäte a zohľadňuje rozdiely medzi poskytovateľmi, takže rovnaké využitie vyrovnávacej pamäte sa nezapočítava dvakrát.
To znie úzko. nie je. Stanovenie cien vo vyrovnávacej pamäti sa stalo jednou z ťažších súčastí zjednotenej fakturácie AI API, najmä keď poskytovatelia používajú rôzne názvy, jednotky a pravidlá fakturácie pre opakovane použitý kontext. Zaobchádzanie s každým tokenom uloženým vo vyrovnávacej pamäti ako s bežným vstupným tokenom môže byť jednoduché, ale môže to byť dosť nesprávne na to, aby sa vymazala marža predajcu alebo aby sa zákazníci dostali do omylu, pokiaľ ide o to, aké pracovné zaťaženie je skutočne drahé.
Čo sa zmenilo
AI Gateway už umožňovala pripájanie údajov o vlastných nákladoch k požiadavkám, čo tímom umožnilo reprezentovať dohodnuté sadzby alebo interné cenníky namiesto spoliehania sa len na ceny verejných poskytovateľov. Nová zmena rozširuje tento mechanizmus na kategórie tokenov špecifické pre vyrovnávaciu pamäť.
V praxi môže operátor brány teraz Cloudflare povedať nielen to, čo stojí vstupný alebo výstupný token, ale aj koľko stojí čítanie alebo zápis do vyrovnávacej pamäte. Tento rozdiel je dôležitý, pretože poskytovatelia čoraz viac oceňujú rýchle ukladanie do vyrovnávacej pamäte ako svoju vlastnú ekonomickú vrstvu. Zápis do vyrovnávacej pamäte môže stáť viac ako čítanie z vyrovnávacej pamäte. Čítanie z vyrovnávacej pamäte môže byť výrazne lacnejšie ako nový vstup. Niektorí poskytovatelia môžu v záznamoch o používaní odhaľovať vytváranie vyrovnávacej pamäte a získavanie vyrovnávacej pamäte odlišne.
Poznámka Cloudflare, že rieši rozdiely medzi poskytovateľmi, aby sa zabránilo dvojitému započítaniu, je tiež dôležitá. Polia vyrovnávacej pamäte nie sú vždy čisto oddelené od súčtu vstupných tokenov. Ak fakturačný systém naivne pridáva tokeny vyrovnávacej pamäte nad rámec využitia vstupu hláseného poskytovateľom, môže to pre zákazníkov predražiť alebo zvýšiť interné náklady. Ak ignoruje polia vyrovnávacej pamäte, môže to podhodnotiť cenu aplikácií s dlhým kontextom, ktoré často vytvárajú položky vyrovnávacej pamäte.
Prečo je teraz účtovanie vyrovnávacej pamäte dôležité
Rýchle ukladanie do vyrovnávacej pamäte bývalo detailom optimalizácie. Pre mnohé produkčné úlohy je teraz súčasťou cenovej architektúry.
Z opätovného použitia kontextu profitujú dlhé systémové výzvy, kontext rozšírený o vyhľadávanie, úložiská kódovacích agentov, balíky právnych dokumentov a podporné znalostné bázy. Čím viac opakovaného kontextu systém posiela, tým viac ceny vyrovnávacej pamäte menia skutočnú ekonomiku jednotky. Dve požiadavky s podobným počtom tokenov môžu mať veľmi rozdielne náklady, ak jedna zapisuje záznam z vyrovnávacej pamäte a druhá z neho číta.
To robí z viditeľnosti vyrovnávacej pamäte finančný problém, nielen technický problém. Tím s internými agentmi môže potrebovať vedieť, či je nový pracovný postup drahý, pretože generuje príliš veľa nových výziev, vynecháva vyrovnávaciu pamäť alebo príliš často zapisuje veľké bloky vyrovnávacej pamäte. Predajca možno bude musieť zákazníkom ukázať, prečo je fakturovaná spotreba jednej aplikácie nižšia, ako sa očakávalo, aj keď je jej zdanlivá promptná veľkosť veľká. Dodávateľ brány môže potrebovať zachovať polia vyrovnávacej pamäte v protokoloch, analýzach a záznamoch účtovnej knihy, aby sa vyrovnanie na konci mesiaca zhodovalo s faktúrami poskytovateľa.
To je tiež oblasť, kde sa analýza nákladov rozhrania AI API stáva náročnejšou. Súhrnné náklady na žiadosť už nestačia. Tímy musia samostatne vidieť vstup, výstup, zapisovanie do vyrovnávacej pamäte a čítanie z vyrovnávacej pamäte a potom tieto kategórie prepojiť s kľúčmi API, zákazníkmi, modelmi a trasami.
Koho sa to týka
Bezprostredným publikom sú používatelia služby Cloudflare AI Gateway, ktorí sa spoliehajú na vlastné náklady a nie na predvolené verejné ceny. Patria sem podniky s dohodnutými modelovými sadzbami, platformy, ktoré zákazníkom priznávajú používanie poskytovateľov, a tímy, ktoré používajú Cloudflare ako zdieľanú kontrolnú rovinu medzi viacerými poskytovateľmi modelov.
Obzvlášť vystavení sú predajcovia. Ak predajca účtuje zákazníkom pomocou zjednodušeného modelu tokenov, pričom platí poskytovateľom za ceny s ohľadom na vyrovnávaciu pamäť, rozdiel sa môže pokojne nahromadiť. Podbitie zápisov do vyrovnávacej pamäte alebo prebitie načítania vyrovnávacej pamäte sa nemusí prejaviť v jednej požiadavke, ale môže to záležať na reláciách agenta, dávkovom spracovaní alebo pri veľkom objeme sťahovania.
Vývojári vytvárajúci vrstvy brány kompatibilné s OpenAI sú ovplyvnené, aj keď priamo nepoužívajú Cloudflare. Zmena odzrkadľuje širší smer na trhu: fakturačné povrchy poskytovateľov sú čoraz podrobnejšie, zatiaľ čo zákazníci stále očakávajú čistú faktúru a predvídateľné správy o používaní.Produkty, ako je Model Gate, musia s poliami tokenov vyrovnávacej pamäte zaobchádzať ako s prvotriednymi údajmi účtovnej knihy, ak chcú presné vykazovanie na úrovni zákazníka, limity používania a analýzu marže u viacerých poskytovateľov.
Praktické dôsledky
Tímy brány by mali skontrolovať, ako ich protokoly požiadaviek, kalkulačky nákladov a faktúry predstavujú aktivitu vyrovnávacej pamäte. Ak sa čítanie a zápis z vyrovnávacej pamäte zlúči do bežných tokenov výzvy, analytika môže vyzerať jednoduchšie ako základný účet. Ak záznamy o používaní poskytovateľa obsahujú polia vyrovnávacej pamäte, ktoré sa počas prijímania vypustia, neskoršie zosúladenie bude zložité.
Cenové nástroje tiež musia podporovať viac ako jednu sadzbu na smer. Staré rozdelenie vstupov a výstupov už nestačí na účtovanie pokročilého modelu. Dôveryhodná modelová kniha teraz potrebuje priestor pre nové vstupné tokeny, výstupné tokeny, zápisy do vyrovnávacej pamäte, čítanie z vyrovnávacej pamäte a prípadne varianty týchto kategórií špecifické pre poskytovateľa.
Zákaznícke panely by mali tieto rozdiely pozorne odhaľovať. Väčšina používateľov nechce čítať surovú telemetriu poskytovateľa, ale musia pochopiť, prečo sa náklady menia, keď aplikácia začne efektívnejšie znova používať kontext. Najlepším rozhraním môže byť rozpis nákladov, ktorý zobrazuje úspory vyrovnávacej pamäte a náklady na vytvorenie vyrovnávacej pamäte bez toho, aby nútil zákazníkov, aby sa učili terminológiu každého poskytovateľa.
Existujú aj prevádzkové dôsledky pre upozornenia a limity. Zákaznícky rozpočtový limit založený iba na celkovom počte tokenov môže zlyhať pri zachytení pracovného zaťaženia, ktoré zapisuje drahé položky vyrovnávacej pamäte. Upozornenie na maržu založené iba na počte žiadostí môže vynechať nesúlad cien poskytovateľa. Pre tímy, ktoré predávajú prístup prostredníctvom kľúčov jednotlivých zákazníkov, by malo byť účtovanie s vedomím vyrovnávacej pamäte prepojené s tým istým identifikátorom zákazníka, projektu alebo aplikácie, ktoré sa používajú na kontrolu výdavkov.
Čo zostáva otvorené
V protokole zmien je stanovená podpora pre vlastné sadzby za čítanie do vyrovnávacej pamäte a zapisovanie do vyrovnávacej pamäte, ale nevyrieši každú otázku implementácie pre operátorov brány. Tímy ešte musia otestovať, ako ich konkrétni poskytovatelia hlásia využitie vyrovnávacej pamäte, ako sa vypočítané náklady Cloudflare zobrazujú v protokoloch a exportoch a ako by sa mali porovnávať existujúce faktúry s novými poľami vlastných nákladov.
Väčší smer je však jasný. Účtovanie brány AI sa presúva z jednoduchého merača tokenov k podrobnej knihe používania. Cena vyrovnávacej pamäte je teraz súčasťou tejto účtovnej knihy. Tímy, ktoré zachovávajú podrobnosti, budú mať čistejšie zosúladenie a lepšiu analýzu zákazníkov. Tímy, ktoré to zbalia, si nemusia všimnúť problém, kým ich faktúra od poskytovateľa a faktúra pre zákazníka neprestanú rozprávať rovnaký príbeh.