Cloudflare a adăugat rate de jetoane de citire și scriere în cache la contabilitatea personalizată a costurilor AI Gateway, un mic element din jurnalul de modificări cu consecințe mari de facturare pentru echipele care revind, direcționează sau reconciliază utilizarea modelului între furnizori.
Actualizarea din 9 septembrie înseamnă că dezvoltatorii pot acum transmite per_cache_code_read> și_ Valorile per_cache_write_token din antetul cf-aig-custom-cost. Când este prezentă oricare dintre ratele specifice memoriei cache, Cloudflare spune că AI Gateway activează prețurile pentru token-ul cache și ține cont de diferențele dintre furnizori, astfel încât aceeași utilizare a memoriei cache nu este luată în considerare de două ori.
Asta sună îngust. Nu este. Prețul cache a devenit una dintre părțile mai dificile ale facturarea API unificată AI, mai ales că furnizorii folosesc diferite nume, unități și reguli de facturare pentru contextul reutilizat. Tratarea fiecărui token din cache ca pe un simbol de intrare normal poate fi simplă, dar poate fi suficient de greșită pentru a șterge marja resellerului sau a induce în eroare clienții cu privire la sarcinile de lucru care sunt de fapt scumpe.
Ceea ce s-a schimbat
AI Gateway permitea deja atașarea datelor de cost personalizate la solicitări, oferind echipelor o modalitate de a reprezenta doar tarifele negociate, în loc să ofere prețuri interne doar pentru rerezervările publice. Noua modificare extinde acest mecanism la categoriile de token-uri specifice memoriei cache.
În practică, un operator de gateway îi poate spune acum Cloudflare nu numai cât costă un jeton de intrare sau de ieșire, ci și cât costă o citire cache sau scriere în cache. Această distincție contează, deoarece furnizorii prețuiesc din ce în ce mai mult stocarea promptă în cache ca propriul nivel economic. O scriere în cache poate costa mai mult decât o citire în cache. O citire în cache poate fi dramatic mai ieftină decât o intrare nouă. Unii furnizori pot expune diferit crearea și recuperarea memoriei cache în înregistrările de utilizare.
Nota Cloudflare că gestionează diferențele dintre furnizori pentru a evita contorizarea dublă este, de asemenea, importantă. Câmpurile de cache nu sunt întotdeauna separate clar de totalurile token-ului de intrare. Dacă un sistem de facturare adaugă naiv token-uri cache pe lângă utilizarea de intrare raportată de furnizor, poate supraîncărca clienții sau poate crește costurile interne. Dacă ignoră câmpurile de cache, poate subestima costul aplicațiilor cu context lung care creează frecvent intrări în cache.
De ce contează acum contabilitatea cache
Memoria cache promptă era un detaliu de optimizare. Pentru multe sarcini de lucru de producție, acum face parte din arhitectura prețurilor.
Solicitările lungi ale sistemului, contextul îmbunătățit de recuperare, depozitele de agenți de codare, pachetele de documente legale și bazele de cunoștințe de asistență beneficiază toate de reutilizarea contextului. Cu cât un context trimite un sistem mai repetat, cu atât mai mult prețul cache-ului schimbă economia reală a unității. Două solicitări cu un număr de simboluri similare pot avea costuri foarte diferite dacă una scrie o intrare în cache și alta citește din ea.
Aceasta face ca vizibilitatea cache-ului să fie o problemă financiară, nu doar o problemă de inginerie. O echipă care rulează agenți interni poate avea nevoie să știe dacă un nou flux de lucru este costisitor, deoarece generează prea multe solicitări noi, pierde memoria cache sau scrie prea des blocuri mari de cache. Este posibil ca un revânzător să fie nevoie să le arate clienților de ce utilizarea facturată a unei aplicații este mai mică decât se aștepta, chiar dacă dimensiunea aparentă a promptului este mare. Un furnizor de gateway poate avea nevoie să păstreze câmpurile cache în jurnalele, analizele și înregistrările registrului, astfel încât reconcilierea la sfârșitul lunii să se potrivească cu facturile furnizorului.
De asemenea, aici analitica costurilor API AI devine mai solicitantă. Costul total al cererii nu mai este suficient. Echipele trebuie să vadă separat comportamentul de intrare, ieșire, scriere în cache și citire în cache, apoi să conecteze acele categorii la chei API, clienți, modele și rute.
Cine este afectat
Publicul imediat este utilizatorii Cloudflare AI Gateway care se bazează pe costuri personalizate, mai degrabă decât pe prețurile publice implicite. Acestea includ întreprinderile cu tarife de model negociate, platforme care marcă utilizarea furnizorilor pentru clienți și echipele care folosesc Cloudflare ca plan de control partajat între mai mulți furnizori de modele.
Revânzătorii sunt expuși în mod special. Dacă un revânzător taxează clienții folosind un model de token simplificat în timp ce plătește furnizorilor la prețuri care țin seama de cache, diferența se poate acumula în liniște. Scrierile cache-ului subîncărcate sau citirile cache-ului supraîncărcate s-ar putea să nu apară într-o singură solicitare, dar poate conta pentru sesiuni de agent, procesare în loturi sau încărcături de lucru de recuperare în volum mare.
Dezvoltatorii care construiesc straturi de gateway compatibile cu OpenAI sunt afectați chiar și atunci când nu folosesc Cloudflare direct. Schimbarea reflectă o direcție mai largă a pieței: suprafețele de facturare ale furnizorilor devin din ce în ce mai granulare, în timp ce clienții încă se așteaptă la o factură curată și rapoarte de utilizare previzibile.Produse precum Model Gate trebuie să trateze câmpurile token-ului cache ca date de primă clasă dacă doresc raportări precise pentru clienți, limite de utilizare și analize ale marjelor la mai mulți furnizori.
Consecințe practice
Echipele Gateway ar trebui să analizeze modul în care jurnalele de solicitări, calculatoarele de costuri și facturile lor reprezintă activitatea de cache. Dacă citirile și scrierile din cache sunt aplatizate în indicative prompte obișnuite, analiza poate părea mai simplă decât factura de bază. Dacă înregistrările de utilizare ale furnizorului conțin câmpuri de cache care sunt eliminate în timpul ingerării, reconcilierea ulterioară va fi dificilă.
Motoarele de prețuri trebuie, de asemenea, să accepte mai mult de o rată pe direcție. Vechea împărțire de intrare versus ieșire nu mai este suficientă pentru contabilitatea modelului avansat. Un registru de model credibil are acum nevoie de spațiu pentru token-uri noi de intrare, jetoane de ieșire, scrieri în cache, citiri în cache și, eventual, variante specifice furnizorilor respective ale acestor categorii.
Tablourile de bord orientate către clienți ar trebui să expună cu atenție aceste distincții. Majoritatea utilizatorilor nu doresc să citească telemetria brută a furnizorului, dar trebuie să înțeleagă de ce costurile se modifică atunci când o aplicație începe să reutilizeze contextul mai eficient. Cea mai bună interfață poate fi o defalcare a costurilor care arată economiile și costurile de creare a memoriei cache, fără a-i obliga pe clienți să învețe terminologia fiecărui furnizor.
Există și implicații operaționale pentru alerte și limite. O limită a bugetului clientului, bazată numai pe tokenurile totale, poate să nu reușească să prindă o sarcină de lucru care scrie intrări scumpe în cache. O alertă de marjă bazată numai pe numărul de solicitări poate lipsi o nepotrivire a prețurilor furnizorului. Pentru echipele care vând acces prin chei pentru fiecare client, contabilitatea cache-aware ar trebui să fie legată de aceiași identificatori de client, proiect sau aplicație utilizați pentru controalele cheltuielilor.
Ceea ce rămâne deschis
Jurnalul de modificări stabilește suport pentru rate personalizate de citire și scriere cache, dar nu rezolvă toate întrebările de implementare pentru operatorii de gateway. Echipele trebuie încă să testeze modul în care furnizorii lor specifici raportează utilizarea memoriei cache, cum apar costurile calculate de Cloudflare în jurnale și exporturi și cum ar trebui să fie comparate facturile existente cu noile câmpuri de costuri personalizate.
Directia mai mare este totuși clară. Facturarea prin gateway AI trece de la un simplu contor de simboluri la un registru de utilizare detaliat. Prețurile cache fac acum parte din acel registru. Echipele care păstrează detaliile vor avea o reconciliere mai curată și o analiză mai bună a clienților. Este posibil ca echipele care îl restrâng să nu observe problema până când factura furnizorului și factura clientului nu vor mai spune aceeași poveste.