Cloudflare dodał współczynniki tokenów odczytu i zapisu w pamięci podręcznej do niestandardowego rachunku kosztów AI Gateway. Jest to niewielka pozycja w dzienniku zmian z dużymi konsekwencjami rozliczeniowymi dla zespołów, które sprzedają, wyznaczają trasę lub uzgadniają wykorzystanie modelu u różnych dostawców.
Aktualizacja z 9 września oznacza, że programiści mogą teraz przekazywać wartości per_cache_read_token i per_cache_write_token w Nagłówek cf-aig-custom-cost. Cloudflare twierdzi, że gdy dostępna jest którakolwiek stawka zależna od pamięci podręcznej, AI Gateway aktywuje ceny tokenów pamięci podręcznej i uwzględnia różnice dostawców, dzięki czemu to samo użycie pamięci podręcznej nie jest liczone dwukrotnie.
Brzmi to wąsko. Tak nie jest. Wycena pamięci podręcznej stała się jedną z trudniejszych części ujednoliconego rozliczeń za pomocą interfejsu API AI, zwłaszcza że dostawcy używają różnych nazw, jednostek i zasad rozliczeń w przypadku ponownego wykorzystania kontekstu. Traktowanie każdego tokena w pamięci podręcznej jako normalnego tokena wejściowego może być proste, ale może być na tyle błędne, że usuwa marżę sprzedawcy lub wprowadza klientów w błąd co do tego, które zadania są rzeczywiście drogie.
Co się zmieniło
AI Gateway umożliwił już dołączanie niestandardowych danych o kosztach do żądań, dając zespołom możliwość przedstawiania wynegocjowanych stawek lub wewnętrznych cenników zamiast polegania wyłącznie na cenach dostawców publicznych. Nowa zmiana rozszerza ten mechanizm na kategorie tokenów specyficznych dla pamięci podręcznej.
W praktyce operator bramy może teraz poinformować Cloudflare nie tylko o kosztach tokena wejściowego lub wyjściowego, ale także o kosztach odczytu lub zapisu w pamięci podręcznej. To rozróżnienie ma znaczenie, ponieważ dostawcy coraz częściej cenią buforowanie natychmiastowe jako własną warstwę ekonomiczną. Zapis w pamięci podręcznej może kosztować więcej niż odczyt w pamięci podręcznej. Odczyt pamięci podręcznej może być znacznie tańszy niż świeże dane wejściowe. Niektórzy dostawcy mogą inaczej ujawniać tworzenie i pobieranie pamięci podręcznej w rejestrach użytkowania.
Ważna jest również uwaga Cloudflare, że obsługuje ona różnice dostawców, aby uniknąć podwójnego liczenia. Pola pamięci podręcznej nie zawsze są wyraźnie oddzielone od sum tokenów wejściowych. Jeśli system rozliczeniowy naiwnie doda tokeny pamięci podręcznej oprócz zużycia danych wejściowych zgłoszonych przez dostawcę, może to spowodować nadmierne obciążenie klientów lub zawyżenie kosztów wewnętrznych. Jeśli zignoruje pola pamięci podręcznej, może zaniżyć koszt aplikacji o długim kontekście, które często tworzą wpisy w pamięci podręcznej.
Dlaczego rozliczanie pamięci podręcznej ma teraz znaczenie
Buforowanie podpowiedzi było kiedyś szczegółem optymalizacji. W przypadku wielu obciążeń produkcyjnych jest to obecnie część architektury cenowej.
Długie podpowiedzi systemowe, kontekst rozszerzony o wyszukiwanie, repozytoria agentów kodujących, pakiety dokumentów prawnych i bazy wiedzy wsparcia – wszystkie korzyści z ponownego wykorzystania kontekstu. Im częściej powtarza się kontekst, jaki wysyła system, tym bardziej wycena pamięci podręcznej zmienia rzeczywistą ekonomikę jednostki. Dwa żądania z podobną liczbą tokenów mogą mieć bardzo różne koszty, jeśli jedno zapisuje wpis w pamięci podręcznej, a drugie go odczytuje.
To sprawia, że widoczność pamięci podręcznej jest kwestią finansową, a nie tylko kwestią techniczną. Zespół obsługujący agentów wewnętrznych może potrzebować wiedzy, czy nowy przepływ pracy jest kosztowny, ponieważ generuje zbyt wiele nowych podpowiedzi, pomija pamięć podręczną lub zbyt często zapisuje duże bloki pamięci podręcznej. Sprzedawca może być zmuszony do pokazania klientom, dlaczego rozliczone użycie jednej aplikacji jest niższe niż oczekiwano, mimo że widoczny rozmiar monitu jest duży. Dostawca bramy może być zmuszony do zachowania pól pamięci podręcznej w logach, analizach i zapisach księgowych, tak aby uzgodnienie na koniec miesiąca było zgodne z fakturami dostawcy.
W tym przypadku Analiza kosztów interfejsu API AI staje się bardziej wymagająca. Łączny koszt żądania nie jest już wystarczający. Zespoły muszą oddzielnie widzieć dane wejściowe, wyjściowe, zachowanie zapisu w pamięci podręcznej i odczytu pamięci podręcznej, a następnie połączyć te kategorie z kluczami API, klientami, modelami i trasami.
Kogo to dotyczy
Bezpośrednią grupą odbiorców są użytkownicy Cloudflare AI Gateway, którzy opierają się na niestandardowych kosztach, a nie na domyślnych publicznych cenach. Dotyczy to przedsiębiorstw z negocjowanymi stawkami za modele, platform, które oznaczają wykorzystanie dostawców dla klientów, oraz zespołów korzystających z Cloudflare jako wspólnej płaszczyzny kontroli dla wielu dostawców modeli.
Resellerzy są szczególnie narażeni. Jeśli sprzedawca pobiera od klientów opłaty za korzystanie z uproszczonego modelu tokena, płacąc dostawcom w ramach cen uwzględniających pamięć podręczną, różnica może po cichu się kumulować. Niedostateczne obciążenie zapisów w pamięci podręcznej lub przepełnienie odczytów pamięci podręcznej może nie pojawić się w pojedynczym żądaniu, ale może mieć znaczenie w sesjach agenta, przetwarzaniu wsadowym lub dużych obciążeniach związanych z pobieraniem.
Ma to wpływ na programistów tworzących warstwy bram kompatybilne z OpenAI, nawet jeśli nie korzystają bezpośrednio z Cloudflare. Zmiana odzwierciedla szerszy kierunek na rynku: powierzchnie rozliczeniowe dostawców stają się coraz bardziej szczegółowe, a klienci w dalszym ciągu oczekują czystej faktury i przewidywalnych raportów z użytkowania.Produkty takie jak Model Gate muszą traktować pola tokenów pamięci podręcznej jako pierwszorzędne dane księgi, jeśli chcą dokładnych raportów dostosowanych do klienta, limitów wykorzystania i analiz marży u wielu dostawców.
Praktyczne konsekwencje
Zespoły zajmujące się bramami powinny sprawdzić, w jaki sposób ich dzienniki żądań, kalkulatory kosztów i faktury reprezentują aktywność pamięci podręcznej. Jeśli odczyty i zapisy z pamięci podręcznej zostaną spłaszczone do zwykłych tokenów podpowiedzi, analizy mogą wyglądać na prostsze niż podstawowy rachunek. Jeśli rekordy użycia dostawcy zawierają pola pamięci podręcznej, które są usuwane podczas przetwarzania, późniejsze uzgodnienie będzie trudne.
Silniki wyceny muszą również obsługiwać więcej niż jedną stawkę na kierunek. Stary podział nakładów na wyniki nie jest już wystarczający w przypadku zaawansowanego modelu rachunkowości. Wiarygodna księga modelowa potrzebuje teraz miejsca na nowe tokeny wejściowe i wyjściowe, zapisy w pamięci podręcznej, odczyty z pamięci podręcznej i ewentualnie specyficzne dla dostawcy warianty tych kategorii.
Panele informacyjne skierowane do klienta powinny dokładnie eksponować te rozróżnienia. Większość użytkowników nie chce czytać nieprzetworzonych danych telemetrycznych dostawcy, ale muszą zrozumieć, dlaczego koszty zmieniają się, gdy aplikacja zaczyna efektywniej ponownie wykorzystywać kontekst. Najlepszym interfejsem może być zestawienie kosztów, które pokazuje oszczędności w pamięci podręcznej i koszty jej tworzenia, nie zmuszając klientów do poznawania terminologii każdego dostawcy.
Alerty i limity mają również konsekwencje operacyjne. Limit budżetu klienta oparty wyłącznie na sumie tokenów może nie przechwycić obciążenia, które zapisuje drogie wpisy w pamięci podręcznej. Alert dotyczący marży oparty wyłącznie na liczbie żądań może nie uwzględniać niedopasowania cen dostawcy. W przypadku zespołów sprzedających dostęp za pomocą kluczy poszczególnych klientów księgowość uwzględniająca pamięć podręczną powinna być powiązana z tym samym identyfikatorem klienta, projektu lub aplikacji używanym do kontroli wydatków.
Co pozostaje otwarte
Dziennik zmian ustanawia obsługę niestandardowych stawek odczytu i zapisu w pamięci podręcznej, ale nie rozstrzyga wszystkich kwestii związanych z implementacją dla operatorów bram. Zespoły nadal muszą przetestować, w jaki sposób ich konkretni dostawcy raportują wykorzystanie pamięci podręcznej, jak obliczone koszty Cloudflare pojawiają się w dziennikach i eksportach oraz jak należy porównywać istniejące faktury z nowymi polami kosztów niestandardowych.
Jednak szerszy kierunek jest jasny. Rozliczenia za bramę AI odchodzą od prostego licznika tokenów w stronę szczegółowej księgi użytkowania. Ceny pamięci podręcznej są teraz częścią tej księgi. Zespoły, które zachowują szczegóły, będą miały czystsze uzgodnienia i lepszą analizę klientów. Zespoły, które to zapomną, mogą nie zauważyć problemu, dopóki rachunek od dostawcy i faktura klienta nie przestaną opowiadać tej samej historii.