Anthropic wypuściło Claude Fable 5.1, dodając nowy, ogólnie dostępny model Claude ze strukturą cenową, która stawia zachowanie pamięci podręcznej w centrum planowania kosztów API. Dokumentacja modelu firmy wymienia Claude Fable 5.1 w wersji wydanej 1 września 2026 r., aktywnej i najnowszej, z identyfikatorem modelu Claude API claude-fable-5-1.

Główne ceny są proste: 10 dolarów za milion tokenów wejściowych i 50 dolarów za milion tokenów wyjściowych. Ważniejszą liczbą może być cena odczytu pamięci podręcznej, wynosząca 0,25 dolara za milion tokenów. Anthropic dokumentuje również 50% zniżki Batch API na tokeny wejściowe i wyjściowe.

Ta kombinacja zmienia oblicze w przypadku zespołów, które wysyłają duże, powtarzające się konteksty do agentów kodujących, drugich pilotów wsparcia, systemów kontroli zgodności lub wewnętrznych asystentów wiedzy. Jeśli aplikacja może zachować trafienia w pamięci podręcznej w różnych turach i użytkownikach, Fable 5.1 może kosztować znacznie mniej, niż sugeruje proste porównanie cen wejścia-wyjścia. Jeśli nie, to samo obciążenie może wyglądać na drogie na papierze i drogie w produkcji.

Co się zmieniło

Fable 5.1 to nie tylko nowa nazwa w katalogu Anthropic. Dokumentacja Anthropic zawiera listę identyfikatorów dla wielu dróg dystrybucji, w tym Claude API, Amazon Bedrock, Google Cloud, Microsoft Foundry i Claude Platform na AWS. Ma to znaczenie, ponieważ wielu nabywców korporacyjnych nie korzysta z modeli granicznych bezpośrednio z punktu końcowego jednego dostawcy. Przechodzą przez rynki w chmurze, bramy wewnętrzne, platformy zatwierdzone przez zamówienia lub narzędzia dla programistów, które mają własną warstwę zasad.

Obraz dostępności jest również wielopoziomowy. Firma Axios poinformowała, że ​​Claude Fable 5.1 jest ogólnie dostępna, natomiast Claude Mythos 5.1 jest dostępna wyłącznie dla sprawdzonych partnerów z takich dziedzin, jak cyberbezpieczeństwo i nauki przyrodnicze. Dla administratorów oznacza to, że wrześniowej wersji Anthropic nie należy traktować jako jednego prostego modelu. Jeden model jest powszechnie dostępny; inny wydaje się wynikać z procesu ograniczonego dostępu.

To rozróżnienie jest coraz bardziej powszechne w pionierskich obszarach sztucznej inteligencji. Dostęp jest podzielony według modelu, możliwości, kanału wdrożenia, kontroli danych i przypadku użycia. Katalog modeli, który przechowuje tylko nazwę wyświetlaną i pole dostawcy, nie będzie wystarczający dla zespołów, które muszą wyjaśnić, dlaczego użytkownik może wywołać jedną jednostkę SKU Claude z jednego środowiska, a nie innego.

Dlaczego ceny pamięci podręcznej mają znaczenie

Ceny tokenów były kiedyś łatwe do porównania w arkuszu kalkulacyjnym: dane wejściowe z jednej strony, dane wyjściowe z drugiej. Obciążenia agentowe sprawiły, że było to mniej przydatne. Agent kodujący może przechowywać podsumowanie repozytorium, instrukcje systemowe, schematy narzędzi, historię rozmów i wcześniejsze analizy w kontekście wielu tur. Przepływ pracy pomocy technicznej może wielokrotnie dołączać te same dokumenty dotyczące zasad lub stan konta. W takich przypadkach odczyty pamięci podręcznej mogą zdominować efektywną krzywą kosztów.

Udokumentowana cena odczytu pamięci podręcznej Fable 5.1 wynosząca 0,25 USD za milion jest znacznie niższa od ceny świeżych danych wejściowych wynoszącej 10 USD za milion. Stwarza to silną zachętę do utrzymywania stabilności powtarzającego się kontekstu, spójnego trasowania sesji i unikania wzorców aplikacji, które przypadkowo unieważniają buforowanie po stronie dostawcy. Drobne wybory w zakresie implementacji mogą spowodować duże różnice w rozliczeniach: zmiana przedrostków podpowiedzi, wstrzyknięcie znaczników czasu do stabilnych instrukcji lub rozłożenie sesji użytkownika na trasy, które nie współdzielą stanu pamięci podręcznej, może zmniejszyć wartość tanich odczytów pamięci podręcznej.

Zniżka Batch API dodaje drugą dźwignię. Zadania związane z analizą zaplecza, ocenami, przeglądaniem dokumentów i migracją mogą być tańsze, jeśli można je zaplanować jako zadania wsadowe, a nie połączenia interaktywne. Dla firm praktycznym pytaniem nie jest po prostu to, czy Fable 5.1 „jest tego warte”. Określa, które obciążenia powinny działać interaktywnie, które powinny działać wsadowo i które można przeprojektować, aby zachować kontekst umożliwiający ponowne wykorzystanie.

Kogo to dotyczy

Programiści obsługujący bramy AI muszą dodać nowy identyfikator modelu API Claude i zaktualizować tabele cenowe, w tym rozliczanie odczytu z pamięci podręcznej. Tę ostatnią część łatwo przeoczyć. Brama, która wystawia rachunki tylko za świeże tokeny wejściowe i wyjściowe, albo błędnie poda marże, albo ukryje oszczędności przed klientami. Analityka użycia powinna pokazywać dane zapisane w pamięci podręcznej oddzielnie od nowych danych wejściowych, szczególnie w przypadku zespołów próbujących dostroić obciążenie agentów.

Zespoły zajmujące się platformami korporacyjnymi mają inny problem: dostępność i zarządzanie. Ponieważ Fable 5.1 jest udokumentowany na kilku platformach i w chmurze, administratorzy mogą być zmuszeni zdecydować, czy ten sam model jest dozwolony wszędzie, czy tylko za pośrednictwem zatwierdzonych kanałów. Wybór trasy w chmurze może mieć wpływ na zaopatrzenie, rejestrowanie, kontrole regionalne i reakcję na incydenty.Ograniczony dostęp do Mythos 5.1 dodaje kolejną warstwę, ponieważ kwalifikowalność może zależeć od weryfikacji partnerów, a nie od normalnego przepływu pracy polegającego na przełączaniu modelu.

W przypadku platform w stylu Model Gate ta wersja przypomina, że ​​wielomodelowy interfejs API jest teraz abstrakcją dotyczącą cen i zasad, a nie tylko fasadą interfejsu API zgodną z OpenAI. Brama musi znać identyfikator modelu, trasę dostawcy, zasady pamięci podręcznej, rabat partii, cenę widoczną dla klienta i stan dostępu. Wymaga także wyraźnych trybów awarii, gdy klient prosi o model lub funkcję, której nie wolno mu używać.

Co pozostaje niejasne

Ogólnodostępna dokumentacja pobrana na potrzeby tego raportu potwierdza identyfikator modelu, datę premiery, status aktywny, podane ceny i obsługiwane identyfikatory dystrybucji. Nie rozstrzyga w pełni wszystkich kwestii dotyczących szczegółów uruchomienia. Indeks redakcji Anthropic pokazał wpis dotyczący publicznego uruchomienia, ale szczegółowa strona nie została w pełni pobrana w tym przebiegu badań. Axios poinformował również o rozróżnieniu między ogólnie dostępną wersją Fable 5.1 a ograniczonym dostępem do Mythos 5.1, ale w zweryfikowanym materiale nie określono dokładnego procesu kwalifikowalności Mythos.

Istnieją również pytania dotyczące implementacji, na które każda platforma będzie musiała odpowiedzieć sama. Ekonomia pamięci podręcznej zależy od rzeczywistych współczynników trafień, a nie od cen katalogowych. Identyfikatory specyficzne dla chmury mogą mieć zachowanie operacyjne specyficzne dla trasy. Obciążenia wsadowe mogą być tanie, ale nieodpowiednie dla produktów wrażliwych na opóźnienia. Przedsiębiorstwa nadal będą musiały zdecydować, czy najnowsze ceny Anthropic odpowiadają ich wymogom w zakresie zarządzania, przechowywania i audytu.

Natychmiastowe działanie jest konkretne: dodaj claude-fable-5-1 tam, gdzie to konieczne, oddziel Fable 5.1 od ograniczonej wersji Mythos 5.1 w katalogach i udostępnij odczyty pamięci podręcznej w raportach kosztów. Lekcja długoterminowa jest szersza. Premiery modeli pionierskich stają się wydarzeniami na płaszczyźnie kontrolnej. Zwycięzcami zostaną zespoły, które będą w stanie wyznaczać trasy według możliwości, ceny, zasad i kształtu obciążenia, nie zmuszając programistów do zapamiętywania katalogu dostawców.