Przewodniki połączeń

Szczegółowe instrukcje konfiguracji zestawów SDK, agentów kodujących, IDE i klientów zgodnych z OpenAI.

Wybierz klienta, którego używasz:

Utwórz klucz API w pliku Panel sterowania Model Gate. Pełny klucz jest pokazywany tylko raz.

Dostęp do placu zabaw

Otwarte Plac gier i zabaw w menu konta, aby skorzystać z narzędzia do tworzenia żądań lub weryfikacji modelu. W profilach firmowych sekcja pozostaje widoczna, gdy włączony jest Model API, nawet jeśli nie przypisano jeszcze żadnego użytecznego klucza. Strona konfiguracji wyjaśnia brakującą weryfikację konta, aktywację firmy, kluczowe uprawnienia lub konfigurację punktu końcowego API oraz oferuje dozwolone łącza do zarządzania i pomoc techniczną. Samo otwarcie Placu zabaw nie powoduje płatnego żądania i nie tworzy klucza.

Żądania wymagają dozwolonego aktywnego klucza. Klucz powiązany z projektem musi należeć do bieżącej firmy i aktywnego projektu. Mając dostęp do programu deweloperskiego lub administratora, członek może korzystać ze wspólnego poświadczenia projektu w Playground bez otrzymywania jego stałego sekretu. Sesja przeglądarki reprezentuje zalogowanego członka, a nie opiekuna klucza; Samo sprawdzenie użycia nie gwarantuje wykonania. Gdy Model API jest wyłączony dla domeny, jej trasy Playground również są niedostępne. Hasło tymczasowe i wymagana konfiguracja dwuskładnikowa nadal mają pierwszeństwo.

Panel korzysta z punktu końcowego API skonfigurowanego w bieżącym profilu domeny. Nie przełącza się do interfejsu API innego projektu, gdy brakuje powiązania. Selektor kluczy pokazuje możliwe do zresetowania wykorzystanie w stosunku do skonfigurowanego limitu wydatków; wydatki całego życia nie są tym licznikiem. Bieżące limity klucza/projektu i saldo firmy są sprawdzane przed wydaniem krótkotrwałej sesji, a interfejs API pozostaje miarodajny w przypadku wstępu na żywo i rozliczeń. Zamrożenie projektu lub zmiana uprawnień po załadowaniu strony może spowodować, że wcześniej wybrany klucz będzie niedostępny; odśwież stronę po autoryzowanej korekcie.

Multimodalne formaty żądań

Konstruktor stosuje te same kontrakty dotyczące możliwości, które są stosowane w przypadku sond modelu administratora. Wykorzystuje generowanie obrazów zgodne z OpenAI /v1/responses z gospodarzem image_generation narzędzie; wygenerowany image_generation_call.result jest dekodowany i pokazywany jako artefakt obrazu. Odpowiedzi OpenAI Wejście PDF wykorzystuje plik input_file element treści z kompletną data:application/pdf;base64,... wartość w file_data. Komunikaty antropiczne w formacie PDF korzystają z formatu natywnego document blok z source.type=base64, media_type=application/pdf i gołe base64 bajty. Przeglądarka odczytuje wybrane pliki lokalnie i wysyła je bezpośrednio do skonfigurowanego punktu końcowego Model API; panel nie przesyła ich jako pierwszy. Kreator nie reklamuje ukończeń czatu w formacie PDF. Surowy kod JSON pozostaje dostępny w przypadku umów specyficznych dla dostawcy poza tymi przetestowanymi kształtami.

Weryfikacja modelu przeglądarki

/chat/verify porównuje punkt końcowy z gotowym odniesienie behawioralne wybranego modelu kanonicznego. Obecna metoda jest model-verification-behavioral-reference-v2.0. Nie jest to zaświadczenie dostawcy ani oświadczenie dotyczące dokumentacji szkoleniowej.

Gotowe odniesienie, bez etapu badawczego

Administratorzy osobno włączają moduł zbierający płatne referencje przy użyciu jawnie zaufanej trasy. Odczytuje gotowe miesiące z istniejącego banku pytań, domyślnie z dziesięcioma ocenionymi obserwacjami na pytanie i maksymalnie dwudziestoma odrębnymi pytaniami na żądanie odbioru. Awarie dostawcy i niesklasyfikowane/brakujące odpowiedzi nie są obserwacją ignorancji. Odpowiedzi administracyjne i poprawki są zachowywane do wglądu; uruchomienia użytkownika nigdy nie przyczyniają się automatycznie do tego zaufanego odniesienia.

Referencja musi obejmować szesnaście kolejnych ukończonych miesięcy po obu stronach stabilnej, zaobserwowanej kotwicy RECALL. Co miesiąc wybierane są dwa kwalifikujące się fakty, preferowany jest jeden fakt zwykle poprawny i jeden fakt zazwyczaj niepoprawny, jeśli oba istnieją; w przeciwnym razie dwie z dostępnych kategorii stabilnych. Sędzia musi zaakceptować wezwanie do kontroli formatu składające się z 32 pytań, zanim referencja będzie gotowa. Włączono automatyczne zbieranie kolejek w ramach współdzielonej autoryzacji wywołań API; starsze profile ręczne zachowują swoje wyraźne działania kontrolne. Oficjalne metadane dotyczące wartości odcięcia pozostają odrębne. Nieopublikowany oficjalny limit nigdy nie powoduje uruchomienia badań podczas uruchamiania przez użytkownika. Brak gotowej referencji lub niepełne pokrycie oznacza, że ​​modelu nie można jeszcze przetestować.

Jedna przetestowana prośba i jeden sędzia pierwszoplanowy

Wybierz gotowe referencje i odpowiedni klucz Model Gate do rozliczeń ewaluacyjnych. Odniesienie przypina protokół, model kanoniczny i dokładną umowę żądania. Nowe użycie automatycznych referencji minimal-v1: Chat wysyła tylko model + jedną wiadomość użytkownika, Odpowiedzi tylko model + dane wejściowe, a Anthropic Messages dodatkowo wysyła wymagane max_tokens=4096. Odniesienia historyczne zachowują zapisane opcje starszego typu. Przeglądarka wysyła jedno żądanie za pomocą 32 pytania do wybranego punktu końcowego HTTPS. Klucz zewnętrzny pozostaje jedynie w pamięci przeglądarki; nigdy nie jest wysyłany do serwera aplikacji Model Gate ani przechowywany w pamięci lokalnej/sesji. CORS musi zezwolić na to żądanie przeglądarki. Testowany model otrzymuje pytania i instrukcje w postaci zamkniętej księgi, nigdy klucz odpowiedzi, odpowiedzi referencyjne, pozytywne/negatywne etykiety lub oczekiwane błędy.

W tym cyklu życia nie ma wyszukiwania końcowego, wyszukiwania hostowanego, populacji banków ani generowania pytań. Wybór lokalnych migawek nie jest połączeniem płatnej generacji. Dostawca zewnętrzny może pobierać opłaty za swoje żądanie; sędzia pierwszoplanowy korzysta z wybranego kwalifikującego się certyfikatu Model Gate. Trzymaj kartę otwartą. Wskaźnik etapu na żywo pokazuje upływ czasu i rzeczywistą pracę; gdy weryfikacja jest aktywna, przeglądarka ostrzega przed zamknięciem, ponownym załadowaniem lub nawigacją. Nie powoduje to kontynuacji żądania w tle. Ponowna próba niekompletnej oceny wykorzystuje odpowiedź nadal przechowywaną w przeglądarce, a nie drugie żądanie testowanego modelu. Niepewne wywołanie nie jest automatycznie odtwarzane.

Przeglądarka bezpośrednio przesyła strumieniowo żądanie odpowiedzi sędziego pierwszoplanowego api.model-gate.com, bez wyszukiwania hostowanego. Wielominutowy strumień sędziowski nie jest wstrzymywany panel.model-gate.com. Automatyczne sprawdzanie formatu i stara punktacja według instrukcji pozostają wyłączone; ocena semantyczna należy wyłącznie do sędziego.

Korespondencja wyłącznie sędziowska

Sędzia otrzymuje odpowiedzi aktualne, odpowiedzi prawidłowe oraz wszystkie pogrupowane obserwacje referencyjne dla wybranych 32 faktów, w tym obserwacje sprzeczne i ich mnogość. Ocenia poprawność, deklaruje PRZYPOMINANIE/WNIOSEK/DOMYŚLENIE/NIEZNANE zachowanie i odchylenia w dowolnym kierunku. Nieoczekiwane prawidłowe odpowiedzi na zwykle nierozwiązane pytania referencyjne mogą ograniczyć korespondencję; rzeczywiste poprawne odpowiedzi nie są ponownie oznaczane jako błędne. Sędzia sam przydziela punktację korespondencyjną, kategorię oceny tożsamości, pewność, powody i ograniczenia. Serwer sprawdza strukturę raportu i zlicza zapisane obserwacje, ale nie stosuje żadnego progu semantycznego, kary, wyniku ważonego ani wniosków zastępczych.

Wysoki wynik nie oznacza prawdopodobieństwa dokładnej identyczności modelu. W raporcie nie można ustalić ceny modelu ani daty szkolenia. Przechowywane migawki i testy porównawcze dokładnie identyfikują to, co zostało porównane. Stare raporty wersji 1.7 zachowują swoją oryginalną metodę i nie są łączone z dowodami wersji 2. Na podstawie wyników wersji 2 nie jest obliczany żaden automatyczny identyfikator społeczności.

Raporty i prywatność

Śledzenie na żywo pokazuje żądanie, odpowiedź przechowywaną w przeglądarce, ładunek ewaluacyjny i dane wyjściowe sędziego bez poświadczeń. W przypadku uruchomienia prywatnego nie jest zachowywana pełna, nieprzetworzona odpowiedź dostawcy ani dosłowna, widoczna odpowiedź na pytanie na potrzeby odzyskiwania przeglądarki; znormalizowane oceny, wyjaśnienia i niezmienne identyfikatory referencyjne pozostają. Publikacja stanowi osobną, wyraźną zgodę. Opublikowane raporty w wersji 2 wyświetlają zapisane wnioski sędziego bez konieczności przeprowadzania kolejnej oceny lub ponownej oceny po stronie serwera. Odpowiedzi administracyjne mają swój własny zachowany/skontrolowany cykl życia, w przeciwieństwie do zwykłych odpowiedzi przeglądarki.

Żądanie zgodności i błędów dostawcy (10.28.1)

Prośba o weryfikację zakończenia czatu umieszcza kompletne instrukcje zamkniętej księgi i wszystkie pytania, w kolejności, w jednej wiadomości użytkownika. Dzięki temu brama kompatybilna z OpenAI nie musi tłumaczyć roli systemowej, gdy ta kieruje się do zaplecza w stylu antropicznym. Wybrany protokół i dokładny punkt końcowy pozostają miarodajne: nie ma przełączania protokołu opartego na nazwie modelu, dodatkowego żądania testowanego modelu ani konwersji proxy ogólnego przeznaczenia. Natywne wiadomości antropiczne nadal korzystają z najwyższego poziomu system z komunikatem użytkownika; W aplikacji Responses zachowywane są kanoniczne dane wprowadzone przez użytkownika. Ślad pokazuje rzeczywisty wychodzący kod JSON. Ustalona kompatybilność transportowa zostaje zachowana. Behavioral-Reference v2 dostarcza przypięte żądanie składające się z 32 pytań bez zmiany reguły żądania jednego przetestowanego modelu.

Odpowiedzi inne niż 2xx to błędy HTTP, a nie nierozpoznane pomyślne koperty. Błąd dostawcy root jest zgłaszany jako Koperta błędu dostawcy, nawet jeśli zostaną zwrócone za pomocą protokołu HTTP 200. Takie błędy nigdy nie dostarczają odpowiedzi modelowych, nigdy nie trafiają do oceny sędziego i nie można ich naprawić poprzez ponowną ocenę tej samej odpowiedzi. Zgodność protokołu jest NOT_ASSESSED dla reakcji na błąd. Każde wykonane żądanie zewnętrzne może nadal podlegać rozliczeniu; wybór lokalnego odniesienia nie powoduje wywołania generatora. Nieprzetworzone błędy dostawcy pozostają lokalną diagnostyką przeglądarki, a nie treścią raportów publicznych. Ogólny błąd przesyłania danych Model Gate celowo nie ujawnia nieprzetworzonego komunikatu przesyłania danych przeznaczonego tylko dla administratora.

Automatyczne administrowanie referencjami

Administratorzy jednorazowo konfigurują automatyczne zbieranie referencji dla kwalifikujących się istniejących i przyszłych modeli katalogów. Wykorzystywane jest skonfigurowane połączenie API Model Gate i klucz administratora, ze wspólnymi dziennymi/dożywotnimi limitami połączeń API i bez oddzielnego automatycznego budżetu rezerwacji w USD. Aby zakotwiczyć zbiór, modele wymagają oficjalnego punktu granicznego lub nieoficjalnego oszacowania pochodzącego z osobnego źródła; pracownik nie szuka brakujących dat ani nie generuje pytań. Początkowym ustawieniem domyślnym pozostaje dziesięć użytecznych obserwacji na pytanie i maksymalnie dwadzieścia różnych pytań na żądanie windykacji. Starsze odniesienia do podręczników pozostają oddzielne.

Odniesienie stanowi dowód skonfigurowanego zachowania, a nie dowód, który dostawca wykonał żądanie. Nieodpowiednie lub niejednoznaczne trasy pozostają niedostępne, dopóki administrator nie rozwiąże routingu. Korespondencję ocenia wyłącznie sędzia.

Teraz zwracane są nieobsługiwane ścieżki API 404 endpoint_not_supported z żądaną ścieżką; zwracana jest zła metoda na obsługiwanej ścieżce 405 method_not_allowed I Allow. Rodzinny /v1/balance pozostaje niezmieniony; /v1/user/balance nie jest realizowany. Podczas zgłaszania tych błędów udostępniaj zwrócony identyfikator żądania, a nie klucz API.