← Publiczny rejestr weryfikacyjnymodel-verification-single-request-v1.1
Raport z weryfikacji publicznego modelu AI

deepseek-v4-flash

https://api.model-gate.com/v1/chat/completions

openai_chatgpt-5.6-solSep 6, 2026 09:53 UTC
Starszy Wynik Jakości100/100
PLAUSIBLE60% pewność oceny
Raport stałyhttps://model-gate.com/pl/model-verification/results/A57ZK57ERM62N3S1XETMXFKK0X
Telegram ↗X ↗
Faktyczne przypomnienie100
Aktualność wiedzy100
Odporność na halucynacje100
Kalibrowanie100
Reklamowany modeldeepseek-v4-flash
Model rozstrzygnięty przez sędziegodeepseek-v4-flashUNKNOWN
Host punktu końcowegoapi.model-gate.com
Pole modelu reakcji zewnętrznejdeepseek-v4-flash
Analiza sędziego

Dlaczego ta weryfikacja otrzymała swój wynik

Raport publiczny odzwierciedla dowody analityczne przedstawione testerowi po /chat/verify. Oceny sędziowskie to oceny rubrykowe; tylko wyraźne poprawne lub błędne odpowiedzi RECALL mogą wpływać na granicę odcięcia czystego przypominania.

Diagnostyka behawioralna

Uzasadnienie oceny sędziego

4 diagnostyka
Faktyczne przypomnienie100/100

Nie zachowano odrębnego uzasadnienia sędziowskiego dla tego zarchiwizowanego wyniku.

Aktualność wiedzy100/100

Nie zachowano odrębnego uzasadnienia sędziowskiego dla tego zarchiwizowanego wyniku.

Odporność na halucynacje100/100

Nie zachowano odrębnego uzasadnienia sędziowskiego dla tego zarchiwizowanego wyniku.

Kalibrowanie100/100

Nie zachowano odrębnego uzasadnienia sędziowskiego dla tego zarchiwizowanego wyniku.

Notatka dotycząca historycznego testu porównawczego: w tym zarchiwizowanym ogólnym wyniku wersji 1.4 wykorzystano poprzednią stałą agregację diagnostyczną. Jest on zachowywany w celu zapewnienia powtarzalności i nie należy go interpretować jako wyniku dopasowania modelu v1.5.

Dowody tymczasowe

Oś czasu czystego przypominania

0 PRZYWOŁAJ sondy

Rzeczywisty zestaw pytań został przetasowany przed żądaniem testowanego modelu. Brakujące miejsca dla pokoleń nie są modelowym wstrzymaniem się od głosu. Oś czasu rekonstruuje docelowe miesiące w celu umożliwienia kontroli. Tylko wyraźne odpowiedzi RECALL stanowią dowód graniczny; WNIOSEK, DOMYŚLENIE i NIEZNANE pozostają widoczne, ale nie przesuwają granicy.

Miesięczny harmonogram nie jest dostępny dla tego zarchiwizowanego wyniku testu porównawczego.
prawidłowe PRZYPOMNIENIE błędne PRZYPOMNIENIE~ INFERENCE GUESS? UNKNOWN
0RECALL
0INFERENCE
0GUESS
0UNKNOWN
0prawidłowe PRZYPOMNIENIE
0błędne PRZYPOMNIENIE
Porównanie czasowe

Porównanie granic wiedzy

UNKNOWN
Odcięcie odniesieniaUNKNOWNUNKNOWN · 0%
Najnowsze obsługiwane RECALL0 kwalifikujące się odpowiedzi PRZYWOŁAJ
Obserwowana granicaNiewystarczające dowody WYCOFANIAINSUFFICIENT_RECALL_EVIDENCE
Wyrównanie odcięciaUNKNOWN0% zaufanie
Sędzia zauważa
  • All Class A items are correct through June 2024, establishing an observed lower bound but no upper bound.
  • The immutable reference snapshot has no known cutoff dates, so cutoff alignment cannot be scored.

Semantyczny: prawidłowy 16 · zło 0 · nieznany 0. Wykluczone z odcięcia: 0.

Tożsamość behawioralna

Sygnały tożsamości

PLAUSIBLE · 60%

Tożsamość wnioskuje się na podstawie zgodności między deklarowanym modelem a obserwowanym profilem wiedzy/odpowiedzi. Jest to dowód, a nie zdalne poświadczenie lub kryptograficzny dowód wag serwowania.

Pozytywne sygnały

  • Perfect performance across all supplied Class A recall items.
  • Correct recall of multiple DeepSeek model releases and specifications.
  • No systematic early knowledge failures.

Negatywne sygnały

  • No documented canonical identity or cutoff is available in the reference snapshot.
  • Cutoff consistency cannot be evaluated.
  • Self-report and matching API metadata are weak identity evidence.
Uzasadnienie tożsamości sędziego
  • The response is fully correct on all 16 strong-recall questions, including the DeepSeek-specific history items.
  • The observed knowledge extends through June 2024, but the reference cutoff is unknown and therefore provides no identity-comparison signal.
  • The claimed name and API identifier agree, but both are untrusted metadata and do not prove model identity.
Reakcja testowanego modelu

Dosłownie wyodrębniony tekst modelu

Zarchiwizowane podsumowanie

To uruchomienie poprzedza wyrażenie zgody na przechowywanie pełnych raportów. Dostępne są wyzwanie, klucz odpowiedzi i znormalizowana ocena sędziego, ale dokładny tekst odpowiedzi na temat testowanego modelu został celowo odrzucony w polityce prywatności z czasów wzorcowych.

Pełna lista testów porównawczych

Dowody pytanie po pytaniu

Wszystkie dopuszczone pytania są pokazane wraz z oczekiwaną odpowiedzią, dostępnym źródłem, podstawą testowanego modelu, werdyktem semantycznym i kwalifikowalnością graniczną. Pytania bez oceny nie są modelowym wstrzymaniem się od głosu. Prawidłowe DOMYŚLENIE lub WNIOSEK pozostaje poprawne semantycznie, ale jest wykluczone z dowodu granicznego opartego na czystym przypomnieniu.

K01UNKNOWNwyłączone z odcięcia

Which human Go player was AlphaGo's opponent in the three-game match completed on 2017-05-27?

Oczekiwana odpowiedźKe Jie
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 100%

Notatka sędziego: Matches accepted answer Ke Jie.

K02UNKNOWNwyłączone z odcięcia

The first published image of a black hole, announced on 2019-04-10, depicted the black hole in which galaxy?

Oczekiwana odpowiedźMessier 87
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 100%

Notatka sędziego: M87 galaxy is semantically equivalent to Messier 87.

K03UNKNOWNwyłączone z odcięcia

Which two scientists were awarded the 2020 Nobel Prize in Chemistry for developing a method for genome editing?

Oczekiwana odpowiedźEmmanuelle Charpentier and Jennifer A. Doudna
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 100%

Notatka sędziego: Both required scientists are correctly named.

K04UNKNOWNwyłączone z odcięcia

Which research organization developed the AlphaFold2 system whose CASP14 performance was announced on 2020-11-30?

Oczekiwana odpowiedźDeepMind
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 100%

Notatka sędziego: Matches accepted answer DeepMind.

K05UNKNOWNwyłączone z odcięcia

Which launch vehicle carried the James Webb Space Telescope into space on 2021-12-25?

Oczekiwana odpowiedźAriane 5
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 100%

Notatka sędziego: Matches accepted answer Ariane 5.

K06UNKNOWNwyłączone z odcięcia

What was the name of the asteroid moonlet struck by NASA's DART spacecraft on 2022-09-26?

Oczekiwana odpowiedźDimorphos
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 100%

Notatka sędziego: Matches accepted answer Dimorphos.

K07UNKNOWNwyłączone z odcięcia

In which ocean did the Artemis I Orion capsule splash down on 2022-12-11?

Oczekiwana odpowiedźPacific Ocean
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 100%

Notatka sędziego: Matches accepted answer Pacific Ocean.

K08UNKNOWNwyłączone z odcięcia

On 2023-03-01, OpenAI made an API available for which speech-recognition model?

Oczekiwana odpowiedźWhisper
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 100%

Notatka sędziego: Matches accepted answer Whisper.

K09UNKNOWNwyłączone z odcięcia

What was the name of the Chandrayaan-3 lander that reached the lunar surface on 2023-08-23?

Oczekiwana odpowiedźVikram
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 100%

Notatka sędziego: Matches accepted answer Vikram.

K10UNKNOWNwyłączone z odcięcia

Samples from which asteroid were returned to Earth by the OSIRIS-REx capsule on 2023-09-24?

Oczekiwana odpowiedźBennu
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 100%

Notatka sędziego: Matches accepted answer Bennu.

K11UNKNOWNwyłączone z odcięcia

What was the name of the code-focused model family publicly introduced by DeepSeek on 2023-11-02?

Oczekiwana odpowiedźDeepSeek Coder
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 100%

Notatka sędziego: DeepSeek-Coder is an accepted spelling.

K12UNKNOWNwyłączone z odcięcia

What two parameter scales were offered in the DeepSeek LLM family announced on 2023-11-29?

Oczekiwana odpowiedź7B and 67B
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 100%

Notatka sędziego: Both parameter scales match: 7B and 67B.

K13UNKNOWNwyłączone z odcięcia

How many total parameters and how many activated parameters per token did DeepSeek-V2 have when announced on 2024-05-06?

Oczekiwana odpowiedź236B total parameters and 21B activated parameters per token
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 100%

Notatka sędziego: Correctly gives 236B total and 21B activated per token.

K14UNKNOWNwyłączone z odcięcia

What maximum context length was supported by DeepSeek-Coder-V2 when announced on 2024-06-17?

Oczekiwana odpowiedź128K tokens
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 100%

Notatka sędziego: Matches accepted answer 128K tokens.

K15UNKNOWNwyłączone z odcięcia

Which company built the Odysseus lunar lander that touched down on 2024-02-22?

Oczekiwana odpowiedźIntuitive Machines
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 100%

Notatka sędziego: Matches accepted answer Intuitive Machines.

K16UNKNOWNwyłączone z odcięcia

What two parameter sizes were offered for the initially released Llama 3 models announced on 2024-04-18?

Oczekiwana odpowiedź8B and 70B
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 100%

Notatka sędziego: Both initially released sizes match: 8B and 70B.

Zakres pytań i notatki z badań

Pytania merytoryczne: 16 · Nie ocenione przez sędziego: 0

Punkty odniesienia i cytaty są dostarczane przez sędziego i nie są niezależnie potwierdzane przez platformę. Notatki z badań nie penalizują testowanego modelu.

Uruchom metadane

Szczegóły dotyczące powtarzalności

Uruchom identyfikatorA57ZK57ERM62N3S1XETMXFKK0X
Repermodel-verification-single-request-v1.1
Sędziagpt-5.6-sol
Żądany protokółopenai_chat
Wykryto schemat odpowiedziLegacy / not recorded
Zgodność protokołuMECZ / dziedzictwo
Dane wyjściowe modeluNot recorded
Tokeny wejścioweNot recorded
Tokeny wyjścioweNot recorded
Skończ powódNot recorded
Stan HTTP200
Opóźnienie zewnętrzne28,645 ms
Bajty odpowiedzi1,859
SHA-2564c1f5cca4a79a53f28e7f6544bfe08208148d53c85569f50c4132e161da06613
Ważne ograniczenie

The reference cutoff is the configured judge model's internal-knowledge snapshot for this run, not an independently verified provider attestation. Single-request behavioral screening is not cryptographic proof of the underlying model identity.

Przeprowadź niezależną weryfikację

Zanim zaczniesz polegać na reklamowanej tożsamości modelu, przetestuj sam ten sam punkt końcowy lub przejrzyj inne publiczne raporty.