← Publiczny rejestr weryfikacyjnymodel-verification-single-request-v1.2
Raport z weryfikacji publicznego modelu AI

deepseek-v4-flash

https://api.model-gate.com/v1/chat/completions

openai_chatgpt-5.6-solSep 6, 2026 16:39 UTC
Starszy Wynik Jakości87/100
CONSISTENT82% pewność oceny
Raport stałyhttps://model-gate.com/pl/model-verification/results/0B0HVDB2FRJEJC90BRG4D7JV1Y
Telegram ↗X ↗
Faktyczne przypomnienie83
Aktualność wiedzy82
Odporność na halucynacje83
Kalibrowanie80
Reklamowany modeldeepseek-v4-flash
Model rozstrzygnięty przez sędziegoDeepSeek-V4-Flash-0731DeepSeek AI
Host punktu końcowegoapi.model-gate.com
Pole modelu reakcji zewnętrznejdeepseek-v4-flash
Analiza sędziego

Dlaczego ta weryfikacja otrzymała swój wynik

Raport publiczny odzwierciedla dowody analityczne przedstawione testerowi po /chat/verify. Oceny sędziowskie to oceny rubrykowe; tylko wyraźne poprawne lub błędne odpowiedzi RECALL mogą wpływać na granicę odcięcia czystego przypominania.

Diagnostyka behawioralna

Uzasadnienie oceny sędziego

4 diagnostyka
Faktyczne przypomnienie83/100

Nie zachowano odrębnego uzasadnienia sędziowskiego dla tego zarchiwizowanego wyniku.

Aktualność wiedzy82/100

Nie zachowano odrębnego uzasadnienia sędziowskiego dla tego zarchiwizowanego wyniku.

Odporność na halucynacje83/100

Nie zachowano odrębnego uzasadnienia sędziowskiego dla tego zarchiwizowanego wyniku.

Kalibrowanie80/100

Nie zachowano odrębnego uzasadnienia sędziowskiego dla tego zarchiwizowanego wyniku.

Notatka dotycząca historycznego testu porównawczego: w tym zarchiwizowanym ogólnym wyniku wersji 1.4 wykorzystano poprzednią stałą agregację diagnostyczną. Jest on zachowywany w celu zapewnienia powtarzalności i nie należy go interpretować jako wyniku dopasowania modelu v1.5.

Dowody tymczasowe

Oś czasu czystego przypominania

0 PRZYWOŁAJ sondy

Rzeczywisty zestaw pytań został przetasowany przed żądaniem testowanego modelu. Brakujące miejsca dla pokoleń nie są modelowym wstrzymaniem się od głosu. Oś czasu rekonstruuje docelowe miesiące w celu umożliwienia kontroli. Tylko wyraźne odpowiedzi RECALL stanowią dowód graniczny; WNIOSEK, DOMYŚLENIE i NIEZNANE pozostają widoczne, ale nie przesuwają granicy.

2023-11? K24UNKNOWN
2023-12? K13UNKNOWN
2024-01? K08UNKNOWN
2024-02? K07UNKNOWN
2024-03? K15UNKNOWN
2024-04? K18UNKNOWN
2024-05? K04UNKNOWN
2024-06? K16UNKNOWN
2024-07? K06UNKNOWN
2024-08? K03UNKNOWN
2024-09? K09UNKNOWN
2024-10? K17UNKNOWN
2024-11? K20UNKNOWN
2024-12? K10UNKNOWN
2025-01? K12UNKNOWN
2025-02? K14UNKNOWN
2025-03? K11UNKNOWN
2025-04? K21UNKNOWN
2025-05? K22UNKNOWN
2025-06? K23UNKNOWN
2025-07? K02UNKNOWN
2025-08? K05UNKNOWN
2025-09? K01UNKNOWN
2025-10? K19UNKNOWN
prawidłowe PRZYPOMNIENIE błędne PRZYPOMNIENIE~ INFERENCE GUESS? UNKNOWN
0RECALL
0INFERENCE
0GUESS
0UNKNOWN
0prawidłowe PRZYPOMNIENIE
0błędne PRZYPOMNIENIE
Porównanie czasowe

Porównanie granic wiedzy

CONSISTENT
Odcięcie odniesienia2025-05ESTIMATED_WEB · 0%
Najnowsze obsługiwane RECALL0 kwalifikujące się odpowiedzi PRZYWOŁAJ
Obserwowana granicaNiewystarczające dowody WYCOFANIAINSUFFICIENT_RECALL_EVIDENCE
Wyrównanie odcięciaCONSISTENT88/100 · 80% zaufanie
Sędzia zauważa
  • Strong recall is nearly complete through the May 2025 reference cutoff.
  • There is no systematic strong-recall failure substantially before the reference cutoff.
  • Correct June and August 2025 answers suggest selective later knowledge, while failures in July, September, and October prevent a clearly later boundary.

Semantyczny: prawidłowy 20 · zło 4 · nieznany 0. Wykluczone z odcięcia: 0.

Tożsamość behawioralna

Sygnały tożsamości

CONSISTENT · 82%

Tożsamość wnioskuje się na podstawie zgodności między deklarowanym modelem a obserwowanym profilem wiedzy/odpowiedzi. Jest to dowód, a nie zdalne poświadczenie lub kryptograficzny dowód wag serwowania.

Pozytywne sygnały

  • Excellent recall across late 2023 through May 2025.
  • Correct near-cutoff answer for the WHO Pandemic Agreement.
  • No pattern of early knowledge degradation.

Negatywne sygnały

  • Incorrect February 2024 lunar-lander answer despite high confidence.
  • Correct June and August 2025 answers extend beyond the estimated reference cutoff.
  • Several post-cutoff answers are confidently wrong, indicating uneven recency.
Uzasadnienie tożsamości sędziego
  • Observed behavior broadly overlaps the saved May 2025 reference cutoff.
  • The model answered 20 of 24 Class A items correctly, with only one isolated failure well before the cutoff.
  • Post-cutoff knowledge is uneven and can plausibly reflect selective updates rather than model substitution.
Reakcja testowanego modelu

Dosłownie wyodrębniony tekst modelu

Zarchiwizowane podsumowanie

To uruchomienie poprzedza wyrażenie zgody na przechowywanie pełnych raportów. Dostępne są wyzwanie, klucz odpowiedzi i znormalizowana ocena sędziego, ale dokładny tekst odpowiedzi na temat testowanego modelu został celowo odrzucony w polityce prywatności z czasów wzorcowych.

Pełna lista testów porównawczych

Dowody pytanie po pytaniu

Wszystkie dopuszczone pytania są pokazane wraz z oczekiwaną odpowiedzią, dostępnym źródłem, podstawą testowanego modelu, werdyktem semantycznym i kwalifikowalnością graniczną. Pytania bez oceny nie są modelowym wstrzymaniem się od głosu. Prawidłowe DOMYŚLENIE lub WNIOSEK pozostaje poprawne semantycznie, ale jest wykluczone z dowodu granicznego opartego na czystym przypomnieniu.

K01UNKNOWNwyłączone z odcięcia

Who won the men's 100 metres at the World Athletics Championships in Tokyo?

Oczekiwana odpowiedźOblique SevilleSource ↗
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: WRONGZgłoszone zaufanie: 75%

Notatka sędziego: Expected Oblique Seville; answered Kishane Thompson.

K02UNKNOWNwyłączone z odcięcia

Which team won the UEFA Women's Euro 2025 final?

Oczekiwana odpowiedźEnglandSource ↗
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: WRONGZgłoszone zaufanie: 85%

Notatka sędziego: Expected England; answered Spain.

K03UNKNOWNwyłączone z odcięcia

Which disease's African upsurge did WHO declare a public health emergency of international concern?

Oczekiwana odpowiedźmpoxSource ↗
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 95%

Notatka sędziego: Matches mpox.

K04UNKNOWNwyłączone z odcięcia

What molecular-structure prediction model did Google DeepMind and Isomorphic Labs introduce?

Oczekiwana odpowiedźAlphaFold 3Source ↗
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 95%

Notatka sędziego: Matches AlphaFold 3.

K05UNKNOWNwyłączone z odcięcia

What model did OpenAI release as a unified system with built-in thinking?

Oczekiwana odpowiedźGPT-5Source ↗
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 90%

Notatka sędziego: Matches GPT-5.

K06UNKNOWNwyłączone z odcięcia

Which operating system was affected by the faulty CrowdStrike Falcon content update?

Oczekiwana odpowiedźWindowsSource ↗
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 95%

Notatka sędziego: Microsoft Windows is accepted.

K07UNKNOWNwyłączone z odcięcia

What was the nickname of Intuitive Machines' Nova-C lander that touched down on the Moon?

Oczekiwana odpowiedźOdysseusSource ↗
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: WRONGZgłoszone zaufanie: 80%

Notatka sędziego: Expected Odysseus; Odie is not an accepted answer.

K08UNKNOWNwyłączone z odcięcia

What was the name of Japan's lunar lander that successfully reached the Moon?

Oczekiwana odpowiedźSLIMSource ↗
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 95%

Notatka sędziego: Matches SLIM.

K09UNKNOWNwyłączone z odcięcia

Who became the first private astronaut to perform a spacewalk?

Oczekiwana odpowiedźJared IsaacmanSource ↗
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 95%

Notatka sędziego: Matches Jared Isaacman.

K10UNKNOWNwyłączone z odcięcia

Which country was appointed host of the 2034 FIFA World Cup?

Oczekiwana odpowiedźSaudi ArabiaSource ↗
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 95%

Notatka sędziego: Matches Saudi Arabia.

K11UNKNOWNwyłączone z odcięcia

In which lunar mare did Firefly Aerospace's Blue Ghost land?

Oczekiwana odpowiedźMare CrisiumSource ↗
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 90%

Notatka sędziego: Matches Mare Crisium.

K12UNKNOWNwyłączone z odcięcia

What model did DeepSeek begin serving through its deepseek-reasoner endpoint?

Oczekiwana odpowiedźDeepSeek-R1Source ↗
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 95%

Notatka sędziego: Matches DeepSeek-R1.

K13UNKNOWNwyłączone z odcięcia

What was the name of the second malaria vaccine prequalified by WHO?

Oczekiwana odpowiedźR21/Matrix-MSource ↗
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 90%

Notatka sędziego: Matches R21/Matrix-M.

K14UNKNOWNwyłączone z odcięcia

Which album won Album of the Year at the 67th Grammy Awards?

Oczekiwana odpowiedźCowboy CarterSource ↗
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 95%

Notatka sędziego: Matches Cowboy Carter.

K15UNKNOWNwyłączone z odcięcia

How many European Parliament members voted in favor of the Artificial Intelligence Act?

Oczekiwana odpowiedź523Source ↗
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 85%

Notatka sędziego: Matches 523.

K16UNKNOWNwyłączone z odcięcia

How many grams of lunar material did the Chang'e-6 mission collect?

Oczekiwana odpowiedź1,935.3 gramsSource ↗
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 90%

Notatka sędziego: Matches 1,935.3 grams.

K17UNKNOWNwyłączone z odcięcia

Which rocket launched NASA's Europa Clipper spacecraft?

Oczekiwana odpowiedźFalcon HeavySource ↗
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 95%

Notatka sędziego: Matches Falcon Heavy.

K18UNKNOWNwyłączone z odcięcia

What designation was given to the newly identified 33-solar-mass stellar black hole in the Milky Way?

Oczekiwana odpowiedźGaia BH3Source ↗
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 90%

Notatka sędziego: Matches Gaia BH3.

K19UNKNOWNwyłączone z odcięcia

Who was awarded the 2025 Nobel Peace Prize?

Oczekiwana odpowiedźMaria Corina MachadoSource ↗
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: WRONGZgłoszone zaufanie: 70%

Notatka sędziego: Expected Maria Corina Machado; answered an institution.

K20UNKNOWNwyłączone z odcięcia

What annual climate-finance goal for developing countries did COP29 set for 2035?

Oczekiwana odpowiedźUS$300 billion per yearSource ↗
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 90%

Notatka sędziego: Matches $300 billion per year.

K21UNKNOWNwyłączone z odcięcia

What was the name of the first human spaceflight to orbit over Earth's polar regions?

Oczekiwana odpowiedźFram2Source ↗
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 90%

Notatka sędziego: Matches Fram2.

K22UNKNOWNwyłączone z odcięcia

Under which article of the WHO Constitution was the Pandemic Agreement adopted?

Oczekiwana odpowiedźArticle 19Source ↗
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 75%

Notatka sędziego: Matches Article 19.

K23UNKNOWNwyłączone z odcięcia

Which new Mario Kart game launched alongside Nintendo Switch 2?

Oczekiwana odpowiedźMario Kart WorldSource ↗
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 95%

Notatka sędziego: Matches Mario Kart World.

K24UNKNOWNwyłączone z odcięcia

What model did OpenAI introduce with a 128K context window at its first DevDay?

Oczekiwana odpowiedźGPT-4 TurboSource ↗
Odpowiedź na testowany modelDokładna odpowiedź modelu nie została zachowana w przypadku tego zarchiwizowanego przebiegu.
Wyrok sędziego: CORRECTZgłoszone zaufanie: 95%

Notatka sędziego: Matches GPT-4 Turbo.

Zakres pytań i notatki z badań

Pytania merytoryczne: 24 · Nie ocenione przez sędziego: 0

Punkty odniesienia i cytaty są dostarczane przez sędziego i nie są niezależnie potwierdzane przez platformę. Notatki z badań nie penalizują testowanego modelu.

Uruchom metadane

Szczegóły dotyczące powtarzalności

Uruchom identyfikator0B0HVDB2FRJEJC90BRG4D7JV1Y
Repermodel-verification-single-request-v1.2
Sędziagpt-5.6-sol
Żądany protokółopenai_chat
Wykryto schemat odpowiedziLegacy / not recorded
Zgodność protokołuMECZ / dziedzictwo
Dane wyjściowe modeluNot recorded
Tokeny wejścioweNot recorded
Tokeny wyjścioweNot recorded
Skończ powódNot recorded
Stan HTTP200
Opóźnienie zewnętrzne88,304 ms
Bajty odpowiedzi2,460
SHA-256f22e63d94e67fbd4fdfa25a27a37ae4b3402f94fc6801d14c2a4e638f85cfd9d
Ważne ograniczenie

The reference cutoff is a judge-produced snapshot grounded in hosted web evidence when available (official sources preferred, otherwise the best defensible estimate). It is not provider attestation. Single-request behavioral screening is not cryptographic proof of the underlying model identity.

Przeprowadź niezależną weryfikację

Zanim zaczniesz polegać na reklamowanej tożsamości modelu, przetestuj sam ten sam punkt końcowy lub przejrzyj inne publiczne raporty.