deepseek-v4-flash
https://api.model-gate.com/v1/chat/completions
https://model-gate.com/pl/model-verification/results/A57ZK57ERM62N3S1XETMXFKK0XDlaczego ta weryfikacja otrzymała swój wynik
Raport publiczny odzwierciedla dowody analityczne przedstawione testerowi po /chat/verify. Oceny sędziowskie to oceny rubrykowe; tylko wyraźne poprawne lub błędne odpowiedzi RECALL mogą wpływać na granicę odcięcia czystego przypominania.
Uzasadnienie oceny sędziego
Nie zachowano odrębnego uzasadnienia sędziowskiego dla tego zarchiwizowanego wyniku.
Nie zachowano odrębnego uzasadnienia sędziowskiego dla tego zarchiwizowanego wyniku.
Nie zachowano odrębnego uzasadnienia sędziowskiego dla tego zarchiwizowanego wyniku.
Nie zachowano odrębnego uzasadnienia sędziowskiego dla tego zarchiwizowanego wyniku.
Notatka dotycząca historycznego testu porównawczego: w tym zarchiwizowanym ogólnym wyniku wersji 1.4 wykorzystano poprzednią stałą agregację diagnostyczną. Jest on zachowywany w celu zapewnienia powtarzalności i nie należy go interpretować jako wyniku dopasowania modelu v1.5.
Oś czasu czystego przypominania
Rzeczywisty zestaw pytań został przetasowany przed żądaniem testowanego modelu. Brakujące miejsca dla pokoleń nie są modelowym wstrzymaniem się od głosu. Oś czasu rekonstruuje docelowe miesiące w celu umożliwienia kontroli. Tylko wyraźne odpowiedzi RECALL stanowią dowód graniczny; WNIOSEK, DOMYŚLENIE i NIEZNANE pozostają widoczne, ale nie przesuwają granicy.
Porównanie granic wiedzy
- All Class A items are correct through June 2024, establishing an observed lower bound but no upper bound.
- The immutable reference snapshot has no known cutoff dates, so cutoff alignment cannot be scored.
Semantyczny: prawidłowy 16 · zło 0 · nieznany 0. Wykluczone z odcięcia: 0.
Sygnały tożsamości
Tożsamość wnioskuje się na podstawie zgodności między deklarowanym modelem a obserwowanym profilem wiedzy/odpowiedzi. Jest to dowód, a nie zdalne poświadczenie lub kryptograficzny dowód wag serwowania.
Pozytywne sygnały
- Perfect performance across all supplied Class A recall items.
- Correct recall of multiple DeepSeek model releases and specifications.
- No systematic early knowledge failures.
Negatywne sygnały
- No documented canonical identity or cutoff is available in the reference snapshot.
- Cutoff consistency cannot be evaluated.
- Self-report and matching API metadata are weak identity evidence.
- The response is fully correct on all 16 strong-recall questions, including the DeepSeek-specific history items.
- The observed knowledge extends through June 2024, but the reference cutoff is unknown and therefore provides no identity-comparison signal.
- The claimed name and API identifier agree, but both are untrusted metadata and do not prove model identity.
Dosłownie wyodrębniony tekst modelu
To uruchomienie poprzedza wyrażenie zgody na przechowywanie pełnych raportów. Dostępne są wyzwanie, klucz odpowiedzi i znormalizowana ocena sędziego, ale dokładny tekst odpowiedzi na temat testowanego modelu został celowo odrzucony w polityce prywatności z czasów wzorcowych.
Dowody pytanie po pytaniu
Wszystkie dopuszczone pytania są pokazane wraz z oczekiwaną odpowiedzią, dostępnym źródłem, podstawą testowanego modelu, werdyktem semantycznym i kwalifikowalnością graniczną. Pytania bez oceny nie są modelowym wstrzymaniem się od głosu. Prawidłowe DOMYŚLENIE lub WNIOSEK pozostaje poprawne semantycznie, ale jest wykluczone z dowodu granicznego opartego na czystym przypomnieniu.
Which human Go player was AlphaGo's opponent in the three-game match completed on 2017-05-27?
Notatka sędziego: Matches accepted answer Ke Jie.
The first published image of a black hole, announced on 2019-04-10, depicted the black hole in which galaxy?
Notatka sędziego: M87 galaxy is semantically equivalent to Messier 87.
Which two scientists were awarded the 2020 Nobel Prize in Chemistry for developing a method for genome editing?
Notatka sędziego: Both required scientists are correctly named.
Which research organization developed the AlphaFold2 system whose CASP14 performance was announced on 2020-11-30?
Notatka sędziego: Matches accepted answer DeepMind.
Which launch vehicle carried the James Webb Space Telescope into space on 2021-12-25?
Notatka sędziego: Matches accepted answer Ariane 5.
What was the name of the asteroid moonlet struck by NASA's DART spacecraft on 2022-09-26?
Notatka sędziego: Matches accepted answer Dimorphos.
In which ocean did the Artemis I Orion capsule splash down on 2022-12-11?
Notatka sędziego: Matches accepted answer Pacific Ocean.
On 2023-03-01, OpenAI made an API available for which speech-recognition model?
Notatka sędziego: Matches accepted answer Whisper.
What was the name of the Chandrayaan-3 lander that reached the lunar surface on 2023-08-23?
Notatka sędziego: Matches accepted answer Vikram.
Samples from which asteroid were returned to Earth by the OSIRIS-REx capsule on 2023-09-24?
Notatka sędziego: Matches accepted answer Bennu.
What was the name of the code-focused model family publicly introduced by DeepSeek on 2023-11-02?
Notatka sędziego: DeepSeek-Coder is an accepted spelling.
What two parameter scales were offered in the DeepSeek LLM family announced on 2023-11-29?
Notatka sędziego: Both parameter scales match: 7B and 67B.
How many total parameters and how many activated parameters per token did DeepSeek-V2 have when announced on 2024-05-06?
Notatka sędziego: Correctly gives 236B total and 21B activated per token.
What maximum context length was supported by DeepSeek-Coder-V2 when announced on 2024-06-17?
Notatka sędziego: Matches accepted answer 128K tokens.
Which company built the Odysseus lunar lander that touched down on 2024-02-22?
Notatka sędziego: Matches accepted answer Intuitive Machines.
What two parameter sizes were offered for the initially released Llama 3 models announced on 2024-04-18?
Notatka sędziego: Both initially released sizes match: 8B and 70B.
Zakres pytań i notatki z badań
Pytania merytoryczne: 16 · Nie ocenione przez sędziego: 0
Punkty odniesienia i cytaty są dostarczane przez sędziego i nie są niezależnie potwierdzane przez platformę. Notatki z badań nie penalizują testowanego modelu.
Szczegóły dotyczące powtarzalności
A57ZK57ERM62N3S1XETMXFKK0Xmodel-verification-single-request-v1.1gpt-5.6-solopenai_chatLegacy / not recordedMECZ / dziedzictwoNot recordedNot recordedNot recordedNot recorded20028,645 ms1,8594c1f5cca4a79a53f28e7f6544bfe08208148d53c85569f50c4132e161da06613The reference cutoff is the configured judge model's internal-knowledge snapshot for this run, not an independently verified provider attestation. Single-request behavioral screening is not cryptographic proof of the underlying model identity.
Przeprowadź niezależną weryfikację
Zanim zaczniesz polegać na reklamowanej tożsamości modelu, przetestuj sam ten sam punkt końcowy lub przejrzyj inne publiczne raporty.