deepseek-v4-flash
https://api.model-gate.com/v1/chat/completions
https://model-gate.com/pl/model-verification/results/0B0HVDB2FRJEJC90BRG4D7JV1YDlaczego ta weryfikacja otrzymała swój wynik
Raport publiczny odzwierciedla dowody analityczne przedstawione testerowi po /chat/verify. Oceny sędziowskie to oceny rubrykowe; tylko wyraźne poprawne lub błędne odpowiedzi RECALL mogą wpływać na granicę odcięcia czystego przypominania.
Uzasadnienie oceny sędziego
Nie zachowano odrębnego uzasadnienia sędziowskiego dla tego zarchiwizowanego wyniku.
Nie zachowano odrębnego uzasadnienia sędziowskiego dla tego zarchiwizowanego wyniku.
Nie zachowano odrębnego uzasadnienia sędziowskiego dla tego zarchiwizowanego wyniku.
Nie zachowano odrębnego uzasadnienia sędziowskiego dla tego zarchiwizowanego wyniku.
Notatka dotycząca historycznego testu porównawczego: w tym zarchiwizowanym ogólnym wyniku wersji 1.4 wykorzystano poprzednią stałą agregację diagnostyczną. Jest on zachowywany w celu zapewnienia powtarzalności i nie należy go interpretować jako wyniku dopasowania modelu v1.5.
Oś czasu czystego przypominania
Rzeczywisty zestaw pytań został przetasowany przed żądaniem testowanego modelu. Brakujące miejsca dla pokoleń nie są modelowym wstrzymaniem się od głosu. Oś czasu rekonstruuje docelowe miesiące w celu umożliwienia kontroli. Tylko wyraźne odpowiedzi RECALL stanowią dowód graniczny; WNIOSEK, DOMYŚLENIE i NIEZNANE pozostają widoczne, ale nie przesuwają granicy.
Porównanie granic wiedzy
- Strong recall is nearly complete through the May 2025 reference cutoff.
- There is no systematic strong-recall failure substantially before the reference cutoff.
- Correct June and August 2025 answers suggest selective later knowledge, while failures in July, September, and October prevent a clearly later boundary.
Semantyczny: prawidłowy 20 · zło 4 · nieznany 0. Wykluczone z odcięcia: 0.
Sygnały tożsamości
Tożsamość wnioskuje się na podstawie zgodności między deklarowanym modelem a obserwowanym profilem wiedzy/odpowiedzi. Jest to dowód, a nie zdalne poświadczenie lub kryptograficzny dowód wag serwowania.
Pozytywne sygnały
- Excellent recall across late 2023 through May 2025.
- Correct near-cutoff answer for the WHO Pandemic Agreement.
- No pattern of early knowledge degradation.
Negatywne sygnały
- Incorrect February 2024 lunar-lander answer despite high confidence.
- Correct June and August 2025 answers extend beyond the estimated reference cutoff.
- Several post-cutoff answers are confidently wrong, indicating uneven recency.
- Observed behavior broadly overlaps the saved May 2025 reference cutoff.
- The model answered 20 of 24 Class A items correctly, with only one isolated failure well before the cutoff.
- Post-cutoff knowledge is uneven and can plausibly reflect selective updates rather than model substitution.
Dosłownie wyodrębniony tekst modelu
To uruchomienie poprzedza wyrażenie zgody na przechowywanie pełnych raportów. Dostępne są wyzwanie, klucz odpowiedzi i znormalizowana ocena sędziego, ale dokładny tekst odpowiedzi na temat testowanego modelu został celowo odrzucony w polityce prywatności z czasów wzorcowych.
Dowody pytanie po pytaniu
Wszystkie dopuszczone pytania są pokazane wraz z oczekiwaną odpowiedzią, dostępnym źródłem, podstawą testowanego modelu, werdyktem semantycznym i kwalifikowalnością graniczną. Pytania bez oceny nie są modelowym wstrzymaniem się od głosu. Prawidłowe DOMYŚLENIE lub WNIOSEK pozostaje poprawne semantycznie, ale jest wykluczone z dowodu granicznego opartego na czystym przypomnieniu.
Who won the men's 100 metres at the World Athletics Championships in Tokyo?
Notatka sędziego: Expected Oblique Seville; answered Kishane Thompson.
Which team won the UEFA Women's Euro 2025 final?
Notatka sędziego: Expected England; answered Spain.
Which disease's African upsurge did WHO declare a public health emergency of international concern?
Notatka sędziego: Matches mpox.
What molecular-structure prediction model did Google DeepMind and Isomorphic Labs introduce?
Notatka sędziego: Matches AlphaFold 3.
What model did OpenAI release as a unified system with built-in thinking?
Notatka sędziego: Matches GPT-5.
Which operating system was affected by the faulty CrowdStrike Falcon content update?
Notatka sędziego: Microsoft Windows is accepted.
What was the nickname of Intuitive Machines' Nova-C lander that touched down on the Moon?
Notatka sędziego: Expected Odysseus; Odie is not an accepted answer.
What was the name of Japan's lunar lander that successfully reached the Moon?
Notatka sędziego: Matches SLIM.
Who became the first private astronaut to perform a spacewalk?
Notatka sędziego: Matches Jared Isaacman.
Which country was appointed host of the 2034 FIFA World Cup?
Notatka sędziego: Matches Saudi Arabia.
In which lunar mare did Firefly Aerospace's Blue Ghost land?
Notatka sędziego: Matches Mare Crisium.
What model did DeepSeek begin serving through its deepseek-reasoner endpoint?
Notatka sędziego: Matches DeepSeek-R1.
What was the name of the second malaria vaccine prequalified by WHO?
Notatka sędziego: Matches R21/Matrix-M.
Which album won Album of the Year at the 67th Grammy Awards?
Notatka sędziego: Matches Cowboy Carter.
How many European Parliament members voted in favor of the Artificial Intelligence Act?
Notatka sędziego: Matches 523.
How many grams of lunar material did the Chang'e-6 mission collect?
Notatka sędziego: Matches 1,935.3 grams.
Which rocket launched NASA's Europa Clipper spacecraft?
Notatka sędziego: Matches Falcon Heavy.
What designation was given to the newly identified 33-solar-mass stellar black hole in the Milky Way?
Notatka sędziego: Matches Gaia BH3.
Who was awarded the 2025 Nobel Peace Prize?
Notatka sędziego: Expected Maria Corina Machado; answered an institution.
What annual climate-finance goal for developing countries did COP29 set for 2035?
Notatka sędziego: Matches $300 billion per year.
What was the name of the first human spaceflight to orbit over Earth's polar regions?
Notatka sędziego: Matches Fram2.
Under which article of the WHO Constitution was the Pandemic Agreement adopted?
Notatka sędziego: Matches Article 19.
Which new Mario Kart game launched alongside Nintendo Switch 2?
Notatka sędziego: Matches Mario Kart World.
What model did OpenAI introduce with a 128K context window at its first DevDay?
Notatka sędziego: Matches GPT-4 Turbo.
Zakres pytań i notatki z badań
Pytania merytoryczne: 24 · Nie ocenione przez sędziego: 0
Punkty odniesienia i cytaty są dostarczane przez sędziego i nie są niezależnie potwierdzane przez platformę. Notatki z badań nie penalizują testowanego modelu.
Szczegóły dotyczące powtarzalności
0B0HVDB2FRJEJC90BRG4D7JV1Ymodel-verification-single-request-v1.2gpt-5.6-solopenai_chatLegacy / not recordedMECZ / dziedzictwoNot recordedNot recordedNot recordedNot recorded20088,304 ms2,460f22e63d94e67fbd4fdfa25a27a37ae4b3402f94fc6801d14c2a4e638f85cfd9dThe reference cutoff is a judge-produced snapshot grounded in hosted web evidence when available (official sources preferred, otherwise the best defensible estimate). It is not provider attestation. Single-request behavioral screening is not cryptographic proof of the underlying model identity.
Przeprowadź niezależną weryfikację
Zanim zaczniesz polegać na reklamowanej tożsamości modelu, przetestuj sam ten sam punkt końcowy lub przejrzyj inne publiczne raporty.