deepseek-v4-flash
https://api.model-gate.com/v1/chat/completions
https://model-gate.com/de/model-verification/results/0B0HVDB2FRJEJC90BRG4D7JV1YWarum diese Überprüfung ihr Ergebnis erhalten hat
Der öffentliche Bericht spiegelt die analytischen Beweise wider, die dem Tester nach /chat/verify angezeigt werden. Bei den Wertungen der Richter handelt es sich um Rubrikbewertungen. Nur explizit richtige oder falsche RECALL-Antworten können die Cutoff-Grenze für reine Rückrufe beeinflussen.
Begründung der Bewertung durch den Richter
Für dieses archivierte Ergebnis wurde keine gesonderte Begründung des Richters beibehalten.
Für dieses archivierte Ergebnis wurde keine gesonderte Begründung des Richters beibehalten.
Für dieses archivierte Ergebnis wurde keine gesonderte Begründung des Richters beibehalten.
Für dieses archivierte Ergebnis wurde keine gesonderte Begründung des Richters beibehalten.
Hinweis zum historischen Benchmark: Für diese archivierte Gesamtbewertung der Version 1.4 wurde die frühere feste Diagnoseaggregation verwendet. Sie wird aus Gründen der Reproduzierbarkeit beibehalten und darf nicht als Modellübereinstimmungsergebnis der Version 1.5 interpretiert werden.
Pure-Recall-Zeitleiste
Der eigentliche Fragensatz wurde vor der Anfrage nach dem getesteten Modell gemischt. Fehlende Generationenslots gelten nicht als Musterenthaltungen. Die Zeitleiste rekonstruiert ihre Zielmonate zur Überprüfbarkeit. Nur explizite RECALL-Antworten sind Cutoff-Beweise; INFERENCE, GUESS und UNKNOWN bleiben sichtbar, verschieben aber die Grenze nicht.
Vergleich der Wissensgrenzen
- Strong recall is nearly complete through the May 2025 reference cutoff.
- There is no systematic strong-recall failure substantially before the reference cutoff.
- Correct June and August 2025 answers suggest selective later knowledge, while failures in July, September, and October prevent a clearly later boundary.
Semantisch: richtig 20 · falsch 4 · unbekannt 0. Vom Cutoff ausgeschlossen: 0.
Identitätssignale
Identität wird aus der Konsistenz zwischen dem beanspruchten Modell und dem beobachteten Wissens-/Antwortprofil abgeleitet. Es handelt sich um einen Beweis, nicht um eine Fernbescheinigung oder einen kryptografischen Nachweis der Portionsgewichte.
Positive Signale
- Excellent recall across late 2023 through May 2025.
- Correct near-cutoff answer for the WHO Pandemic Agreement.
- No pattern of early knowledge degradation.
Negative Signale
- Incorrect February 2024 lunar-lander answer despite high confidence.
- Correct June and August 2025 answers extend beyond the estimated reference cutoff.
- Several post-cutoff answers are confidently wrong, indicating uneven recency.
- Observed behavior broadly overlaps the saved May 2025 reference cutoff.
- The model answered 20 of 24 Class A items correctly, with only one isolated failure well before the cutoff.
- Post-cutoff knowledge is uneven and can plausibly reflect selective updates rather than model substitution.
Verbatim extrahierter Modelltext
Dieser Lauf geht der Opt-in-Aufbewahrung für vollständige Berichte voraus. Die Herausforderung, der Antwortschlüssel und die normalisierte Richterbewertung sind verfügbar, aber der genaue Antworttext des getesteten Modells wurde in dieser Datenschutzrichtlinie aus der Benchmark-Ära absichtlich verworfen.
Beweise von Frage zu Frage
Alle zugelassenen Fragen werden mit der erwarteten Antwort, der verfügbaren Quelle, der Basis des getesteten Modells, dem semantischen Urteil und der Cutoff-Berechtigung angezeigt. Unbenotete Fragen gelten nicht als Musterenthaltungen. Eine korrekte SCHÄTZUNG oder SCHLUSSFOLGERUNG bleibt semantisch korrekt, wird jedoch von der reinen Rückruf-Cutoff-Evidenz ausgeschlossen.
Who won the men's 100 metres at the World Athletics Championships in Tokyo?
Anmerkung des Richters: Expected Oblique Seville; answered Kishane Thompson.
Which team won the UEFA Women's Euro 2025 final?
Anmerkung des Richters: Expected England; answered Spain.
Which disease's African upsurge did WHO declare a public health emergency of international concern?
Anmerkung des Richters: Matches mpox.
What molecular-structure prediction model did Google DeepMind and Isomorphic Labs introduce?
Anmerkung des Richters: Matches AlphaFold 3.
What model did OpenAI release as a unified system with built-in thinking?
Anmerkung des Richters: Matches GPT-5.
Which operating system was affected by the faulty CrowdStrike Falcon content update?
Anmerkung des Richters: Microsoft Windows is accepted.
What was the nickname of Intuitive Machines' Nova-C lander that touched down on the Moon?
Anmerkung des Richters: Expected Odysseus; Odie is not an accepted answer.
What was the name of Japan's lunar lander that successfully reached the Moon?
Anmerkung des Richters: Matches SLIM.
Who became the first private astronaut to perform a spacewalk?
Anmerkung des Richters: Matches Jared Isaacman.
Which country was appointed host of the 2034 FIFA World Cup?
Anmerkung des Richters: Matches Saudi Arabia.
In which lunar mare did Firefly Aerospace's Blue Ghost land?
Anmerkung des Richters: Matches Mare Crisium.
What model did DeepSeek begin serving through its deepseek-reasoner endpoint?
Anmerkung des Richters: Matches DeepSeek-R1.
What was the name of the second malaria vaccine prequalified by WHO?
Anmerkung des Richters: Matches R21/Matrix-M.
Which album won Album of the Year at the 67th Grammy Awards?
Anmerkung des Richters: Matches Cowboy Carter.
How many European Parliament members voted in favor of the Artificial Intelligence Act?
Anmerkung des Richters: Matches 523.
How many grams of lunar material did the Chang'e-6 mission collect?
Anmerkung des Richters: Matches 1,935.3 grams.
Which rocket launched NASA's Europa Clipper spacecraft?
Anmerkung des Richters: Matches Falcon Heavy.
What designation was given to the newly identified 33-solar-mass stellar black hole in the Milky Way?
Anmerkung des Richters: Matches Gaia BH3.
Who was awarded the 2025 Nobel Peace Prize?
Anmerkung des Richters: Expected Maria Corina Machado; answered an institution.
What annual climate-finance goal for developing countries did COP29 set for 2035?
Anmerkung des Richters: Matches $300 billion per year.
What was the name of the first human spaceflight to orbit over Earth's polar regions?
Anmerkung des Richters: Matches Fram2.
Under which article of the WHO Constitution was the Pandemic Agreement adopted?
Anmerkung des Richters: Matches Article 19.
Which new Mario Kart game launched alongside Nintendo Switch 2?
Anmerkung des Richters: Matches Mario Kart World.
What model did OpenAI introduce with a 128K context window at its first DevDay?
Anmerkung des Richters: Matches GPT-4 Turbo.
Fragenabdeckung und Forschungsnotizen
Sachliche Fragen: 24 · Vom Richter nicht bewertet: 0
Referenz-Cutoff und Zitate werden vom Richter bereitgestellt und nicht unabhängig von der Plattform bestätigt. Forschungsnotizen bestrafen das getestete Modell nicht.
Details zur Reproduzierbarkeit
0B0HVDB2FRJEJC90BRG4D7JV1Ymodel-verification-single-request-v1.2gpt-5.6-solopenai_chatLegacy / not recordedMATCH / VermächtnisNot recordedNot recordedNot recordedNot recorded20088,304 ms2,460f22e63d94e67fbd4fdfa25a27a37ae4b3402f94fc6801d14c2a4e638f85cfd9dThe reference cutoff is a judge-produced snapshot grounded in hosted web evidence when available (official sources preferred, otherwise the best defensible estimate). It is not provider attestation. Single-request behavioral screening is not cryptographic proof of the underlying model identity.
Führen Sie eine unabhängige Überprüfung durch
Testen Sie denselben Endpunkt selbst oder durchsuchen Sie andere öffentliche Berichte, bevor Sie sich auf eine beworbene Modellidentität verlassen.