deepseek-v4-flash
https://api.model-gate.com/v1/chat/completions
https://model-gate.com/de/model-verification/results/A57ZK57ERM62N3S1XETMXFKK0XWarum diese Überprüfung ihr Ergebnis erhalten hat
Der öffentliche Bericht spiegelt die analytischen Beweise wider, die dem Tester nach /chat/verify angezeigt werden. Bei den Wertungen der Richter handelt es sich um Rubrikbewertungen. Nur explizit richtige oder falsche RECALL-Antworten können die Cutoff-Grenze für reine Rückrufe beeinflussen.
Begründung der Bewertung durch den Richter
Für dieses archivierte Ergebnis wurde keine gesonderte Begründung des Richters beibehalten.
Für dieses archivierte Ergebnis wurde keine gesonderte Begründung des Richters beibehalten.
Für dieses archivierte Ergebnis wurde keine gesonderte Begründung des Richters beibehalten.
Für dieses archivierte Ergebnis wurde keine gesonderte Begründung des Richters beibehalten.
Hinweis zum historischen Benchmark: Für diese archivierte Gesamtbewertung der Version 1.4 wurde die frühere feste Diagnoseaggregation verwendet. Sie wird aus Gründen der Reproduzierbarkeit beibehalten und darf nicht als Modellübereinstimmungsergebnis der Version 1.5 interpretiert werden.
Pure-Recall-Zeitleiste
Der eigentliche Fragensatz wurde vor der Anfrage nach dem getesteten Modell gemischt. Fehlende Generationenslots gelten nicht als Musterenthaltungen. Die Zeitleiste rekonstruiert ihre Zielmonate zur Überprüfbarkeit. Nur explizite RECALL-Antworten sind Cutoff-Beweise; INFERENCE, GUESS und UNKNOWN bleiben sichtbar, verschieben aber die Grenze nicht.
Vergleich der Wissensgrenzen
- All Class A items are correct through June 2024, establishing an observed lower bound but no upper bound.
- The immutable reference snapshot has no known cutoff dates, so cutoff alignment cannot be scored.
Semantisch: richtig 16 · falsch 0 · unbekannt 0. Vom Cutoff ausgeschlossen: 0.
Identitätssignale
Identität wird aus der Konsistenz zwischen dem beanspruchten Modell und dem beobachteten Wissens-/Antwortprofil abgeleitet. Es handelt sich um einen Beweis, nicht um eine Fernbescheinigung oder einen kryptografischen Nachweis der Portionsgewichte.
Positive Signale
- Perfect performance across all supplied Class A recall items.
- Correct recall of multiple DeepSeek model releases and specifications.
- No systematic early knowledge failures.
Negative Signale
- No documented canonical identity or cutoff is available in the reference snapshot.
- Cutoff consistency cannot be evaluated.
- Self-report and matching API metadata are weak identity evidence.
- The response is fully correct on all 16 strong-recall questions, including the DeepSeek-specific history items.
- The observed knowledge extends through June 2024, but the reference cutoff is unknown and therefore provides no identity-comparison signal.
- The claimed name and API identifier agree, but both are untrusted metadata and do not prove model identity.
Verbatim extrahierter Modelltext
Dieser Lauf geht der Opt-in-Aufbewahrung für vollständige Berichte voraus. Die Herausforderung, der Antwortschlüssel und die normalisierte Richterbewertung sind verfügbar, aber der genaue Antworttext des getesteten Modells wurde in dieser Datenschutzrichtlinie aus der Benchmark-Ära absichtlich verworfen.
Beweise von Frage zu Frage
Alle zugelassenen Fragen werden mit der erwarteten Antwort, der verfügbaren Quelle, der Basis des getesteten Modells, dem semantischen Urteil und der Cutoff-Berechtigung angezeigt. Unbenotete Fragen gelten nicht als Musterenthaltungen. Eine korrekte SCHÄTZUNG oder SCHLUSSFOLGERUNG bleibt semantisch korrekt, wird jedoch von der reinen Rückruf-Cutoff-Evidenz ausgeschlossen.
Which human Go player was AlphaGo's opponent in the three-game match completed on 2017-05-27?
Anmerkung des Richters: Matches accepted answer Ke Jie.
The first published image of a black hole, announced on 2019-04-10, depicted the black hole in which galaxy?
Anmerkung des Richters: M87 galaxy is semantically equivalent to Messier 87.
Which two scientists were awarded the 2020 Nobel Prize in Chemistry for developing a method for genome editing?
Anmerkung des Richters: Both required scientists are correctly named.
Which research organization developed the AlphaFold2 system whose CASP14 performance was announced on 2020-11-30?
Anmerkung des Richters: Matches accepted answer DeepMind.
Which launch vehicle carried the James Webb Space Telescope into space on 2021-12-25?
Anmerkung des Richters: Matches accepted answer Ariane 5.
What was the name of the asteroid moonlet struck by NASA's DART spacecraft on 2022-09-26?
Anmerkung des Richters: Matches accepted answer Dimorphos.
In which ocean did the Artemis I Orion capsule splash down on 2022-12-11?
Anmerkung des Richters: Matches accepted answer Pacific Ocean.
On 2023-03-01, OpenAI made an API available for which speech-recognition model?
Anmerkung des Richters: Matches accepted answer Whisper.
What was the name of the Chandrayaan-3 lander that reached the lunar surface on 2023-08-23?
Anmerkung des Richters: Matches accepted answer Vikram.
Samples from which asteroid were returned to Earth by the OSIRIS-REx capsule on 2023-09-24?
Anmerkung des Richters: Matches accepted answer Bennu.
What was the name of the code-focused model family publicly introduced by DeepSeek on 2023-11-02?
Anmerkung des Richters: DeepSeek-Coder is an accepted spelling.
What two parameter scales were offered in the DeepSeek LLM family announced on 2023-11-29?
Anmerkung des Richters: Both parameter scales match: 7B and 67B.
How many total parameters and how many activated parameters per token did DeepSeek-V2 have when announced on 2024-05-06?
Anmerkung des Richters: Correctly gives 236B total and 21B activated per token.
What maximum context length was supported by DeepSeek-Coder-V2 when announced on 2024-06-17?
Anmerkung des Richters: Matches accepted answer 128K tokens.
Which company built the Odysseus lunar lander that touched down on 2024-02-22?
Anmerkung des Richters: Matches accepted answer Intuitive Machines.
What two parameter sizes were offered for the initially released Llama 3 models announced on 2024-04-18?
Anmerkung des Richters: Both initially released sizes match: 8B and 70B.
Fragenabdeckung und Forschungsnotizen
Sachliche Fragen: 16 · Vom Richter nicht bewertet: 0
Referenz-Cutoff und Zitate werden vom Richter bereitgestellt und nicht unabhängig von der Plattform bestätigt. Forschungsnotizen bestrafen das getestete Modell nicht.
Details zur Reproduzierbarkeit
A57ZK57ERM62N3S1XETMXFKK0Xmodel-verification-single-request-v1.1gpt-5.6-solopenai_chatLegacy / not recordedMATCH / VermächtnisNot recordedNot recordedNot recordedNot recorded20028,645 ms1,8594c1f5cca4a79a53f28e7f6544bfe08208148d53c85569f50c4132e161da06613The reference cutoff is the configured judge model's internal-knowledge snapshot for this run, not an independently verified provider attestation. Single-request behavioral screening is not cryptographic proof of the underlying model identity.
Führen Sie eine unabhängige Überprüfung durch
Testen Sie denselben Endpunkt selbst oder durchsuchen Sie andere öffentliche Berichte, bevor Sie sich auf eine beworbene Modellidentität verlassen.