← Öffentliches Verifizierungsregistermodel-verification-single-request-v1.1
Bericht zur Verifizierung des öffentlichen KI-Modells

deepseek-v4-flash

https://api.model-gate.com/v1/chat/completions

openai_chatgpt-5.6-solSep 6, 2026 09:53 UTC
Legacy-Qualitätsfaktor100/100
PLAUSIBLE60% Beurteilungssicherheit
Ständiger Berichthttps://model-gate.com/de/model-verification/results/A57ZK57ERM62N3S1XETMXFKK0X
Telegram ↗X ↗
Faktischer Rückruf100
Aktualität des Wissens100
Halluzinationsresistenz100
Kalibrierung100
Beanspruchtes Modelldeepseek-v4-flash
Vom Richter entschiedenes Modelldeepseek-v4-flashUNKNOWN
Endpunkthostapi.model-gate.com
Feld für externes Antwortmodelldeepseek-v4-flash
Richteranalyse

Warum diese Überprüfung ihr Ergebnis erhalten hat

Der öffentliche Bericht spiegelt die analytischen Beweise wider, die dem Tester nach /chat/verify angezeigt werden. Bei den Wertungen der Richter handelt es sich um Rubrikbewertungen. Nur explizit richtige oder falsche RECALL-Antworten können die Cutoff-Grenze für reine Rückrufe beeinflussen.

Verhaltensdiagnostik

Begründung der Bewertung durch den Richter

4 Diagnosen
Faktischer Rückruf100/100

Für dieses archivierte Ergebnis wurde keine gesonderte Begründung des Richters beibehalten.

Aktualität des Wissens100/100

Für dieses archivierte Ergebnis wurde keine gesonderte Begründung des Richters beibehalten.

Halluzinationsresistenz100/100

Für dieses archivierte Ergebnis wurde keine gesonderte Begründung des Richters beibehalten.

Kalibrierung100/100

Für dieses archivierte Ergebnis wurde keine gesonderte Begründung des Richters beibehalten.

Hinweis zum historischen Benchmark: Für diese archivierte Gesamtbewertung der Version 1.4 wurde die frühere feste Diagnoseaggregation verwendet. Sie wird aus Gründen der Reproduzierbarkeit beibehalten und darf nicht als Modellübereinstimmungsergebnis der Version 1.5 interpretiert werden.

Zeitlicher Beweis

Pure-Recall-Zeitleiste

0 Sonden zurückrufen

Der eigentliche Fragensatz wurde vor der Anfrage nach dem getesteten Modell gemischt. Fehlende Generationenslots gelten nicht als Musterenthaltungen. Die Zeitleiste rekonstruiert ihre Zielmonate zur Überprüfbarkeit. Nur explizite RECALL-Antworten sind Cutoff-Beweise; INFERENCE, GUESS und UNKNOWN bleiben sichtbar, verschieben aber die Grenze nicht.

Für dieses archivierte Benchmark-Ergebnis ist keine monatliche Zeitleiste verfügbar.
richtiger RECALL falscher Rückruf~ INFERENCE GUESS? UNKNOWN
0RECALL
0INFERENCE
0GUESS
0UNKNOWN
0richtiger RECALL
0falscher Rückruf
Zeitlicher Vergleich

Vergleich der Wissensgrenzen

UNKNOWN
Referenz-CutoffUNKNOWNUNKNOWN · 0%
Letzter unterstützter RECALL0 geeignete RECALL-Antworten
Beobachtete GrenzeUnzureichende RECALL-BeweiseINSUFFICIENT_RECALL_EVIDENCE
Cutoff-AusrichtungUNKNOWN0% Vertrauen
Notizen des Richters
  • All Class A items are correct through June 2024, establishing an observed lower bound but no upper bound.
  • The immutable reference snapshot has no known cutoff dates, so cutoff alignment cannot be scored.

Semantisch: richtig 16 · falsch 0 · unbekannt 0. Vom Cutoff ausgeschlossen: 0.

Verhaltensidentität

Identitätssignale

PLAUSIBLE · 60%

Identität wird aus der Konsistenz zwischen dem beanspruchten Modell und dem beobachteten Wissens-/Antwortprofil abgeleitet. Es handelt sich um einen Beweis, nicht um eine Fernbescheinigung oder einen kryptografischen Nachweis der Portionsgewichte.

Positive Signale

  • Perfect performance across all supplied Class A recall items.
  • Correct recall of multiple DeepSeek model releases and specifications.
  • No systematic early knowledge failures.

Negative Signale

  • No documented canonical identity or cutoff is available in the reference snapshot.
  • Cutoff consistency cannot be evaluated.
  • Self-report and matching API metadata are weak identity evidence.
Beurteilen Sie die Identitätsgründe
  • The response is fully correct on all 16 strong-recall questions, including the DeepSeek-specific history items.
  • The observed knowledge extends through June 2024, but the reference cutoff is unknown and therefore provides no identity-comparison signal.
  • The claimed name and API identifier agree, but both are untrusted metadata and do not prove model identity.
Antwort des getesteten Modells

Verbatim extrahierter Modelltext

Archivierte Zusammenfassung

Dieser Lauf geht der Opt-in-Aufbewahrung für vollständige Berichte voraus. Die Herausforderung, der Antwortschlüssel und die normalisierte Richterbewertung sind verfügbar, aber der genaue Antworttext des getesteten Modells wurde in dieser Datenschutzrichtlinie aus der Benchmark-Ära absichtlich verworfen.

Vollständige Benchmark-Auflistung

Beweise von Frage zu Frage

Alle zugelassenen Fragen werden mit der erwarteten Antwort, der verfügbaren Quelle, der Basis des getesteten Modells, dem semantischen Urteil und der Cutoff-Berechtigung angezeigt. Unbenotete Fragen gelten nicht als Musterenthaltungen. Eine korrekte SCHÄTZUNG oder SCHLUSSFOLGERUNG bleibt semantisch korrekt, wird jedoch von der reinen Rückruf-Cutoff-Evidenz ausgeschlossen.

K01UNKNOWNvom Cutoff ausgeschlossen

Which human Go player was AlphaGo's opponent in the three-game match completed on 2017-05-27?

Erwartete AntwortKe Jie
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 100%

Anmerkung des Richters: Matches accepted answer Ke Jie.

K02UNKNOWNvom Cutoff ausgeschlossen

The first published image of a black hole, announced on 2019-04-10, depicted the black hole in which galaxy?

Erwartete AntwortMessier 87
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 100%

Anmerkung des Richters: M87 galaxy is semantically equivalent to Messier 87.

K03UNKNOWNvom Cutoff ausgeschlossen

Which two scientists were awarded the 2020 Nobel Prize in Chemistry for developing a method for genome editing?

Erwartete AntwortEmmanuelle Charpentier and Jennifer A. Doudna
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 100%

Anmerkung des Richters: Both required scientists are correctly named.

K04UNKNOWNvom Cutoff ausgeschlossen

Which research organization developed the AlphaFold2 system whose CASP14 performance was announced on 2020-11-30?

Erwartete AntwortDeepMind
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 100%

Anmerkung des Richters: Matches accepted answer DeepMind.

K05UNKNOWNvom Cutoff ausgeschlossen

Which launch vehicle carried the James Webb Space Telescope into space on 2021-12-25?

Erwartete AntwortAriane 5
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 100%

Anmerkung des Richters: Matches accepted answer Ariane 5.

K06UNKNOWNvom Cutoff ausgeschlossen

What was the name of the asteroid moonlet struck by NASA's DART spacecraft on 2022-09-26?

Erwartete AntwortDimorphos
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 100%

Anmerkung des Richters: Matches accepted answer Dimorphos.

K07UNKNOWNvom Cutoff ausgeschlossen

In which ocean did the Artemis I Orion capsule splash down on 2022-12-11?

Erwartete AntwortPacific Ocean
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 100%

Anmerkung des Richters: Matches accepted answer Pacific Ocean.

K08UNKNOWNvom Cutoff ausgeschlossen

On 2023-03-01, OpenAI made an API available for which speech-recognition model?

Erwartete AntwortWhisper
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 100%

Anmerkung des Richters: Matches accepted answer Whisper.

K09UNKNOWNvom Cutoff ausgeschlossen

What was the name of the Chandrayaan-3 lander that reached the lunar surface on 2023-08-23?

Erwartete AntwortVikram
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 100%

Anmerkung des Richters: Matches accepted answer Vikram.

K10UNKNOWNvom Cutoff ausgeschlossen

Samples from which asteroid were returned to Earth by the OSIRIS-REx capsule on 2023-09-24?

Erwartete AntwortBennu
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 100%

Anmerkung des Richters: Matches accepted answer Bennu.

K11UNKNOWNvom Cutoff ausgeschlossen

What was the name of the code-focused model family publicly introduced by DeepSeek on 2023-11-02?

Erwartete AntwortDeepSeek Coder
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 100%

Anmerkung des Richters: DeepSeek-Coder is an accepted spelling.

K12UNKNOWNvom Cutoff ausgeschlossen

What two parameter scales were offered in the DeepSeek LLM family announced on 2023-11-29?

Erwartete Antwort7B and 67B
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 100%

Anmerkung des Richters: Both parameter scales match: 7B and 67B.

K13UNKNOWNvom Cutoff ausgeschlossen

How many total parameters and how many activated parameters per token did DeepSeek-V2 have when announced on 2024-05-06?

Erwartete Antwort236B total parameters and 21B activated parameters per token
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 100%

Anmerkung des Richters: Correctly gives 236B total and 21B activated per token.

K14UNKNOWNvom Cutoff ausgeschlossen

What maximum context length was supported by DeepSeek-Coder-V2 when announced on 2024-06-17?

Erwartete Antwort128K tokens
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 100%

Anmerkung des Richters: Matches accepted answer 128K tokens.

K15UNKNOWNvom Cutoff ausgeschlossen

Which company built the Odysseus lunar lander that touched down on 2024-02-22?

Erwartete AntwortIntuitive Machines
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 100%

Anmerkung des Richters: Matches accepted answer Intuitive Machines.

K16UNKNOWNvom Cutoff ausgeschlossen

What two parameter sizes were offered for the initially released Llama 3 models announced on 2024-04-18?

Erwartete Antwort8B and 70B
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 100%

Anmerkung des Richters: Both initially released sizes match: 8B and 70B.

Fragenabdeckung und Forschungsnotizen

Sachliche Fragen: 16 · Vom Richter nicht bewertet: 0

Referenz-Cutoff und Zitate werden vom Richter bereitgestellt und nicht unabhängig von der Plattform bestätigt. Forschungsnotizen bestrafen das getestete Modell nicht.

Metadaten ausführen

Details zur Reproduzierbarkeit

Lauf-IDA57ZK57ERM62N3S1XETMXFKK0X
Benchmarkmodel-verification-single-request-v1.1
Richtergpt-5.6-sol
Angefordertes Protokollopenai_chat
Erkanntes AntwortschemaLegacy / not recorded
ProtokollkompatibilitätMATCH / Vermächtnis
ModellausgabeNot recorded
Eingabe-TokensNot recorded
AusgabetokenNot recorded
Schluss mit dem GrundNot recorded
HTTP-Status200
Externe Latenz28,645 ms
Antwortbytes1,859
SHA-2564c1f5cca4a79a53f28e7f6544bfe08208148d53c85569f50c4132e161da06613
Wichtige Einschränkung

The reference cutoff is the configured judge model's internal-knowledge snapshot for this run, not an independently verified provider attestation. Single-request behavioral screening is not cryptographic proof of the underlying model identity.

Führen Sie eine unabhängige Überprüfung durch

Testen Sie denselben Endpunkt selbst oder durchsuchen Sie andere öffentliche Berichte, bevor Sie sich auf eine beworbene Modellidentität verlassen.