← Öffentliches Verifizierungsregistermodel-verification-single-request-v1.2
Bericht zur Verifizierung des öffentlichen KI-Modells

deepseek-v4-flash

https://api.model-gate.com/v1/chat/completions

openai_chatgpt-5.6-solSep 6, 2026 16:39 UTC
Legacy-Qualitätsfaktor87/100
CONSISTENT82% Beurteilungssicherheit
Ständiger Berichthttps://model-gate.com/de/model-verification/results/0B0HVDB2FRJEJC90BRG4D7JV1Y
Telegram ↗X ↗
Faktischer Rückruf83
Aktualität des Wissens82
Halluzinationsresistenz83
Kalibrierung80
Beanspruchtes Modelldeepseek-v4-flash
Vom Richter entschiedenes ModellDeepSeek-V4-Flash-0731DeepSeek AI
Endpunkthostapi.model-gate.com
Feld für externes Antwortmodelldeepseek-v4-flash
Richteranalyse

Warum diese Überprüfung ihr Ergebnis erhalten hat

Der öffentliche Bericht spiegelt die analytischen Beweise wider, die dem Tester nach /chat/verify angezeigt werden. Bei den Wertungen der Richter handelt es sich um Rubrikbewertungen. Nur explizit richtige oder falsche RECALL-Antworten können die Cutoff-Grenze für reine Rückrufe beeinflussen.

Verhaltensdiagnostik

Begründung der Bewertung durch den Richter

4 Diagnosen
Faktischer Rückruf83/100

Für dieses archivierte Ergebnis wurde keine gesonderte Begründung des Richters beibehalten.

Aktualität des Wissens82/100

Für dieses archivierte Ergebnis wurde keine gesonderte Begründung des Richters beibehalten.

Halluzinationsresistenz83/100

Für dieses archivierte Ergebnis wurde keine gesonderte Begründung des Richters beibehalten.

Kalibrierung80/100

Für dieses archivierte Ergebnis wurde keine gesonderte Begründung des Richters beibehalten.

Hinweis zum historischen Benchmark: Für diese archivierte Gesamtbewertung der Version 1.4 wurde die frühere feste Diagnoseaggregation verwendet. Sie wird aus Gründen der Reproduzierbarkeit beibehalten und darf nicht als Modellübereinstimmungsergebnis der Version 1.5 interpretiert werden.

Zeitlicher Beweis

Pure-Recall-Zeitleiste

0 Sonden zurückrufen

Der eigentliche Fragensatz wurde vor der Anfrage nach dem getesteten Modell gemischt. Fehlende Generationenslots gelten nicht als Musterenthaltungen. Die Zeitleiste rekonstruiert ihre Zielmonate zur Überprüfbarkeit. Nur explizite RECALL-Antworten sind Cutoff-Beweise; INFERENCE, GUESS und UNKNOWN bleiben sichtbar, verschieben aber die Grenze nicht.

2023-11? K24UNKNOWN
2023-12? K13UNKNOWN
2024-01? K08UNKNOWN
2024-02? K07UNKNOWN
2024-03? K15UNKNOWN
2024-04? K18UNKNOWN
2024-05? K04UNKNOWN
2024-06? K16UNKNOWN
2024-07? K06UNKNOWN
2024-08? K03UNKNOWN
2024-09? K09UNKNOWN
2024-10? K17UNKNOWN
2024-11? K20UNKNOWN
2024-12? K10UNKNOWN
2025-01? K12UNKNOWN
2025-02? K14UNKNOWN
2025-03? K11UNKNOWN
2025-04? K21UNKNOWN
2025-05? K22UNKNOWN
2025-06? K23UNKNOWN
2025-07? K02UNKNOWN
2025-08? K05UNKNOWN
2025-09? K01UNKNOWN
2025-10? K19UNKNOWN
richtiger RECALL falscher Rückruf~ INFERENCE GUESS? UNKNOWN
0RECALL
0INFERENCE
0GUESS
0UNKNOWN
0richtiger RECALL
0falscher Rückruf
Zeitlicher Vergleich

Vergleich der Wissensgrenzen

CONSISTENT
Referenz-Cutoff2025-05ESTIMATED_WEB · 0%
Letzter unterstützter RECALL0 geeignete RECALL-Antworten
Beobachtete GrenzeUnzureichende RECALL-BeweiseINSUFFICIENT_RECALL_EVIDENCE
Cutoff-AusrichtungCONSISTENT88/100 · 80% Vertrauen
Notizen des Richters
  • Strong recall is nearly complete through the May 2025 reference cutoff.
  • There is no systematic strong-recall failure substantially before the reference cutoff.
  • Correct June and August 2025 answers suggest selective later knowledge, while failures in July, September, and October prevent a clearly later boundary.

Semantisch: richtig 20 · falsch 4 · unbekannt 0. Vom Cutoff ausgeschlossen: 0.

Verhaltensidentität

Identitätssignale

CONSISTENT · 82%

Identität wird aus der Konsistenz zwischen dem beanspruchten Modell und dem beobachteten Wissens-/Antwortprofil abgeleitet. Es handelt sich um einen Beweis, nicht um eine Fernbescheinigung oder einen kryptografischen Nachweis der Portionsgewichte.

Positive Signale

  • Excellent recall across late 2023 through May 2025.
  • Correct near-cutoff answer for the WHO Pandemic Agreement.
  • No pattern of early knowledge degradation.

Negative Signale

  • Incorrect February 2024 lunar-lander answer despite high confidence.
  • Correct June and August 2025 answers extend beyond the estimated reference cutoff.
  • Several post-cutoff answers are confidently wrong, indicating uneven recency.
Beurteilen Sie die Identitätsgründe
  • Observed behavior broadly overlaps the saved May 2025 reference cutoff.
  • The model answered 20 of 24 Class A items correctly, with only one isolated failure well before the cutoff.
  • Post-cutoff knowledge is uneven and can plausibly reflect selective updates rather than model substitution.
Antwort des getesteten Modells

Verbatim extrahierter Modelltext

Archivierte Zusammenfassung

Dieser Lauf geht der Opt-in-Aufbewahrung für vollständige Berichte voraus. Die Herausforderung, der Antwortschlüssel und die normalisierte Richterbewertung sind verfügbar, aber der genaue Antworttext des getesteten Modells wurde in dieser Datenschutzrichtlinie aus der Benchmark-Ära absichtlich verworfen.

Vollständige Benchmark-Auflistung

Beweise von Frage zu Frage

Alle zugelassenen Fragen werden mit der erwarteten Antwort, der verfügbaren Quelle, der Basis des getesteten Modells, dem semantischen Urteil und der Cutoff-Berechtigung angezeigt. Unbenotete Fragen gelten nicht als Musterenthaltungen. Eine korrekte SCHÄTZUNG oder SCHLUSSFOLGERUNG bleibt semantisch korrekt, wird jedoch von der reinen Rückruf-Cutoff-Evidenz ausgeschlossen.

K01UNKNOWNvom Cutoff ausgeschlossen

Who won the men's 100 metres at the World Athletics Championships in Tokyo?

Erwartete AntwortOblique SevilleSource ↗
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: WRONGGemeldetes Vertrauen: 75%

Anmerkung des Richters: Expected Oblique Seville; answered Kishane Thompson.

K02UNKNOWNvom Cutoff ausgeschlossen

Which team won the UEFA Women's Euro 2025 final?

Erwartete AntwortEnglandSource ↗
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: WRONGGemeldetes Vertrauen: 85%

Anmerkung des Richters: Expected England; answered Spain.

K03UNKNOWNvom Cutoff ausgeschlossen

Which disease's African upsurge did WHO declare a public health emergency of international concern?

Erwartete AntwortmpoxSource ↗
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 95%

Anmerkung des Richters: Matches mpox.

K04UNKNOWNvom Cutoff ausgeschlossen

What molecular-structure prediction model did Google DeepMind and Isomorphic Labs introduce?

Erwartete AntwortAlphaFold 3Source ↗
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 95%

Anmerkung des Richters: Matches AlphaFold 3.

K05UNKNOWNvom Cutoff ausgeschlossen

What model did OpenAI release as a unified system with built-in thinking?

Erwartete AntwortGPT-5Source ↗
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 90%

Anmerkung des Richters: Matches GPT-5.

K06UNKNOWNvom Cutoff ausgeschlossen

Which operating system was affected by the faulty CrowdStrike Falcon content update?

Erwartete AntwortWindowsSource ↗
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 95%

Anmerkung des Richters: Microsoft Windows is accepted.

K07UNKNOWNvom Cutoff ausgeschlossen

What was the nickname of Intuitive Machines' Nova-C lander that touched down on the Moon?

Erwartete AntwortOdysseusSource ↗
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: WRONGGemeldetes Vertrauen: 80%

Anmerkung des Richters: Expected Odysseus; Odie is not an accepted answer.

K08UNKNOWNvom Cutoff ausgeschlossen

What was the name of Japan's lunar lander that successfully reached the Moon?

Erwartete AntwortSLIMSource ↗
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 95%

Anmerkung des Richters: Matches SLIM.

K09UNKNOWNvom Cutoff ausgeschlossen

Who became the first private astronaut to perform a spacewalk?

Erwartete AntwortJared IsaacmanSource ↗
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 95%

Anmerkung des Richters: Matches Jared Isaacman.

K10UNKNOWNvom Cutoff ausgeschlossen

Which country was appointed host of the 2034 FIFA World Cup?

Erwartete AntwortSaudi ArabiaSource ↗
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 95%

Anmerkung des Richters: Matches Saudi Arabia.

K11UNKNOWNvom Cutoff ausgeschlossen

In which lunar mare did Firefly Aerospace's Blue Ghost land?

Erwartete AntwortMare CrisiumSource ↗
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 90%

Anmerkung des Richters: Matches Mare Crisium.

K12UNKNOWNvom Cutoff ausgeschlossen

What model did DeepSeek begin serving through its deepseek-reasoner endpoint?

Erwartete AntwortDeepSeek-R1Source ↗
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 95%

Anmerkung des Richters: Matches DeepSeek-R1.

K13UNKNOWNvom Cutoff ausgeschlossen

What was the name of the second malaria vaccine prequalified by WHO?

Erwartete AntwortR21/Matrix-MSource ↗
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 90%

Anmerkung des Richters: Matches R21/Matrix-M.

K14UNKNOWNvom Cutoff ausgeschlossen

Which album won Album of the Year at the 67th Grammy Awards?

Erwartete AntwortCowboy CarterSource ↗
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 95%

Anmerkung des Richters: Matches Cowboy Carter.

K15UNKNOWNvom Cutoff ausgeschlossen

How many European Parliament members voted in favor of the Artificial Intelligence Act?

Erwartete Antwort523Source ↗
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 85%

Anmerkung des Richters: Matches 523.

K16UNKNOWNvom Cutoff ausgeschlossen

How many grams of lunar material did the Chang'e-6 mission collect?

Erwartete Antwort1,935.3 gramsSource ↗
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 90%

Anmerkung des Richters: Matches 1,935.3 grams.

K17UNKNOWNvom Cutoff ausgeschlossen

Which rocket launched NASA's Europa Clipper spacecraft?

Erwartete AntwortFalcon HeavySource ↗
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 95%

Anmerkung des Richters: Matches Falcon Heavy.

K18UNKNOWNvom Cutoff ausgeschlossen

What designation was given to the newly identified 33-solar-mass stellar black hole in the Milky Way?

Erwartete AntwortGaia BH3Source ↗
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 90%

Anmerkung des Richters: Matches Gaia BH3.

K19UNKNOWNvom Cutoff ausgeschlossen

Who was awarded the 2025 Nobel Peace Prize?

Erwartete AntwortMaria Corina MachadoSource ↗
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: WRONGGemeldetes Vertrauen: 70%

Anmerkung des Richters: Expected Maria Corina Machado; answered an institution.

K20UNKNOWNvom Cutoff ausgeschlossen

What annual climate-finance goal for developing countries did COP29 set for 2035?

Erwartete AntwortUS$300 billion per yearSource ↗
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 90%

Anmerkung des Richters: Matches $300 billion per year.

K21UNKNOWNvom Cutoff ausgeschlossen

What was the name of the first human spaceflight to orbit over Earth's polar regions?

Erwartete AntwortFram2Source ↗
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 90%

Anmerkung des Richters: Matches Fram2.

K22UNKNOWNvom Cutoff ausgeschlossen

Under which article of the WHO Constitution was the Pandemic Agreement adopted?

Erwartete AntwortArticle 19Source ↗
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 75%

Anmerkung des Richters: Matches Article 19.

K23UNKNOWNvom Cutoff ausgeschlossen

Which new Mario Kart game launched alongside Nintendo Switch 2?

Erwartete AntwortMario Kart WorldSource ↗
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 95%

Anmerkung des Richters: Matches Mario Kart World.

K24UNKNOWNvom Cutoff ausgeschlossen

What model did OpenAI introduce with a 128K context window at its first DevDay?

Erwartete AntwortGPT-4 TurboSource ↗
Antwort mit getestetem ModellFür diesen archivierten Lauf wurde keine genaue Modellantwort gespeichert.
Urteil des Richters: CORRECTGemeldetes Vertrauen: 95%

Anmerkung des Richters: Matches GPT-4 Turbo.

Fragenabdeckung und Forschungsnotizen

Sachliche Fragen: 24 · Vom Richter nicht bewertet: 0

Referenz-Cutoff und Zitate werden vom Richter bereitgestellt und nicht unabhängig von der Plattform bestätigt. Forschungsnotizen bestrafen das getestete Modell nicht.

Metadaten ausführen

Details zur Reproduzierbarkeit

Lauf-ID0B0HVDB2FRJEJC90BRG4D7JV1Y
Benchmarkmodel-verification-single-request-v1.2
Richtergpt-5.6-sol
Angefordertes Protokollopenai_chat
Erkanntes AntwortschemaLegacy / not recorded
ProtokollkompatibilitätMATCH / Vermächtnis
ModellausgabeNot recorded
Eingabe-TokensNot recorded
AusgabetokenNot recorded
Schluss mit dem GrundNot recorded
HTTP-Status200
Externe Latenz88,304 ms
Antwortbytes2,460
SHA-256f22e63d94e67fbd4fdfa25a27a37ae4b3402f94fc6801d14c2a4e638f85cfd9d
Wichtige Einschränkung

The reference cutoff is a judge-produced snapshot grounded in hosted web evidence when available (official sources preferred, otherwise the best defensible estimate). It is not provider attestation. Single-request behavioral screening is not cryptographic proof of the underlying model identity.

Führen Sie eine unabhängige Überprüfung durch

Testen Sie denselben Endpunkt selbst oder durchsuchen Sie andere öffentliche Berichte, bevor Sie sich auf eine beworbene Modellidentität verlassen.