deepseek-v4-flash
https://api.model-gate.com/v1/chat/completions
https://model-gate.com/nl/model-verification/results/A57ZK57ERM62N3S1XETMXFKK0XWaarom deze verificatie resultaat heeft opgeleverd
Het openbare rapport weerspiegelt het analytische bewijs dat aan de tester wordt getoond na /chat/verify. Beoordelaarsscores zijn rubriekbeoordelingen; alleen expliciete goede of foute RECALL-antwoorden kunnen de pure-recall-grens beïnvloeden.
Rechter scoort motivering
Voor dit gearchiveerde resultaat werd geen afzonderlijke motivering van de rechter aangehouden.
Voor dit gearchiveerde resultaat werd geen afzonderlijke motivering van de rechter aangehouden.
Voor dit gearchiveerde resultaat werd geen afzonderlijke motivering van de rechter aangehouden.
Voor dit gearchiveerde resultaat werd geen afzonderlijke motivering van de rechter aangehouden.
Historische benchmarknoot: deze gearchiveerde algemene score v1.4 maakte gebruik van de voormalige vaste diagnostische aggregatie. Deze wordt behouden voor reproduceerbaarheid en mag niet worden geïnterpreteerd als een v1.5 Model Match-score.
Tijdlijn voor pure herinnering
De daadwerkelijke vragenset werd vóór het geteste modelverzoek geschud. Ontbrekende generatieslots zijn geen modelonthoudingen. De tijdlijn reconstrueert hun doelmaanden voor controleerbaarheid. Alleen expliciete RECALL-antwoorden zijn afkapbewijs; INFERENCE, GUESS en UNKNOWN blijven zichtbaar maar verplaatsen de grens niet.
Vergelijking van kennisgrenzen
- All Class A items are correct through June 2024, establishing an observed lower bound but no upper bound.
- The immutable reference snapshot has no known cutoff dates, so cutoff alignment cannot be scored.
Semantisch: juist 16 · fout 0 · onbekend 0. Uitgesloten van de afsluiting: 0.
Identiteitssignalen
Identiteit wordt afgeleid uit de consistentie tussen het geclaimde model en het waargenomen kennis/antwoordprofiel. Het is bewijs, geen attest op afstand of cryptografisch bewijs van de serveergewichten.
Positieve signalen
- Perfect performance across all supplied Class A recall items.
- Correct recall of multiple DeepSeek model releases and specifications.
- No systematic early knowledge failures.
Negatieve signalen
- No documented canonical identity or cutoff is available in the reference snapshot.
- Cutoff consistency cannot be evaluated.
- Self-report and matching API metadata are weak identity evidence.
- The response is fully correct on all 16 strong-recall questions, including the DeepSeek-specific history items.
- The observed knowledge extends through June 2024, but the reference cutoff is unknown and therefore provides no identity-comparison signal.
- The claimed name and API identifier agree, but both are untrusted metadata and do not prove model identity.
Woordelijk geëxtraheerde modeltekst
Deze run dateert van vóór de retentie van het volledige rapport waarvoor u zich heeft aangemeld. De uitdaging, de antwoordsleutel en de genormaliseerde beoordeling van de rechter zijn beschikbaar, maar de exact geteste antwoordtekst van het model werd opzettelijk weggegooid door het privacybeleid uit het benchmarktijdperk.
Vraag-voor-vraag bewijs
Alle toegelaten vragen worden weergegeven met het verwachte antwoord, de beschikbare bron, de basis van het geteste model, het semantische oordeel en de geschiktheidslimiet. Vragen zonder cijfer zijn geen modelonthoudingen. Een correcte GIDS of INFERTIE blijft semantisch correct, maar wordt uitgesloten van puur terugroep-cutoff-bewijs.
Which human Go player was AlphaGo's opponent in the three-game match completed on 2017-05-27?
Opmerking rechter: Matches accepted answer Ke Jie.
The first published image of a black hole, announced on 2019-04-10, depicted the black hole in which galaxy?
Opmerking rechter: M87 galaxy is semantically equivalent to Messier 87.
Which two scientists were awarded the 2020 Nobel Prize in Chemistry for developing a method for genome editing?
Opmerking rechter: Both required scientists are correctly named.
Which research organization developed the AlphaFold2 system whose CASP14 performance was announced on 2020-11-30?
Opmerking rechter: Matches accepted answer DeepMind.
Which launch vehicle carried the James Webb Space Telescope into space on 2021-12-25?
Opmerking rechter: Matches accepted answer Ariane 5.
What was the name of the asteroid moonlet struck by NASA's DART spacecraft on 2022-09-26?
Opmerking rechter: Matches accepted answer Dimorphos.
In which ocean did the Artemis I Orion capsule splash down on 2022-12-11?
Opmerking rechter: Matches accepted answer Pacific Ocean.
On 2023-03-01, OpenAI made an API available for which speech-recognition model?
Opmerking rechter: Matches accepted answer Whisper.
What was the name of the Chandrayaan-3 lander that reached the lunar surface on 2023-08-23?
Opmerking rechter: Matches accepted answer Vikram.
Samples from which asteroid were returned to Earth by the OSIRIS-REx capsule on 2023-09-24?
Opmerking rechter: Matches accepted answer Bennu.
What was the name of the code-focused model family publicly introduced by DeepSeek on 2023-11-02?
Opmerking rechter: DeepSeek-Coder is an accepted spelling.
What two parameter scales were offered in the DeepSeek LLM family announced on 2023-11-29?
Opmerking rechter: Both parameter scales match: 7B and 67B.
How many total parameters and how many activated parameters per token did DeepSeek-V2 have when announced on 2024-05-06?
Opmerking rechter: Correctly gives 236B total and 21B activated per token.
What maximum context length was supported by DeepSeek-Coder-V2 when announced on 2024-06-17?
Opmerking rechter: Matches accepted answer 128K tokens.
Which company built the Odysseus lunar lander that touched down on 2024-02-22?
Opmerking rechter: Matches accepted answer Intuitive Machines.
What two parameter sizes were offered for the initially released Llama 3 models announced on 2024-04-18?
Opmerking rechter: Both initially released sizes match: 8B and 70B.
Vraagdekking en onderzoeksnotities
Feitelijke vragen: 16 · Niet beoordeeld door de rechter: 0
Referentiegrens en citaten worden verstrekt door de rechter en niet onafhankelijk bevestigd door het platform. Onderzoeksnotities bestraffen het geteste model niet.
Reproduceerbaarheidsdetails
A57ZK57ERM62N3S1XETMXFKK0Xmodel-verification-single-request-v1.1gpt-5.6-solopenai_chatLegacy / not recordedWEDSTRIJD / erfenisNot recordedNot recordedNot recordedNot recorded20028,645 ms1,8594c1f5cca4a79a53f28e7f6544bfe08208148d53c85569f50c4132e161da06613The reference cutoff is the configured judge model's internal-knowledge snapshot for this run, not an independently verified provider attestation. Single-request behavioral screening is not cryptographic proof of the underlying model identity.
Voer een onafhankelijke verificatie uit
Test hetzelfde eindpunt zelf of blader door andere openbare rapporten voordat u vertrouwt op een geadverteerde modelidentiteit.