← Openbaar verificatieregistermodel-verification-single-request-v1.1
Openbaar AI-modelverificatierapport

deepseek-v4-flash

https://api.model-gate.com/v1/chat/completions

openai_chatgpt-5.6-solSep 6, 2026 09:53 UTC
Verouderde kwaliteitsscore100/100
PLAUSIBLE60% beoordelingsvertrouwen
Permanent rapporthttps://model-gate.com/nl/model-verification/results/A57ZK57ERM62N3S1XETMXFKK0X
Telegram ↗X ↗
Feitelijke herinnering100
Kennis recentheid100
Hallucinatie weerstand100
Kalibratie100
Geclaimd modeldeepseek-v4-flash
Door de rechter opgelost modeldeepseek-v4-flashUNKNOWN
Eindpunthostapi.model-gate.com
Veld Extern responsmodeldeepseek-v4-flash
Analyse van de rechter

Waarom deze verificatie resultaat heeft opgeleverd

Het openbare rapport weerspiegelt het analytische bewijs dat aan de tester wordt getoond na /chat/verify. Beoordelaarsscores zijn rubriekbeoordelingen; alleen expliciete goede of foute RECALL-antwoorden kunnen de pure-recall-grens beïnvloeden.

Gedragsdiagnostiek

Rechter scoort motivering

4 diagnostiek
Feitelijke herinnering100/100

Voor dit gearchiveerde resultaat werd geen afzonderlijke motivering van de rechter aangehouden.

Kennis recentheid100/100

Voor dit gearchiveerde resultaat werd geen afzonderlijke motivering van de rechter aangehouden.

Hallucinatie weerstand100/100

Voor dit gearchiveerde resultaat werd geen afzonderlijke motivering van de rechter aangehouden.

Kalibratie100/100

Voor dit gearchiveerde resultaat werd geen afzonderlijke motivering van de rechter aangehouden.

Historische benchmarknoot: deze gearchiveerde algemene score v1.4 maakte gebruik van de voormalige vaste diagnostische aggregatie. Deze wordt behouden voor reproduceerbaarheid en mag niet worden geïnterpreteerd als een v1.5 Model Match-score.

Tijdelijk bewijs

Tijdlijn voor pure herinnering

0 RECALL-sondes

De daadwerkelijke vragenset werd vóór het geteste modelverzoek geschud. Ontbrekende generatieslots zijn geen modelonthoudingen. De tijdlijn reconstrueert hun doelmaanden voor controleerbaarheid. Alleen expliciete RECALL-antwoorden zijn afkapbewijs; INFERENCE, GUESS en UNKNOWN blijven zichtbaar maar verplaatsen de grens niet.

Er is geen maandelijkse tijdlijn beschikbaar voor dit gearchiveerde benchmarkresultaat.
juiste RECALL verkeerde RECALL~ INFERENCE GUESS? UNKNOWN
0RECALL
0INFERENCE
0GUESS
0UNKNOWN
0juiste RECALL
0verkeerde RECALL
Tijdelijke vergelijking

Vergelijking van kennisgrenzen

UNKNOWN
Referentie-uitschakelingUNKNOWNUNKNOWN · 0%
Nieuwst ondersteunde RECALL0 in aanmerking komende RECALL-antwoorden
Waargenomen grensOnvoldoende RECALL-bewijsINSUFFICIENT_RECALL_EVIDENCE
AfsnijdingsuitlijningUNKNOWN0% vertrouwen
Rechter merkt op
  • All Class A items are correct through June 2024, establishing an observed lower bound but no upper bound.
  • The immutable reference snapshot has no known cutoff dates, so cutoff alignment cannot be scored.

Semantisch: juist 16 · fout 0 · onbekend 0. Uitgesloten van de afsluiting: 0.

Gedragsidentiteit

Identiteitssignalen

PLAUSIBLE · 60%

Identiteit wordt afgeleid uit de consistentie tussen het geclaimde model en het waargenomen kennis/antwoordprofiel. Het is bewijs, geen attest op afstand of cryptografisch bewijs van de serveergewichten.

Positieve signalen

  • Perfect performance across all supplied Class A recall items.
  • Correct recall of multiple DeepSeek model releases and specifications.
  • No systematic early knowledge failures.

Negatieve signalen

  • No documented canonical identity or cutoff is available in the reference snapshot.
  • Cutoff consistency cannot be evaluated.
  • Self-report and matching API metadata are weak identity evidence.
Beoordeel identiteitsredenen
  • The response is fully correct on all 16 strong-recall questions, including the DeepSeek-specific history items.
  • The observed knowledge extends through June 2024, but the reference cutoff is unknown and therefore provides no identity-comparison signal.
  • The claimed name and API identifier agree, but both are untrusted metadata and do not prove model identity.
Reactie van getest model

Woordelijk geëxtraheerde modeltekst

Gearchiveerde samenvatting

Deze run dateert van vóór de retentie van het volledige rapport waarvoor u zich heeft aangemeld. De uitdaging, de antwoordsleutel en de genormaliseerde beoordeling van de rechter zijn beschikbaar, maar de exact geteste antwoordtekst van het model werd opzettelijk weggegooid door het privacybeleid uit het benchmarktijdperk.

Volledige benchmarklijst

Vraag-voor-vraag bewijs

Alle toegelaten vragen worden weergegeven met het verwachte antwoord, de beschikbare bron, de basis van het geteste model, het semantische oordeel en de geschiktheidslimiet. Vragen zonder cijfer zijn geen modelonthoudingen. Een correcte GIDS of INFERTIE blijft semantisch correct, maar wordt uitgesloten van puur terugroep-cutoff-bewijs.

K01UNKNOWNuitgesloten van de afsluiting

Which human Go player was AlphaGo's opponent in the three-game match completed on 2017-05-27?

Verwacht antwoordKe Jie
Beproefd model antwoordHet exacte modelantwoord werd niet behouden voor deze gearchiveerde run.
Oordeel van de rechter: CORRECTGerapporteerd vertrouwen: 100%

Opmerking rechter: Matches accepted answer Ke Jie.

K02UNKNOWNuitgesloten van de afsluiting

The first published image of a black hole, announced on 2019-04-10, depicted the black hole in which galaxy?

Verwacht antwoordMessier 87
Beproefd model antwoordHet exacte modelantwoord werd niet behouden voor deze gearchiveerde run.
Oordeel van de rechter: CORRECTGerapporteerd vertrouwen: 100%

Opmerking rechter: M87 galaxy is semantically equivalent to Messier 87.

K03UNKNOWNuitgesloten van de afsluiting

Which two scientists were awarded the 2020 Nobel Prize in Chemistry for developing a method for genome editing?

Verwacht antwoordEmmanuelle Charpentier and Jennifer A. Doudna
Beproefd model antwoordHet exacte modelantwoord werd niet behouden voor deze gearchiveerde run.
Oordeel van de rechter: CORRECTGerapporteerd vertrouwen: 100%

Opmerking rechter: Both required scientists are correctly named.

K04UNKNOWNuitgesloten van de afsluiting

Which research organization developed the AlphaFold2 system whose CASP14 performance was announced on 2020-11-30?

Verwacht antwoordDeepMind
Beproefd model antwoordHet exacte modelantwoord werd niet behouden voor deze gearchiveerde run.
Oordeel van de rechter: CORRECTGerapporteerd vertrouwen: 100%

Opmerking rechter: Matches accepted answer DeepMind.

K05UNKNOWNuitgesloten van de afsluiting

Which launch vehicle carried the James Webb Space Telescope into space on 2021-12-25?

Verwacht antwoordAriane 5
Beproefd model antwoordHet exacte modelantwoord werd niet behouden voor deze gearchiveerde run.
Oordeel van de rechter: CORRECTGerapporteerd vertrouwen: 100%

Opmerking rechter: Matches accepted answer Ariane 5.

K06UNKNOWNuitgesloten van de afsluiting

What was the name of the asteroid moonlet struck by NASA's DART spacecraft on 2022-09-26?

Verwacht antwoordDimorphos
Beproefd model antwoordHet exacte modelantwoord werd niet behouden voor deze gearchiveerde run.
Oordeel van de rechter: CORRECTGerapporteerd vertrouwen: 100%

Opmerking rechter: Matches accepted answer Dimorphos.

K07UNKNOWNuitgesloten van de afsluiting

In which ocean did the Artemis I Orion capsule splash down on 2022-12-11?

Verwacht antwoordPacific Ocean
Beproefd model antwoordHet exacte modelantwoord werd niet behouden voor deze gearchiveerde run.
Oordeel van de rechter: CORRECTGerapporteerd vertrouwen: 100%

Opmerking rechter: Matches accepted answer Pacific Ocean.

K08UNKNOWNuitgesloten van de afsluiting

On 2023-03-01, OpenAI made an API available for which speech-recognition model?

Verwacht antwoordWhisper
Beproefd model antwoordHet exacte modelantwoord werd niet behouden voor deze gearchiveerde run.
Oordeel van de rechter: CORRECTGerapporteerd vertrouwen: 100%

Opmerking rechter: Matches accepted answer Whisper.

K09UNKNOWNuitgesloten van de afsluiting

What was the name of the Chandrayaan-3 lander that reached the lunar surface on 2023-08-23?

Verwacht antwoordVikram
Beproefd model antwoordHet exacte modelantwoord werd niet behouden voor deze gearchiveerde run.
Oordeel van de rechter: CORRECTGerapporteerd vertrouwen: 100%

Opmerking rechter: Matches accepted answer Vikram.

K10UNKNOWNuitgesloten van de afsluiting

Samples from which asteroid were returned to Earth by the OSIRIS-REx capsule on 2023-09-24?

Verwacht antwoordBennu
Beproefd model antwoordHet exacte modelantwoord werd niet behouden voor deze gearchiveerde run.
Oordeel van de rechter: CORRECTGerapporteerd vertrouwen: 100%

Opmerking rechter: Matches accepted answer Bennu.

K11UNKNOWNuitgesloten van de afsluiting

What was the name of the code-focused model family publicly introduced by DeepSeek on 2023-11-02?

Verwacht antwoordDeepSeek Coder
Beproefd model antwoordHet exacte modelantwoord werd niet behouden voor deze gearchiveerde run.
Oordeel van de rechter: CORRECTGerapporteerd vertrouwen: 100%

Opmerking rechter: DeepSeek-Coder is an accepted spelling.

K12UNKNOWNuitgesloten van de afsluiting

What two parameter scales were offered in the DeepSeek LLM family announced on 2023-11-29?

Verwacht antwoord7B and 67B
Beproefd model antwoordHet exacte modelantwoord werd niet behouden voor deze gearchiveerde run.
Oordeel van de rechter: CORRECTGerapporteerd vertrouwen: 100%

Opmerking rechter: Both parameter scales match: 7B and 67B.

K13UNKNOWNuitgesloten van de afsluiting

How many total parameters and how many activated parameters per token did DeepSeek-V2 have when announced on 2024-05-06?

Verwacht antwoord236B total parameters and 21B activated parameters per token
Beproefd model antwoordHet exacte modelantwoord werd niet behouden voor deze gearchiveerde run.
Oordeel van de rechter: CORRECTGerapporteerd vertrouwen: 100%

Opmerking rechter: Correctly gives 236B total and 21B activated per token.

K14UNKNOWNuitgesloten van de afsluiting

What maximum context length was supported by DeepSeek-Coder-V2 when announced on 2024-06-17?

Verwacht antwoord128K tokens
Beproefd model antwoordHet exacte modelantwoord werd niet behouden voor deze gearchiveerde run.
Oordeel van de rechter: CORRECTGerapporteerd vertrouwen: 100%

Opmerking rechter: Matches accepted answer 128K tokens.

K15UNKNOWNuitgesloten van de afsluiting

Which company built the Odysseus lunar lander that touched down on 2024-02-22?

Verwacht antwoordIntuitive Machines
Beproefd model antwoordHet exacte modelantwoord werd niet behouden voor deze gearchiveerde run.
Oordeel van de rechter: CORRECTGerapporteerd vertrouwen: 100%

Opmerking rechter: Matches accepted answer Intuitive Machines.

K16UNKNOWNuitgesloten van de afsluiting

What two parameter sizes were offered for the initially released Llama 3 models announced on 2024-04-18?

Verwacht antwoord8B and 70B
Beproefd model antwoordHet exacte modelantwoord werd niet behouden voor deze gearchiveerde run.
Oordeel van de rechter: CORRECTGerapporteerd vertrouwen: 100%

Opmerking rechter: Both initially released sizes match: 8B and 70B.

Vraagdekking en onderzoeksnotities

Feitelijke vragen: 16 · Niet beoordeeld door de rechter: 0

Referentiegrens en citaten worden verstrekt door de rechter en niet onafhankelijk bevestigd door het platform. Onderzoeksnotities bestraffen het geteste model niet.

Metagegevens uitvoeren

Reproduceerbaarheidsdetails

Run-IDA57ZK57ERM62N3S1XETMXFKK0X
Benchmarkmodel-verification-single-request-v1.1
Rechtergpt-5.6-sol
Gevraagd protocolopenai_chat
Gedetecteerd antwoordschemaLegacy / not recorded
Compatibiliteit van protocollenWEDSTRIJD / erfenis
ModeluitvoerNot recorded
InvoertokensNot recorded
UitvoertokensNot recorded
Einde redenNot recorded
HTTP-status200
Externe latentie28,645 ms
Reactiebytes1,859
SHA-2564c1f5cca4a79a53f28e7f6544bfe08208148d53c85569f50c4132e161da06613
Belangrijke beperking

The reference cutoff is the configured judge model's internal-knowledge snapshot for this run, not an independently verified provider attestation. Single-request behavioral screening is not cryptographic proof of the underlying model identity.

Voer een onafhankelijke verificatie uit

Test hetzelfde eindpunt zelf of blader door andere openbare rapporten voordat u vertrouwt op een geadverteerde modelidentiteit.