← Offentligt verifikationsregistermodel-verification-single-request-v1.1
Offentlig AI-model verifikationsrapport

deepseek-v4-flash

https://api.model-gate.com/v1/chat/completions

openai_chatgpt-5.6-solSep 6, 2026 09:53 UTC
Ældre kvalitetsscore100/100
PLAUSIBLE60% vurdering tillid
Permanent rapporthttps://model-gate.com/da/model-verification/results/A57ZK57ERM62N3S1XETMXFKK0X
Telegram ↗X ↗
Faktisk tilbagekaldelse100
Nylighed af viden100
Hallucinationsmodstand100
Kalibrering100
Påstået modeldeepseek-v4-flash
Dommerbesluttet modeldeepseek-v4-flashUNKNOWN
Slutpunktsværtapi.model-gate.com
Ekstern responsmodelfeltdeepseek-v4-flash
Dommeranalyse

Hvorfor denne verifikation modtog sit resultat

Den offentlige rapport afspejler de analytiske beviser, der er vist for testeren efter /chat/verify. Dommerscore er rubrikvurderinger; kun eksplicitte korrekte eller forkerte RECALL-svar kan påvirke grænsen for ren genkaldelse.

Adfærdsdiagnostik

Begrundelse for dommerscoring

4 diagnostik
Faktisk tilbagekaldelse100/100

Ingen særskilt dommerbegrundelse blev bibeholdt for dette arkiverede resultat.

Nylighed af viden100/100

Ingen særskilt dommerbegrundelse blev bibeholdt for dette arkiverede resultat.

Hallucinationsmodstand100/100

Ingen særskilt dommerbegrundelse blev bibeholdt for dette arkiverede resultat.

Kalibrering100/100

Ingen særskilt dommerbegrundelse blev bibeholdt for dette arkiverede resultat.

Historisk benchmarknote: denne arkiverede v1.4 samlede score brugte den tidligere faste diagnostiske aggregering. Det bibeholdes for reproducerbarhed og må ikke tolkes som en v1.5 Model Match-score.

Tidlige beviser

Tidslinje for ren genkaldelse

0 GENKALD sonder

Selve spørgsmålssættet blev blandet før anmodningen om testet model. Manglende generationspladser er ikke modelundladelser. Tidslinjen rekonstruerer deres målmåneder for auditabilitet. Kun eksplicitte RECALL-svar er afskæringsbeviser; INFERENCE, GÆT og UKENDT forbliver synlige, men flytter ikke grænsen.

Månedlig tidslinje er ikke tilgængelig for dette arkiverede benchmarkresultat.
korrekt RECALL forkert tilbagekaldelse~ INFERENCE GUESS? UNKNOWN
0RECALL
0INFERENCE
0GUESS
0UNKNOWN
0korrekt RECALL
0forkert tilbagekaldelse
Tidsmæssig sammenligning

Viden cutoff sammenligning

UNKNOWN
ReferenceafskæringUNKNOWNUNKNOWN · 0%
Senest understøttede RECALL0 kvalificerede RECALL-svar
Observeret grænseUtilstrækkelig RECALL-bevisINSUFFICIENT_RECALL_EVIDENCE
AfskæringsjusteringUNKNOWN0% tillid
Dommernotater
  • All Class A items are correct through June 2024, establishing an observed lower bound but no upper bound.
  • The immutable reference snapshot has no known cutoff dates, so cutoff alignment cannot be scored.

Semantisk: korrekt 16 · forkert 0 · ukendt 0. Udelukket fra cutoff: 0.

Adfærdsidentitet

Identitetssignaler

PLAUSIBLE · 60%

Identitet udledes af sammenhæng mellem den påståede model og den observerede viden/svar-profil. Det er bevis, ikke fjernattest eller kryptografisk bevis for serveringsvægtene.

Positive signaler

  • Perfect performance across all supplied Class A recall items.
  • Correct recall of multiple DeepSeek model releases and specifications.
  • No systematic early knowledge failures.

Negative signaler

  • No documented canonical identity or cutoff is available in the reference snapshot.
  • Cutoff consistency cannot be evaluated.
  • Self-report and matching API metadata are weak identity evidence.
Begrundelse for dommerens identitet
  • The response is fully correct on all 16 strong-recall questions, including the DeepSeek-specific history items.
  • The observed knowledge extends through June 2024, but the reference cutoff is unknown and therefore provides no identity-comparison signal.
  • The claimed name and API identifier agree, but both are untrusted metadata and do not prove model identity.
Testet model respons

Ordret uddraget modeltekst

Arkiveret resume

Denne kørsel går forud for opt-in-bevarelse af fuld rapport. Udfordringen, svarnøglen og den normaliserede dommervurdering er tilgængelige, men den nøjagtige svartekst fra den testede model blev bevidst kasseret af denne privatlivspolitik fra benchmark-æraen.

Komplet benchmarkliste

Spørgsmål-for-spørgsmål beviser

Alle godkendte spørgsmål vises med det forventede svar, tilgængelig kilde, testmodelgrundlag, semantisk dom og berettigelse til cutoff. Spørgsmål uden karakter er ikke modelundladelser. Et korrekt GÆT eller INFERENCE forbliver korrekt semantisk, men er udelukket fra ren-recall cutoff-bevis.

K01UNKNOWNudelukket fra afskæring

Which human Go player was AlphaGo's opponent in the three-game match completed on 2017-05-27?

Forventet svarKe Jie
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 100%

Dommernotat: Matches accepted answer Ke Jie.

K02UNKNOWNudelukket fra afskæring

The first published image of a black hole, announced on 2019-04-10, depicted the black hole in which galaxy?

Forventet svarMessier 87
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 100%

Dommernotat: M87 galaxy is semantically equivalent to Messier 87.

K03UNKNOWNudelukket fra afskæring

Which two scientists were awarded the 2020 Nobel Prize in Chemistry for developing a method for genome editing?

Forventet svarEmmanuelle Charpentier and Jennifer A. Doudna
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 100%

Dommernotat: Both required scientists are correctly named.

K04UNKNOWNudelukket fra afskæring

Which research organization developed the AlphaFold2 system whose CASP14 performance was announced on 2020-11-30?

Forventet svarDeepMind
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 100%

Dommernotat: Matches accepted answer DeepMind.

K05UNKNOWNudelukket fra afskæring

Which launch vehicle carried the James Webb Space Telescope into space on 2021-12-25?

Forventet svarAriane 5
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 100%

Dommernotat: Matches accepted answer Ariane 5.

K06UNKNOWNudelukket fra afskæring

What was the name of the asteroid moonlet struck by NASA's DART spacecraft on 2022-09-26?

Forventet svarDimorphos
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 100%

Dommernotat: Matches accepted answer Dimorphos.

K07UNKNOWNudelukket fra afskæring

In which ocean did the Artemis I Orion capsule splash down on 2022-12-11?

Forventet svarPacific Ocean
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 100%

Dommernotat: Matches accepted answer Pacific Ocean.

K08UNKNOWNudelukket fra afskæring

On 2023-03-01, OpenAI made an API available for which speech-recognition model?

Forventet svarWhisper
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 100%

Dommernotat: Matches accepted answer Whisper.

K09UNKNOWNudelukket fra afskæring

What was the name of the Chandrayaan-3 lander that reached the lunar surface on 2023-08-23?

Forventet svarVikram
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 100%

Dommernotat: Matches accepted answer Vikram.

K10UNKNOWNudelukket fra afskæring

Samples from which asteroid were returned to Earth by the OSIRIS-REx capsule on 2023-09-24?

Forventet svarBennu
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 100%

Dommernotat: Matches accepted answer Bennu.

K11UNKNOWNudelukket fra afskæring

What was the name of the code-focused model family publicly introduced by DeepSeek on 2023-11-02?

Forventet svarDeepSeek Coder
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 100%

Dommernotat: DeepSeek-Coder is an accepted spelling.

K12UNKNOWNudelukket fra afskæring

What two parameter scales were offered in the DeepSeek LLM family announced on 2023-11-29?

Forventet svar7B and 67B
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 100%

Dommernotat: Both parameter scales match: 7B and 67B.

K13UNKNOWNudelukket fra afskæring

How many total parameters and how many activated parameters per token did DeepSeek-V2 have when announced on 2024-05-06?

Forventet svar236B total parameters and 21B activated parameters per token
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 100%

Dommernotat: Correctly gives 236B total and 21B activated per token.

K14UNKNOWNudelukket fra afskæring

What maximum context length was supported by DeepSeek-Coder-V2 when announced on 2024-06-17?

Forventet svar128K tokens
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 100%

Dommernotat: Matches accepted answer 128K tokens.

K15UNKNOWNudelukket fra afskæring

Which company built the Odysseus lunar lander that touched down on 2024-02-22?

Forventet svarIntuitive Machines
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 100%

Dommernotat: Matches accepted answer Intuitive Machines.

K16UNKNOWNudelukket fra afskæring

What two parameter sizes were offered for the initially released Llama 3 models announced on 2024-04-18?

Forventet svar8B and 70B
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 100%

Dommernotat: Both initially released sizes match: 8B and 70B.

Spørgsmålsdækning og forskningsnotater

Faktiske spørgsmål: 16 · Ikke bedømt af dommer: 0

Referenceafskæring og citater leveres af dommeren, ikke uafhængigt bekræftet af platformen. Forskningsnotater straffer ikke den testede model.

Kør metadata

Reproducerbarhedsdetaljer

Kør IDA57ZK57ERM62N3S1XETMXFKK0X
Benchmarkmodel-verification-single-request-v1.1
Dommergpt-5.6-sol
Anmodet protokolopenai_chat
Registreret svarskemaLegacy / not recorded
ProtokolkompatibilitetMATCH / arv
Model outputNot recorded
Indtast tokensNot recorded
Output tokensNot recorded
Afslut grundNot recorded
HTTP-status200
Ekstern latenstid28,645 ms
Svarbytes1,859
SHA-2564c1f5cca4a79a53f28e7f6544bfe08208148d53c85569f50c4132e161da06613
Vigtig begrænsning

The reference cutoff is the configured judge model's internal-knowledge snapshot for this run, not an independently verified provider attestation. Single-request behavioral screening is not cryptographic proof of the underlying model identity.

Kør en uafhængig verifikation

Test det samme slutpunkt selv, eller gennemse andre offentlige rapporter, før du stoler på en annonceret modelidentitet.