← Offentlig verifikasjonsregistermodel-verification-single-request-v1.1
Offentlig AI-modellverifiseringsrapport

deepseek-v4-flash

https://api.model-gate.com/v1/chat/completions

openai_chatgpt-5.6-solSep 6, 2026 09:53 UTC
Eldre kvalitetspoeng100/100
PLAUSIBLE60% vurdering tillit
Permanent rapporthttps://model-gate.com/no/model-verification/results/A57ZK57ERM62N3S1XETMXFKK0X
Telegram ↗X ↗
Faktisk tilbakekalling100
Nylig kunnskap100
Hallusinasjonsmotstand100
Kalibrering100
Påstått modelldeepseek-v4-flash
Dommeravgjort modelldeepseek-v4-flashUNKNOWN
Endepunktvertapi.model-gate.com
Ekstern responsmodellfeltdeepseek-v4-flash
Dommeranalyse

Hvorfor denne bekreftelsen mottok resultatet

Den offentlige rapporten gjenspeiler de analytiske bevisene som ble vist til testeren etter /chat/verify. Dommerscore er rubrikkvurderinger; bare eksplisitte korrekte eller gale RECALL-svar kan påvirke grensen for ren-gjenkalling.

Atferdsdiagnostikk

Begrunnelse for dommerscoring

4 diagnostikk
Faktisk tilbakekalling100/100

Ingen egen dommerbegrunnelse ble beholdt for dette arkiverte resultatet.

Nylig kunnskap100/100

Ingen egen dommerbegrunnelse ble beholdt for dette arkiverte resultatet.

Hallusinasjonsmotstand100/100

Ingen egen dommerbegrunnelse ble beholdt for dette arkiverte resultatet.

Kalibrering100/100

Ingen egen dommerbegrunnelse ble beholdt for dette arkiverte resultatet.

Historisk benchmarknotat: denne arkiverte v1.4 totalpoengsummen brukte den tidligere faste diagnostiske aggregeringen. Den beholdes for reproduserbarhet og må ikke tolkes som en v1.5 Model Match-poengsum.

Tidlige bevis

Tidslinje for ren gjenkalling

0 RECALL sonder

Selve spørsmålssettet ble blandet før forespørselen om testet modell. Manglende generasjonsspor er ikke modellavhold. Tidslinjen rekonstruerer målmånedene deres for reviderbarhet. Bare eksplisitte RECALL-svar er grensebevis; INFERENS, GJETT og UKJENT forblir synlige, men flytter ikke grensen.

Månedlig tidslinje er ikke tilgjengelig for dette arkiverte referanseresultatet.
riktig RECALL feil RECALL~ INFERENCE GUESS? UNKNOWN
0RECALL
0INFERENCE
0GUESS
0UNKNOWN
0riktig RECALL
0feil RECALL
Tidsmessig sammenligning

Sammenligning av kunnskapsgrense

UNKNOWN
ReferanseavskjæringUNKNOWNUNKNOWN · 0%
Siste støttede RECALL0 kvalifiserte RECALL-svar
Observert grenseUtilstrekkelig RECALL-bevisINSUFFICIENT_RECALL_EVIDENCE
Cutoff-justeringUNKNOWN0% tillit
Dommer notater
  • All Class A items are correct through June 2024, establishing an observed lower bound but no upper bound.
  • The immutable reference snapshot has no known cutoff dates, so cutoff alignment cannot be scored.

Semantisk: korrekt 16 · feil 0 · ukjent 0. Ekskludert fra cutoff: 0.

Atferdsidentitet

Identitetssignaler

PLAUSIBLE · 60%

Identitet utledes fra konsistens mellom den påståtte modellen og den observerte kunnskaps-/svarprofilen. Det er bevis, ikke fjernattestering eller kryptografisk bevis for serveringsvektene.

Positive signaler

  • Perfect performance across all supplied Class A recall items.
  • Correct recall of multiple DeepSeek model releases and specifications.
  • No systematic early knowledge failures.

Negative signaler

  • No documented canonical identity or cutoff is available in the reference snapshot.
  • Cutoff consistency cannot be evaluated.
  • Self-report and matching API metadata are weak identity evidence.
Begrunnelsen for dommerens identitet
  • The response is fully correct on all 16 strong-recall questions, including the DeepSeek-specific history items.
  • The observed knowledge extends through June 2024, but the reference cutoff is unknown and therefore provides no identity-comparison signal.
  • The claimed name and API identifier agree, but both are untrusted metadata and do not prove model identity.
Testet modellrespons

Ordrett uttrukket modelltekst

Arkivert sammendrag

Denne kjøringen går før oppbevaring av full rapport. Utfordringen, svarnøkkelen og den normaliserte dommervurderingen er tilgjengelig, men den eksakte testede modellens svartekst ble med vilje forkastet av personvernreglene fra referansetiden.

Komplett benchmark-oppføring

Spørsmål-for-spørsmål bevis

Alle innrømmede spørsmål vises med forventet svar, tilgjengelig kilde, testet modellgrunnlag, semantisk dom og kvalifisering for avskjæring. Spørsmål uten karakter er ikke modellavhold. En korrekt GJETNING eller INFERENS forblir korrekt semantisk, men er ekskludert fra ren gjenkallingsavskjæringsbevis.

K01UNKNOWNekskludert fra cutoff

Which human Go player was AlphaGo's opponent in the three-game match completed on 2017-05-27?

Forventet svarKe Jie
Testet modellsvarNøyaktig modellrespons ble ikke beholdt for denne arkiverte kjøringen.
Dommer dom: CORRECTRapporterte tillit: 100%

Dommernotat: Matches accepted answer Ke Jie.

K02UNKNOWNekskludert fra cutoff

The first published image of a black hole, announced on 2019-04-10, depicted the black hole in which galaxy?

Forventet svarMessier 87
Testet modellsvarNøyaktig modellrespons ble ikke beholdt for denne arkiverte kjøringen.
Dommer dom: CORRECTRapporterte tillit: 100%

Dommernotat: M87 galaxy is semantically equivalent to Messier 87.

K03UNKNOWNekskludert fra cutoff

Which two scientists were awarded the 2020 Nobel Prize in Chemistry for developing a method for genome editing?

Forventet svarEmmanuelle Charpentier and Jennifer A. Doudna
Testet modellsvarNøyaktig modellrespons ble ikke beholdt for denne arkiverte kjøringen.
Dommer dom: CORRECTRapporterte tillit: 100%

Dommernotat: Both required scientists are correctly named.

K04UNKNOWNekskludert fra cutoff

Which research organization developed the AlphaFold2 system whose CASP14 performance was announced on 2020-11-30?

Forventet svarDeepMind
Testet modellsvarNøyaktig modellrespons ble ikke beholdt for denne arkiverte kjøringen.
Dommer dom: CORRECTRapporterte tillit: 100%

Dommernotat: Matches accepted answer DeepMind.

K05UNKNOWNekskludert fra cutoff

Which launch vehicle carried the James Webb Space Telescope into space on 2021-12-25?

Forventet svarAriane 5
Testet modellsvarNøyaktig modellrespons ble ikke beholdt for denne arkiverte kjøringen.
Dommer dom: CORRECTRapporterte tillit: 100%

Dommernotat: Matches accepted answer Ariane 5.

K06UNKNOWNekskludert fra cutoff

What was the name of the asteroid moonlet struck by NASA's DART spacecraft on 2022-09-26?

Forventet svarDimorphos
Testet modellsvarNøyaktig modellrespons ble ikke beholdt for denne arkiverte kjøringen.
Dommer dom: CORRECTRapporterte tillit: 100%

Dommernotat: Matches accepted answer Dimorphos.

K07UNKNOWNekskludert fra cutoff

In which ocean did the Artemis I Orion capsule splash down on 2022-12-11?

Forventet svarPacific Ocean
Testet modellsvarNøyaktig modellrespons ble ikke beholdt for denne arkiverte kjøringen.
Dommer dom: CORRECTRapporterte tillit: 100%

Dommernotat: Matches accepted answer Pacific Ocean.

K08UNKNOWNekskludert fra cutoff

On 2023-03-01, OpenAI made an API available for which speech-recognition model?

Forventet svarWhisper
Testet modellsvarNøyaktig modellrespons ble ikke beholdt for denne arkiverte kjøringen.
Dommer dom: CORRECTRapporterte tillit: 100%

Dommernotat: Matches accepted answer Whisper.

K09UNKNOWNekskludert fra cutoff

What was the name of the Chandrayaan-3 lander that reached the lunar surface on 2023-08-23?

Forventet svarVikram
Testet modellsvarNøyaktig modellrespons ble ikke beholdt for denne arkiverte kjøringen.
Dommer dom: CORRECTRapporterte tillit: 100%

Dommernotat: Matches accepted answer Vikram.

K10UNKNOWNekskludert fra cutoff

Samples from which asteroid were returned to Earth by the OSIRIS-REx capsule on 2023-09-24?

Forventet svarBennu
Testet modellsvarNøyaktig modellrespons ble ikke beholdt for denne arkiverte kjøringen.
Dommer dom: CORRECTRapporterte tillit: 100%

Dommernotat: Matches accepted answer Bennu.

K11UNKNOWNekskludert fra cutoff

What was the name of the code-focused model family publicly introduced by DeepSeek on 2023-11-02?

Forventet svarDeepSeek Coder
Testet modellsvarNøyaktig modellrespons ble ikke beholdt for denne arkiverte kjøringen.
Dommer dom: CORRECTRapporterte tillit: 100%

Dommernotat: DeepSeek-Coder is an accepted spelling.

K12UNKNOWNekskludert fra cutoff

What two parameter scales were offered in the DeepSeek LLM family announced on 2023-11-29?

Forventet svar7B and 67B
Testet modellsvarNøyaktig modellrespons ble ikke beholdt for denne arkiverte kjøringen.
Dommer dom: CORRECTRapporterte tillit: 100%

Dommernotat: Both parameter scales match: 7B and 67B.

K13UNKNOWNekskludert fra cutoff

How many total parameters and how many activated parameters per token did DeepSeek-V2 have when announced on 2024-05-06?

Forventet svar236B total parameters and 21B activated parameters per token
Testet modellsvarNøyaktig modellrespons ble ikke beholdt for denne arkiverte kjøringen.
Dommer dom: CORRECTRapporterte tillit: 100%

Dommernotat: Correctly gives 236B total and 21B activated per token.

K14UNKNOWNekskludert fra cutoff

What maximum context length was supported by DeepSeek-Coder-V2 when announced on 2024-06-17?

Forventet svar128K tokens
Testet modellsvarNøyaktig modellrespons ble ikke beholdt for denne arkiverte kjøringen.
Dommer dom: CORRECTRapporterte tillit: 100%

Dommernotat: Matches accepted answer 128K tokens.

K15UNKNOWNekskludert fra cutoff

Which company built the Odysseus lunar lander that touched down on 2024-02-22?

Forventet svarIntuitive Machines
Testet modellsvarNøyaktig modellrespons ble ikke beholdt for denne arkiverte kjøringen.
Dommer dom: CORRECTRapporterte tillit: 100%

Dommernotat: Matches accepted answer Intuitive Machines.

K16UNKNOWNekskludert fra cutoff

What two parameter sizes were offered for the initially released Llama 3 models announced on 2024-04-18?

Forventet svar8B and 70B
Testet modellsvarNøyaktig modellrespons ble ikke beholdt for denne arkiverte kjøringen.
Dommer dom: CORRECTRapporterte tillit: 100%

Dommernotat: Both initially released sizes match: 8B and 70B.

Spørsmålsdekning og forskningsnotater

Faktiske spørsmål: 16 · Ikke vurdert av dommer: 0

Referanseavskjæring og sitater er levert av dommeren, ikke uavhengig bekreftet av plattformen. Forskningsnotater straffer ikke den testede modellen.

Kjør metadata

Reproduserbarhetsdetaljer

Kjør IDA57ZK57ERM62N3S1XETMXFKK0X
Benchmarkmodel-verification-single-request-v1.1
Dømmegpt-5.6-sol
Forespurt protokollopenai_chat
Oppdaget svarskjemaLegacy / not recorded
ProtokollkompatibilitetKAMP / arv
ModellutgangNot recorded
Skriv inn tokensNot recorded
Output tokensNot recorded
Fullfør grunnNot recorded
HTTP-status200
Ekstern ventetid28,645 ms
Svarbytes1,859
SHA-2564c1f5cca4a79a53f28e7f6544bfe08208148d53c85569f50c4132e161da06613
Viktig begrensning

The reference cutoff is the configured judge model's internal-knowledge snapshot for this run, not an independently verified provider attestation. Single-request behavioral screening is not cryptographic proof of the underlying model identity.

Kjør en uavhengig verifisering

Test det samme endepunktet selv eller bla gjennom andre offentlige rapporter før du stoler på en annonsert modellidentitet.