← Offentligt verifikationsregistermodel-verification-single-request-v1.2
Offentlig AI-model verifikationsrapport

deepseek-v4-flash

https://api.model-gate.com/v1/chat/completions

openai_chatgpt-5.6-solSep 6, 2026 16:39 UTC
Ældre kvalitetsscore87/100
CONSISTENT82% vurdering tillid
Permanent rapporthttps://model-gate.com/da/model-verification/results/0B0HVDB2FRJEJC90BRG4D7JV1Y
Telegram ↗X ↗
Faktisk tilbagekaldelse83
Nylighed af viden82
Hallucinationsmodstand83
Kalibrering80
Påstået modeldeepseek-v4-flash
Dommerbesluttet modelDeepSeek-V4-Flash-0731DeepSeek AI
Slutpunktsværtapi.model-gate.com
Ekstern responsmodelfeltdeepseek-v4-flash
Dommeranalyse

Hvorfor denne verifikation modtog sit resultat

Den offentlige rapport afspejler de analytiske beviser, der er vist for testeren efter /chat/verify. Dommerscore er rubrikvurderinger; kun eksplicitte korrekte eller forkerte RECALL-svar kan påvirke grænsen for ren genkaldelse.

Adfærdsdiagnostik

Begrundelse for dommerscoring

4 diagnostik
Faktisk tilbagekaldelse83/100

Ingen særskilt dommerbegrundelse blev bibeholdt for dette arkiverede resultat.

Nylighed af viden82/100

Ingen særskilt dommerbegrundelse blev bibeholdt for dette arkiverede resultat.

Hallucinationsmodstand83/100

Ingen særskilt dommerbegrundelse blev bibeholdt for dette arkiverede resultat.

Kalibrering80/100

Ingen særskilt dommerbegrundelse blev bibeholdt for dette arkiverede resultat.

Historisk benchmarknote: denne arkiverede v1.4 samlede score brugte den tidligere faste diagnostiske aggregering. Det bibeholdes for reproducerbarhed og må ikke tolkes som en v1.5 Model Match-score.

Tidlige beviser

Tidslinje for ren genkaldelse

0 GENKALD sonder

Selve spørgsmålssættet blev blandet før anmodningen om testet model. Manglende generationspladser er ikke modelundladelser. Tidslinjen rekonstruerer deres målmåneder for auditabilitet. Kun eksplicitte RECALL-svar er afskæringsbeviser; INFERENCE, GÆT og UKENDT forbliver synlige, men flytter ikke grænsen.

2023-11? K24UNKNOWN
2023-12? K13UNKNOWN
2024-01? K08UNKNOWN
2024-02? K07UNKNOWN
2024-03? K15UNKNOWN
2024-04? K18UNKNOWN
2024-05? K04UNKNOWN
2024-06? K16UNKNOWN
2024-07? K06UNKNOWN
2024-08? K03UNKNOWN
2024-09? K09UNKNOWN
2024-10? K17UNKNOWN
2024-11? K20UNKNOWN
2024-12? K10UNKNOWN
2025-01? K12UNKNOWN
2025-02? K14UNKNOWN
2025-03? K11UNKNOWN
2025-04? K21UNKNOWN
2025-05? K22UNKNOWN
2025-06? K23UNKNOWN
2025-07? K02UNKNOWN
2025-08? K05UNKNOWN
2025-09? K01UNKNOWN
2025-10? K19UNKNOWN
korrekt RECALL forkert tilbagekaldelse~ INFERENCE GUESS? UNKNOWN
0RECALL
0INFERENCE
0GUESS
0UNKNOWN
0korrekt RECALL
0forkert tilbagekaldelse
Tidsmæssig sammenligning

Viden cutoff sammenligning

CONSISTENT
Referenceafskæring2025-05ESTIMATED_WEB · 0%
Senest understøttede RECALL0 kvalificerede RECALL-svar
Observeret grænseUtilstrækkelig RECALL-bevisINSUFFICIENT_RECALL_EVIDENCE
AfskæringsjusteringCONSISTENT88/100 · 80% tillid
Dommernotater
  • Strong recall is nearly complete through the May 2025 reference cutoff.
  • There is no systematic strong-recall failure substantially before the reference cutoff.
  • Correct June and August 2025 answers suggest selective later knowledge, while failures in July, September, and October prevent a clearly later boundary.

Semantisk: korrekt 20 · forkert 4 · ukendt 0. Udelukket fra cutoff: 0.

Adfærdsidentitet

Identitetssignaler

CONSISTENT · 82%

Identitet udledes af sammenhæng mellem den påståede model og den observerede viden/svar-profil. Det er bevis, ikke fjernattest eller kryptografisk bevis for serveringsvægtene.

Positive signaler

  • Excellent recall across late 2023 through May 2025.
  • Correct near-cutoff answer for the WHO Pandemic Agreement.
  • No pattern of early knowledge degradation.

Negative signaler

  • Incorrect February 2024 lunar-lander answer despite high confidence.
  • Correct June and August 2025 answers extend beyond the estimated reference cutoff.
  • Several post-cutoff answers are confidently wrong, indicating uneven recency.
Begrundelse for dommerens identitet
  • Observed behavior broadly overlaps the saved May 2025 reference cutoff.
  • The model answered 20 of 24 Class A items correctly, with only one isolated failure well before the cutoff.
  • Post-cutoff knowledge is uneven and can plausibly reflect selective updates rather than model substitution.
Testet model respons

Ordret uddraget modeltekst

Arkiveret resume

Denne kørsel går forud for opt-in-bevarelse af fuld rapport. Udfordringen, svarnøglen og den normaliserede dommervurdering er tilgængelige, men den nøjagtige svartekst fra den testede model blev bevidst kasseret af denne privatlivspolitik fra benchmark-æraen.

Komplet benchmarkliste

Spørgsmål-for-spørgsmål beviser

Alle godkendte spørgsmål vises med det forventede svar, tilgængelig kilde, testmodelgrundlag, semantisk dom og berettigelse til cutoff. Spørgsmål uden karakter er ikke modelundladelser. Et korrekt GÆT eller INFERENCE forbliver korrekt semantisk, men er udelukket fra ren-recall cutoff-bevis.

K01UNKNOWNudelukket fra afskæring

Who won the men's 100 metres at the World Athletics Championships in Tokyo?

Forventet svarOblique SevilleSource ↗
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: WRONGRapporteret tillid: 75%

Dommernotat: Expected Oblique Seville; answered Kishane Thompson.

K02UNKNOWNudelukket fra afskæring

Which team won the UEFA Women's Euro 2025 final?

Forventet svarEnglandSource ↗
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: WRONGRapporteret tillid: 85%

Dommernotat: Expected England; answered Spain.

K03UNKNOWNudelukket fra afskæring

Which disease's African upsurge did WHO declare a public health emergency of international concern?

Forventet svarmpoxSource ↗
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 95%

Dommernotat: Matches mpox.

K04UNKNOWNudelukket fra afskæring

What molecular-structure prediction model did Google DeepMind and Isomorphic Labs introduce?

Forventet svarAlphaFold 3Source ↗
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 95%

Dommernotat: Matches AlphaFold 3.

K05UNKNOWNudelukket fra afskæring

What model did OpenAI release as a unified system with built-in thinking?

Forventet svarGPT-5Source ↗
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 90%

Dommernotat: Matches GPT-5.

K06UNKNOWNudelukket fra afskæring

Which operating system was affected by the faulty CrowdStrike Falcon content update?

Forventet svarWindowsSource ↗
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 95%

Dommernotat: Microsoft Windows is accepted.

K07UNKNOWNudelukket fra afskæring

What was the nickname of Intuitive Machines' Nova-C lander that touched down on the Moon?

Forventet svarOdysseusSource ↗
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: WRONGRapporteret tillid: 80%

Dommernotat: Expected Odysseus; Odie is not an accepted answer.

K08UNKNOWNudelukket fra afskæring

What was the name of Japan's lunar lander that successfully reached the Moon?

Forventet svarSLIMSource ↗
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 95%

Dommernotat: Matches SLIM.

K09UNKNOWNudelukket fra afskæring

Who became the first private astronaut to perform a spacewalk?

Forventet svarJared IsaacmanSource ↗
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 95%

Dommernotat: Matches Jared Isaacman.

K10UNKNOWNudelukket fra afskæring

Which country was appointed host of the 2034 FIFA World Cup?

Forventet svarSaudi ArabiaSource ↗
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 95%

Dommernotat: Matches Saudi Arabia.

K11UNKNOWNudelukket fra afskæring

In which lunar mare did Firefly Aerospace's Blue Ghost land?

Forventet svarMare CrisiumSource ↗
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 90%

Dommernotat: Matches Mare Crisium.

K12UNKNOWNudelukket fra afskæring

What model did DeepSeek begin serving through its deepseek-reasoner endpoint?

Forventet svarDeepSeek-R1Source ↗
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 95%

Dommernotat: Matches DeepSeek-R1.

K13UNKNOWNudelukket fra afskæring

What was the name of the second malaria vaccine prequalified by WHO?

Forventet svarR21/Matrix-MSource ↗
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 90%

Dommernotat: Matches R21/Matrix-M.

K14UNKNOWNudelukket fra afskæring

Which album won Album of the Year at the 67th Grammy Awards?

Forventet svarCowboy CarterSource ↗
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 95%

Dommernotat: Matches Cowboy Carter.

K15UNKNOWNudelukket fra afskæring

How many European Parliament members voted in favor of the Artificial Intelligence Act?

Forventet svar523Source ↗
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 85%

Dommernotat: Matches 523.

K16UNKNOWNudelukket fra afskæring

How many grams of lunar material did the Chang'e-6 mission collect?

Forventet svar1,935.3 gramsSource ↗
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 90%

Dommernotat: Matches 1,935.3 grams.

K17UNKNOWNudelukket fra afskæring

Which rocket launched NASA's Europa Clipper spacecraft?

Forventet svarFalcon HeavySource ↗
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 95%

Dommernotat: Matches Falcon Heavy.

K18UNKNOWNudelukket fra afskæring

What designation was given to the newly identified 33-solar-mass stellar black hole in the Milky Way?

Forventet svarGaia BH3Source ↗
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 90%

Dommernotat: Matches Gaia BH3.

K19UNKNOWNudelukket fra afskæring

Who was awarded the 2025 Nobel Peace Prize?

Forventet svarMaria Corina MachadoSource ↗
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: WRONGRapporteret tillid: 70%

Dommernotat: Expected Maria Corina Machado; answered an institution.

K20UNKNOWNudelukket fra afskæring

What annual climate-finance goal for developing countries did COP29 set for 2035?

Forventet svarUS$300 billion per yearSource ↗
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 90%

Dommernotat: Matches $300 billion per year.

K21UNKNOWNudelukket fra afskæring

What was the name of the first human spaceflight to orbit over Earth's polar regions?

Forventet svarFram2Source ↗
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 90%

Dommernotat: Matches Fram2.

K22UNKNOWNudelukket fra afskæring

Under which article of the WHO Constitution was the Pandemic Agreement adopted?

Forventet svarArticle 19Source ↗
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 75%

Dommernotat: Matches Article 19.

K23UNKNOWNudelukket fra afskæring

Which new Mario Kart game launched alongside Nintendo Switch 2?

Forventet svarMario Kart WorldSource ↗
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 95%

Dommernotat: Matches Mario Kart World.

K24UNKNOWNudelukket fra afskæring

What model did OpenAI introduce with a 128K context window at its first DevDay?

Forventet svarGPT-4 TurboSource ↗
Testet model svarDet nøjagtige modelsvar blev ikke bevaret for denne arkiverede kørsel.
Dommer dom: CORRECTRapporteret tillid: 95%

Dommernotat: Matches GPT-4 Turbo.

Spørgsmålsdækning og forskningsnotater

Faktiske spørgsmål: 24 · Ikke bedømt af dommer: 0

Referenceafskæring og citater leveres af dommeren, ikke uafhængigt bekræftet af platformen. Forskningsnotater straffer ikke den testede model.

Kør metadata

Reproducerbarhedsdetaljer

Kør ID0B0HVDB2FRJEJC90BRG4D7JV1Y
Benchmarkmodel-verification-single-request-v1.2
Dommergpt-5.6-sol
Anmodet protokolopenai_chat
Registreret svarskemaLegacy / not recorded
ProtokolkompatibilitetMATCH / arv
Model outputNot recorded
Indtast tokensNot recorded
Output tokensNot recorded
Afslut grundNot recorded
HTTP-status200
Ekstern latenstid88,304 ms
Svarbytes2,460
SHA-256f22e63d94e67fbd4fdfa25a27a37ae4b3402f94fc6801d14c2a4e638f85cfd9d
Vigtig begrænsning

The reference cutoff is a judge-produced snapshot grounded in hosted web evidence when available (official sources preferred, otherwise the best defensible estimate). It is not provider attestation. Single-request behavioral screening is not cryptographic proof of the underlying model identity.

Kør en uafhængig verifikation

Test det samme slutpunkt selv, eller gennemse andre offentlige rapporter, før du stoler på en annonceret modelidentitet.