deepseek-v4-flash
https://api.model-gate.com/v1/chat/completions
https://model-gate.com/da/model-verification/results/0B0HVDB2FRJEJC90BRG4D7JV1YHvorfor denne verifikation modtog sit resultat
Den offentlige rapport afspejler de analytiske beviser, der er vist for testeren efter /chat/verify. Dommerscore er rubrikvurderinger; kun eksplicitte korrekte eller forkerte RECALL-svar kan påvirke grænsen for ren genkaldelse.
Begrundelse for dommerscoring
Ingen særskilt dommerbegrundelse blev bibeholdt for dette arkiverede resultat.
Ingen særskilt dommerbegrundelse blev bibeholdt for dette arkiverede resultat.
Ingen særskilt dommerbegrundelse blev bibeholdt for dette arkiverede resultat.
Ingen særskilt dommerbegrundelse blev bibeholdt for dette arkiverede resultat.
Historisk benchmarknote: denne arkiverede v1.4 samlede score brugte den tidligere faste diagnostiske aggregering. Det bibeholdes for reproducerbarhed og må ikke tolkes som en v1.5 Model Match-score.
Tidslinje for ren genkaldelse
Selve spørgsmålssættet blev blandet før anmodningen om testet model. Manglende generationspladser er ikke modelundladelser. Tidslinjen rekonstruerer deres målmåneder for auditabilitet. Kun eksplicitte RECALL-svar er afskæringsbeviser; INFERENCE, GÆT og UKENDT forbliver synlige, men flytter ikke grænsen.
Viden cutoff sammenligning
- Strong recall is nearly complete through the May 2025 reference cutoff.
- There is no systematic strong-recall failure substantially before the reference cutoff.
- Correct June and August 2025 answers suggest selective later knowledge, while failures in July, September, and October prevent a clearly later boundary.
Semantisk: korrekt 20 · forkert 4 · ukendt 0. Udelukket fra cutoff: 0.
Identitetssignaler
Identitet udledes af sammenhæng mellem den påståede model og den observerede viden/svar-profil. Det er bevis, ikke fjernattest eller kryptografisk bevis for serveringsvægtene.
Positive signaler
- Excellent recall across late 2023 through May 2025.
- Correct near-cutoff answer for the WHO Pandemic Agreement.
- No pattern of early knowledge degradation.
Negative signaler
- Incorrect February 2024 lunar-lander answer despite high confidence.
- Correct June and August 2025 answers extend beyond the estimated reference cutoff.
- Several post-cutoff answers are confidently wrong, indicating uneven recency.
- Observed behavior broadly overlaps the saved May 2025 reference cutoff.
- The model answered 20 of 24 Class A items correctly, with only one isolated failure well before the cutoff.
- Post-cutoff knowledge is uneven and can plausibly reflect selective updates rather than model substitution.
Ordret uddraget modeltekst
Denne kørsel går forud for opt-in-bevarelse af fuld rapport. Udfordringen, svarnøglen og den normaliserede dommervurdering er tilgængelige, men den nøjagtige svartekst fra den testede model blev bevidst kasseret af denne privatlivspolitik fra benchmark-æraen.
Spørgsmål-for-spørgsmål beviser
Alle godkendte spørgsmål vises med det forventede svar, tilgængelig kilde, testmodelgrundlag, semantisk dom og berettigelse til cutoff. Spørgsmål uden karakter er ikke modelundladelser. Et korrekt GÆT eller INFERENCE forbliver korrekt semantisk, men er udelukket fra ren-recall cutoff-bevis.
Who won the men's 100 metres at the World Athletics Championships in Tokyo?
Dommernotat: Expected Oblique Seville; answered Kishane Thompson.
Which team won the UEFA Women's Euro 2025 final?
Dommernotat: Expected England; answered Spain.
Which disease's African upsurge did WHO declare a public health emergency of international concern?
Dommernotat: Matches mpox.
What molecular-structure prediction model did Google DeepMind and Isomorphic Labs introduce?
Dommernotat: Matches AlphaFold 3.
What model did OpenAI release as a unified system with built-in thinking?
Dommernotat: Matches GPT-5.
Which operating system was affected by the faulty CrowdStrike Falcon content update?
Dommernotat: Microsoft Windows is accepted.
What was the nickname of Intuitive Machines' Nova-C lander that touched down on the Moon?
Dommernotat: Expected Odysseus; Odie is not an accepted answer.
What was the name of Japan's lunar lander that successfully reached the Moon?
Dommernotat: Matches SLIM.
Who became the first private astronaut to perform a spacewalk?
Dommernotat: Matches Jared Isaacman.
Which country was appointed host of the 2034 FIFA World Cup?
Dommernotat: Matches Saudi Arabia.
In which lunar mare did Firefly Aerospace's Blue Ghost land?
Dommernotat: Matches Mare Crisium.
What model did DeepSeek begin serving through its deepseek-reasoner endpoint?
Dommernotat: Matches DeepSeek-R1.
What was the name of the second malaria vaccine prequalified by WHO?
Dommernotat: Matches R21/Matrix-M.
Which album won Album of the Year at the 67th Grammy Awards?
Dommernotat: Matches Cowboy Carter.
How many European Parliament members voted in favor of the Artificial Intelligence Act?
Dommernotat: Matches 523.
How many grams of lunar material did the Chang'e-6 mission collect?
Dommernotat: Matches 1,935.3 grams.
Which rocket launched NASA's Europa Clipper spacecraft?
Dommernotat: Matches Falcon Heavy.
What designation was given to the newly identified 33-solar-mass stellar black hole in the Milky Way?
Dommernotat: Matches Gaia BH3.
Who was awarded the 2025 Nobel Peace Prize?
Dommernotat: Expected Maria Corina Machado; answered an institution.
What annual climate-finance goal for developing countries did COP29 set for 2035?
Dommernotat: Matches $300 billion per year.
What was the name of the first human spaceflight to orbit over Earth's polar regions?
Dommernotat: Matches Fram2.
Under which article of the WHO Constitution was the Pandemic Agreement adopted?
Dommernotat: Matches Article 19.
Which new Mario Kart game launched alongside Nintendo Switch 2?
Dommernotat: Matches Mario Kart World.
What model did OpenAI introduce with a 128K context window at its first DevDay?
Dommernotat: Matches GPT-4 Turbo.
Spørgsmålsdækning og forskningsnotater
Faktiske spørgsmål: 24 · Ikke bedømt af dommer: 0
Referenceafskæring og citater leveres af dommeren, ikke uafhængigt bekræftet af platformen. Forskningsnotater straffer ikke den testede model.
Reproducerbarhedsdetaljer
0B0HVDB2FRJEJC90BRG4D7JV1Ymodel-verification-single-request-v1.2gpt-5.6-solopenai_chatLegacy / not recordedMATCH / arvNot recordedNot recordedNot recordedNot recorded20088,304 ms2,460f22e63d94e67fbd4fdfa25a27a37ae4b3402f94fc6801d14c2a4e638f85cfd9dThe reference cutoff is a judge-produced snapshot grounded in hosted web evidence when available (official sources preferred, otherwise the best defensible estimate). It is not provider attestation. Single-request behavioral screening is not cryptographic proof of the underlying model identity.
Kør en uafhængig verifikation
Test det samme slutpunkt selv, eller gennemse andre offentlige rapporter, før du stoler på en annonceret modelidentitet.