deepseek-v4-flash
https://api.model-gate.com/v1/chat/completions
https://model-gate.com/cs/model-verification/results/A57ZK57ERM62N3S1XETMXFKK0XProč toto ověření dostalo svůj výsledek
Veřejná zpráva odráží analytické důkazy zobrazené testerovi po /chat/verify. Skóre rozhodčích jsou hodnocení rubrik; pouze explicitní správné nebo nesprávné odpovědi RECALL mohou ovlivnit hranici čistého stažení.
Odůvodnění hodnocení rozhodčího
Pro tento archivovaný výsledek nebylo zachováno žádné samostatné zdůvodnění rozhodčího.
Pro tento archivovaný výsledek nebylo zachováno žádné samostatné zdůvodnění rozhodčího.
Pro tento archivovaný výsledek nebylo zachováno žádné samostatné zdůvodnění rozhodčího.
Pro tento archivovaný výsledek nebylo zachováno žádné samostatné zdůvodnění rozhodčího.
Poznámka k historickému benchmarku: toto archivované celkové skóre verze 1.4 využívalo dřívější pevnou diagnostickou agregaci. Je zachováno z důvodu reprodukovatelnosti a nesmí být interpretováno jako skóre v1.5 Model Match.
Časová osa čistého vyvolání
Aktuální sada otázek byla zamíchána před požadavkem testovaného modelu. Chybějící generační sloty nejsou modelovým zdržením se hlasování. Časová osa rekonstruuje jejich cílové měsíce pro auditovatelnost. Pouze explicitní odpovědi RECALL jsou hraničním důkazem; INFERENCE, GUESS a UNKNOWN zůstávají viditelné, ale neposouvají hranici.
Srovnání limitu znalostí
- All Class A items are correct through June 2024, establishing an observed lower bound but no upper bound.
- The immutable reference snapshot has no known cutoff dates, so cutoff alignment cannot be scored.
Sémantický: opravit 16 · špatně 0 · neznámý 0. Vyloučeno z omezení: 0.
Signály identity
Identita je odvozena z konzistence mezi nárokovaným modelem a pozorovaným profilem znalostí/odpovědí. Je to důkaz, nikoli dálkové potvrzení nebo kryptografický důkaz servírovacích závaží.
Pozitivní signály
- Perfect performance across all supplied Class A recall items.
- Correct recall of multiple DeepSeek model releases and specifications.
- No systematic early knowledge failures.
Negativní signály
- No documented canonical identity or cutoff is available in the reference snapshot.
- Cutoff consistency cannot be evaluated.
- Self-report and matching API metadata are weak identity evidence.
- The response is fully correct on all 16 strong-recall questions, including the DeepSeek-specific history items.
- The observed knowledge extends through June 2024, but the reference cutoff is unknown and therefore provides no identity-comparison signal.
- The claimed name and API identifier agree, but both are untrusted metadata and do not prove model identity.
Doslovně extrahovaný text modelu
Toto spuštění předcházelo uchování úplného přehledu při přihlášení. Výzva, klíč odpovědí a normalizované hodnocení soudce jsou k dispozici, ale přesný text odpovědi testovaného modelu byl záměrně vyřazen z těchto zásad ochrany osobních údajů z éry srovnávacích testů.
Důkazy otázka od otázky
Všechny přijaté otázky jsou zobrazeny s očekávanou odpovědí, dostupným zdrojem, základem testovaného modelu, sémantickým verdiktem a způsobilostí pro omezení. Nehodnocené otázky nejsou modelové zdržení se hlasování. Správný GUESS nebo INFERENCE zůstává sémanticky správný, ale je vyloučen z čistého důkazu o mezní hodnotě vyvolání.
Which human Go player was AlphaGo's opponent in the three-game match completed on 2017-05-27?
Poznámka soudce: Matches accepted answer Ke Jie.
The first published image of a black hole, announced on 2019-04-10, depicted the black hole in which galaxy?
Poznámka soudce: M87 galaxy is semantically equivalent to Messier 87.
Which two scientists were awarded the 2020 Nobel Prize in Chemistry for developing a method for genome editing?
Poznámka soudce: Both required scientists are correctly named.
Which research organization developed the AlphaFold2 system whose CASP14 performance was announced on 2020-11-30?
Poznámka soudce: Matches accepted answer DeepMind.
Which launch vehicle carried the James Webb Space Telescope into space on 2021-12-25?
Poznámka soudce: Matches accepted answer Ariane 5.
What was the name of the asteroid moonlet struck by NASA's DART spacecraft on 2022-09-26?
Poznámka soudce: Matches accepted answer Dimorphos.
In which ocean did the Artemis I Orion capsule splash down on 2022-12-11?
Poznámka soudce: Matches accepted answer Pacific Ocean.
On 2023-03-01, OpenAI made an API available for which speech-recognition model?
Poznámka soudce: Matches accepted answer Whisper.
What was the name of the Chandrayaan-3 lander that reached the lunar surface on 2023-08-23?
Poznámka soudce: Matches accepted answer Vikram.
Samples from which asteroid were returned to Earth by the OSIRIS-REx capsule on 2023-09-24?
Poznámka soudce: Matches accepted answer Bennu.
What was the name of the code-focused model family publicly introduced by DeepSeek on 2023-11-02?
Poznámka soudce: DeepSeek-Coder is an accepted spelling.
What two parameter scales were offered in the DeepSeek LLM family announced on 2023-11-29?
Poznámka soudce: Both parameter scales match: 7B and 67B.
How many total parameters and how many activated parameters per token did DeepSeek-V2 have when announced on 2024-05-06?
Poznámka soudce: Correctly gives 236B total and 21B activated per token.
What maximum context length was supported by DeepSeek-Coder-V2 when announced on 2024-06-17?
Poznámka soudce: Matches accepted answer 128K tokens.
Which company built the Odysseus lunar lander that touched down on 2024-02-22?
Poznámka soudce: Matches accepted answer Intuitive Machines.
What two parameter sizes were offered for the initially released Llama 3 models announced on 2024-04-18?
Poznámka soudce: Both initially released sizes match: 8B and 70B.
Pokrytí otázky a poznámky výzkumu
Věcné otázky: 16 · Nehodnoceno rozhodčím: 0
Referenční limit a citace dodává porotce, platforma je nezávisle nepotvrzuje. Výzkumné poznámky nepenalizují testovaný model.
Podrobnosti o reprodukovatelnosti
A57ZK57ERM62N3S1XETMXFKK0Xmodel-verification-single-request-v1.1gpt-5.6-solopenai_chatLegacy / not recordedMATCH / dědictvíNot recordedNot recordedNot recordedNot recorded20028,645 ms1,8594c1f5cca4a79a53f28e7f6544bfe08208148d53c85569f50c4132e161da06613The reference cutoff is the configured judge model's internal-knowledge snapshot for this run, not an independently verified provider attestation. Single-request behavioral screening is not cryptographic proof of the underlying model identity.
Proveďte nezávislé ověření
Než se spolehnete na inzerovanou identitu modelu, otestujte si stejný koncový bod sami nebo si projděte jiné veřejné sestavy.