← Veřejný ověřovací registrmodel-verification-single-request-v1.1
Veřejná zpráva o ověření modelu AI

deepseek-v4-flash

https://api.model-gate.com/v1/chat/completions

openai_chatgpt-5.6-solSep 6, 2026 09:53 UTC
Starší skóre kvality100/100
PLAUSIBLE60% spolehlivost hodnocení
Stálá zprávahttps://model-gate.com/cs/model-verification/results/A57ZK57ERM62N3S1XETMXFKK0X
Telegram ↗X ↗
Faktické odvolání100
Aktuálnost znalostí100
Odolnost proti halucinacím100
Kalibrace100
Reklamovaný modeldeepseek-v4-flash
Model vyřešený soudcemdeepseek-v4-flashUNKNOWN
Hostitel koncového boduapi.model-gate.com
Pole modelu externí odezvydeepseek-v4-flash
Analýza soudce

Proč toto ověření dostalo svůj výsledek

Veřejná zpráva odráží analytické důkazy zobrazené testerovi po /chat/verify. Skóre rozhodčích jsou hodnocení rubrik; pouze explicitní správné nebo nesprávné odpovědi RECALL mohou ovlivnit hranici čistého stažení.

Diagnostika chování

Odůvodnění hodnocení rozhodčího

4 diagnostika
Faktické odvolání100/100

Pro tento archivovaný výsledek nebylo zachováno žádné samostatné zdůvodnění rozhodčího.

Aktuálnost znalostí100/100

Pro tento archivovaný výsledek nebylo zachováno žádné samostatné zdůvodnění rozhodčího.

Odolnost proti halucinacím100/100

Pro tento archivovaný výsledek nebylo zachováno žádné samostatné zdůvodnění rozhodčího.

Kalibrace100/100

Pro tento archivovaný výsledek nebylo zachováno žádné samostatné zdůvodnění rozhodčího.

Poznámka k historickému benchmarku: toto archivované celkové skóre verze 1.4 využívalo dřívější pevnou diagnostickou agregaci. Je zachováno z důvodu reprodukovatelnosti a nesmí být interpretováno jako skóre v1.5 Model Match.

Časové důkazy

Časová osa čistého vyvolání

0 RECALL sondy

Aktuální sada otázek byla zamíchána před požadavkem testovaného modelu. Chybějící generační sloty nejsou modelovým zdržením se hlasování. Časová osa rekonstruuje jejich cílové měsíce pro auditovatelnost. Pouze explicitní odpovědi RECALL jsou hraničním důkazem; INFERENCE, GUESS a UNKNOWN zůstávají viditelné, ale neposouvají hranici.

Pro tento archivovaný výsledek benchmarku není měsíční časová osa k dispozici.
správné RECALL špatně RECALL~ INFERENCE GUESS? UNKNOWN
0RECALL
0INFERENCE
0GUESS
0UNKNOWN
0správné RECALL
0špatně RECALL
Časové srovnání

Srovnání limitu znalostí

UNKNOWN
Referenční limitUNKNOWNUNKNOWN · 0%
Nejnovější podporované RECALL0 způsobilé odpovědi RECALL
Pozorovaná hraniceNedostatečný důkaz RECALLINSUFFICIENT_RECALL_EVIDENCE
Zarovnání cutoffUNKNOWN0% důvěra
Soudce poznamenává
  • All Class A items are correct through June 2024, establishing an observed lower bound but no upper bound.
  • The immutable reference snapshot has no known cutoff dates, so cutoff alignment cannot be scored.

Sémantický: opravit 16 · špatně 0 · neznámý 0. Vyloučeno z omezení: 0.

Behaviorální identita

Signály identity

PLAUSIBLE · 60%

Identita je odvozena z konzistence mezi nárokovaným modelem a pozorovaným profilem znalostí/odpovědí. Je to důkaz, nikoli dálkové potvrzení nebo kryptografický důkaz servírovacích závaží.

Pozitivní signály

  • Perfect performance across all supplied Class A recall items.
  • Correct recall of multiple DeepSeek model releases and specifications.
  • No systematic early knowledge failures.

Negativní signály

  • No documented canonical identity or cutoff is available in the reference snapshot.
  • Cutoff consistency cannot be evaluated.
  • Self-report and matching API metadata are weak identity evidence.
Zdůvodnění identity soudce
  • The response is fully correct on all 16 strong-recall questions, including the DeepSeek-specific history items.
  • The observed knowledge extends through June 2024, but the reference cutoff is unknown and therefore provides no identity-comparison signal.
  • The claimed name and API identifier agree, but both are untrusted metadata and do not prove model identity.
Odezva testovaného modelu

Doslovně extrahovaný text modelu

Archivovaný souhrn

Toto spuštění předcházelo uchování úplného přehledu při přihlášení. Výzva, klíč odpovědí a normalizované hodnocení soudce jsou k dispozici, ale přesný text odpovědi testovaného modelu byl záměrně vyřazen z těchto zásad ochrany osobních údajů z éry srovnávacích testů.

Kompletní výpis benchmarků

Důkazy otázka od otázky

Všechny přijaté otázky jsou zobrazeny s očekávanou odpovědí, dostupným zdrojem, základem testovaného modelu, sémantickým verdiktem a způsobilostí pro omezení. Nehodnocené otázky nejsou modelové zdržení se hlasování. Správný GUESS nebo INFERENCE zůstává sémanticky správný, ale je vyloučen z čistého důkazu o mezní hodnotě vyvolání.

K01UNKNOWNvyloučeno z přerušení

Which human Go player was AlphaGo's opponent in the three-game match completed on 2017-05-27?

Očekávaná odpověďKe Jie
Odpověď na testovaný modelPřesná odpověď modelu nebyla pro tento archivovaný běh zachována.
Verdikt soudce: CORRECTHlášená důvěra: 100%

Poznámka soudce: Matches accepted answer Ke Jie.

K02UNKNOWNvyloučeno z přerušení

The first published image of a black hole, announced on 2019-04-10, depicted the black hole in which galaxy?

Očekávaná odpověďMessier 87
Odpověď na testovaný modelPřesná odpověď modelu nebyla pro tento archivovaný běh zachována.
Verdikt soudce: CORRECTHlášená důvěra: 100%

Poznámka soudce: M87 galaxy is semantically equivalent to Messier 87.

K03UNKNOWNvyloučeno z přerušení

Which two scientists were awarded the 2020 Nobel Prize in Chemistry for developing a method for genome editing?

Očekávaná odpověďEmmanuelle Charpentier and Jennifer A. Doudna
Odpověď na testovaný modelPřesná odpověď modelu nebyla pro tento archivovaný běh zachována.
Verdikt soudce: CORRECTHlášená důvěra: 100%

Poznámka soudce: Both required scientists are correctly named.

K04UNKNOWNvyloučeno z přerušení

Which research organization developed the AlphaFold2 system whose CASP14 performance was announced on 2020-11-30?

Očekávaná odpověďDeepMind
Odpověď na testovaný modelPřesná odpověď modelu nebyla pro tento archivovaný běh zachována.
Verdikt soudce: CORRECTHlášená důvěra: 100%

Poznámka soudce: Matches accepted answer DeepMind.

K05UNKNOWNvyloučeno z přerušení

Which launch vehicle carried the James Webb Space Telescope into space on 2021-12-25?

Očekávaná odpověďAriane 5
Odpověď na testovaný modelPřesná odpověď modelu nebyla pro tento archivovaný běh zachována.
Verdikt soudce: CORRECTHlášená důvěra: 100%

Poznámka soudce: Matches accepted answer Ariane 5.

K06UNKNOWNvyloučeno z přerušení

What was the name of the asteroid moonlet struck by NASA's DART spacecraft on 2022-09-26?

Očekávaná odpověďDimorphos
Odpověď na testovaný modelPřesná odpověď modelu nebyla pro tento archivovaný běh zachována.
Verdikt soudce: CORRECTHlášená důvěra: 100%

Poznámka soudce: Matches accepted answer Dimorphos.

K07UNKNOWNvyloučeno z přerušení

In which ocean did the Artemis I Orion capsule splash down on 2022-12-11?

Očekávaná odpověďPacific Ocean
Odpověď na testovaný modelPřesná odpověď modelu nebyla pro tento archivovaný běh zachována.
Verdikt soudce: CORRECTHlášená důvěra: 100%

Poznámka soudce: Matches accepted answer Pacific Ocean.

K08UNKNOWNvyloučeno z přerušení

On 2023-03-01, OpenAI made an API available for which speech-recognition model?

Očekávaná odpověďWhisper
Odpověď na testovaný modelPřesná odpověď modelu nebyla pro tento archivovaný běh zachována.
Verdikt soudce: CORRECTHlášená důvěra: 100%

Poznámka soudce: Matches accepted answer Whisper.

K09UNKNOWNvyloučeno z přerušení

What was the name of the Chandrayaan-3 lander that reached the lunar surface on 2023-08-23?

Očekávaná odpověďVikram
Odpověď na testovaný modelPřesná odpověď modelu nebyla pro tento archivovaný běh zachována.
Verdikt soudce: CORRECTHlášená důvěra: 100%

Poznámka soudce: Matches accepted answer Vikram.

K10UNKNOWNvyloučeno z přerušení

Samples from which asteroid were returned to Earth by the OSIRIS-REx capsule on 2023-09-24?

Očekávaná odpověďBennu
Odpověď na testovaný modelPřesná odpověď modelu nebyla pro tento archivovaný běh zachována.
Verdikt soudce: CORRECTHlášená důvěra: 100%

Poznámka soudce: Matches accepted answer Bennu.

K11UNKNOWNvyloučeno z přerušení

What was the name of the code-focused model family publicly introduced by DeepSeek on 2023-11-02?

Očekávaná odpověďDeepSeek Coder
Odpověď na testovaný modelPřesná odpověď modelu nebyla pro tento archivovaný běh zachována.
Verdikt soudce: CORRECTHlášená důvěra: 100%

Poznámka soudce: DeepSeek-Coder is an accepted spelling.

K12UNKNOWNvyloučeno z přerušení

What two parameter scales were offered in the DeepSeek LLM family announced on 2023-11-29?

Očekávaná odpověď7B and 67B
Odpověď na testovaný modelPřesná odpověď modelu nebyla pro tento archivovaný běh zachována.
Verdikt soudce: CORRECTHlášená důvěra: 100%

Poznámka soudce: Both parameter scales match: 7B and 67B.

K13UNKNOWNvyloučeno z přerušení

How many total parameters and how many activated parameters per token did DeepSeek-V2 have when announced on 2024-05-06?

Očekávaná odpověď236B total parameters and 21B activated parameters per token
Odpověď na testovaný modelPřesná odpověď modelu nebyla pro tento archivovaný běh zachována.
Verdikt soudce: CORRECTHlášená důvěra: 100%

Poznámka soudce: Correctly gives 236B total and 21B activated per token.

K14UNKNOWNvyloučeno z přerušení

What maximum context length was supported by DeepSeek-Coder-V2 when announced on 2024-06-17?

Očekávaná odpověď128K tokens
Odpověď na testovaný modelPřesná odpověď modelu nebyla pro tento archivovaný běh zachována.
Verdikt soudce: CORRECTHlášená důvěra: 100%

Poznámka soudce: Matches accepted answer 128K tokens.

K15UNKNOWNvyloučeno z přerušení

Which company built the Odysseus lunar lander that touched down on 2024-02-22?

Očekávaná odpověďIntuitive Machines
Odpověď na testovaný modelPřesná odpověď modelu nebyla pro tento archivovaný běh zachována.
Verdikt soudce: CORRECTHlášená důvěra: 100%

Poznámka soudce: Matches accepted answer Intuitive Machines.

K16UNKNOWNvyloučeno z přerušení

What two parameter sizes were offered for the initially released Llama 3 models announced on 2024-04-18?

Očekávaná odpověď8B and 70B
Odpověď na testovaný modelPřesná odpověď modelu nebyla pro tento archivovaný běh zachována.
Verdikt soudce: CORRECTHlášená důvěra: 100%

Poznámka soudce: Both initially released sizes match: 8B and 70B.

Pokrytí otázky a poznámky výzkumu

Věcné otázky: 16 · Nehodnoceno rozhodčím: 0

Referenční limit a citace dodává porotce, platforma je nezávisle nepotvrzuje. Výzkumné poznámky nepenalizují testovaný model.

Spustit metadata

Podrobnosti o reprodukovatelnosti

Spustit IDA57ZK57ERM62N3S1XETMXFKK0X
Benchmarkmodel-verification-single-request-v1.1
Soudcegpt-5.6-sol
Požadovaný protokolopenai_chat
Zjištěné schéma odezvyLegacy / not recorded
Kompatibilita protokolůMATCH / dědictví
Výstup modeluNot recorded
Vstupní tokenyNot recorded
Výstupní tokenyNot recorded
Dokonči důvodNot recorded
Stav HTTP200
Externí latence28,645 ms
Byty odpovědi1,859
SHA-2564c1f5cca4a79a53f28e7f6544bfe08208148d53c85569f50c4132e161da06613
Důležité omezení

The reference cutoff is the configured judge model's internal-knowledge snapshot for this run, not an independently verified provider attestation. Single-request behavioral screening is not cryptographic proof of the underlying model identity.

Proveďte nezávislé ověření

Než se spolehnete na inzerovanou identitu modelu, otestujte si stejný koncový bod sami nebo si projděte jiné veřejné sestavy.