← Verejný overovací registermodel-verification-single-request-v1.1
Verejná správa o overení modelu AI

deepseek-v4-flash

https://api.model-gate.com/v1/chat/completions

openai_chatgpt-5.6-solSep 6, 2026 09:53 UTC
Staršie skóre kvality100/100
PLAUSIBLE60% dôvera v hodnotenie
Stála správahttps://model-gate.com/sk/model-verification/results/A57ZK57ERM62N3S1XETMXFKK0X
Telegram ↗X ↗
Faktické pripomenutie100
Aktuálnosť vedomostí100
Odolnosť voči halucináciám100
Kalibrácia100
Nárokovaný modeldeepseek-v4-flash
Model vyriešený sudcomdeepseek-v4-flashUNKNOWN
Hostiteľ koncového boduapi.model-gate.com
Pole modelu externej odozvydeepseek-v4-flash
Analýza sudcu

Prečo toto overenie dostalo svoj výsledok

Verejná správa odzrkadľuje analytické dôkazy zobrazené testerovi po /chat/verify. Skóre sudcov sú hodnotenia rubriky; iba explicitné správne alebo nesprávne odpovede RECALL môžu ovplyvniť hranicu čistého stiahnutia.

Diagnostika správania

Zdôvodnenie bodovania rozhodcu

4 diagnostika
Faktické pripomenutie100/100

Pre tento archivovaný výsledok nebolo zachované žiadne samostatné zdôvodnenie sudcu.

Aktuálnosť vedomostí100/100

Pre tento archivovaný výsledok nebolo zachované žiadne samostatné zdôvodnenie sudcu.

Odolnosť voči halucináciám100/100

Pre tento archivovaný výsledok nebolo zachované žiadne samostatné zdôvodnenie sudcu.

Kalibrácia100/100

Pre tento archivovaný výsledok nebolo zachované žiadne samostatné zdôvodnenie sudcu.

Poznámka k historickému benchmarku: toto archivované celkové skóre verzie 1.4 využívalo bývalú fixnú diagnostickú agregáciu. Zachováva sa kvôli reprodukovateľnosti a nesmie sa interpretovať ako skóre zhody modelu v1.5.

Časový dôkaz

Čistá časová os

0 RECALL sondy

Skutočný súbor otázok bol zamiešaný pred požiadavkou testovaného modelu. Chýbajúce generačné sloty nie sú modelovým zdržaním sa hlasovania. Časová os rekonštruuje ich cieľové mesiace pre auditovateľnosť. Iba explicitné odpovede RECALL sú hraničným dôkazom; INFERENCE, GUESS a UNKNOWN zostávajú viditeľné, ale neposúvajú hranicu.

Pre tento archivovaný výsledok porovnávania nie je k dispozícii mesačná časová os.
správne RECALL nesprávne RECALL~ INFERENCE GUESS? UNKNOWN
0RECALL
0INFERENCE
0GUESS
0UNKNOWN
0správne RECALL
0nesprávne RECALL
Časové porovnanie

Porovnanie hranice vedomostí

UNKNOWN
Referenčná hranicaUNKNOWNUNKNOWN · 0%
Najnovšie podporované RECALL0 oprávnené odpovede RECALL
Pozorovaná hranicaNedostatočné dôkazy RECALLINSUFFICIENT_RECALL_EVIDENCE
Cutoff zarovnanieUNKNOWN0% dôvera
Sudca poznamenáva
  • All Class A items are correct through June 2024, establishing an observed lower bound but no upper bound.
  • The immutable reference snapshot has no known cutoff dates, so cutoff alignment cannot be scored.

Sémantický: správne 16 · nesprávne 0 · neznámy 0. Vylúčené z prerušenia: 0.

Behaviorálna identita

Signály identity

PLAUSIBLE · 60%

Identita sa odvodzuje z konzistentnosti medzi nárokovaným modelom a pozorovaným profilom vedomostí/odpovedí. Je to dôkaz, nie diaľkové potvrdenie alebo kryptografický dôkaz o hmotnosti podávania.

Pozitívne signály

  • Perfect performance across all supplied Class A recall items.
  • Correct recall of multiple DeepSeek model releases and specifications.
  • No systematic early knowledge failures.

Negatívne signály

  • No documented canonical identity or cutoff is available in the reference snapshot.
  • Cutoff consistency cannot be evaluated.
  • Self-report and matching API metadata are weak identity evidence.
Zdôvodnenie identity sudcu
  • The response is fully correct on all 16 strong-recall questions, including the DeepSeek-specific history items.
  • The observed knowledge extends through June 2024, but the reference cutoff is unknown and therefore provides no identity-comparison signal.
  • The claimed name and API identifier agree, but both are untrusted metadata and do not prove model identity.
Odozva testovaného modelu

Doslovne extrahovaný text modelu

Archivované zhrnutie

Toto spustenie predchádzalo uchovaniu úplného prehľadu prihlásením. Výzva, kľúč odpovedí a normalizované hodnotenie sudcu sú k dispozícii, ale presný text odpovede testovaného modelu bol zámerne vyradený z pravidiel ochrany osobných údajov z éry porovnávania.

Kompletný zoznam benchmarkov

Dôkazy otázka po otázke

Všetky prijaté otázky sú zobrazené s očakávanou odpoveďou, dostupným zdrojom, základom testovaného modelu, sémantickým verdiktom a oprávnenosťou na obmedzenie. Nehodnotené otázky nie sú modelovým zdržaním sa hlasovania. Správny GUESS alebo INFERENCE zostáva sémanticky správny, ale je vylúčený z čistého dôkazu o medznej hodnote stiahnutia.

K01UNKNOWNvylúčené z prerušenia

Which human Go player was AlphaGo's opponent in the three-game match completed on 2017-05-27?

Očakávaná odpoveďKe Jie
Odpoveď testovaného modeluPre tento archivovaný cyklus sa nezachovala presná odpoveď modelu.
Verdikt sudcu: CORRECTHlásená dôvera: 100%

Poznámka sudcu: Matches accepted answer Ke Jie.

K02UNKNOWNvylúčené z prerušenia

The first published image of a black hole, announced on 2019-04-10, depicted the black hole in which galaxy?

Očakávaná odpoveďMessier 87
Odpoveď testovaného modeluPre tento archivovaný cyklus sa nezachovala presná odpoveď modelu.
Verdikt sudcu: CORRECTHlásená dôvera: 100%

Poznámka sudcu: M87 galaxy is semantically equivalent to Messier 87.

K03UNKNOWNvylúčené z prerušenia

Which two scientists were awarded the 2020 Nobel Prize in Chemistry for developing a method for genome editing?

Očakávaná odpoveďEmmanuelle Charpentier and Jennifer A. Doudna
Odpoveď testovaného modeluPre tento archivovaný cyklus sa nezachovala presná odpoveď modelu.
Verdikt sudcu: CORRECTHlásená dôvera: 100%

Poznámka sudcu: Both required scientists are correctly named.

K04UNKNOWNvylúčené z prerušenia

Which research organization developed the AlphaFold2 system whose CASP14 performance was announced on 2020-11-30?

Očakávaná odpoveďDeepMind
Odpoveď testovaného modeluPre tento archivovaný cyklus sa nezachovala presná odpoveď modelu.
Verdikt sudcu: CORRECTHlásená dôvera: 100%

Poznámka sudcu: Matches accepted answer DeepMind.

K05UNKNOWNvylúčené z prerušenia

Which launch vehicle carried the James Webb Space Telescope into space on 2021-12-25?

Očakávaná odpoveďAriane 5
Odpoveď testovaného modeluPre tento archivovaný cyklus sa nezachovala presná odpoveď modelu.
Verdikt sudcu: CORRECTHlásená dôvera: 100%

Poznámka sudcu: Matches accepted answer Ariane 5.

K06UNKNOWNvylúčené z prerušenia

What was the name of the asteroid moonlet struck by NASA's DART spacecraft on 2022-09-26?

Očakávaná odpoveďDimorphos
Odpoveď testovaného modeluPre tento archivovaný cyklus sa nezachovala presná odpoveď modelu.
Verdikt sudcu: CORRECTHlásená dôvera: 100%

Poznámka sudcu: Matches accepted answer Dimorphos.

K07UNKNOWNvylúčené z prerušenia

In which ocean did the Artemis I Orion capsule splash down on 2022-12-11?

Očakávaná odpoveďPacific Ocean
Odpoveď testovaného modeluPre tento archivovaný cyklus sa nezachovala presná odpoveď modelu.
Verdikt sudcu: CORRECTHlásená dôvera: 100%

Poznámka sudcu: Matches accepted answer Pacific Ocean.

K08UNKNOWNvylúčené z prerušenia

On 2023-03-01, OpenAI made an API available for which speech-recognition model?

Očakávaná odpoveďWhisper
Odpoveď testovaného modeluPre tento archivovaný cyklus sa nezachovala presná odpoveď modelu.
Verdikt sudcu: CORRECTHlásená dôvera: 100%

Poznámka sudcu: Matches accepted answer Whisper.

K09UNKNOWNvylúčené z prerušenia

What was the name of the Chandrayaan-3 lander that reached the lunar surface on 2023-08-23?

Očakávaná odpoveďVikram
Odpoveď testovaného modeluPre tento archivovaný cyklus sa nezachovala presná odpoveď modelu.
Verdikt sudcu: CORRECTHlásená dôvera: 100%

Poznámka sudcu: Matches accepted answer Vikram.

K10UNKNOWNvylúčené z prerušenia

Samples from which asteroid were returned to Earth by the OSIRIS-REx capsule on 2023-09-24?

Očakávaná odpoveďBennu
Odpoveď testovaného modeluPre tento archivovaný cyklus sa nezachovala presná odpoveď modelu.
Verdikt sudcu: CORRECTHlásená dôvera: 100%

Poznámka sudcu: Matches accepted answer Bennu.

K11UNKNOWNvylúčené z prerušenia

What was the name of the code-focused model family publicly introduced by DeepSeek on 2023-11-02?

Očakávaná odpoveďDeepSeek Coder
Odpoveď testovaného modeluPre tento archivovaný cyklus sa nezachovala presná odpoveď modelu.
Verdikt sudcu: CORRECTHlásená dôvera: 100%

Poznámka sudcu: DeepSeek-Coder is an accepted spelling.

K12UNKNOWNvylúčené z prerušenia

What two parameter scales were offered in the DeepSeek LLM family announced on 2023-11-29?

Očakávaná odpoveď7B and 67B
Odpoveď testovaného modeluPre tento archivovaný cyklus sa nezachovala presná odpoveď modelu.
Verdikt sudcu: CORRECTHlásená dôvera: 100%

Poznámka sudcu: Both parameter scales match: 7B and 67B.

K13UNKNOWNvylúčené z prerušenia

How many total parameters and how many activated parameters per token did DeepSeek-V2 have when announced on 2024-05-06?

Očakávaná odpoveď236B total parameters and 21B activated parameters per token
Odpoveď testovaného modeluPre tento archivovaný cyklus sa nezachovala presná odpoveď modelu.
Verdikt sudcu: CORRECTHlásená dôvera: 100%

Poznámka sudcu: Correctly gives 236B total and 21B activated per token.

K14UNKNOWNvylúčené z prerušenia

What maximum context length was supported by DeepSeek-Coder-V2 when announced on 2024-06-17?

Očakávaná odpoveď128K tokens
Odpoveď testovaného modeluPre tento archivovaný cyklus sa nezachovala presná odpoveď modelu.
Verdikt sudcu: CORRECTHlásená dôvera: 100%

Poznámka sudcu: Matches accepted answer 128K tokens.

K15UNKNOWNvylúčené z prerušenia

Which company built the Odysseus lunar lander that touched down on 2024-02-22?

Očakávaná odpoveďIntuitive Machines
Odpoveď testovaného modeluPre tento archivovaný cyklus sa nezachovala presná odpoveď modelu.
Verdikt sudcu: CORRECTHlásená dôvera: 100%

Poznámka sudcu: Matches accepted answer Intuitive Machines.

K16UNKNOWNvylúčené z prerušenia

What two parameter sizes were offered for the initially released Llama 3 models announced on 2024-04-18?

Očakávaná odpoveď8B and 70B
Odpoveď testovaného modeluPre tento archivovaný cyklus sa nezachovala presná odpoveď modelu.
Verdikt sudcu: CORRECTHlásená dôvera: 100%

Poznámka sudcu: Both initially released sizes match: 8B and 70B.

Pokrytie otázok a výskumné poznámky

Faktické otázky: 16 · Nehodnotené sudcom: 0

Referenčný limit a citácie poskytuje sudca, platforma ich nezávisle nepotvrdzuje. Výskumné poznámky nepenalizujú testovaný model.

Spustite metadáta

Podrobnosti o reprodukovateľnosti

Spustiť IDA57ZK57ERM62N3S1XETMXFKK0X
Benchmarkmodel-verification-single-request-v1.1
sudcagpt-5.6-sol
Požadovaný protokolopenai_chat
Schéma zistenej odozvyLegacy / not recorded
Kompatibilita protokolovMATCH / dedičstvo
Výstup modeluNot recorded
Vstupné tokenyNot recorded
Výstupné tokenyNot recorded
Dokončiť dôvodNot recorded
Stav HTTP200
Vonkajšia latencia28,645 ms
Byty odpovede1,859
SHA-2564c1f5cca4a79a53f28e7f6544bfe08208148d53c85569f50c4132e161da06613
Dôležité obmedzenie

The reference cutoff is the configured judge model's internal-knowledge snapshot for this run, not an independently verified provider attestation. Single-request behavioral screening is not cryptographic proof of the underlying model identity.

Spustite nezávislé overenie

Otestujte si ten istý koncový bod sami alebo si prezrite iné verejné správy predtým, ako sa spoľahnete na inzerovanú identitu modelu.