← Registrul public de verificaremodel-verification-single-request-v1.1
Raport public de verificare a modelului AI

deepseek-v4-flash

https://api.model-gate.com/v1/chat/completions

openai_chatgpt-5.6-solSep 6, 2026 09:53 UTC
Scorul de calitate vechi100/100
PLAUSIBLE60% încrederea în evaluare
Raport permanenthttps://model-gate.com/ro/model-verification/results/A57ZK57ERM62N3S1XETMXFKK0X
Telegram ↗X ↗
Rechemarea faptelor100
Recentitatea cunoștințelor100
Rezistenta la halucinatii100
Calibrare100
Model revendicatdeepseek-v4-flash
Model rezolvat de judecătordeepseek-v4-flashUNKNOWN
Gazdă punct finalapi.model-gate.com
Câmpul modelului de răspuns externdeepseek-v4-flash
Analiza judecătorilor

De ce a primit rezultatul acestei verificări

Raportul public reflectă dovezile analitice prezentate testatorului după /chat/verify. Scorurile judecătorilor sunt evaluări rubrica; numai răspunsurile RECALL explicite, corecte sau greșite, pot influența limita limită de rechemare pură.

Diagnosticarea comportamentului

Motivul punctajului judecătorului

4 diagnostice
Rechemarea faptelor100/100

Nu s-a reținut nicio justificare separată a judecătorului pentru acest rezultat arhivat.

Recentitatea cunoștințelor100/100

Nu s-a reținut nicio justificare separată a judecătorului pentru acest rezultat arhivat.

Rezistenta la halucinatii100/100

Nu s-a reținut nicio justificare separată a judecătorului pentru acest rezultat arhivat.

Calibrare100/100

Nu s-a reținut nicio justificare separată a judecătorului pentru acest rezultat arhivat.

Notă de referință istorică: acest scor general arhivat v1.4 a folosit fosta agregare fixă ​​de diagnosticare. Este păstrat pentru reproductibilitate și nu trebuie interpretat ca un scor de potrivire a modelului v1.5.

Dovezi temporale

Cronologie pură de reamintire

0 Sondele RECALL

Setul real de întrebări a fost amestecat înainte de solicitarea modelului testat. Sloturile de generație lipsă nu sunt abțineri de model. Cronologia reconstruiește lunile țintă pentru auditabilitate. Doar răspunsurile RECALL explicite sunt dovezi tăiate; INFERENȚĂ, GHICI și NECUNOSCUT rămân vizibile, dar nu mută granița.

Cronologia lunară nu este disponibilă pentru acest rezultat de referință arhivat.
RECALL corect REAMINARE greșită~ INFERENCE GUESS? UNKNOWN
0RECALL
0INFERENCE
0GUESS
0UNKNOWN
0RECALL corect
0REAMINARE greșită
Comparație temporală

Compararea limitelor de cunoștințe

UNKNOWN
Limită de referințăUNKNOWNUNKNOWN · 0%
Cel mai recent RECALL acceptat0 răspunsuri eligibile RECALL
Limită respectatăDovezi RECALL insuficienteINSUFFICIENT_RECALL_EVIDENCE
Cutoff AlignmentUNKNOWN0% încredere
Judecătorul notează
  • All Class A items are correct through June 2024, establishing an observed lower bound but no upper bound.
  • The immutable reference snapshot has no known cutoff dates, so cutoff alignment cannot be scored.

Semantic: corecta 16 · greşit 0 · necunoscut 0. Exclus din cutoff: 0.

Identitatea comportamentală

Semnale de identitate

PLAUSIBLE · 60%

Identitatea este dedusă din coerența dintre modelul revendicat și profilul de cunoștințe/răspuns observat. Este o dovadă, nu o atestare de la distanță sau o dovadă criptografică a greutăților porției.

Semnale pozitive

  • Perfect performance across all supplied Class A recall items.
  • Correct recall of multiple DeepSeek model releases and specifications.
  • No systematic early knowledge failures.

Semnale negative

  • No documented canonical identity or cutoff is available in the reference snapshot.
  • Cutoff consistency cannot be evaluated.
  • Self-report and matching API metadata are weak identity evidence.
Raționamentul identității judecătorului
  • The response is fully correct on all 16 strong-recall questions, including the DeepSeek-specific history items.
  • The observed knowledge extends through June 2024, but the reference cutoff is unknown and therefore provides no identity-comparison signal.
  • The claimed name and API identifier agree, but both are untrusted metadata and do not prove model identity.
Răspunsul modelului testat

Text model extras literal

Rezumat arhivat

Această rulare este anterioară reținerii rapoartelor complete pentru înscriere. Provocarea, cheia de răspuns și evaluarea normalizată a judecătorului sunt disponibile, dar textul de răspuns exact al modelului testat a fost eliminat în mod intenționat de acea politică de confidențialitate a epocii de referință.

Lista completă a benchmark-ului

Dovezi întrebare cu întrebare

Toate întrebările admise sunt afișate cu răspunsul așteptat, sursa disponibilă, baza modelului testat, verdictul semantic și eligibilitatea limită. Întrebările negradate nu sunt abțineri model. O PRECIZARE sau INFERENȚĂ corectă rămâne corectă din punct de vedere semantic, dar este exclusă din dovezile de reducere a reamintirii.

K01UNKNOWNexclus din cutoff

Which human Go player was AlphaGo's opponent in the three-game match completed on 2017-05-27?

Răspuns așteptatKe Jie
Răspuns model testatRăspunsul exact al modelului nu a fost reținut pentru această rulare arhivată.
Verdictul judecătorului: CORRECTÎncrederea raportată: 100%

Nota judecătorului: Matches accepted answer Ke Jie.

K02UNKNOWNexclus din cutoff

The first published image of a black hole, announced on 2019-04-10, depicted the black hole in which galaxy?

Răspuns așteptatMessier 87
Răspuns model testatRăspunsul exact al modelului nu a fost reținut pentru această rulare arhivată.
Verdictul judecătorului: CORRECTÎncrederea raportată: 100%

Nota judecătorului: M87 galaxy is semantically equivalent to Messier 87.

K03UNKNOWNexclus din cutoff

Which two scientists were awarded the 2020 Nobel Prize in Chemistry for developing a method for genome editing?

Răspuns așteptatEmmanuelle Charpentier and Jennifer A. Doudna
Răspuns model testatRăspunsul exact al modelului nu a fost reținut pentru această rulare arhivată.
Verdictul judecătorului: CORRECTÎncrederea raportată: 100%

Nota judecătorului: Both required scientists are correctly named.

K04UNKNOWNexclus din cutoff

Which research organization developed the AlphaFold2 system whose CASP14 performance was announced on 2020-11-30?

Răspuns așteptatDeepMind
Răspuns model testatRăspunsul exact al modelului nu a fost reținut pentru această rulare arhivată.
Verdictul judecătorului: CORRECTÎncrederea raportată: 100%

Nota judecătorului: Matches accepted answer DeepMind.

K05UNKNOWNexclus din cutoff

Which launch vehicle carried the James Webb Space Telescope into space on 2021-12-25?

Răspuns așteptatAriane 5
Răspuns model testatRăspunsul exact al modelului nu a fost reținut pentru această rulare arhivată.
Verdictul judecătorului: CORRECTÎncrederea raportată: 100%

Nota judecătorului: Matches accepted answer Ariane 5.

K06UNKNOWNexclus din cutoff

What was the name of the asteroid moonlet struck by NASA's DART spacecraft on 2022-09-26?

Răspuns așteptatDimorphos
Răspuns model testatRăspunsul exact al modelului nu a fost reținut pentru această rulare arhivată.
Verdictul judecătorului: CORRECTÎncrederea raportată: 100%

Nota judecătorului: Matches accepted answer Dimorphos.

K07UNKNOWNexclus din cutoff

In which ocean did the Artemis I Orion capsule splash down on 2022-12-11?

Răspuns așteptatPacific Ocean
Răspuns model testatRăspunsul exact al modelului nu a fost reținut pentru această rulare arhivată.
Verdictul judecătorului: CORRECTÎncrederea raportată: 100%

Nota judecătorului: Matches accepted answer Pacific Ocean.

K08UNKNOWNexclus din cutoff

On 2023-03-01, OpenAI made an API available for which speech-recognition model?

Răspuns așteptatWhisper
Răspuns model testatRăspunsul exact al modelului nu a fost reținut pentru această rulare arhivată.
Verdictul judecătorului: CORRECTÎncrederea raportată: 100%

Nota judecătorului: Matches accepted answer Whisper.

K09UNKNOWNexclus din cutoff

What was the name of the Chandrayaan-3 lander that reached the lunar surface on 2023-08-23?

Răspuns așteptatVikram
Răspuns model testatRăspunsul exact al modelului nu a fost reținut pentru această rulare arhivată.
Verdictul judecătorului: CORRECTÎncrederea raportată: 100%

Nota judecătorului: Matches accepted answer Vikram.

K10UNKNOWNexclus din cutoff

Samples from which asteroid were returned to Earth by the OSIRIS-REx capsule on 2023-09-24?

Răspuns așteptatBennu
Răspuns model testatRăspunsul exact al modelului nu a fost reținut pentru această rulare arhivată.
Verdictul judecătorului: CORRECTÎncrederea raportată: 100%

Nota judecătorului: Matches accepted answer Bennu.

K11UNKNOWNexclus din cutoff

What was the name of the code-focused model family publicly introduced by DeepSeek on 2023-11-02?

Răspuns așteptatDeepSeek Coder
Răspuns model testatRăspunsul exact al modelului nu a fost reținut pentru această rulare arhivată.
Verdictul judecătorului: CORRECTÎncrederea raportată: 100%

Nota judecătorului: DeepSeek-Coder is an accepted spelling.

K12UNKNOWNexclus din cutoff

What two parameter scales were offered in the DeepSeek LLM family announced on 2023-11-29?

Răspuns așteptat7B and 67B
Răspuns model testatRăspunsul exact al modelului nu a fost reținut pentru această rulare arhivată.
Verdictul judecătorului: CORRECTÎncrederea raportată: 100%

Nota judecătorului: Both parameter scales match: 7B and 67B.

K13UNKNOWNexclus din cutoff

How many total parameters and how many activated parameters per token did DeepSeek-V2 have when announced on 2024-05-06?

Răspuns așteptat236B total parameters and 21B activated parameters per token
Răspuns model testatRăspunsul exact al modelului nu a fost reținut pentru această rulare arhivată.
Verdictul judecătorului: CORRECTÎncrederea raportată: 100%

Nota judecătorului: Correctly gives 236B total and 21B activated per token.

K14UNKNOWNexclus din cutoff

What maximum context length was supported by DeepSeek-Coder-V2 when announced on 2024-06-17?

Răspuns așteptat128K tokens
Răspuns model testatRăspunsul exact al modelului nu a fost reținut pentru această rulare arhivată.
Verdictul judecătorului: CORRECTÎncrederea raportată: 100%

Nota judecătorului: Matches accepted answer 128K tokens.

K15UNKNOWNexclus din cutoff

Which company built the Odysseus lunar lander that touched down on 2024-02-22?

Răspuns așteptatIntuitive Machines
Răspuns model testatRăspunsul exact al modelului nu a fost reținut pentru această rulare arhivată.
Verdictul judecătorului: CORRECTÎncrederea raportată: 100%

Nota judecătorului: Matches accepted answer Intuitive Machines.

K16UNKNOWNexclus din cutoff

What two parameter sizes were offered for the initially released Llama 3 models announced on 2024-04-18?

Răspuns așteptat8B and 70B
Răspuns model testatRăspunsul exact al modelului nu a fost reținut pentru această rulare arhivată.
Verdictul judecătorului: CORRECTÎncrederea raportată: 100%

Nota judecătorului: Both initially released sizes match: 8B and 70B.

Acoperirea întrebărilor și note de cercetare

Întrebări de fapt: 16 · Nu este notat de judecător: 0

Limitele de referință și citările sunt furnizate de judecător, nu confirmate independent de platformă. Notele cercetării nu penalizează modelul testat.

Rulați metadate

Detalii de reproductibilitate

Run IDA57ZK57ERM62N3S1XETMXFKK0X
Benchmarkmodel-verification-single-request-v1.1
Judecătorgpt-5.6-sol
Protocolul solicitatopenai_chat
Schema de răspuns detectatăLegacy / not recorded
Compatibilitate protocolMECI / moștenire
Ieșire modelNot recorded
Jetoane de intrareNot recorded
Jetoane de ieșireNot recorded
Termină motivulNot recorded
Stare HTTP200
Latența externă28,645 ms
Octeți de răspuns1,859
SHA-2564c1f5cca4a79a53f28e7f6544bfe08208148d53c85569f50c4132e161da06613
Limitare importantă

The reference cutoff is the configured judge model's internal-knowledge snapshot for this run, not an independently verified provider attestation. Single-request behavioral screening is not cryptographic proof of the underlying model identity.

Efectuați o verificare independentă

Testați singur același punct final sau răsfoiți alte rapoarte publice înainte de a vă baza pe o identitate de model promovată.