← Registre públic de verificaciómodel-verification-single-request-v1.1
Informe públic de verificació del model d'IA

deepseek-v4-flash

https://api.model-gate.com/v1/chat/completions

openai_chatgpt-5.6-solSep 6, 2026 09:53 UTC
Nivell de qualitat heretat100/100
PLAUSIBLE60% confiança en l'avaluació
Informe permanenthttps://model-gate.com/ca/model-verification/results/A57ZK57ERM62N3S1XETMXFKK0X
Telegram ↗X ↗
Recordatori de fets100
Recentitat del coneixement100
Resistència a les al·lucinacions100
Calibració100
Model reivindicatdeepseek-v4-flash
Model resolt pel jutgedeepseek-v4-flashUNKNOWN
Amfitrió del punt finalapi.model-gate.com
Camp del model de resposta externadeepseek-v4-flash
Anàlisi del jutge

Per què aquesta verificació va rebre el seu resultat

L'informe públic reflecteix l'evidència analítica mostrada al verificador després de /chat/verify. Les puntuacions dels jutges són avaluacions de rúbrica; només les respostes RECALL explícites correctes o incorrectes poden influir en el límit de tall de record pur.

Diagnòstic de la conducta

Justificació de la puntuació del jutge

4 diagnòstics
Recordatori de fets100/100

No es va retenir cap justificació de jutge independent per a aquest resultat arxivat.

Recentitat del coneixement100/100

No es va retenir cap justificació de jutge independent per a aquest resultat arxivat.

Resistència a les al·lucinacions100/100

No es va retenir cap justificació de jutge independent per a aquest resultat arxivat.

Calibració100/100

No es va retenir cap justificació de jutge independent per a aquest resultat arxivat.

Nota de referència històrica: aquesta puntuació global de la v1.4 arxivada utilitzava l'anterior agregació de diagnòstic fix. Es conserva per a la seva reproductibilitat i no s'ha d'interpretar com una puntuació de concordança del model v1.5.

Evidència temporal

Línia de temps de record pur

0 Sondes RECALL

El conjunt de preguntes real es va barrejar abans de la sol·licitud del model provat. Els espais de generació que falten no són abstencions de model. La línia de temps reconstrueix els mesos objectiu per a la seva auditabilitat. Només les respostes RECALL explícites són proves de tall; INFERÈNCIA, ENDEVINA i DESCONEGUT romanen visibles però no mouen el límit.

La cronologia mensual no està disponible per a aquest resultat de referència arxivat.
RECOLLIDA correcta RECORD equivocat~ INFERENCE GUESS? UNKNOWN
0RECALL
0INFERENCE
0GUESS
0UNKNOWN
0RECOLLIDA correcta
0RECORD equivocat
Comparació temporal

Comparació de talls de coneixement

UNKNOWN
Tall de referènciaUNKNOWNUNKNOWN · 0%
L'últim RECALL compatible0 respostes RECALL elegibles
Límit observatProves de RECALL insuficientsINSUFFICIENT_RECALL_EVIDENCE
Alineació de tallUNKNOWN0% confiança
Notes del jutge
  • All Class A items are correct through June 2024, establishing an observed lower bound but no upper bound.
  • The immutable reference snapshot has no known cutoff dates, so cutoff alignment cannot be scored.

Semàntica: correcte 16 · malament 0 · desconegut 0. Exclòs del tall: 0.

Identitat de comportament

Senyals d'identitat

PLAUSIBLE · 60%

La identitat es dedueix de la coherència entre el model reivindicat i el perfil de coneixement/resposta observat. És una prova, no una certificació remota o una prova criptogràfica dels pesos de la porció.

Senyals positius

  • Perfect performance across all supplied Class A recall items.
  • Correct recall of multiple DeepSeek model releases and specifications.
  • No systematic early knowledge failures.

Senyals negatius

  • No documented canonical identity or cutoff is available in the reference snapshot.
  • Cutoff consistency cannot be evaluated.
  • Self-report and matching API metadata are weak identity evidence.
Justificació de la identitat del jutge
  • The response is fully correct on all 16 strong-recall questions, including the DeepSeek-specific history items.
  • The observed knowledge extends through June 2024, but the reference cutoff is unknown and therefore provides no identity-comparison signal.
  • The claimed name and API identifier agree, but both are untrusted metadata and do not prove model identity.
Resposta del model provat

Text model extret textualment

Resum arxivat

Aquesta execució és anterior a la retenció d'informes complets activats. El repte, la clau de respostes i l'avaluació normalitzada del jutge estan disponibles, però el text de resposta exacte del model provat va ser descartat intencionadament per aquesta política de privadesa de l'era de referència.

Llistat complet de referència

Evidència pregunta per pregunta

Totes les preguntes admeses es mostren amb la resposta esperada, la font disponible, la base del model provat, el veredicte semàntic i l'elegibilitat de tall. Les preguntes no qualificades no són abstencions model. Una CONDECINA o INFERÈNCIA correcta segueix sent correcta semànticament, però s'exclou de l'evidència de tall de record pur.

K01UNKNOWNexclòs del tall

Which human Go player was AlphaGo's opponent in the three-game match completed on 2017-05-27?

Resposta esperadaKe Jie
Resposta del model provatNo s'ha conservat la resposta exacta del model per a aquesta execució arxivada.
Sentència del jutge: CORRECTConfiança informada: 100%

Nota del jutge: Matches accepted answer Ke Jie.

K02UNKNOWNexclòs del tall

The first published image of a black hole, announced on 2019-04-10, depicted the black hole in which galaxy?

Resposta esperadaMessier 87
Resposta del model provatNo s'ha conservat la resposta exacta del model per a aquesta execució arxivada.
Sentència del jutge: CORRECTConfiança informada: 100%

Nota del jutge: M87 galaxy is semantically equivalent to Messier 87.

K03UNKNOWNexclòs del tall

Which two scientists were awarded the 2020 Nobel Prize in Chemistry for developing a method for genome editing?

Resposta esperadaEmmanuelle Charpentier and Jennifer A. Doudna
Resposta del model provatNo s'ha conservat la resposta exacta del model per a aquesta execució arxivada.
Sentència del jutge: CORRECTConfiança informada: 100%

Nota del jutge: Both required scientists are correctly named.

K04UNKNOWNexclòs del tall

Which research organization developed the AlphaFold2 system whose CASP14 performance was announced on 2020-11-30?

Resposta esperadaDeepMind
Resposta del model provatNo s'ha conservat la resposta exacta del model per a aquesta execució arxivada.
Sentència del jutge: CORRECTConfiança informada: 100%

Nota del jutge: Matches accepted answer DeepMind.

K05UNKNOWNexclòs del tall

Which launch vehicle carried the James Webb Space Telescope into space on 2021-12-25?

Resposta esperadaAriane 5
Resposta del model provatNo s'ha conservat la resposta exacta del model per a aquesta execució arxivada.
Sentència del jutge: CORRECTConfiança informada: 100%

Nota del jutge: Matches accepted answer Ariane 5.

K06UNKNOWNexclòs del tall

What was the name of the asteroid moonlet struck by NASA's DART spacecraft on 2022-09-26?

Resposta esperadaDimorphos
Resposta del model provatNo s'ha conservat la resposta exacta del model per a aquesta execució arxivada.
Sentència del jutge: CORRECTConfiança informada: 100%

Nota del jutge: Matches accepted answer Dimorphos.

K07UNKNOWNexclòs del tall

In which ocean did the Artemis I Orion capsule splash down on 2022-12-11?

Resposta esperadaPacific Ocean
Resposta del model provatNo s'ha conservat la resposta exacta del model per a aquesta execució arxivada.
Sentència del jutge: CORRECTConfiança informada: 100%

Nota del jutge: Matches accepted answer Pacific Ocean.

K08UNKNOWNexclòs del tall

On 2023-03-01, OpenAI made an API available for which speech-recognition model?

Resposta esperadaWhisper
Resposta del model provatNo s'ha conservat la resposta exacta del model per a aquesta execució arxivada.
Sentència del jutge: CORRECTConfiança informada: 100%

Nota del jutge: Matches accepted answer Whisper.

K09UNKNOWNexclòs del tall

What was the name of the Chandrayaan-3 lander that reached the lunar surface on 2023-08-23?

Resposta esperadaVikram
Resposta del model provatNo s'ha conservat la resposta exacta del model per a aquesta execució arxivada.
Sentència del jutge: CORRECTConfiança informada: 100%

Nota del jutge: Matches accepted answer Vikram.

K10UNKNOWNexclòs del tall

Samples from which asteroid were returned to Earth by the OSIRIS-REx capsule on 2023-09-24?

Resposta esperadaBennu
Resposta del model provatNo s'ha conservat la resposta exacta del model per a aquesta execució arxivada.
Sentència del jutge: CORRECTConfiança informada: 100%

Nota del jutge: Matches accepted answer Bennu.

K11UNKNOWNexclòs del tall

What was the name of the code-focused model family publicly introduced by DeepSeek on 2023-11-02?

Resposta esperadaDeepSeek Coder
Resposta del model provatNo s'ha conservat la resposta exacta del model per a aquesta execució arxivada.
Sentència del jutge: CORRECTConfiança informada: 100%

Nota del jutge: DeepSeek-Coder is an accepted spelling.

K12UNKNOWNexclòs del tall

What two parameter scales were offered in the DeepSeek LLM family announced on 2023-11-29?

Resposta esperada7B and 67B
Resposta del model provatNo s'ha conservat la resposta exacta del model per a aquesta execució arxivada.
Sentència del jutge: CORRECTConfiança informada: 100%

Nota del jutge: Both parameter scales match: 7B and 67B.

K13UNKNOWNexclòs del tall

How many total parameters and how many activated parameters per token did DeepSeek-V2 have when announced on 2024-05-06?

Resposta esperada236B total parameters and 21B activated parameters per token
Resposta del model provatNo s'ha conservat la resposta exacta del model per a aquesta execució arxivada.
Sentència del jutge: CORRECTConfiança informada: 100%

Nota del jutge: Correctly gives 236B total and 21B activated per token.

K14UNKNOWNexclòs del tall

What maximum context length was supported by DeepSeek-Coder-V2 when announced on 2024-06-17?

Resposta esperada128K tokens
Resposta del model provatNo s'ha conservat la resposta exacta del model per a aquesta execució arxivada.
Sentència del jutge: CORRECTConfiança informada: 100%

Nota del jutge: Matches accepted answer 128K tokens.

K15UNKNOWNexclòs del tall

Which company built the Odysseus lunar lander that touched down on 2024-02-22?

Resposta esperadaIntuitive Machines
Resposta del model provatNo s'ha conservat la resposta exacta del model per a aquesta execució arxivada.
Sentència del jutge: CORRECTConfiança informada: 100%

Nota del jutge: Matches accepted answer Intuitive Machines.

K16UNKNOWNexclòs del tall

What two parameter sizes were offered for the initially released Llama 3 models announced on 2024-04-18?

Resposta esperada8B and 70B
Resposta del model provatNo s'ha conservat la resposta exacta del model per a aquesta execució arxivada.
Sentència del jutge: CORRECTConfiança informada: 100%

Nota del jutge: Both initially released sizes match: 8B and 70B.

Cobertura de preguntes i notes de recerca

Preguntes de fet: 16 · No qualificat pel jutge: 0

El tall de referència i les citacions són proporcionades pel jutge, no confirmades de manera independent per la plataforma. Les notes de recerca no penalitzen el model provat.

Executeu metadades

Detalls de reproductibilitat

ID d'execucióA57ZK57ERM62N3S1XETMXFKK0X
Referentmodel-verification-single-request-v1.1
Jutgegpt-5.6-sol
Protocol sol·licitatopenai_chat
Esquema de resposta detectatLegacy / not recorded
Compatibilitat de protocolsPARTIT / llegat
Sortida del modelNot recorded
Fitxes d'entradaNot recorded
Fitxes de sortidaNot recorded
Acaba la raóNot recorded
Estat HTTP200
Latència externa28,645 ms
Bytes de resposta1,859
SHA-2564c1f5cca4a79a53f28e7f6544bfe08208148d53c85569f50c4132e161da06613
Limitació important

The reference cutoff is the configured judge model's internal-knowledge snapshot for this run, not an independently verified provider attestation. Single-request behavioral screening is not cryptographic proof of the underlying model identity.

Executeu una verificació independent

Proveu vosaltres mateixos el mateix punt final o navegueu per altres informes públics abans de confiar en una identitat de model anunciada.