← Registro público de verificaciónmodel-verification-single-request-v1.1
Informe de verificación del modelo público de IA

deepseek-v4-flash

https://api.model-gate.com/v1/chat/completions

openai_chatgpt-5.6-solSep 6, 2026 09:53 UTC
Puntuación de calidad heredada100/100
PLAUSIBLE60% confianza en la evaluación
Informe permanentehttps://model-gate.com/es/model-verification/results/A57ZK57ERM62N3S1XETMXFKK0X
Telegram ↗X ↗
Recuerdo de hechos100
Conocimiento reciente100
Resistencia a las alucinaciones100
Calibración100
modelo reclamadodeepseek-v4-flash
Modelo resuelto por juezdeepseek-v4-flashUNKNOWN
Host de punto finalapi.model-gate.com
Campo del modelo de respuesta externadeepseek-v4-flash
Análisis del juez

¿Por qué esta verificación recibió su resultado?

El informe público refleja la evidencia analítica que se muestra al evaluador después de /chat/verify. Las puntuaciones de los jueces son evaluaciones de rúbricas; sólo las respuestas RECALL explícitas, correctas o incorrectas, pueden influir en el límite de recuperación pura.

Diagnóstico de comportamiento

Justificación de la puntuación del juez

4 diagnósticos
Recuerdo de hechos100/100

No se mantuvo ninguna justificación del juez por separado para este resultado archivado.

Conocimiento reciente100/100

No se mantuvo ninguna justificación del juez por separado para este resultado archivado.

Resistencia a las alucinaciones100/100

No se mantuvo ninguna justificación del juez por separado para este resultado archivado.

Calibración100/100

No se mantuvo ninguna justificación del juez por separado para este resultado archivado.

Nota de referencia histórica: esta puntuación general archivada v1.4 utilizó la agregación de diagnóstico fija anterior. Se conserva para fines de reproducibilidad y no debe interpretarse como una puntuación de Model Match v1.5.

evidencia temporal

Cronología de recuerdo puro

0 RECUPERAR sondas

El conjunto de preguntas real se barajó antes de la solicitud del modelo probado. Los espacios de generación que faltan no son abstenciones modelo. El cronograma reconstruye los meses objetivo para la auditabilidad. Sólo las respuestas RECALL explícitas son evidencia de corte; INFERENCIA, ADIVINAR y DESCONOCIDO permanecen visibles pero no mueven el límite.

El cronograma mensual no está disponible para este resultado de referencia archivado.
RECUERDE correcto RECUERDO incorrecto~ INFERENCE GUESS? UNKNOWN
0RECALL
0INFERENCE
0GUESS
0UNKNOWN
0RECUERDE correcto
0RECUERDO incorrecto
Comparación temporal

Comparación de límites de conocimiento

UNKNOWN
Corte de referenciaUNKNOWNUNKNOWN · 0%
Último RECUERDO soportado0 RECUPERAR respuestas elegibles
Límite observadoEvidencia de RECUPERACIÓN insuficienteINSUFFICIENT_RECALL_EVIDENCE
Alineación de corteUNKNOWN0% confianza
notas del juez
  • All Class A items are correct through June 2024, establishing an observed lower bound but no upper bound.
  • The immutable reference snapshot has no known cutoff dates, so cutoff alignment cannot be scored.

Semántico: correcto 16 · equivocado 0 · desconocido 0. Excluido del límite: 0.

Identidad conductual

Señales de identidad

PLAUSIBLE · 60%

La identidad se infiere de la coherencia entre el modelo reivindicado y el perfil de conocimiento/respuesta observado. Es una evidencia, no una certificación remota o una prueba criptográfica de los pesos de las porciones.

Señales positivas

  • Perfect performance across all supplied Class A recall items.
  • Correct recall of multiple DeepSeek model releases and specifications.
  • No systematic early knowledge failures.

Señales negativas

  • No documented canonical identity or cutoff is available in the reference snapshot.
  • Cutoff consistency cannot be evaluated.
  • Self-report and matching API metadata are weak identity evidence.
Justificación de la identidad del juez
  • The response is fully correct on all 16 strong-recall questions, including the DeepSeek-specific history items.
  • The observed knowledge extends through June 2024, but the reference cutoff is unknown and therefore provides no identity-comparison signal.
  • The claimed name and API identifier agree, but both are untrusted metadata and do not prove model identity.
Respuesta del modelo probado

Texto del modelo extraído palabra por palabra

Resumen archivado

Esta ejecución es anterior a la retención voluntaria del informe completo. El desafío, la clave de respuestas y la evaluación del juez normalizada están disponibles, pero el texto exacto de la respuesta del modelo probado fue descartado intencionalmente por esa política de privacidad de la era de los puntos de referencia.

Listado completo de referencias

Evidencia pregunta por pregunta

Todas las preguntas admitidas se muestran con la respuesta esperada, la fuente disponible, la base del modelo probado, el veredicto semántico y el límite de elegibilidad. Las preguntas sin calificación no son abstenciones modelo. Una CONDICIÓN o INFERENCIA correcta sigue siendo semánticamente correcta, pero se excluye de la evidencia de corte de recuerdo puro.

K01UNKNOWNexcluido del corte

Which human Go player was AlphaGo's opponent in the three-game match completed on 2017-05-27?

Respuesta esperadaKe Jie
Respuesta del modelo probadoNo se conservó la respuesta exacta del modelo para esta ejecución archivada.
veredicto del juez: CORRECTConfianza reportada: 100%

nota del juez: Matches accepted answer Ke Jie.

K02UNKNOWNexcluido del corte

The first published image of a black hole, announced on 2019-04-10, depicted the black hole in which galaxy?

Respuesta esperadaMessier 87
Respuesta del modelo probadoNo se conservó la respuesta exacta del modelo para esta ejecución archivada.
veredicto del juez: CORRECTConfianza reportada: 100%

nota del juez: M87 galaxy is semantically equivalent to Messier 87.

K03UNKNOWNexcluido del corte

Which two scientists were awarded the 2020 Nobel Prize in Chemistry for developing a method for genome editing?

Respuesta esperadaEmmanuelle Charpentier and Jennifer A. Doudna
Respuesta del modelo probadoNo se conservó la respuesta exacta del modelo para esta ejecución archivada.
veredicto del juez: CORRECTConfianza reportada: 100%

nota del juez: Both required scientists are correctly named.

K04UNKNOWNexcluido del corte

Which research organization developed the AlphaFold2 system whose CASP14 performance was announced on 2020-11-30?

Respuesta esperadaDeepMind
Respuesta del modelo probadoNo se conservó la respuesta exacta del modelo para esta ejecución archivada.
veredicto del juez: CORRECTConfianza reportada: 100%

nota del juez: Matches accepted answer DeepMind.

K05UNKNOWNexcluido del corte

Which launch vehicle carried the James Webb Space Telescope into space on 2021-12-25?

Respuesta esperadaAriane 5
Respuesta del modelo probadoNo se conservó la respuesta exacta del modelo para esta ejecución archivada.
veredicto del juez: CORRECTConfianza reportada: 100%

nota del juez: Matches accepted answer Ariane 5.

K06UNKNOWNexcluido del corte

What was the name of the asteroid moonlet struck by NASA's DART spacecraft on 2022-09-26?

Respuesta esperadaDimorphos
Respuesta del modelo probadoNo se conservó la respuesta exacta del modelo para esta ejecución archivada.
veredicto del juez: CORRECTConfianza reportada: 100%

nota del juez: Matches accepted answer Dimorphos.

K07UNKNOWNexcluido del corte

In which ocean did the Artemis I Orion capsule splash down on 2022-12-11?

Respuesta esperadaPacific Ocean
Respuesta del modelo probadoNo se conservó la respuesta exacta del modelo para esta ejecución archivada.
veredicto del juez: CORRECTConfianza reportada: 100%

nota del juez: Matches accepted answer Pacific Ocean.

K08UNKNOWNexcluido del corte

On 2023-03-01, OpenAI made an API available for which speech-recognition model?

Respuesta esperadaWhisper
Respuesta del modelo probadoNo se conservó la respuesta exacta del modelo para esta ejecución archivada.
veredicto del juez: CORRECTConfianza reportada: 100%

nota del juez: Matches accepted answer Whisper.

K09UNKNOWNexcluido del corte

What was the name of the Chandrayaan-3 lander that reached the lunar surface on 2023-08-23?

Respuesta esperadaVikram
Respuesta del modelo probadoNo se conservó la respuesta exacta del modelo para esta ejecución archivada.
veredicto del juez: CORRECTConfianza reportada: 100%

nota del juez: Matches accepted answer Vikram.

K10UNKNOWNexcluido del corte

Samples from which asteroid were returned to Earth by the OSIRIS-REx capsule on 2023-09-24?

Respuesta esperadaBennu
Respuesta del modelo probadoNo se conservó la respuesta exacta del modelo para esta ejecución archivada.
veredicto del juez: CORRECTConfianza reportada: 100%

nota del juez: Matches accepted answer Bennu.

K11UNKNOWNexcluido del corte

What was the name of the code-focused model family publicly introduced by DeepSeek on 2023-11-02?

Respuesta esperadaDeepSeek Coder
Respuesta del modelo probadoNo se conservó la respuesta exacta del modelo para esta ejecución archivada.
veredicto del juez: CORRECTConfianza reportada: 100%

nota del juez: DeepSeek-Coder is an accepted spelling.

K12UNKNOWNexcluido del corte

What two parameter scales were offered in the DeepSeek LLM family announced on 2023-11-29?

Respuesta esperada7B and 67B
Respuesta del modelo probadoNo se conservó la respuesta exacta del modelo para esta ejecución archivada.
veredicto del juez: CORRECTConfianza reportada: 100%

nota del juez: Both parameter scales match: 7B and 67B.

K13UNKNOWNexcluido del corte

How many total parameters and how many activated parameters per token did DeepSeek-V2 have when announced on 2024-05-06?

Respuesta esperada236B total parameters and 21B activated parameters per token
Respuesta del modelo probadoNo se conservó la respuesta exacta del modelo para esta ejecución archivada.
veredicto del juez: CORRECTConfianza reportada: 100%

nota del juez: Correctly gives 236B total and 21B activated per token.

K14UNKNOWNexcluido del corte

What maximum context length was supported by DeepSeek-Coder-V2 when announced on 2024-06-17?

Respuesta esperada128K tokens
Respuesta del modelo probadoNo se conservó la respuesta exacta del modelo para esta ejecución archivada.
veredicto del juez: CORRECTConfianza reportada: 100%

nota del juez: Matches accepted answer 128K tokens.

K15UNKNOWNexcluido del corte

Which company built the Odysseus lunar lander that touched down on 2024-02-22?

Respuesta esperadaIntuitive Machines
Respuesta del modelo probadoNo se conservó la respuesta exacta del modelo para esta ejecución archivada.
veredicto del juez: CORRECTConfianza reportada: 100%

nota del juez: Matches accepted answer Intuitive Machines.

K16UNKNOWNexcluido del corte

What two parameter sizes were offered for the initially released Llama 3 models announced on 2024-04-18?

Respuesta esperada8B and 70B
Respuesta del modelo probadoNo se conservó la respuesta exacta del modelo para esta ejecución archivada.
veredicto del juez: CORRECTConfianza reportada: 100%

nota del juez: Both initially released sizes match: 8B and 70B.

Cobertura de preguntas y notas de investigación.

Preguntas fácticas: 16 · No calificado por el juez: 0

El corte de referencia y las citas son proporcionadas por el juez, no confirmadas de forma independiente por la plataforma. Las notas de investigación no penalizan el modelo probado.

Ejecutar metadatos

Detalles de reproducibilidad

ID de ejecuciónA57ZK57ERM62N3S1XETMXFKK0X
Punto de referenciamodel-verification-single-request-v1.1
Juezgpt-5.6-sol
Protocolo solicitadoopenai_chat
Esquema de respuesta detectadoLegacy / not recorded
Compatibilidad de protocoloPARTIDO / legado
Salida del modeloNot recorded
Fichas de entradaNot recorded
Fichas de salidaNot recorded
Finalizar motivoNot recorded
Estado HTTP200
Latencia externa28,645 ms
Bytes de respuesta1,859
SHA-2564c1f5cca4a79a53f28e7f6544bfe08208148d53c85569f50c4132e161da06613
Limitación importante

The reference cutoff is the configured judge model's internal-knowledge snapshot for this run, not an independently verified provider attestation. Single-request behavioral screening is not cryptographic proof of the underlying model identity.

Ejecute una verificación independiente

Pruebe usted mismo el mismo punto final o explore otros informes públicos antes de confiar en una identidad de modelo anunciada.