← Registro de verificação públicamodel-verification-single-request-v1.1
Relatório de verificação de modelo de IA pública

deepseek-v4-flash

https://api.model-gate.com/v1/chat/completions

openai_chatgpt-5.6-solSep 6, 2026 09:53 UTC
Índice de qualidade legado100/100
PLAUSIBLE60% confiança na avaliação
Relatório permanentehttps://model-gate.com/pt/model-verification/results/A57ZK57ERM62N3S1XETMXFKK0X
Telegram ↗X ↗
Recordação factual100
Recenticidade do Conhecimento100
Resistência à Alucinação100
Calibração100
Modelo reivindicadodeepseek-v4-flash
Modelo resolvido pelo juizdeepseek-v4-flashUNKNOWN
Host de ponto finalapi.model-gate.com
Campo do modelo de resposta externadeepseek-v4-flash
Análise do juiz

Por que esta verificação recebeu seu resultado

O relatório público reflete a evidência analítica mostrada ao testador após /chat/verify. As pontuações dos juízes são avaliações de rubricas; apenas respostas RECALL corretas ou erradas explícitas podem influenciar o limite de corte de recordação pura.

Diagnóstico de comportamento

Justificativa de pontuação do juiz

4 diagnósticos
Recordação factual100/100

Nenhuma justificativa separada do juiz foi mantida para este resultado arquivado.

Recenticidade do Conhecimento100/100

Nenhuma justificativa separada do juiz foi mantida para este resultado arquivado.

Resistência à Alucinação100/100

Nenhuma justificativa separada do juiz foi mantida para este resultado arquivado.

Calibração100/100

Nenhuma justificativa separada do juiz foi mantida para este resultado arquivado.

Nota de referência histórica: esta pontuação geral arquivada da versão 1.4 usou a antiga agregação de diagnóstico fixa. Ela é mantida para fins de reprodutibilidade e não deve ser interpretada como uma pontuação de Model Match v1.5.

Evidência temporal

Linha do tempo de recall puro

0 Sondas RECALL

O conjunto de perguntas real foi embaralhado antes da solicitação do modelo testado. Os slots de geração ausentes não são abstenções modelo. A linha do tempo reconstrói os meses-alvo para auditabilidade. Somente respostas RECALL explícitas são evidências de corte; INFERENCE, GUESS e UNKNOWN permanecem visíveis, mas não movem o limite.

O cronograma mensal não está disponível para este resultado de benchmark arquivado.
RECALL correto RECALL errado~ INFERENCE GUESS? UNKNOWN
0RECALL
0INFERENCE
0GUESS
0UNKNOWN
0RECALL correto
0RECALL errado
Comparação temporal

Comparação de limite de conhecimento

UNKNOWN
Corte de referênciaUNKNOWNUNKNOWN · 0%
RECALL suportado mais recente0 respostas RECALL elegíveis
Limite observadoEvidência de RECALL insuficienteINSUFFICIENT_RECALL_EVIDENCE
Alinhamento de corteUNKNOWN0% confiança
Notas do juiz
  • All Class A items are correct through June 2024, establishing an observed lower bound but no upper bound.
  • The immutable reference snapshot has no known cutoff dates, so cutoff alignment cannot be scored.

Semântica: correto 16 · errado 0 · desconhecido 0. Excluído do corte: 0.

Identidade comportamental

Sinais de identidade

PLAUSIBLE · 60%

A identidade é inferida a partir da consistência entre o modelo reivindicado e o perfil de conhecimento/resposta observado. É uma evidência, não um atestado remoto ou prova criptográfica dos pesos da porção.

Sinais positivos

  • Perfect performance across all supplied Class A recall items.
  • Correct recall of multiple DeepSeek model releases and specifications.
  • No systematic early knowledge failures.

Sinais negativos

  • No documented canonical identity or cutoff is available in the reference snapshot.
  • Cutoff consistency cannot be evaluated.
  • Self-report and matching API metadata are weak identity evidence.
Justificativa de identidade do juiz
  • The response is fully correct on all 16 strong-recall questions, including the DeepSeek-specific history items.
  • The observed knowledge extends through June 2024, but the reference cutoff is unknown and therefore provides no identity-comparison signal.
  • The claimed name and API identifier agree, but both are untrusted metadata and do not prove model identity.
Resposta do modelo testado

Texto do modelo extraído literalmente

Resumo arquivado

Essa execução é anterior à retenção de relatório completo opcional. O desafio, a resposta e a avaliação normalizada do juiz estão disponíveis, mas o texto exato da resposta do modelo testado foi intencionalmente descartado pela política de privacidade da era do benchmark.

Listagem completa de benchmarks

Evidência pergunta por pergunta

Todas as questões admitidas são mostradas com a resposta esperada, fonte disponível, base do modelo testado, veredicto semântico e elegibilidade de corte. Perguntas não avaliadas não são abstenções modelo. Uma GUESS ou INFERENCE correta permanece semanticamente correta, mas é excluída da evidência de corte de recordação pura.

K01UNKNOWNexcluído do corte

Which human Go player was AlphaGo's opponent in the three-game match completed on 2017-05-27?

Resposta esperadaKe Jie
Resposta do modelo testadoA resposta exata do modelo não foi retida para esta execução arquivada.
Veredicto do juiz: CORRECTConfiança relatada: 100%

Nota do juiz: Matches accepted answer Ke Jie.

K02UNKNOWNexcluído do corte

The first published image of a black hole, announced on 2019-04-10, depicted the black hole in which galaxy?

Resposta esperadaMessier 87
Resposta do modelo testadoA resposta exata do modelo não foi retida para esta execução arquivada.
Veredicto do juiz: CORRECTConfiança relatada: 100%

Nota do juiz: M87 galaxy is semantically equivalent to Messier 87.

K03UNKNOWNexcluído do corte

Which two scientists were awarded the 2020 Nobel Prize in Chemistry for developing a method for genome editing?

Resposta esperadaEmmanuelle Charpentier and Jennifer A. Doudna
Resposta do modelo testadoA resposta exata do modelo não foi retida para esta execução arquivada.
Veredicto do juiz: CORRECTConfiança relatada: 100%

Nota do juiz: Both required scientists are correctly named.

K04UNKNOWNexcluído do corte

Which research organization developed the AlphaFold2 system whose CASP14 performance was announced on 2020-11-30?

Resposta esperadaDeepMind
Resposta do modelo testadoA resposta exata do modelo não foi retida para esta execução arquivada.
Veredicto do juiz: CORRECTConfiança relatada: 100%

Nota do juiz: Matches accepted answer DeepMind.

K05UNKNOWNexcluído do corte

Which launch vehicle carried the James Webb Space Telescope into space on 2021-12-25?

Resposta esperadaAriane 5
Resposta do modelo testadoA resposta exata do modelo não foi retida para esta execução arquivada.
Veredicto do juiz: CORRECTConfiança relatada: 100%

Nota do juiz: Matches accepted answer Ariane 5.

K06UNKNOWNexcluído do corte

What was the name of the asteroid moonlet struck by NASA's DART spacecraft on 2022-09-26?

Resposta esperadaDimorphos
Resposta do modelo testadoA resposta exata do modelo não foi retida para esta execução arquivada.
Veredicto do juiz: CORRECTConfiança relatada: 100%

Nota do juiz: Matches accepted answer Dimorphos.

K07UNKNOWNexcluído do corte

In which ocean did the Artemis I Orion capsule splash down on 2022-12-11?

Resposta esperadaPacific Ocean
Resposta do modelo testadoA resposta exata do modelo não foi retida para esta execução arquivada.
Veredicto do juiz: CORRECTConfiança relatada: 100%

Nota do juiz: Matches accepted answer Pacific Ocean.

K08UNKNOWNexcluído do corte

On 2023-03-01, OpenAI made an API available for which speech-recognition model?

Resposta esperadaWhisper
Resposta do modelo testadoA resposta exata do modelo não foi retida para esta execução arquivada.
Veredicto do juiz: CORRECTConfiança relatada: 100%

Nota do juiz: Matches accepted answer Whisper.

K09UNKNOWNexcluído do corte

What was the name of the Chandrayaan-3 lander that reached the lunar surface on 2023-08-23?

Resposta esperadaVikram
Resposta do modelo testadoA resposta exata do modelo não foi retida para esta execução arquivada.
Veredicto do juiz: CORRECTConfiança relatada: 100%

Nota do juiz: Matches accepted answer Vikram.

K10UNKNOWNexcluído do corte

Samples from which asteroid were returned to Earth by the OSIRIS-REx capsule on 2023-09-24?

Resposta esperadaBennu
Resposta do modelo testadoA resposta exata do modelo não foi retida para esta execução arquivada.
Veredicto do juiz: CORRECTConfiança relatada: 100%

Nota do juiz: Matches accepted answer Bennu.

K11UNKNOWNexcluído do corte

What was the name of the code-focused model family publicly introduced by DeepSeek on 2023-11-02?

Resposta esperadaDeepSeek Coder
Resposta do modelo testadoA resposta exata do modelo não foi retida para esta execução arquivada.
Veredicto do juiz: CORRECTConfiança relatada: 100%

Nota do juiz: DeepSeek-Coder is an accepted spelling.

K12UNKNOWNexcluído do corte

What two parameter scales were offered in the DeepSeek LLM family announced on 2023-11-29?

Resposta esperada7B and 67B
Resposta do modelo testadoA resposta exata do modelo não foi retida para esta execução arquivada.
Veredicto do juiz: CORRECTConfiança relatada: 100%

Nota do juiz: Both parameter scales match: 7B and 67B.

K13UNKNOWNexcluído do corte

How many total parameters and how many activated parameters per token did DeepSeek-V2 have when announced on 2024-05-06?

Resposta esperada236B total parameters and 21B activated parameters per token
Resposta do modelo testadoA resposta exata do modelo não foi retida para esta execução arquivada.
Veredicto do juiz: CORRECTConfiança relatada: 100%

Nota do juiz: Correctly gives 236B total and 21B activated per token.

K14UNKNOWNexcluído do corte

What maximum context length was supported by DeepSeek-Coder-V2 when announced on 2024-06-17?

Resposta esperada128K tokens
Resposta do modelo testadoA resposta exata do modelo não foi retida para esta execução arquivada.
Veredicto do juiz: CORRECTConfiança relatada: 100%

Nota do juiz: Matches accepted answer 128K tokens.

K15UNKNOWNexcluído do corte

Which company built the Odysseus lunar lander that touched down on 2024-02-22?

Resposta esperadaIntuitive Machines
Resposta do modelo testadoA resposta exata do modelo não foi retida para esta execução arquivada.
Veredicto do juiz: CORRECTConfiança relatada: 100%

Nota do juiz: Matches accepted answer Intuitive Machines.

K16UNKNOWNexcluído do corte

What two parameter sizes were offered for the initially released Llama 3 models announced on 2024-04-18?

Resposta esperada8B and 70B
Resposta do modelo testadoA resposta exata do modelo não foi retida para esta execução arquivada.
Veredicto do juiz: CORRECTConfiança relatada: 100%

Nota do juiz: Both initially released sizes match: 8B and 70B.

Cobertura de perguntas e notas de pesquisa

Perguntas factuais: 16 · Não avaliado pelo juiz: 0

O corte de referência e as citações são fornecidos pelo juiz, não confirmados de forma independente pela plataforma. As notas de pesquisa não penalizam o modelo testado.

Executar metadados

Detalhes de reprodutibilidade

ID de execuçãoA57ZK57ERM62N3S1XETMXFKK0X
Referênciamodel-verification-single-request-v1.1
Juizgpt-5.6-sol
Protocolo solicitadoopenai_chat
Esquema de resposta detectadoLegacy / not recorded
Compatibilidade de protocoloPARTIDA / legado
Saída do modeloNot recorded
Tokens de entradaNot recorded
Tokens de saídaNot recorded
Finalizar motivoNot recorded
Estado HTTP200
Latência externa28,645 ms
Bytes de resposta1,859
SHA-2564c1f5cca4a79a53f28e7f6544bfe08208148d53c85569f50c4132e161da06613
Limitação importante

The reference cutoff is the configured judge model's internal-knowledge snapshot for this run, not an independently verified provider attestation. Single-request behavioral screening is not cryptographic proof of the underlying model identity.

Execute uma verificação independente

Teste você mesmo o mesmo endpoint ou navegue em outros relatórios públicos antes de confiar em uma identidade de modelo anunciada.