← Registre public de vérificationmodel-verification-single-request-v1.2
Rapport public de vérification du modèle d'IA

deepseek-v4-flash

https://api.model-gate.com/v1/chat/completions

openai_chatgpt-5.6-solSep 6, 2026 16:39 UTC
Niveau de qualité hérité87/100
CONSISTENT82% confiance dans l'évaluation
Rapport permanenthttps://model-gate.com/fr/model-verification/results/0B0HVDB2FRJEJC90BRG4D7JV1Y
Telegram ↗X ↗
Rappel factuel83
Récence des connaissances82
Résistance aux hallucinations83
Étalonnage80
Modèle revendiquédeepseek-v4-flash
Modèle résolu par le jugeDeepSeek-V4-Flash-0731DeepSeek AI
Hôte du point de terminaisonapi.model-gate.com
Champ du modèle de réponse externedeepseek-v4-flash
Analyse du juge

Pourquoi cette vérification a reçu son résultat

Le rapport public reflète les preuves analytiques présentées au testeur après /chat/verify. Les notes des juges sont des évaluations par rubrique ; seules les réponses explicites correctes ou erronées de RECALL peuvent influencer la limite du rappel pur.

Diagnostic comportemental

Justification de la notation du juge

4 diagnostics
Rappel factuel83/100

Aucune justification distincte du juge n’a été retenue pour ce résultat archivé.

Récence des connaissances82/100

Aucune justification distincte du juge n’a été retenue pour ce résultat archivé.

Résistance aux hallucinations83/100

Aucune justification distincte du juge n’a été retenue pour ce résultat archivé.

Étalonnage80/100

Aucune justification distincte du juge n’a été retenue pour ce résultat archivé.

Note de référence historique : ce score global v1.4 archivé utilisait l'ancienne agrégation de diagnostic fixe. Il est conservé par souci de reproductibilité et ne doit pas être interprété comme un score de correspondance de modèle v1.5.

Preuve temporelle

Chronologie de pur rappel

0 Sondes de RAPPEL

L'ensemble de questions réel a été mélangé avant la demande de modèle testé. Les créneaux de génération manquants ne constituent pas des abstentions de modèle. La chronologie reconstitue leurs mois cibles pour l’auditabilité. Seules les réponses explicites de RECALL constituent une preuve de coupure ; INFERENCE, GUESS et UNKNOWN restent visibles mais ne déplacent pas la limite.

2023-11? K24UNKNOWN
2023-12? K13UNKNOWN
2024-01? K08UNKNOWN
2024-02? K07UNKNOWN
2024-03? K15UNKNOWN
2024-04? K18UNKNOWN
2024-05? K04UNKNOWN
2024-06? K16UNKNOWN
2024-07? K06UNKNOWN
2024-08? K03UNKNOWN
2024-09? K09UNKNOWN
2024-10? K17UNKNOWN
2024-11? K20UNKNOWN
2024-12? K10UNKNOWN
2025-01? K12UNKNOWN
2025-02? K14UNKNOWN
2025-03? K11UNKNOWN
2025-04? K21UNKNOWN
2025-05? K22UNKNOWN
2025-06? K23UNKNOWN
2025-07? K02UNKNOWN
2025-08? K05UNKNOWN
2025-09? K01UNKNOWN
2025-10? K19UNKNOWN
RAPPEL correct mauvais RAPPEL~ INFERENCE GUESS? UNKNOWN
0RECALL
0INFERENCE
0GUESS
0UNKNOWN
0RAPPEL correct
0mauvais RAPPEL
Comparaison temporelle

Comparaison des seuils de connaissances

CONSISTENT
Seuil de référence2025-05ESTIMATED_WEB · 0%
Dernier rappel pris en charge0 réponses de RAPPEL éligibles
Limite observéePreuves RECALL insuffisantesINSUFFICIENT_RECALL_EVIDENCE
Alignement des coupuresCONSISTENT88/100 · 80% confiance
Notes du juge
  • Strong recall is nearly complete through the May 2025 reference cutoff.
  • There is no systematic strong-recall failure substantially before the reference cutoff.
  • Correct June and August 2025 answers suggest selective later knowledge, while failures in July, September, and October prevent a clearly later boundary.

Sémantique: correct 20 · faux 4 · inconnu 0. Exclus du seuil: 0.

Identité comportementale

Signaux d'identité

CONSISTENT · 82%

L'identité est déduite de la cohérence entre le modèle revendiqué et le profil connaissance/réponse observé. Il s’agit d’une preuve, et non d’une attestation à distance ou d’une preuve cryptographique du poids servi.

Signaux positifs

  • Excellent recall across late 2023 through May 2025.
  • Correct near-cutoff answer for the WHO Pandemic Agreement.
  • No pattern of early knowledge degradation.

Signaux négatifs

  • Incorrect February 2024 lunar-lander answer despite high confidence.
  • Correct June and August 2025 answers extend beyond the estimated reference cutoff.
  • Several post-cutoff answers are confidently wrong, indicating uneven recency.
Justification de l’identité du juge
  • Observed behavior broadly overlaps the saved May 2025 reference cutoff.
  • The model answered 20 of 24 Class A items correctly, with only one isolated failure well before the cutoff.
  • Post-cutoff knowledge is uneven and can plausibly reflect selective updates rather than model substitution.
Réponse du modèle testé

Texte du modèle extrait textuellement

Résumé archivé

Cette exécution est antérieure à la conservation opt-in du rapport complet. Le défi, le corrigé et l'évaluation normalisée du juge sont disponibles, mais le texte de réponse exact du modèle testé a été intentionnellement rejeté par cette politique de confidentialité de l'ère de référence.

Liste de référence complète

Preuve question par question

Toutes les questions admises sont présentées avec la réponse attendue, la source disponible, la base du modèle testé, le verdict sémantique et le seuil d'éligibilité. Les questions non notées ne constituent pas des abstentions modèles. Une DEVINATION ou UNE INFÉRENCE correcte reste sémantiquement correcte mais est exclue des preuves de coupure de rappel pur.

K01UNKNOWNexclu du seuil

Who won the men's 100 metres at the World Athletics Championships in Tokyo?

Réponse attendueOblique SevilleSource ↗
Réponse du modèle testéLa réponse exacte du modèle n'a pas été conservée pour cette exécution archivée.
Verdict du juge: WRONGConfiance déclarée: 75%

Note du juge: Expected Oblique Seville; answered Kishane Thompson.

K02UNKNOWNexclu du seuil

Which team won the UEFA Women's Euro 2025 final?

Réponse attendueEnglandSource ↗
Réponse du modèle testéLa réponse exacte du modèle n'a pas été conservée pour cette exécution archivée.
Verdict du juge: WRONGConfiance déclarée: 85%

Note du juge: Expected England; answered Spain.

K03UNKNOWNexclu du seuil

Which disease's African upsurge did WHO declare a public health emergency of international concern?

Réponse attenduempoxSource ↗
Réponse du modèle testéLa réponse exacte du modèle n'a pas été conservée pour cette exécution archivée.
Verdict du juge: CORRECTConfiance déclarée: 95%

Note du juge: Matches mpox.

K04UNKNOWNexclu du seuil

What molecular-structure prediction model did Google DeepMind and Isomorphic Labs introduce?

Réponse attendueAlphaFold 3Source ↗
Réponse du modèle testéLa réponse exacte du modèle n'a pas été conservée pour cette exécution archivée.
Verdict du juge: CORRECTConfiance déclarée: 95%

Note du juge: Matches AlphaFold 3.

K05UNKNOWNexclu du seuil

What model did OpenAI release as a unified system with built-in thinking?

Réponse attendueGPT-5Source ↗
Réponse du modèle testéLa réponse exacte du modèle n'a pas été conservée pour cette exécution archivée.
Verdict du juge: CORRECTConfiance déclarée: 90%

Note du juge: Matches GPT-5.

K06UNKNOWNexclu du seuil

Which operating system was affected by the faulty CrowdStrike Falcon content update?

Réponse attendueWindowsSource ↗
Réponse du modèle testéLa réponse exacte du modèle n'a pas été conservée pour cette exécution archivée.
Verdict du juge: CORRECTConfiance déclarée: 95%

Note du juge: Microsoft Windows is accepted.

K07UNKNOWNexclu du seuil

What was the nickname of Intuitive Machines' Nova-C lander that touched down on the Moon?

Réponse attendueOdysseusSource ↗
Réponse du modèle testéLa réponse exacte du modèle n'a pas été conservée pour cette exécution archivée.
Verdict du juge: WRONGConfiance déclarée: 80%

Note du juge: Expected Odysseus; Odie is not an accepted answer.

K08UNKNOWNexclu du seuil

What was the name of Japan's lunar lander that successfully reached the Moon?

Réponse attendueSLIMSource ↗
Réponse du modèle testéLa réponse exacte du modèle n'a pas été conservée pour cette exécution archivée.
Verdict du juge: CORRECTConfiance déclarée: 95%

Note du juge: Matches SLIM.

K09UNKNOWNexclu du seuil

Who became the first private astronaut to perform a spacewalk?

Réponse attendueJared IsaacmanSource ↗
Réponse du modèle testéLa réponse exacte du modèle n'a pas été conservée pour cette exécution archivée.
Verdict du juge: CORRECTConfiance déclarée: 95%

Note du juge: Matches Jared Isaacman.

K10UNKNOWNexclu du seuil

Which country was appointed host of the 2034 FIFA World Cup?

Réponse attendueSaudi ArabiaSource ↗
Réponse du modèle testéLa réponse exacte du modèle n'a pas été conservée pour cette exécution archivée.
Verdict du juge: CORRECTConfiance déclarée: 95%

Note du juge: Matches Saudi Arabia.

K11UNKNOWNexclu du seuil

In which lunar mare did Firefly Aerospace's Blue Ghost land?

Réponse attendueMare CrisiumSource ↗
Réponse du modèle testéLa réponse exacte du modèle n'a pas été conservée pour cette exécution archivée.
Verdict du juge: CORRECTConfiance déclarée: 90%

Note du juge: Matches Mare Crisium.

K12UNKNOWNexclu du seuil

What model did DeepSeek begin serving through its deepseek-reasoner endpoint?

Réponse attendueDeepSeek-R1Source ↗
Réponse du modèle testéLa réponse exacte du modèle n'a pas été conservée pour cette exécution archivée.
Verdict du juge: CORRECTConfiance déclarée: 95%

Note du juge: Matches DeepSeek-R1.

K13UNKNOWNexclu du seuil

What was the name of the second malaria vaccine prequalified by WHO?

Réponse attendueR21/Matrix-MSource ↗
Réponse du modèle testéLa réponse exacte du modèle n'a pas été conservée pour cette exécution archivée.
Verdict du juge: CORRECTConfiance déclarée: 90%

Note du juge: Matches R21/Matrix-M.

K14UNKNOWNexclu du seuil

Which album won Album of the Year at the 67th Grammy Awards?

Réponse attendueCowboy CarterSource ↗
Réponse du modèle testéLa réponse exacte du modèle n'a pas été conservée pour cette exécution archivée.
Verdict du juge: CORRECTConfiance déclarée: 95%

Note du juge: Matches Cowboy Carter.

K15UNKNOWNexclu du seuil

How many European Parliament members voted in favor of the Artificial Intelligence Act?

Réponse attendue523Source ↗
Réponse du modèle testéLa réponse exacte du modèle n'a pas été conservée pour cette exécution archivée.
Verdict du juge: CORRECTConfiance déclarée: 85%

Note du juge: Matches 523.

K16UNKNOWNexclu du seuil

How many grams of lunar material did the Chang'e-6 mission collect?

Réponse attendue1,935.3 gramsSource ↗
Réponse du modèle testéLa réponse exacte du modèle n'a pas été conservée pour cette exécution archivée.
Verdict du juge: CORRECTConfiance déclarée: 90%

Note du juge: Matches 1,935.3 grams.

K17UNKNOWNexclu du seuil

Which rocket launched NASA's Europa Clipper spacecraft?

Réponse attendueFalcon HeavySource ↗
Réponse du modèle testéLa réponse exacte du modèle n'a pas été conservée pour cette exécution archivée.
Verdict du juge: CORRECTConfiance déclarée: 95%

Note du juge: Matches Falcon Heavy.

K18UNKNOWNexclu du seuil

What designation was given to the newly identified 33-solar-mass stellar black hole in the Milky Way?

Réponse attendueGaia BH3Source ↗
Réponse du modèle testéLa réponse exacte du modèle n'a pas été conservée pour cette exécution archivée.
Verdict du juge: CORRECTConfiance déclarée: 90%

Note du juge: Matches Gaia BH3.

K19UNKNOWNexclu du seuil

Who was awarded the 2025 Nobel Peace Prize?

Réponse attendueMaria Corina MachadoSource ↗
Réponse du modèle testéLa réponse exacte du modèle n'a pas été conservée pour cette exécution archivée.
Verdict du juge: WRONGConfiance déclarée: 70%

Note du juge: Expected Maria Corina Machado; answered an institution.

K20UNKNOWNexclu du seuil

What annual climate-finance goal for developing countries did COP29 set for 2035?

Réponse attendueUS$300 billion per yearSource ↗
Réponse du modèle testéLa réponse exacte du modèle n'a pas été conservée pour cette exécution archivée.
Verdict du juge: CORRECTConfiance déclarée: 90%

Note du juge: Matches $300 billion per year.

K21UNKNOWNexclu du seuil

What was the name of the first human spaceflight to orbit over Earth's polar regions?

Réponse attendueFram2Source ↗
Réponse du modèle testéLa réponse exacte du modèle n'a pas été conservée pour cette exécution archivée.
Verdict du juge: CORRECTConfiance déclarée: 90%

Note du juge: Matches Fram2.

K22UNKNOWNexclu du seuil

Under which article of the WHO Constitution was the Pandemic Agreement adopted?

Réponse attendueArticle 19Source ↗
Réponse du modèle testéLa réponse exacte du modèle n'a pas été conservée pour cette exécution archivée.
Verdict du juge: CORRECTConfiance déclarée: 75%

Note du juge: Matches Article 19.

K23UNKNOWNexclu du seuil

Which new Mario Kart game launched alongside Nintendo Switch 2?

Réponse attendueMario Kart WorldSource ↗
Réponse du modèle testéLa réponse exacte du modèle n'a pas été conservée pour cette exécution archivée.
Verdict du juge: CORRECTConfiance déclarée: 95%

Note du juge: Matches Mario Kart World.

K24UNKNOWNexclu du seuil

What model did OpenAI introduce with a 128K context window at its first DevDay?

Réponse attendueGPT-4 TurboSource ↗
Réponse du modèle testéLa réponse exacte du modèle n'a pas été conservée pour cette exécution archivée.
Verdict du juge: CORRECTConfiance déclarée: 95%

Note du juge: Matches GPT-4 Turbo.

Couverture des questions et notes de recherche

Questions factuelles: 24 · Non noté par le juge: 0

Les seuils de référence et les citations sont fournis par le juge, non confirmés de manière indépendante par la plateforme. Les notes de recherche ne pénalisent pas le modèle testé.

Exécuter des métadonnées

Détails de reproductibilité

ID d'exécution0B0HVDB2FRJEJC90BRG4D7JV1Y
Référencemodel-verification-single-request-v1.2
Jugegpt-5.6-sol
Protocole demandéopenai_chat
Schéma de réponse détectéLegacy / not recorded
Compatibilité des protocolesMATCH / héritage
Sortie du modèleNot recorded
Jetons d'entréeNot recorded
Jetons de sortieNot recorded
Raison de finNot recorded
Statut HTTP200
Latence externe88,304 ms
Octets de réponse2,460
SHA-256f22e63d94e67fbd4fdfa25a27a37ae4b3402f94fc6801d14c2a4e638f85cfd9d
Limite importante

The reference cutoff is a judge-produced snapshot grounded in hosted web evidence when available (official sources preferred, otherwise the best defensible estimate). It is not provider attestation. Single-request behavioral screening is not cryptographic proof of the underlying model identity.

Exécutez une vérification indépendante

Testez vous-même le même point de terminaison ou parcourez d’autres rapports publics avant de vous fier à une identité de modèle annoncée.