← Δημόσιο μητρώο επαλήθευσηςmodel-verification-single-request-v1.1
Δημόσια έκθεση επαλήθευσης μοντέλου AI

deepseek-v4-flash

https://api.model-gate.com/v1/chat/completions

openai_chatgpt-5.6-solSep 6, 2026 09:53 UTC
Δείκτης ποιότητας παλαιού τύπου100/100
PLAUSIBLE60% αξιοπιστία της αξιολόγησης
Μόνιμη έκθεσηhttps://model-gate.com/el/model-verification/results/A57ZK57ERM62N3S1XETMXFKK0X
Telegram ↗X ↗
Πραγματική Ανάκληση100
Τελευταία γνώση100
Αντίσταση σε ψευδαισθήσεις100
Διαμέτρηση100
Διεκδικημένο μοντέλοdeepseek-v4-flash
Μοντέλο με απόφαση δικαστήdeepseek-v4-flashUNKNOWN
Κεντρικό σημείο τερματικούapi.model-gate.com
Πεδίο μοντέλου εξωτερικής απόκρισηςdeepseek-v4-flash
Ανάλυση δικαστών

Γιατί αυτή η επαλήθευση έλαβε το αποτέλεσμά της

Η δημόσια αναφορά αντικατοπτρίζει τα αναλυτικά στοιχεία που εμφανίζονται στον ελεγκτή μετά το /chat/verify. Οι βαθμολογίες των κριτών είναι αξιολογήσεις ρουμπρίκων. μόνο σαφείς σωστές ή λάθος απαντήσεις RECALL μπορεί να επηρεάσουν το όριο αποκοπής καθαρής ανάκλησης.

Διαγνωστικά συμπεριφοράς

Σκεπτικό βαθμολόγησης κριτών

4 διαγνωστικά
Πραγματική Ανάκληση100/100

Για αυτό το αρχειοθετημένο αποτέλεσμα δεν διατηρήθηκε καμία χωριστή αιτιολογία του κριτή.

Τελευταία γνώση100/100

Για αυτό το αρχειοθετημένο αποτέλεσμα δεν διατηρήθηκε καμία χωριστή αιτιολογία του κριτή.

Αντίσταση σε ψευδαισθήσεις100/100

Για αυτό το αρχειοθετημένο αποτέλεσμα δεν διατηρήθηκε καμία χωριστή αιτιολογία του κριτή.

Διαμέτρηση100/100

Για αυτό το αρχειοθετημένο αποτέλεσμα δεν διατηρήθηκε καμία χωριστή αιτιολογία του κριτή.

Σημείωση ιστορικού σημείου αναφοράς: αυτή η αρχειοθετημένη συνολική βαθμολογία v1.4 χρησιμοποιούσε την προηγούμενη σταθερή διαγνωστική συγκέντρωση. Διατηρείται για αναπαραγωγιμότητα και δεν πρέπει να ερμηνεύεται ως βαθμολογία αντιστοιχίας μοντέλου v1.5.

Διαχρονικά στοιχεία

Χρονολόγιο καθαρής ανάκλησης

0 Ανιχνευτές ανάκλησης

Το πραγματικό σύνολο ερωτήσεων ανακάτεψε πριν από το αίτημα δοκιμασμένου μοντέλου. Οι υποδοχές γενιάς που λείπουν δεν είναι οι αποχές του μοντέλου. Το χρονοδιάγραμμα αναδομεί τους μήνες-στόχους τους για δυνατότητα ελέγχου. Μόνο οι ρητές απαντήσεις ανάκλησης αποτελούν αποδεικτικά στοιχεία. ΣΥΜΠΕΡΑΣΜΑ, ΜΑΝΤΩΣΗ και ΑΓΝΩΣΤΟ παραμένουν ορατά αλλά δεν μετακινούν το όριο.

Το μηνιαίο χρονοδιάγραμμα δεν είναι διαθέσιμο για αυτό το αρχειοθετημένο αποτέλεσμα συγκριτικής αξιολόγησης.
σωστή ανάκληση λάθος ανάκληση~ INFERENCE GUESS? UNKNOWN
0RECALL
0INFERENCE
0GUESS
0UNKNOWN
0σωστή ανάκληση
0λάθος ανάκληση
Χρονική σύγκριση

Σύγκριση αποκοπής γνώσης

UNKNOWN
Αποκοπή αναφοράςUNKNOWNUNKNOWN · 0%
Τελευταία υποστηριζόμενη ανάκληση0 κατάλληλες απαντήσεις ανάκλησης
Παρατηρημένο όριοΑνεπαρκή στοιχεία ανάκλησηςINSUFFICIENT_RECALL_EVIDENCE
Ευθυγράμμιση αποκοπήςUNKNOWN0% εμπιστοσύνη
Σημειώνει ο δικαστής
  • All Class A items are correct through June 2024, establishing an observed lower bound but no upper bound.
  • The immutable reference snapshot has no known cutoff dates, so cutoff alignment cannot be scored.

Σημασιολογικός: σωστός 16 · λανθασμένος 0 · άγνωστος 0. Εξαιρείται από την αποκοπή: 0.

Συμπεριφορική ταυτότητα

Σήματα ταυτότητας

PLAUSIBLE · 60%

Η ταυτότητα συνάγεται από τη συνέπεια μεταξύ του διεκδικούμενου μοντέλου και του παρατηρούμενου προφίλ γνώσης/απάντησης. Είναι αποδεικτικό στοιχείο, όχι εξ αποστάσεως βεβαίωση ή κρυπτογραφική απόδειξη των βαρών σερβιρίσματος.

Θετικά σήματα

  • Perfect performance across all supplied Class A recall items.
  • Correct recall of multiple DeepSeek model releases and specifications.
  • No systematic early knowledge failures.

Αρνητικά σήματα

  • No documented canonical identity or cutoff is available in the reference snapshot.
  • Cutoff consistency cannot be evaluated.
  • Self-report and matching API metadata are weak identity evidence.
Το σκεπτικό της ταυτότητας του δικαστή
  • The response is fully correct on all 16 strong-recall questions, including the DeepSeek-specific history items.
  • The observed knowledge extends through June 2024, but the reference cutoff is unknown and therefore provides no identity-comparison signal.
  • The claimed name and API identifier agree, but both are untrusted metadata and do not prove model identity.
Απόκριση δοκιμασμένου μοντέλου

Κατά λέξη εξαγόμενο μοντέλο κειμένου

Αρχειοθετημένη περίληψη

Αυτή η εκτέλεση προηγείται της διατήρησης πλήρους αναφοράς επιλογής. Η πρόκληση, το κλειδί απάντησης και η κανονικοποιημένη αξιολόγηση κριτών είναι διαθέσιμα, αλλά το κείμενο απάντησης του ακριβούς δοκιμασμένου μοντέλου απορρίφθηκε σκόπιμα από αυτήν την πολιτική απορρήτου της εποχής αναφοράς.

Πλήρης λίστα αναφοράς

Αποδεικτικά στοιχεία ερώτηση προς ερώτηση

Όλες οι αποδεκτές ερωτήσεις εμφανίζονται με την αναμενόμενη απάντηση, τη διαθέσιμη πηγή, τη βάση του δοκιμασμένου μοντέλου, τη σημασιολογική ετυμηγορία και την καταλληλότητα αποκοπής. Οι μη βαθμολογημένες ερωτήσεις δεν είναι αποχές μοντέλων. Μια σωστή ΜΑΝΤΕΨΗ ή ΣΥΜΠΕΡΑΣΜΑ παραμένει σωστή σημασιολογικά, αλλά αποκλείεται από αποδείξεις αποκοπής καθαρής ανάκλησης.

K01UNKNOWNεξαιρούνται από την αποκοπή

Which human Go player was AlphaGo's opponent in the three-game match completed on 2017-05-27?

Αναμενόμενη απάντησηKe Jie
Απάντηση δοκιμασμένου μοντέλουΗ ακριβής απόκριση μοντέλου δεν διατηρήθηκε για αυτήν την αρχειοθετημένη εκτέλεση.
Απόφαση του δικαστή: CORRECTΑναφέρθηκε εμπιστοσύνη: 100%

Σημείωμα δικαστή: Matches accepted answer Ke Jie.

K02UNKNOWNεξαιρούνται από την αποκοπή

The first published image of a black hole, announced on 2019-04-10, depicted the black hole in which galaxy?

Αναμενόμενη απάντησηMessier 87
Απάντηση δοκιμασμένου μοντέλουΗ ακριβής απόκριση μοντέλου δεν διατηρήθηκε για αυτήν την αρχειοθετημένη εκτέλεση.
Απόφαση του δικαστή: CORRECTΑναφέρθηκε εμπιστοσύνη: 100%

Σημείωμα δικαστή: M87 galaxy is semantically equivalent to Messier 87.

K03UNKNOWNεξαιρούνται από την αποκοπή

Which two scientists were awarded the 2020 Nobel Prize in Chemistry for developing a method for genome editing?

Αναμενόμενη απάντησηEmmanuelle Charpentier and Jennifer A. Doudna
Απάντηση δοκιμασμένου μοντέλουΗ ακριβής απόκριση μοντέλου δεν διατηρήθηκε για αυτήν την αρχειοθετημένη εκτέλεση.
Απόφαση του δικαστή: CORRECTΑναφέρθηκε εμπιστοσύνη: 100%

Σημείωμα δικαστή: Both required scientists are correctly named.

K04UNKNOWNεξαιρούνται από την αποκοπή

Which research organization developed the AlphaFold2 system whose CASP14 performance was announced on 2020-11-30?

Αναμενόμενη απάντησηDeepMind
Απάντηση δοκιμασμένου μοντέλουΗ ακριβής απόκριση μοντέλου δεν διατηρήθηκε για αυτήν την αρχειοθετημένη εκτέλεση.
Απόφαση του δικαστή: CORRECTΑναφέρθηκε εμπιστοσύνη: 100%

Σημείωμα δικαστή: Matches accepted answer DeepMind.

K05UNKNOWNεξαιρούνται από την αποκοπή

Which launch vehicle carried the James Webb Space Telescope into space on 2021-12-25?

Αναμενόμενη απάντησηAriane 5
Απάντηση δοκιμασμένου μοντέλουΗ ακριβής απόκριση μοντέλου δεν διατηρήθηκε για αυτήν την αρχειοθετημένη εκτέλεση.
Απόφαση του δικαστή: CORRECTΑναφέρθηκε εμπιστοσύνη: 100%

Σημείωμα δικαστή: Matches accepted answer Ariane 5.

K06UNKNOWNεξαιρούνται από την αποκοπή

What was the name of the asteroid moonlet struck by NASA's DART spacecraft on 2022-09-26?

Αναμενόμενη απάντησηDimorphos
Απάντηση δοκιμασμένου μοντέλουΗ ακριβής απόκριση μοντέλου δεν διατηρήθηκε για αυτήν την αρχειοθετημένη εκτέλεση.
Απόφαση του δικαστή: CORRECTΑναφέρθηκε εμπιστοσύνη: 100%

Σημείωμα δικαστή: Matches accepted answer Dimorphos.

K07UNKNOWNεξαιρούνται από την αποκοπή

In which ocean did the Artemis I Orion capsule splash down on 2022-12-11?

Αναμενόμενη απάντησηPacific Ocean
Απάντηση δοκιμασμένου μοντέλουΗ ακριβής απόκριση μοντέλου δεν διατηρήθηκε για αυτήν την αρχειοθετημένη εκτέλεση.
Απόφαση του δικαστή: CORRECTΑναφέρθηκε εμπιστοσύνη: 100%

Σημείωμα δικαστή: Matches accepted answer Pacific Ocean.

K08UNKNOWNεξαιρούνται από την αποκοπή

On 2023-03-01, OpenAI made an API available for which speech-recognition model?

Αναμενόμενη απάντησηWhisper
Απάντηση δοκιμασμένου μοντέλουΗ ακριβής απόκριση μοντέλου δεν διατηρήθηκε για αυτήν την αρχειοθετημένη εκτέλεση.
Απόφαση του δικαστή: CORRECTΑναφέρθηκε εμπιστοσύνη: 100%

Σημείωμα δικαστή: Matches accepted answer Whisper.

K09UNKNOWNεξαιρούνται από την αποκοπή

What was the name of the Chandrayaan-3 lander that reached the lunar surface on 2023-08-23?

Αναμενόμενη απάντησηVikram
Απάντηση δοκιμασμένου μοντέλουΗ ακριβής απόκριση μοντέλου δεν διατηρήθηκε για αυτήν την αρχειοθετημένη εκτέλεση.
Απόφαση του δικαστή: CORRECTΑναφέρθηκε εμπιστοσύνη: 100%

Σημείωμα δικαστή: Matches accepted answer Vikram.

K10UNKNOWNεξαιρούνται από την αποκοπή

Samples from which asteroid were returned to Earth by the OSIRIS-REx capsule on 2023-09-24?

Αναμενόμενη απάντησηBennu
Απάντηση δοκιμασμένου μοντέλουΗ ακριβής απόκριση μοντέλου δεν διατηρήθηκε για αυτήν την αρχειοθετημένη εκτέλεση.
Απόφαση του δικαστή: CORRECTΑναφέρθηκε εμπιστοσύνη: 100%

Σημείωμα δικαστή: Matches accepted answer Bennu.

K11UNKNOWNεξαιρούνται από την αποκοπή

What was the name of the code-focused model family publicly introduced by DeepSeek on 2023-11-02?

Αναμενόμενη απάντησηDeepSeek Coder
Απάντηση δοκιμασμένου μοντέλουΗ ακριβής απόκριση μοντέλου δεν διατηρήθηκε για αυτήν την αρχειοθετημένη εκτέλεση.
Απόφαση του δικαστή: CORRECTΑναφέρθηκε εμπιστοσύνη: 100%

Σημείωμα δικαστή: DeepSeek-Coder is an accepted spelling.

K12UNKNOWNεξαιρούνται από την αποκοπή

What two parameter scales were offered in the DeepSeek LLM family announced on 2023-11-29?

Αναμενόμενη απάντηση7B and 67B
Απάντηση δοκιμασμένου μοντέλουΗ ακριβής απόκριση μοντέλου δεν διατηρήθηκε για αυτήν την αρχειοθετημένη εκτέλεση.
Απόφαση του δικαστή: CORRECTΑναφέρθηκε εμπιστοσύνη: 100%

Σημείωμα δικαστή: Both parameter scales match: 7B and 67B.

K13UNKNOWNεξαιρούνται από την αποκοπή

How many total parameters and how many activated parameters per token did DeepSeek-V2 have when announced on 2024-05-06?

Αναμενόμενη απάντηση236B total parameters and 21B activated parameters per token
Απάντηση δοκιμασμένου μοντέλουΗ ακριβής απόκριση μοντέλου δεν διατηρήθηκε για αυτήν την αρχειοθετημένη εκτέλεση.
Απόφαση του δικαστή: CORRECTΑναφέρθηκε εμπιστοσύνη: 100%

Σημείωμα δικαστή: Correctly gives 236B total and 21B activated per token.

K14UNKNOWNεξαιρούνται από την αποκοπή

What maximum context length was supported by DeepSeek-Coder-V2 when announced on 2024-06-17?

Αναμενόμενη απάντηση128K tokens
Απάντηση δοκιμασμένου μοντέλουΗ ακριβής απόκριση μοντέλου δεν διατηρήθηκε για αυτήν την αρχειοθετημένη εκτέλεση.
Απόφαση του δικαστή: CORRECTΑναφέρθηκε εμπιστοσύνη: 100%

Σημείωμα δικαστή: Matches accepted answer 128K tokens.

K15UNKNOWNεξαιρούνται από την αποκοπή

Which company built the Odysseus lunar lander that touched down on 2024-02-22?

Αναμενόμενη απάντησηIntuitive Machines
Απάντηση δοκιμασμένου μοντέλουΗ ακριβής απόκριση μοντέλου δεν διατηρήθηκε για αυτήν την αρχειοθετημένη εκτέλεση.
Απόφαση του δικαστή: CORRECTΑναφέρθηκε εμπιστοσύνη: 100%

Σημείωμα δικαστή: Matches accepted answer Intuitive Machines.

K16UNKNOWNεξαιρούνται από την αποκοπή

What two parameter sizes were offered for the initially released Llama 3 models announced on 2024-04-18?

Αναμενόμενη απάντηση8B and 70B
Απάντηση δοκιμασμένου μοντέλουΗ ακριβής απόκριση μοντέλου δεν διατηρήθηκε για αυτήν την αρχειοθετημένη εκτέλεση.
Απόφαση του δικαστή: CORRECTΑναφέρθηκε εμπιστοσύνη: 100%

Σημείωμα δικαστή: Both initially released sizes match: 8B and 70B.

Κάλυψη ερωτήσεων και σημειώσεις έρευνας

Πραγματικές ερωτήσεις: 16 · Δεν βαθμολογείται από δικαστή: 0

Το σημείο αναφοράς και οι παραπομπές παρέχονται από τον κριτή, δεν επιβεβαιώνονται ανεξάρτητα από την πλατφόρμα. Οι ερευνητικές σημειώσεις δεν τιμωρούν το δοκιμασμένο μοντέλο.

Εκτέλεση μεταδεδομένων

Λεπτομέρειες αναπαραγωγιμότητας

Αναγνωριστικό εκτέλεσηςA57ZK57ERM62N3S1XETMXFKK0X
Σημείο αναφοράςmodel-verification-single-request-v1.1
Δικαστήςgpt-5.6-sol
Ζητήθηκε πρωτόκολλοopenai_chat
Εντοπίστηκε σχήμα απόκρισηςLegacy / not recorded
Συμβατότητα πρωτοκόλλουΑΓΩΝΑΣ / κληρονομιά
Έξοδος μοντέλουNot recorded
Δείκτες εισαγωγήςNot recorded
Διακριτικά εξόδουNot recorded
Τελειώστε τον λόγοNot recorded
Κατάσταση HTTP200
Εξωτερική καθυστέρηση28,645 ms
byte απόκρισης1,859
SHA-2564c1f5cca4a79a53f28e7f6544bfe08208148d53c85569f50c4132e161da06613
Σημαντικός περιορισμός

The reference cutoff is the configured judge model's internal-knowledge snapshot for this run, not an independently verified provider attestation. Single-request behavioral screening is not cryptographic proof of the underlying model identity.

Εκτελέστε μια ανεξάρτητη επαλήθευση

Δοκιμάστε μόνοι σας το ίδιο τελικό σημείο ή περιηγηθείτε σε άλλες δημόσιες αναφορές προτού βασιστείτε σε μια διαφημιζόμενη ταυτότητα μοντέλου.