Отчет о проверке общедоступной модели ИИ

deepseek-v4-flash

https://api.model-gate.com/v1/chat/completions

openai_chatgpt-5.6-solSep 6, 2026 09:53 UTC
Устаревший показатель качества100/100
PLAUSIBLE60% уверенность в оценке
Постоянный отчетhttps://model-gate.com/ru/model-verification/results/A57ZK57ERM62N3S1XETMXFKK0X
Telegram ↗X ↗
Фактический отзыв100
Свежесть знаний100
Сопротивление галлюцинациям100
Калибровка100
Заявленная модельdeepseek-v4-flash
Модель с разрешением судьиdeepseek-v4-flashUNKNOWN
Хост конечной точкиapi.model-gate.com
Поле модели внешнего ответаdeepseek-v4-flash
Судейский анализ

Почему эта проверка получила свой результат

Публичный отчет отражает аналитические данные, показанные тестировщику после /chat/verify. Судейские оценки представляют собой оценки по рубрикам; только явные правильные или неправильные ответы RECALL могут влиять на границу отсечения чистого воспоминания.

Диагностика поведения

Обоснование оценки судьи

4 диагностики
Фактический отзыв100/100

Никакого отдельного обоснования судьи для этого заархивированного результата не сохранилось.

Свежесть знаний100/100

Никакого отдельного обоснования судьи для этого заархивированного результата не сохранилось.

Сопротивление галлюцинациям100/100

Никакого отдельного обоснования судьи для этого заархивированного результата не сохранилось.

Калибровка100/100

Никакого отдельного обоснования судьи для этого заархивированного результата не сохранилось.

Примечание по историческому эталону: в этом архивированном общем рейтинге версии 1.4 использовалась прежняя фиксированная диагностическая агрегация. Он сохраняется для воспроизводимости и не должен интерпретироваться как показатель соответствия модели v1.5.

Временные доказательства

Хронология чистого воспоминания

0 RECALL зонды

Фактический набор вопросов был перетасован перед запросом тестируемой модели. Отсутствие мест для поколений не является воздержанием модели. График реконструирует целевые месяцы для проверки. Только явные ответы RECALL являются отсекающими доказательствами; ВЫВОД, УГАДАЙТЕ и НЕИЗВЕСТНО остаются видимыми, но не перемещают границу.

Ежемесячная шкала недоступна для этого архивного результата теста.
правильный ОТЗЫВ неправильный НАПОМИНАТЬ~ INFERENCE GUESS? UNKNOWN
0RECALL
0INFERENCE
0GUESS
0UNKNOWN
0правильный ОТЗЫВ
0неправильный НАПОМИНАТЬ
Временное сравнение

Сравнение границ знаний

UNKNOWN
Эталонная границаUNKNOWNUNKNOWN · 0%
Последняя поддерживаемая версия RECALL0 подходящие ответы RECALL
Наблюдаемая границаНедостаточно доказательств RECALLINSUFFICIENT_RECALL_EVIDENCE
Выравнивание обрезкиUNKNOWN0% уверенность
Судья отмечает
  • All Class A items are correct through June 2024, establishing an observed lower bound but no upper bound.
  • The immutable reference snapshot has no known cutoff dates, so cutoff alignment cannot be scored.

Семантический: правильный 16 · неправильный 0 · неизвестный 0. Исключено из исключения: 0.

Поведенческая идентичность

Сигналы идентичности

PLAUSIBLE · 60%

Идентичность выводится из соответствия между заявленной моделью и наблюдаемым профилем знаний/ответов. Это свидетельство, а не удаленная аттестация или криптографическое подтверждение весов обслуживания.

Позитивные сигналы

  • Perfect performance across all supplied Class A recall items.
  • Correct recall of multiple DeepSeek model releases and specifications.
  • No systematic early knowledge failures.

Негативные сигналы

  • No documented canonical identity or cutoff is available in the reference snapshot.
  • Cutoff consistency cannot be evaluated.
  • Self-report and matching API metadata are weak identity evidence.
Обоснование личности судьи
  • The response is fully correct on all 16 strong-recall questions, including the DeepSeek-specific history items.
  • The observed knowledge extends through June 2024, but the reference cutoff is unknown and therefore provides no identity-comparison signal.
  • The claimed name and API identifier agree, but both are untrusted metadata and do not prove model identity.
Ответ протестированной модели

Дословно извлеченный текст модели

Архивированная сводка

Этот запуск предшествует сохранению полного отчета по согласию. Задание, ключ ответа и нормализованная оценка судьи доступны, но точный текст ответа протестированной модели был намеренно исключен из этой политики конфиденциальности эпохи эталонных тестов.

Полный список тестов

Доказательства по каждому вопросу

Все принятые вопросы показаны с указанием ожидаемого ответа, доступного источника, основы проверенной модели, семантического вердикта и приемлемости для исключения. Неклассифицированные вопросы не являются образцовым воздержанием. Правильное ПРЕДПОЛОЖЕНИЕ или ВЫВОД остаются правильными семантически, но исключаются из доказательств, ограничивающих чистое припоминание.

K01UNKNOWNисключен из отсечения

Which human Go player was AlphaGo's opponent in the three-game match completed on 2017-05-27?

Ожидаемый ответKe Jie
Ответ проверенной моделиТочный отклик модели не был сохранен для этого архивного прогона.
Вердикт судьи: CORRECTЗаявленная уверенность: 100%

Примечание судьи: Matches accepted answer Ke Jie.

K02UNKNOWNисключен из отсечения

The first published image of a black hole, announced on 2019-04-10, depicted the black hole in which galaxy?

Ожидаемый ответMessier 87
Ответ проверенной моделиТочный отклик модели не был сохранен для этого архивного прогона.
Вердикт судьи: CORRECTЗаявленная уверенность: 100%

Примечание судьи: M87 galaxy is semantically equivalent to Messier 87.

K03UNKNOWNисключен из отсечения

Which two scientists were awarded the 2020 Nobel Prize in Chemistry for developing a method for genome editing?

Ожидаемый ответEmmanuelle Charpentier and Jennifer A. Doudna
Ответ проверенной моделиТочный отклик модели не был сохранен для этого архивного прогона.
Вердикт судьи: CORRECTЗаявленная уверенность: 100%

Примечание судьи: Both required scientists are correctly named.

K04UNKNOWNисключен из отсечения

Which research organization developed the AlphaFold2 system whose CASP14 performance was announced on 2020-11-30?

Ожидаемый ответDeepMind
Ответ проверенной моделиТочный отклик модели не был сохранен для этого архивного прогона.
Вердикт судьи: CORRECTЗаявленная уверенность: 100%

Примечание судьи: Matches accepted answer DeepMind.

K05UNKNOWNисключен из отсечения

Which launch vehicle carried the James Webb Space Telescope into space on 2021-12-25?

Ожидаемый ответAriane 5
Ответ проверенной моделиТочный отклик модели не был сохранен для этого архивного прогона.
Вердикт судьи: CORRECTЗаявленная уверенность: 100%

Примечание судьи: Matches accepted answer Ariane 5.

K06UNKNOWNисключен из отсечения

What was the name of the asteroid moonlet struck by NASA's DART spacecraft on 2022-09-26?

Ожидаемый ответDimorphos
Ответ проверенной моделиТочный отклик модели не был сохранен для этого архивного прогона.
Вердикт судьи: CORRECTЗаявленная уверенность: 100%

Примечание судьи: Matches accepted answer Dimorphos.

K07UNKNOWNисключен из отсечения

In which ocean did the Artemis I Orion capsule splash down on 2022-12-11?

Ожидаемый ответPacific Ocean
Ответ проверенной моделиТочный отклик модели не был сохранен для этого архивного прогона.
Вердикт судьи: CORRECTЗаявленная уверенность: 100%

Примечание судьи: Matches accepted answer Pacific Ocean.

K08UNKNOWNисключен из отсечения

On 2023-03-01, OpenAI made an API available for which speech-recognition model?

Ожидаемый ответWhisper
Ответ проверенной моделиТочный отклик модели не был сохранен для этого архивного прогона.
Вердикт судьи: CORRECTЗаявленная уверенность: 100%

Примечание судьи: Matches accepted answer Whisper.

K09UNKNOWNисключен из отсечения

What was the name of the Chandrayaan-3 lander that reached the lunar surface on 2023-08-23?

Ожидаемый ответVikram
Ответ проверенной моделиТочный отклик модели не был сохранен для этого архивного прогона.
Вердикт судьи: CORRECTЗаявленная уверенность: 100%

Примечание судьи: Matches accepted answer Vikram.

K10UNKNOWNисключен из отсечения

Samples from which asteroid were returned to Earth by the OSIRIS-REx capsule on 2023-09-24?

Ожидаемый ответBennu
Ответ проверенной моделиТочный отклик модели не был сохранен для этого архивного прогона.
Вердикт судьи: CORRECTЗаявленная уверенность: 100%

Примечание судьи: Matches accepted answer Bennu.

K11UNKNOWNисключен из отсечения

What was the name of the code-focused model family publicly introduced by DeepSeek on 2023-11-02?

Ожидаемый ответDeepSeek Coder
Ответ проверенной моделиТочный отклик модели не был сохранен для этого архивного прогона.
Вердикт судьи: CORRECTЗаявленная уверенность: 100%

Примечание судьи: DeepSeek-Coder is an accepted spelling.

K12UNKNOWNисключен из отсечения

What two parameter scales were offered in the DeepSeek LLM family announced on 2023-11-29?

Ожидаемый ответ7B and 67B
Ответ проверенной моделиТочный отклик модели не был сохранен для этого архивного прогона.
Вердикт судьи: CORRECTЗаявленная уверенность: 100%

Примечание судьи: Both parameter scales match: 7B and 67B.

K13UNKNOWNисключен из отсечения

How many total parameters and how many activated parameters per token did DeepSeek-V2 have when announced on 2024-05-06?

Ожидаемый ответ236B total parameters and 21B activated parameters per token
Ответ проверенной моделиТочный отклик модели не был сохранен для этого архивного прогона.
Вердикт судьи: CORRECTЗаявленная уверенность: 100%

Примечание судьи: Correctly gives 236B total and 21B activated per token.

K14UNKNOWNисключен из отсечения

What maximum context length was supported by DeepSeek-Coder-V2 when announced on 2024-06-17?

Ожидаемый ответ128K tokens
Ответ проверенной моделиТочный отклик модели не был сохранен для этого архивного прогона.
Вердикт судьи: CORRECTЗаявленная уверенность: 100%

Примечание судьи: Matches accepted answer 128K tokens.

K15UNKNOWNисключен из отсечения

Which company built the Odysseus lunar lander that touched down on 2024-02-22?

Ожидаемый ответIntuitive Machines
Ответ проверенной моделиТочный отклик модели не был сохранен для этого архивного прогона.
Вердикт судьи: CORRECTЗаявленная уверенность: 100%

Примечание судьи: Matches accepted answer Intuitive Machines.

K16UNKNOWNисключен из отсечения

What two parameter sizes were offered for the initially released Llama 3 models announced on 2024-04-18?

Ожидаемый ответ8B and 70B
Ответ проверенной моделиТочный отклик модели не был сохранен для этого архивного прогона.
Вердикт судьи: CORRECTЗаявленная уверенность: 100%

Примечание судьи: Both initially released sizes match: 8B and 70B.

Освещение вопросов и исследовательские заметки

Фактические вопросы: 16 · Не оценивается судьей: 0

Ограничения по ссылкам и цитаты предоставляются судьей и не подтверждаются независимо платформой. Примечания к исследованию не наказывают тестируемую модель.

Запустить метаданные

Детали воспроизводимости

Идентификатор запускаA57ZK57ERM62N3S1XETMXFKK0X
Контрольный показательmodel-verification-single-request-v1.1
Судитьgpt-5.6-sol
Запрошенный протоколopenai_chat
Обнаруженная схема ответаLegacy / not recorded
Совместимость протоколовМАТЧ / наследие
Выходные данные моделиNot recorded
Входные токеныNot recorded
Выходные токеныNot recorded
Завершить причинуNot recorded
Статус HTTP200
Внешняя задержка28,645 ms
Байты ответа1,859
SHA-2564c1f5cca4a79a53f28e7f6544bfe08208148d53c85569f50c4132e161da06613
Важное ограничение

The reference cutoff is the configured judge model's internal-knowledge snapshot for this run, not an independently verified provider attestation. Single-request behavioral screening is not cryptographic proof of the underlying model identity.

Проведите независимую проверку

Проверьте ту же конечную точку самостоятельно или просмотрите другие общедоступные отчеты, прежде чем полагаться на рекламируемую модель.