← Јавни регистар верификацијеmodel-verification-single-request-v1.1
Извештај о верификацији јавног АИ модела

deepseek-v4-flash

https://api.model-gate.com/v1/chat/completions

openai_chatgpt-5.6-solSep 6, 2026 09:53 UTC
Оцена квалитета наслеђа100/100
PLAUSIBLE60% поузданост процене
Стални извештајhttps://model-gate.com/sr/model-verification/results/A57ZK57ERM62N3S1XETMXFKK0X
Telegram ↗X ↗
Фацтуал Рецалл100
Рецентност знања100
Отпорност на халуцинације100
Калибрација100
Захтевани моделdeepseek-v4-flash
Модел по решењу судијеdeepseek-v4-flashUNKNOWN
Хост крајње тачкеapi.model-gate.com
Поље модела екстерног одговораdeepseek-v4-flash
Судијска анализа

Зашто је ова верификација добила свој резултат

Јавни извештај одражава аналитичке доказе приказане тестеру након /цхат/верифи. Оцене судија су оцене по рубрикама; само експлицитни тачни или погрешни РЕЦАЛЛ одговори могу утицати на граничну границу чистог присећања.

Дијагностика понашања

Образложење за бодовање судија

4 дијагностика
Фацтуал Рецалл100/100

За овај архивирани резултат није задржано посебно образложење судије.

Рецентност знања100/100

За овај архивирани резултат није задржано посебно образложење судије.

Отпорност на халуцинације100/100

За овај архивирани резултат није задржано посебно образложење судије.

Калибрација100/100

За овај архивирани резултат није задржано посебно образложење судије.

Историјска бенцхмарк белешка: овај архивирани укупни резултат в1.4 користио је некадашњу фиксну дијагностичку агрегацију. Задржава се ради поновљивости и не сме се тумачити као резултат подударања модела в1.5.

Временски докази

Временска линија чистог опозива

0 РЕЦАЛЛ сонде

Стварни скуп питања је измешан пре захтева за тестирани модел. Недостајућа генерацијска места нису уздржани модел. Временски оквир реконструише њихове циљне месеце ради провере. Само експлицитни одговори на РЕЦАЛЛ су гранични доказ; ЗАКЉУЧАК, ПОГАЂАЊЕ и НЕПОЗНАТО остају видљиви, али не померају границу.

Месечна временска линија није доступна за овај архивирани резултат бенцхмарка.
исправно РЕЦАЛЛ погрешно РЕЦАЛЛ~ INFERENCE GUESS? UNKNOWN
0RECALL
0INFERENCE
0GUESS
0UNKNOWN
0исправно РЕЦАЛЛ
0погрешно РЕЦАЛЛ
Временско поређење

Поређење граница знања

UNKNOWN
Референтна границаUNKNOWNUNKNOWN · 0%
Најновији подржани РЕЦАЛЛ0 квалификовани одговори на РЕЦАЛЛ
Уочена границаНедовољни докази ПОЗИВАЊАINSUFFICIENT_RECALL_EVIDENCE
Цутофф АлигнментUNKNOWN0% самопоуздање
Судија бележи
  • All Class A items are correct through June 2024, establishing an observed lower bound but no upper bound.
  • The immutable reference snapshot has no known cutoff dates, so cutoff alignment cannot be scored.

Семантички: исправан 16 · погрешно 0 · непознато 0. Искључено из прекида: 0.

Идентитет понашања

Сигнали идентитета

PLAUSIBLE · 60%

Идентитет се закључује из конзистентности између модела који се тврди и посматраног профила знања/одговора. То је доказ, а не даљинска потврда или криптографски доказ тежине сервирања.

Позитивни сигнали

  • Perfect performance across all supplied Class A recall items.
  • Correct recall of multiple DeepSeek model releases and specifications.
  • No systematic early knowledge failures.

Негативни сигнали

  • No documented canonical identity or cutoff is available in the reference snapshot.
  • Cutoff consistency cannot be evaluated.
  • Self-report and matching API metadata are weak identity evidence.
Образложење идентитета судије
  • The response is fully correct on all 16 strong-recall questions, including the DeepSeek-specific history items.
  • The observed knowledge extends through June 2024, but the reference cutoff is unknown and therefore provides no identity-comparison signal.
  • The claimed name and API identifier agree, but both are untrusted metadata and do not prove model identity.
Одговор тестираног модела

Дословно извучен текст модела

Архивирани резиме

Ово покретање претходи задржавању пуног извештаја за прихватање. Доступни су изазов, кључ одговора и нормализована процена судије, али тачан текст одговора тестираног модела намерно је одбачен том политиком приватности из ере мерила.

Комплетна листа референтних вредности

Докази питање по питање

Сва прихваћена питања су приказана са очекиваним одговором, доступним извором, основом тестираног модела, семантичком пресудом и граничном подобношћу. Неоцењена питања нису модел уздржаних. Тачна ПОГОДИНА или ЗАКЉУЧАК остаје тачна семантички, али је искључена из доказа о прекиду чистог присећања.

K01UNKNOWNискључено из одсецања

Which human Go player was AlphaGo's opponent in the three-game match completed on 2017-05-27?

Очекивани одговорKe Jie
Одговор на тестираном моделуТачан одговор модела није задржан за ово архивирано покретање.
Пресуда судије: CORRECTПријављено поверење: 100%

Напомена судије: Matches accepted answer Ke Jie.

K02UNKNOWNискључено из одсецања

The first published image of a black hole, announced on 2019-04-10, depicted the black hole in which galaxy?

Очекивани одговорMessier 87
Одговор на тестираном моделуТачан одговор модела није задржан за ово архивирано покретање.
Пресуда судије: CORRECTПријављено поверење: 100%

Напомена судије: M87 galaxy is semantically equivalent to Messier 87.

K03UNKNOWNискључено из одсецања

Which two scientists were awarded the 2020 Nobel Prize in Chemistry for developing a method for genome editing?

Очекивани одговорEmmanuelle Charpentier and Jennifer A. Doudna
Одговор на тестираном моделуТачан одговор модела није задржан за ово архивирано покретање.
Пресуда судије: CORRECTПријављено поверење: 100%

Напомена судије: Both required scientists are correctly named.

K04UNKNOWNискључено из одсецања

Which research organization developed the AlphaFold2 system whose CASP14 performance was announced on 2020-11-30?

Очекивани одговорDeepMind
Одговор на тестираном моделуТачан одговор модела није задржан за ово архивирано покретање.
Пресуда судије: CORRECTПријављено поверење: 100%

Напомена судије: Matches accepted answer DeepMind.

K05UNKNOWNискључено из одсецања

Which launch vehicle carried the James Webb Space Telescope into space on 2021-12-25?

Очекивани одговорAriane 5
Одговор на тестираном моделуТачан одговор модела није задржан за ово архивирано покретање.
Пресуда судије: CORRECTПријављено поверење: 100%

Напомена судије: Matches accepted answer Ariane 5.

K06UNKNOWNискључено из одсецања

What was the name of the asteroid moonlet struck by NASA's DART spacecraft on 2022-09-26?

Очекивани одговорDimorphos
Одговор на тестираном моделуТачан одговор модела није задржан за ово архивирано покретање.
Пресуда судије: CORRECTПријављено поверење: 100%

Напомена судије: Matches accepted answer Dimorphos.

K07UNKNOWNискључено из одсецања

In which ocean did the Artemis I Orion capsule splash down on 2022-12-11?

Очекивани одговорPacific Ocean
Одговор на тестираном моделуТачан одговор модела није задржан за ово архивирано покретање.
Пресуда судије: CORRECTПријављено поверење: 100%

Напомена судије: Matches accepted answer Pacific Ocean.

K08UNKNOWNискључено из одсецања

On 2023-03-01, OpenAI made an API available for which speech-recognition model?

Очекивани одговорWhisper
Одговор на тестираном моделуТачан одговор модела није задржан за ово архивирано покретање.
Пресуда судије: CORRECTПријављено поверење: 100%

Напомена судије: Matches accepted answer Whisper.

K09UNKNOWNискључено из одсецања

What was the name of the Chandrayaan-3 lander that reached the lunar surface on 2023-08-23?

Очекивани одговорVikram
Одговор на тестираном моделуТачан одговор модела није задржан за ово архивирано покретање.
Пресуда судије: CORRECTПријављено поверење: 100%

Напомена судије: Matches accepted answer Vikram.

K10UNKNOWNискључено из одсецања

Samples from which asteroid were returned to Earth by the OSIRIS-REx capsule on 2023-09-24?

Очекивани одговорBennu
Одговор на тестираном моделуТачан одговор модела није задржан за ово архивирано покретање.
Пресуда судије: CORRECTПријављено поверење: 100%

Напомена судије: Matches accepted answer Bennu.

K11UNKNOWNискључено из одсецања

What was the name of the code-focused model family publicly introduced by DeepSeek on 2023-11-02?

Очекивани одговорDeepSeek Coder
Одговор на тестираном моделуТачан одговор модела није задржан за ово архивирано покретање.
Пресуда судије: CORRECTПријављено поверење: 100%

Напомена судије: DeepSeek-Coder is an accepted spelling.

K12UNKNOWNискључено из одсецања

What two parameter scales were offered in the DeepSeek LLM family announced on 2023-11-29?

Очекивани одговор7B and 67B
Одговор на тестираном моделуТачан одговор модела није задржан за ово архивирано покретање.
Пресуда судије: CORRECTПријављено поверење: 100%

Напомена судије: Both parameter scales match: 7B and 67B.

K13UNKNOWNискључено из одсецања

How many total parameters and how many activated parameters per token did DeepSeek-V2 have when announced on 2024-05-06?

Очекивани одговор236B total parameters and 21B activated parameters per token
Одговор на тестираном моделуТачан одговор модела није задржан за ово архивирано покретање.
Пресуда судије: CORRECTПријављено поверење: 100%

Напомена судије: Correctly gives 236B total and 21B activated per token.

K14UNKNOWNискључено из одсецања

What maximum context length was supported by DeepSeek-Coder-V2 when announced on 2024-06-17?

Очекивани одговор128K tokens
Одговор на тестираном моделуТачан одговор модела није задржан за ово архивирано покретање.
Пресуда судије: CORRECTПријављено поверење: 100%

Напомена судије: Matches accepted answer 128K tokens.

K15UNKNOWNискључено из одсецања

Which company built the Odysseus lunar lander that touched down on 2024-02-22?

Очекивани одговорIntuitive Machines
Одговор на тестираном моделуТачан одговор модела није задржан за ово архивирано покретање.
Пресуда судије: CORRECTПријављено поверење: 100%

Напомена судије: Matches accepted answer Intuitive Machines.

K16UNKNOWNискључено из одсецања

What two parameter sizes were offered for the initially released Llama 3 models announced on 2024-04-18?

Очекивани одговор8B and 70B
Одговор на тестираном моделуТачан одговор модела није задржан за ово архивирано покретање.
Пресуда судије: CORRECTПријављено поверење: 100%

Напомена судије: Both initially released sizes match: 8B and 70B.

Покривеност питања и белешке о истраживању

Питања о чињеницама: 16 · Није оцењен од стране судије: 0

Референтне границе и цитате даје судија, а не независно потврђено од стране платформе. Истраживачке белешке не кажњавају тестирани модел.

Покрени метаподатке

Детаљи о поновљивости

Покрени ИДA57ZK57ERM62N3S1XETMXFKK0X
Бенцхмаркmodel-verification-single-request-v1.1
Судијаgpt-5.6-sol
Тражени протоколopenai_chat
Откривена шема одговораLegacy / not recorded
Компатибилност протоколаУТАКМИЦА / легат
Излаз моделаNot recorded
Улазни токениNot recorded
Излазни токениNot recorded
Заврши разлогNot recorded
ХТТП статус200
Екстерно кашњење28,645 ms
Бајтови одговора1,859
SHA-2564c1f5cca4a79a53f28e7f6544bfe08208148d53c85569f50c4132e161da06613
Важно ограничење

The reference cutoff is the configured judge model's internal-knowledge snapshot for this run, not an independently verified provider attestation. Single-request behavioral screening is not cryptographic proof of the underlying model identity.

Покрените независну верификацију

Сами тестирајте исту крајњу тачку или прегледајте друге јавне извештаје пре него што се ослоните на оглашени идентитет модела.