Доклад за проверка на публичен AI модел

deepseek-v4-flash

https://api.model-gate.com/v1/chat/completions

openai_chatgpt-5.6-solSep 6, 2026 09:53 UTC
Наследен качествен рейтинг100/100
PLAUSIBLE60% увереност в оценката
Постоянен отчетhttps://model-gate.com/bg/model-verification/results/A57ZK57ERM62N3S1XETMXFKK0X
Telegram ↗X ↗
Фактическо припомняне100
Актуалност на знанията100
Устойчивост на халюцинации100
Калибриране100
Заявен моделdeepseek-v4-flash
Съдийски решен моделdeepseek-v4-flashUNKNOWN
Хост на крайна точкаapi.model-gate.com
Поле на външен модел на отговорdeepseek-v4-flash
Съдийски анализ

Защо тази проверка получи своя резултат

Публичният доклад отразява аналитичните доказателства, показани на тестера след /chat/verify. Съдийските оценки са оценки по рубрики; само изрични правилни или грешни отговори RECALL могат да повлияят на границата на чисто припомняне.

Диагностика на поведението

Обосновка на съдийското оценяване

4 диагностика
Фактическо припомняне100/100

Не беше запазена отделна съдийска обосновка за този архивиран резултат.

Актуалност на знанията100/100

Не беше запазена отделна съдийска обосновка за този архивиран резултат.

Устойчивост на халюцинации100/100

Не беше запазена отделна съдийска обосновка за този архивиран резултат.

Калибриране100/100

Не беше запазена отделна съдийска обосновка за този архивиран резултат.

Историческа бележка за сравнение: този архивиран общ резултат v1.4 използва предишното фиксирано диагностично обобщаване. Той се запазва за възпроизводимост и не трябва да се тълкува като резултат за съответствие на модела v1.5.

Времеви доказателства

Времева линия за чисто припомняне

0 RECALL сонди

Действителният набор от въпроси беше разбъркан преди заявката за тестван модел. Липсващите слотове за поколение не са въздържание на модела. Графикът реконструира техните целеви месеци за проверка. Само изричните отговори RECALL са крайни доказателства; ИЗВОДИ, ПРЕДПОСТАВКИ и НЕИЗВЕСТНИ остават видими, но не преместват границата.

Месечната хронология не е налична за този архивиран сравнителен резултат.
правилно RECALL грешно ПРИПОМНЕНЕ~ INFERENCE GUESS? UNKNOWN
0RECALL
0INFERENCE
0GUESS
0UNKNOWN
0правилно RECALL
0грешно ПРИПОМНЕНЕ
Времево сравнение

Сравнение на границата на знанията

UNKNOWN
Референтна границаUNKNOWNUNKNOWN · 0%
Най-новото поддържано RECALL0 отговарящи на условията RECALL отговори
Спазвана границаНедостатъчни доказателства за RECALLINSUFFICIENT_RECALL_EVIDENCE
Подравняване на прекъсванеUNKNOWN0% увереност
Съдията отбелязва
  • All Class A items are correct through June 2024, establishing an observed lower bound but no upper bound.
  • The immutable reference snapshot has no known cutoff dates, so cutoff alignment cannot be scored.

Семантичен: правилно 16 · грешно 0 · неизвестен 0. Изключено от прекъсването: 0.

Поведенческа идентичност

Сигнали за самоличност

PLAUSIBLE · 60%

Идентичността се извежда от съответствието между заявения модел и наблюдавания профил на знания/отговори. Това е доказателство, а не дистанционно удостоверение или криптографско доказателство за теглата на сервиране.

Положителни сигнали

  • Perfect performance across all supplied Class A recall items.
  • Correct recall of multiple DeepSeek model releases and specifications.
  • No systematic early knowledge failures.

Отрицателни сигнали

  • No documented canonical identity or cutoff is available in the reference snapshot.
  • Cutoff consistency cannot be evaluated.
  • Self-report and matching API metadata are weak identity evidence.
Обосновка на самоличността на съдията
  • The response is fully correct on all 16 strong-recall questions, including the DeepSeek-specific history items.
  • The observed knowledge extends through June 2024, but the reference cutoff is unknown and therefore provides no identity-comparison signal.
  • The claimed name and API identifier agree, but both are untrusted metadata and do not prove model identity.
Отговор на тестван модел

Дословно извлечен моделен текст

Архивирано резюме

Това изпълнение предхожда запазването на пълния отчет при включване. Предизвикателството, ключът за отговор и нормализирана оценка на съдията са налични, но точният текст на отговора на тествания модел беше умишлено отхвърлен от тази политика за поверителност от епохата на бенчмарка.

Пълен списък с бенчмаркове

Доказателства въпрос по въпрос

Всички допуснати въпроси се показват с очаквания отговор, наличен източник, основа на тестван модел, семантична присъда и допустимост на прекъсване. Неоценените въпроси не са образцови въздържали се. Правилното ПРЕДПОЛАГАНЕ или ИЗВОД остават правилни семантично, но се изключват от доказателствата за прекъсване на чистото припомняне.

K01UNKNOWNизключени от прекъсване

Which human Go player was AlphaGo's opponent in the three-game match completed on 2017-05-27?

Очакван отговорKe Jie
Отговор на тестван моделТочният отговор на модела не беше запазен за това архивирано изпълнение.
Съдийска присъда: CORRECTОтчетено доверие: 100%

Съдийска бележка: Matches accepted answer Ke Jie.

K02UNKNOWNизключени от прекъсване

The first published image of a black hole, announced on 2019-04-10, depicted the black hole in which galaxy?

Очакван отговорMessier 87
Отговор на тестван моделТочният отговор на модела не беше запазен за това архивирано изпълнение.
Съдийска присъда: CORRECTОтчетено доверие: 100%

Съдийска бележка: M87 galaxy is semantically equivalent to Messier 87.

K03UNKNOWNизключени от прекъсване

Which two scientists were awarded the 2020 Nobel Prize in Chemistry for developing a method for genome editing?

Очакван отговорEmmanuelle Charpentier and Jennifer A. Doudna
Отговор на тестван моделТочният отговор на модела не беше запазен за това архивирано изпълнение.
Съдийска присъда: CORRECTОтчетено доверие: 100%

Съдийска бележка: Both required scientists are correctly named.

K04UNKNOWNизключени от прекъсване

Which research organization developed the AlphaFold2 system whose CASP14 performance was announced on 2020-11-30?

Очакван отговорDeepMind
Отговор на тестван моделТочният отговор на модела не беше запазен за това архивирано изпълнение.
Съдийска присъда: CORRECTОтчетено доверие: 100%

Съдийска бележка: Matches accepted answer DeepMind.

K05UNKNOWNизключени от прекъсване

Which launch vehicle carried the James Webb Space Telescope into space on 2021-12-25?

Очакван отговорAriane 5
Отговор на тестван моделТочният отговор на модела не беше запазен за това архивирано изпълнение.
Съдийска присъда: CORRECTОтчетено доверие: 100%

Съдийска бележка: Matches accepted answer Ariane 5.

K06UNKNOWNизключени от прекъсване

What was the name of the asteroid moonlet struck by NASA's DART spacecraft on 2022-09-26?

Очакван отговорDimorphos
Отговор на тестван моделТочният отговор на модела не беше запазен за това архивирано изпълнение.
Съдийска присъда: CORRECTОтчетено доверие: 100%

Съдийска бележка: Matches accepted answer Dimorphos.

K07UNKNOWNизключени от прекъсване

In which ocean did the Artemis I Orion capsule splash down on 2022-12-11?

Очакван отговорPacific Ocean
Отговор на тестван моделТочният отговор на модела не беше запазен за това архивирано изпълнение.
Съдийска присъда: CORRECTОтчетено доверие: 100%

Съдийска бележка: Matches accepted answer Pacific Ocean.

K08UNKNOWNизключени от прекъсване

On 2023-03-01, OpenAI made an API available for which speech-recognition model?

Очакван отговорWhisper
Отговор на тестван моделТочният отговор на модела не беше запазен за това архивирано изпълнение.
Съдийска присъда: CORRECTОтчетено доверие: 100%

Съдийска бележка: Matches accepted answer Whisper.

K09UNKNOWNизключени от прекъсване

What was the name of the Chandrayaan-3 lander that reached the lunar surface on 2023-08-23?

Очакван отговорVikram
Отговор на тестван моделТочният отговор на модела не беше запазен за това архивирано изпълнение.
Съдийска присъда: CORRECTОтчетено доверие: 100%

Съдийска бележка: Matches accepted answer Vikram.

K10UNKNOWNизключени от прекъсване

Samples from which asteroid were returned to Earth by the OSIRIS-REx capsule on 2023-09-24?

Очакван отговорBennu
Отговор на тестван моделТочният отговор на модела не беше запазен за това архивирано изпълнение.
Съдийска присъда: CORRECTОтчетено доверие: 100%

Съдийска бележка: Matches accepted answer Bennu.

K11UNKNOWNизключени от прекъсване

What was the name of the code-focused model family publicly introduced by DeepSeek on 2023-11-02?

Очакван отговорDeepSeek Coder
Отговор на тестван моделТочният отговор на модела не беше запазен за това архивирано изпълнение.
Съдийска присъда: CORRECTОтчетено доверие: 100%

Съдийска бележка: DeepSeek-Coder is an accepted spelling.

K12UNKNOWNизключени от прекъсване

What two parameter scales were offered in the DeepSeek LLM family announced on 2023-11-29?

Очакван отговор7B and 67B
Отговор на тестван моделТочният отговор на модела не беше запазен за това архивирано изпълнение.
Съдийска присъда: CORRECTОтчетено доверие: 100%

Съдийска бележка: Both parameter scales match: 7B and 67B.

K13UNKNOWNизключени от прекъсване

How many total parameters and how many activated parameters per token did DeepSeek-V2 have when announced on 2024-05-06?

Очакван отговор236B total parameters and 21B activated parameters per token
Отговор на тестван моделТочният отговор на модела не беше запазен за това архивирано изпълнение.
Съдийска присъда: CORRECTОтчетено доверие: 100%

Съдийска бележка: Correctly gives 236B total and 21B activated per token.

K14UNKNOWNизключени от прекъсване

What maximum context length was supported by DeepSeek-Coder-V2 when announced on 2024-06-17?

Очакван отговор128K tokens
Отговор на тестван моделТочният отговор на модела не беше запазен за това архивирано изпълнение.
Съдийска присъда: CORRECTОтчетено доверие: 100%

Съдийска бележка: Matches accepted answer 128K tokens.

K15UNKNOWNизключени от прекъсване

Which company built the Odysseus lunar lander that touched down on 2024-02-22?

Очакван отговорIntuitive Machines
Отговор на тестван моделТочният отговор на модела не беше запазен за това архивирано изпълнение.
Съдийска присъда: CORRECTОтчетено доверие: 100%

Съдийска бележка: Matches accepted answer Intuitive Machines.

K16UNKNOWNизключени от прекъсване

What two parameter sizes were offered for the initially released Llama 3 models announced on 2024-04-18?

Очакван отговор8B and 70B
Отговор на тестван моделТочният отговор на модела не беше запазен за това архивирано изпълнение.
Съдийска присъда: CORRECTОтчетено доверие: 100%

Съдийска бележка: Both initially released sizes match: 8B and 70B.

Обхват на въпроси и бележки за изследване

Фактически въпроси: 16 · Не се оценява от съдия: 0

Референтната граница и цитатите се предоставят от съдията, а не се потвърждават независимо от платформата. Изследователските бележки не наказват тествания модел.

Изпълнение на метаданни

Подробности за възпроизводимостта

Run IDA57ZK57ERM62N3S1XETMXFKK0X
Бенчмаркmodel-verification-single-request-v1.1
съдияgpt-5.6-sol
Искан протоколopenai_chat
Открита схема на отговорLegacy / not recorded
Съвместимост на протоколаМАЧ / наследство
Изход на моделаNot recorded
Входни токениNot recorded
Изходни токениNot recorded
Завършете причинатаNot recorded
HTTP състояние200
Външна латентност28,645 ms
Байтове за отговор1,859
SHA-2564c1f5cca4a79a53f28e7f6544bfe08208148d53c85569f50c4132e161da06613
Важно ограничение

The reference cutoff is the configured judge model's internal-knowledge snapshot for this run, not an independently verified provider attestation. Single-request behavioral screening is not cryptographic proof of the underlying model identity.

Извършете независима проверка

Тествайте сами същата крайна точка или прегледайте други публични доклади, преди да разчитате на рекламирана идентичност на модела.