← Javni verifikacijski registarmodel-verification-single-request-v1.1
Javno izvješće o provjeri modela umjetne inteligencije

deepseek-v4-flash

https://api.model-gate.com/v1/chat/completions

openai_chatgpt-5.6-solSep 6, 2026 09:53 UTC
Ukupna ocjena kvalitete100/100
PLAUSIBLE60% povjerenje identiteta
Stalni izvještajhttps://model-gate.com/hr/model-verification/results/A57ZK57ERM62N3S1XETMXFKK0X
Telegram ↗X ↗
Podsjećanje na činjenice100
Najnovije znanje100
Otpornost na halucinacije100
Kalibriranje100
Tvrđeni modeldeepseek-v4-flash
Sudac riješen modeldeepseek-v4-flashUNKNOWN
Domaćin krajnje točkeapi.model-gate.com
Polje modela vanjskog odgovoradeepseek-v4-flash
Analiza sudaca

Zašto je ova provjera dobila svoj rezultat

Javno izvješće odražava analitičke dokaze prikazane testeru nakon /chat/verify. Ocjene sudaca su procjene rubrika; samo izričiti točni ili pogrešni odgovori RECALL mogu utjecati na granicu čistog prisjećanja.

Bodovanje

Obrazloženje suca za bodovanje

100/100
Podsjećanje na činjenice100/100

Za ovaj arhivirani rezultat nije zadržano zasebno sučevo obrazloženje.

Najnovije znanje100/100

Za ovaj arhivirani rezultat nije zadržano zasebno sučevo obrazloženje.

Otpornost na halucinacije100/100

Za ovaj arhivirani rezultat nije zadržano zasebno sučevo obrazloženje.

Kalibriranje100/100

Za ovaj arhivirani rezultat nije zadržano zasebno sučevo obrazloženje.

Ukupna kvaliteta je fiksnih 37,5% prisjećanja činjenica + 25% najnovijeg znanja + 25% otpornosti na halucinacije + 12,5% agregacije kalibracije. Identitet i Cutoff Alignment su odvojene ocjene sudaca.

Vremenski dokaz

16-mjesečna vremenska linija čistog opoziva

0 POZIV sondi

24 pitanja su pomiješana prije zahtjeva testiranog modela. Vremenski slijed rekonstruira njihove ciljane mjesece za reviziju. Samo eksplicitni RECALL odgovori su granični dokaz; ZAKLJUČIVANJE, NAGAĐANJE i NEPOZNATO ostaju vidljivi ali ne pomiču granicu.

Mjesečna vremenska traka nije dostupna za ovaj arhivirani referentni rezultat.
ispravan OPOZIV krivo OPOZIV~ INFERENCE GUESS? UNKNOWN
0RECALL
0INFERENCE
0GUESS
0UNKNOWN
0ispravan OPOZIV
0krivo OPOZIV
Vremenska usporedba

Usporedba graničnih vrijednosti znanja

UNKNOWN
Referentna granicaUNKNOWNUNKNOWN · 0%
Najnoviji podržani RECALL0 prihvatljivi odgovori OPOZIV
Promatrana granicaNedovoljni dokazi za PRISJEĆANJEINSUFFICIENT_RECALL_EVIDENCE
Poravnanje rezaUNKNOWN0% povjerenje
Bilješke suca
  • All Class A items are correct through June 2024, establishing an observed lower bound but no upper bound.
  • The immutable reference snapshot has no known cutoff dates, so cutoff alignment cannot be scored.

Semantički: ispraviti 16 · pogrešno 0 · nepoznato 0. Isključeno iz granične vrijednosti: 0.

Bihevioralni identitet

Signali identiteta

PLAUSIBLE · 60%

Identitet se zaključuje iz dosljednosti između navedenog modela i promatranog profila znanja/odgovora. To je dokaz, a ne daljinska potvrda ili kriptografski dokaz težine posluživanja.

Pozitivni signali

  • Perfect performance across all supplied Class A recall items.
  • Correct recall of multiple DeepSeek model releases and specifications.
  • No systematic early knowledge failures.

Negativni signali

  • No documented canonical identity or cutoff is available in the reference snapshot.
  • Cutoff consistency cannot be evaluated.
  • Self-report and matching API metadata are weak identity evidence.
Obrazloženje identiteta suca
  • The response is fully correct on all 16 strong-recall questions, including the DeepSeek-specific history items.
  • The observed knowledge extends through June 2024, but the reference cutoff is unknown and therefore provides no identity-comparison signal.
  • The claimed name and API identifier agree, but both are untrusted metadata and do not prove model identity.
Odziv testiranog modela

Doslovno izdvojeni tekst modela

Arhivirani sažetak

Ovo izvođenje prethodilo je opt-in zadržavanju cjelovitog izvješća. Izazov, ključ odgovora i normalizirana procjena suca dostupni su, ali točan tekst odgovora testiranog modela namjerno je odbačen tom politikom privatnosti iz razdoblja benchmarka.

Kompletan popis referentnih vrijednosti

Dokazi od pitanja do pitanja

Sve 24 vremenske sonde prikazane su s očekivanim odgovorom, javnim izvorom, osnovom testiranog modela, semantičkom prosudbom i prihvatljivošću ograničenja. Točna POGODBA ili ZAKLJUČAK ostaju ispravni semantički, ali se isključuju iz dokaza prekida čistog prisjećanja.

K01UNKNOWNisključeno iz prekida

Which human Go player was AlphaGo's opponent in the three-game match completed on 2017-05-27?

Očekivani odgovorKe Jie
Odgovor provjerenog modelaTočan odgovor modela nije sačuvan za ovo arhivirano izvođenje.
Presuda suca: CORRECTPrijavljeno povjerenje: 100%

Napomena suca: Matches accepted answer Ke Jie.

K02UNKNOWNisključeno iz prekida

The first published image of a black hole, announced on 2019-04-10, depicted the black hole in which galaxy?

Očekivani odgovorMessier 87
Odgovor provjerenog modelaTočan odgovor modela nije sačuvan za ovo arhivirano izvođenje.
Presuda suca: CORRECTPrijavljeno povjerenje: 100%

Napomena suca: M87 galaxy is semantically equivalent to Messier 87.

K03UNKNOWNisključeno iz prekida

Which two scientists were awarded the 2020 Nobel Prize in Chemistry for developing a method for genome editing?

Očekivani odgovorEmmanuelle Charpentier and Jennifer A. Doudna
Odgovor provjerenog modelaTočan odgovor modela nije sačuvan za ovo arhivirano izvođenje.
Presuda suca: CORRECTPrijavljeno povjerenje: 100%

Napomena suca: Both required scientists are correctly named.

K04UNKNOWNisključeno iz prekida

Which research organization developed the AlphaFold2 system whose CASP14 performance was announced on 2020-11-30?

Očekivani odgovorDeepMind
Odgovor provjerenog modelaTočan odgovor modela nije sačuvan za ovo arhivirano izvođenje.
Presuda suca: CORRECTPrijavljeno povjerenje: 100%

Napomena suca: Matches accepted answer DeepMind.

K05UNKNOWNisključeno iz prekida

Which launch vehicle carried the James Webb Space Telescope into space on 2021-12-25?

Očekivani odgovorAriane 5
Odgovor provjerenog modelaTočan odgovor modela nije sačuvan za ovo arhivirano izvođenje.
Presuda suca: CORRECTPrijavljeno povjerenje: 100%

Napomena suca: Matches accepted answer Ariane 5.

K06UNKNOWNisključeno iz prekida

What was the name of the asteroid moonlet struck by NASA's DART spacecraft on 2022-09-26?

Očekivani odgovorDimorphos
Odgovor provjerenog modelaTočan odgovor modela nije sačuvan za ovo arhivirano izvođenje.
Presuda suca: CORRECTPrijavljeno povjerenje: 100%

Napomena suca: Matches accepted answer Dimorphos.

K07UNKNOWNisključeno iz prekida

In which ocean did the Artemis I Orion capsule splash down on 2022-12-11?

Očekivani odgovorPacific Ocean
Odgovor provjerenog modelaTočan odgovor modela nije sačuvan za ovo arhivirano izvođenje.
Presuda suca: CORRECTPrijavljeno povjerenje: 100%

Napomena suca: Matches accepted answer Pacific Ocean.

K08UNKNOWNisključeno iz prekida

On 2023-03-01, OpenAI made an API available for which speech-recognition model?

Očekivani odgovorWhisper
Odgovor provjerenog modelaTočan odgovor modela nije sačuvan za ovo arhivirano izvođenje.
Presuda suca: CORRECTPrijavljeno povjerenje: 100%

Napomena suca: Matches accepted answer Whisper.

K09UNKNOWNisključeno iz prekida

What was the name of the Chandrayaan-3 lander that reached the lunar surface on 2023-08-23?

Očekivani odgovorVikram
Odgovor provjerenog modelaTočan odgovor modela nije sačuvan za ovo arhivirano izvođenje.
Presuda suca: CORRECTPrijavljeno povjerenje: 100%

Napomena suca: Matches accepted answer Vikram.

K10UNKNOWNisključeno iz prekida

Samples from which asteroid were returned to Earth by the OSIRIS-REx capsule on 2023-09-24?

Očekivani odgovorBennu
Odgovor provjerenog modelaTočan odgovor modela nije sačuvan za ovo arhivirano izvođenje.
Presuda suca: CORRECTPrijavljeno povjerenje: 100%

Napomena suca: Matches accepted answer Bennu.

K11UNKNOWNisključeno iz prekida

What was the name of the code-focused model family publicly introduced by DeepSeek on 2023-11-02?

Očekivani odgovorDeepSeek Coder
Odgovor provjerenog modelaTočan odgovor modela nije sačuvan za ovo arhivirano izvođenje.
Presuda suca: CORRECTPrijavljeno povjerenje: 100%

Napomena suca: DeepSeek-Coder is an accepted spelling.

K12UNKNOWNisključeno iz prekida

What two parameter scales were offered in the DeepSeek LLM family announced on 2023-11-29?

Očekivani odgovor7B and 67B
Odgovor provjerenog modelaTočan odgovor modela nije sačuvan za ovo arhivirano izvođenje.
Presuda suca: CORRECTPrijavljeno povjerenje: 100%

Napomena suca: Both parameter scales match: 7B and 67B.

K13UNKNOWNisključeno iz prekida

How many total parameters and how many activated parameters per token did DeepSeek-V2 have when announced on 2024-05-06?

Očekivani odgovor236B total parameters and 21B activated parameters per token
Odgovor provjerenog modelaTočan odgovor modela nije sačuvan za ovo arhivirano izvođenje.
Presuda suca: CORRECTPrijavljeno povjerenje: 100%

Napomena suca: Correctly gives 236B total and 21B activated per token.

K14UNKNOWNisključeno iz prekida

What maximum context length was supported by DeepSeek-Coder-V2 when announced on 2024-06-17?

Očekivani odgovor128K tokens
Odgovor provjerenog modelaTočan odgovor modela nije sačuvan za ovo arhivirano izvođenje.
Presuda suca: CORRECTPrijavljeno povjerenje: 100%

Napomena suca: Matches accepted answer 128K tokens.

K15UNKNOWNisključeno iz prekida

Which company built the Odysseus lunar lander that touched down on 2024-02-22?

Očekivani odgovorIntuitive Machines
Odgovor provjerenog modelaTočan odgovor modela nije sačuvan za ovo arhivirano izvođenje.
Presuda suca: CORRECTPrijavljeno povjerenje: 100%

Napomena suca: Matches accepted answer Intuitive Machines.

K16UNKNOWNisključeno iz prekida

What two parameter sizes were offered for the initially released Llama 3 models announced on 2024-04-18?

Očekivani odgovor8B and 70B
Odgovor provjerenog modelaTočan odgovor modela nije sačuvan za ovo arhivirano izvođenje.
Presuda suca: CORRECTPrijavljeno povjerenje: 100%

Napomena suca: Both initially released sizes match: 8B and 70B.

Pokreni metapodatke

Pojedinosti o ponovljivosti

Pokreni IDA57ZK57ERM62N3S1XETMXFKK0X
Benchmarkmodel-verification-single-request-v1.1
Suditigpt-5.6-sol
Protokolopenai_chat
HTTP status200
Vanjska latencija28,645 ms
Bajtovi odgovora1,859
SHA-2564c1f5cca4a79a53f28e7f6544bfe08208148d53c85569f50c4132e161da06613
Važno ograničenje

The reference cutoff is the configured judge model's internal-knowledge snapshot for this run, not an independently verified provider attestation. Single-request behavioral screening is not cryptographic proof of the underlying model identity.

Pokrenite neovisnu provjeru

Testirajte sami istu krajnju točku ili pregledajte druga javna izvješća prije nego što se oslonite na oglašeni identitet modela.