← Genel doğrulama kaydımodel-verification-single-request-v1.1
Herkese açık yapay zeka modeli doğrulama raporu

deepseek-v4-flash

https://api.model-gate.com/v1/chat/completions

openai_chatgpt-5.6-solSep 6, 2026 09:53 UTC
Eski kalite puanı100/100
PLAUSIBLE60% değerlendirme güveni
Kalıcı raporhttps://model-gate.com/tr/model-verification/results/A57ZK57ERM62N3S1XETMXFKK0X
Telegram ↗X ↗
Gerçek Hatırlama100
Bilgi Yeniliği100
Halüsinasyon Direnci100
Kalibrasyon100
Talep edilen modeldeepseek-v4-flash
Yargıç tarafından çözümlenen modeldeepseek-v4-flashUNKNOWN
Uç nokta ana bilgisayarıapi.model-gate.com
Dış yanıt modeli alanıdeepseek-v4-flash
Hakim analizi

Bu doğrulamanın sonucu neden alındı?

Herkese açık rapor, /chat/verify sonrasında test uzmanına gösterilen analitik kanıtları yansıtır. Hakem puanları değerlendirme tablosu değerlendirmeleridir; yalnızca açık doğru veya yanlış RECALL yanıtları saf hatırlama kesme sınırını etkileyebilir.

Davranış teşhisi

Hakem puanlama mantığı

4 teşhis
Gerçek Hatırlama100/100

Arşivlenen bu sonuç için ayrı bir yargıç gerekçesi korunmadı.

Bilgi Yeniliği100/100

Arşivlenen bu sonuç için ayrı bir yargıç gerekçesi korunmadı.

Halüsinasyon Direnci100/100

Arşivlenen bu sonuç için ayrı bir yargıç gerekçesi korunmadı.

Kalibrasyon100/100

Arşivlenen bu sonuç için ayrı bir yargıç gerekçesi korunmadı.

Tarihsel karşılaştırma notu: Bu arşivlenmiş v1.4 genel puanı, önceki sabit tanı toplamayı kullanmıştır. Tekrarlanabilirlik amacıyla saklanır ve v1.5 Model Eşleştirme puanı olarak yorumlanmamalıdır.

Zamansal kanıt

Saf hatırlama zaman çizelgesi

0 PROBLARI GERİ ÇAĞIR

Gerçek soru seti, test edilen model talebinden önce karıştırıldı. Eksik nesil slotları model çekimserliği değildir. Zaman çizelgesi, denetlenebilirlik açısından hedef ayları yeniden yapılandırır. Yalnızca açık RECALL yanıtları kesme kanıtıdır; ÇIKARMA, TAHMİN ve BİLİNMEYEN görünür kalır ancak sınırı değiştirmez.

Bu arşivlenmiş karşılaştırma sonucu için aylık zaman çizelgesi mevcut değil.
doğru GERİ ÇAĞIRMA yanlış ÇAĞIRMA~ INFERENCE GUESS? UNKNOWN
0RECALL
0INFERENCE
0GUESS
0UNKNOWN
0doğru GERİ ÇAĞIRMA
0yanlış ÇAĞIRMA
Zamansal karşılaştırma

Bilgi sınırı karşılaştırması

UNKNOWN
Referans kesintisiUNKNOWNUNKNOWN · 0%
En son desteklenen RECALL0 uygun RECALL cevapları
Gözlemlenen sınırYetersiz GERİ ÇAĞIRMA kanıtıINSUFFICIENT_RECALL_EVIDENCE
Kesme HizalamasıUNKNOWN0% kendinden emin
Hakim notları
  • All Class A items are correct through June 2024, establishing an observed lower bound but no upper bound.
  • The immutable reference snapshot has no known cutoff dates, so cutoff alignment cannot be scored.

anlamsal: doğru 16 · yanlış 0 · bilinmiyor 0. Kesintiden hariç tutuldu: 0.

Davranışsal kimlik

Kimlik sinyalleri

PLAUSIBLE · 60%

Kimlik, iddia edilen model ile gözlemlenen bilgi/cevap profili arasındaki tutarlılıktan çıkarılır. Bu, servis ağırlıklarının uzaktan tasdiki veya kriptografik kanıtı değil, kanıtıdır.

Olumlu sinyaller

  • Perfect performance across all supplied Class A recall items.
  • Correct recall of multiple DeepSeek model releases and specifications.
  • No systematic early knowledge failures.

Negatif sinyaller

  • No documented canonical identity or cutoff is available in the reference snapshot.
  • Cutoff consistency cannot be evaluated.
  • Self-report and matching API metadata are weak identity evidence.
Yargıç kimlik gerekçesi
  • The response is fully correct on all 16 strong-recall questions, including the DeepSeek-specific history items.
  • The observed knowledge extends through June 2024, but the reference cutoff is unknown and therefore provides no identity-comparison signal.
  • The claimed name and API identifier agree, but both are untrusted metadata and do not prove model identity.
Test edilmiş model yanıtı

Verbatim model metnini çıkardı

Arşivlenmiş özet

Bu çalıştırma, tam raporun saklanmasını etkinleştirmeden önce gerçekleşir. Soru, cevap anahtarı ve normalleştirilmiş jüri değerlendirmesi mevcuttur, ancak tam olarak test edilmiş model yanıt metni, o kıyaslama dönemi gizlilik politikası tarafından kasıtlı olarak atılmıştır.

Karşılaştırma listesinin tamamını tamamlayın

Soru bazında kanıt

Kabul edilen tüm sorular beklenen yanıt, mevcut kaynak, test edilmiş model esası, anlamsal karar ve kesme uygunluğuyla birlikte gösterilir. Not verilmeyen sorular örnek çekimserlik değildir. Doğru bir TAHMİN veya ÇIKARIM anlamsal olarak doğru kalır ancak saf hatırlama kesme kanıtlarının dışında bırakılır.

K01UNKNOWNkesintinin dışında tutuldu

Which human Go player was AlphaGo's opponent in the three-game match completed on 2017-05-27?

Beklenen cevapKe Jie
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 100%

Hakim notu: Matches accepted answer Ke Jie.

K02UNKNOWNkesintinin dışında tutuldu

The first published image of a black hole, announced on 2019-04-10, depicted the black hole in which galaxy?

Beklenen cevapMessier 87
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 100%

Hakim notu: M87 galaxy is semantically equivalent to Messier 87.

K03UNKNOWNkesintinin dışında tutuldu

Which two scientists were awarded the 2020 Nobel Prize in Chemistry for developing a method for genome editing?

Beklenen cevapEmmanuelle Charpentier and Jennifer A. Doudna
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 100%

Hakim notu: Both required scientists are correctly named.

K04UNKNOWNkesintinin dışında tutuldu

Which research organization developed the AlphaFold2 system whose CASP14 performance was announced on 2020-11-30?

Beklenen cevapDeepMind
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 100%

Hakim notu: Matches accepted answer DeepMind.

K05UNKNOWNkesintinin dışında tutuldu

Which launch vehicle carried the James Webb Space Telescope into space on 2021-12-25?

Beklenen cevapAriane 5
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 100%

Hakim notu: Matches accepted answer Ariane 5.

K06UNKNOWNkesintinin dışında tutuldu

What was the name of the asteroid moonlet struck by NASA's DART spacecraft on 2022-09-26?

Beklenen cevapDimorphos
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 100%

Hakim notu: Matches accepted answer Dimorphos.

K07UNKNOWNkesintinin dışında tutuldu

In which ocean did the Artemis I Orion capsule splash down on 2022-12-11?

Beklenen cevapPacific Ocean
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 100%

Hakim notu: Matches accepted answer Pacific Ocean.

K08UNKNOWNkesintinin dışında tutuldu

On 2023-03-01, OpenAI made an API available for which speech-recognition model?

Beklenen cevapWhisper
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 100%

Hakim notu: Matches accepted answer Whisper.

K09UNKNOWNkesintinin dışında tutuldu

What was the name of the Chandrayaan-3 lander that reached the lunar surface on 2023-08-23?

Beklenen cevapVikram
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 100%

Hakim notu: Matches accepted answer Vikram.

K10UNKNOWNkesintinin dışında tutuldu

Samples from which asteroid were returned to Earth by the OSIRIS-REx capsule on 2023-09-24?

Beklenen cevapBennu
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 100%

Hakim notu: Matches accepted answer Bennu.

K11UNKNOWNkesintinin dışında tutuldu

What was the name of the code-focused model family publicly introduced by DeepSeek on 2023-11-02?

Beklenen cevapDeepSeek Coder
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 100%

Hakim notu: DeepSeek-Coder is an accepted spelling.

K12UNKNOWNkesintinin dışında tutuldu

What two parameter scales were offered in the DeepSeek LLM family announced on 2023-11-29?

Beklenen cevap7B and 67B
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 100%

Hakim notu: Both parameter scales match: 7B and 67B.

K13UNKNOWNkesintinin dışında tutuldu

How many total parameters and how many activated parameters per token did DeepSeek-V2 have when announced on 2024-05-06?

Beklenen cevap236B total parameters and 21B activated parameters per token
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 100%

Hakim notu: Correctly gives 236B total and 21B activated per token.

K14UNKNOWNkesintinin dışında tutuldu

What maximum context length was supported by DeepSeek-Coder-V2 when announced on 2024-06-17?

Beklenen cevap128K tokens
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 100%

Hakim notu: Matches accepted answer 128K tokens.

K15UNKNOWNkesintinin dışında tutuldu

Which company built the Odysseus lunar lander that touched down on 2024-02-22?

Beklenen cevapIntuitive Machines
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 100%

Hakim notu: Matches accepted answer Intuitive Machines.

K16UNKNOWNkesintinin dışında tutuldu

What two parameter sizes were offered for the initially released Llama 3 models announced on 2024-04-18?

Beklenen cevap8B and 70B
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 100%

Hakim notu: Both initially released sizes match: 8B and 70B.

Soru kapsamı ve araştırma notları

Gerçek sorular: 16 · Hakim tarafından notlandırılmadı: 0

Referans kesintisi ve alıntılar hakim tarafından sağlanır, platform tarafından bağımsız olarak onaylanmaz. Araştırma notları test edilen modeli cezalandırmaz.

Meta verileri çalıştır

Tekrarlanabilirlik ayrıntıları

Çalıştırma kimliğiA57ZK57ERM62N3S1XETMXFKK0X
Kalite testimodel-verification-single-request-v1.1
Yargıçgpt-5.6-sol
İstenen protokolopenai_chat
Algılanan yanıt şemasıLegacy / not recorded
Protokol uyumluluğuMAÇ / eski
Modeli çıktısıNot recorded
Giriş jetonlarıNot recorded
Çıkış jetonlarıNot recorded
Bitiş nedeniNot recorded
HTTP durumu200
Harici gecikme28,645 ms
Yanıt baytları1,859
SHA-2564c1f5cca4a79a53f28e7f6544bfe08208148d53c85569f50c4132e161da06613
Önemli sınırlama

The reference cutoff is the configured judge model's internal-knowledge snapshot for this run, not an independently verified provider attestation. Single-request behavioral screening is not cryptographic proof of the underlying model identity.

Bağımsız bir doğrulama çalıştırın

Reklamı yapılan bir model kimliğine güvenmeden önce aynı uç noktayı kendiniz test edin veya diğer genel raporlara göz atın.