← Genel doğrulama kaydımodel-verification-single-request-v1.2
Herkese açık yapay zeka modeli doğrulama raporu

deepseek-v4-flash

https://api.model-gate.com/v1/chat/completions

openai_chatgpt-5.6-solSep 6, 2026 16:39 UTC
Eski kalite puanı87/100
CONSISTENT82% değerlendirme güveni
Kalıcı raporhttps://model-gate.com/tr/model-verification/results/0B0HVDB2FRJEJC90BRG4D7JV1Y
Telegram ↗X ↗
Gerçek Hatırlama83
Bilgi Yeniliği82
Halüsinasyon Direnci83
Kalibrasyon80
Talep edilen modeldeepseek-v4-flash
Yargıç tarafından çözümlenen modelDeepSeek-V4-Flash-0731DeepSeek AI
Uç nokta ana bilgisayarıapi.model-gate.com
Dış yanıt modeli alanıdeepseek-v4-flash
Hakim analizi

Bu doğrulamanın sonucu neden alındı?

Herkese açık rapor, /chat/verify sonrasında test uzmanına gösterilen analitik kanıtları yansıtır. Hakem puanları değerlendirme tablosu değerlendirmeleridir; yalnızca açık doğru veya yanlış RECALL yanıtları saf hatırlama kesme sınırını etkileyebilir.

Davranış teşhisi

Hakem puanlama mantığı

4 teşhis
Gerçek Hatırlama83/100

Arşivlenen bu sonuç için ayrı bir yargıç gerekçesi korunmadı.

Bilgi Yeniliği82/100

Arşivlenen bu sonuç için ayrı bir yargıç gerekçesi korunmadı.

Halüsinasyon Direnci83/100

Arşivlenen bu sonuç için ayrı bir yargıç gerekçesi korunmadı.

Kalibrasyon80/100

Arşivlenen bu sonuç için ayrı bir yargıç gerekçesi korunmadı.

Tarihsel karşılaştırma notu: Bu arşivlenmiş v1.4 genel puanı, önceki sabit tanı toplamayı kullanmıştır. Tekrarlanabilirlik amacıyla saklanır ve v1.5 Model Eşleştirme puanı olarak yorumlanmamalıdır.

Zamansal kanıt

Saf hatırlama zaman çizelgesi

0 PROBLARI GERİ ÇAĞIR

Gerçek soru seti, test edilen model talebinden önce karıştırıldı. Eksik nesil slotları model çekimserliği değildir. Zaman çizelgesi, denetlenebilirlik açısından hedef ayları yeniden yapılandırır. Yalnızca açık RECALL yanıtları kesme kanıtıdır; ÇIKARMA, TAHMİN ve BİLİNMEYEN görünür kalır ancak sınırı değiştirmez.

2023-11? K24UNKNOWN
2023-12? K13UNKNOWN
2024-01? K08UNKNOWN
2024-02? K07UNKNOWN
2024-03? K15UNKNOWN
2024-04? K18UNKNOWN
2024-05? K04UNKNOWN
2024-06? K16UNKNOWN
2024-07? K06UNKNOWN
2024-08? K03UNKNOWN
2024-09? K09UNKNOWN
2024-10? K17UNKNOWN
2024-11? K20UNKNOWN
2024-12? K10UNKNOWN
2025-01? K12UNKNOWN
2025-02? K14UNKNOWN
2025-03? K11UNKNOWN
2025-04? K21UNKNOWN
2025-05? K22UNKNOWN
2025-06? K23UNKNOWN
2025-07? K02UNKNOWN
2025-08? K05UNKNOWN
2025-09? K01UNKNOWN
2025-10? K19UNKNOWN
doğru GERİ ÇAĞIRMA yanlış ÇAĞIRMA~ INFERENCE GUESS? UNKNOWN
0RECALL
0INFERENCE
0GUESS
0UNKNOWN
0doğru GERİ ÇAĞIRMA
0yanlış ÇAĞIRMA
Zamansal karşılaştırma

Bilgi sınırı karşılaştırması

CONSISTENT
Referans kesintisi2025-05ESTIMATED_WEB · 0%
En son desteklenen RECALL0 uygun RECALL cevapları
Gözlemlenen sınırYetersiz GERİ ÇAĞIRMA kanıtıINSUFFICIENT_RECALL_EVIDENCE
Kesme HizalamasıCONSISTENT88/100 · 80% kendinden emin
Hakim notları
  • Strong recall is nearly complete through the May 2025 reference cutoff.
  • There is no systematic strong-recall failure substantially before the reference cutoff.
  • Correct June and August 2025 answers suggest selective later knowledge, while failures in July, September, and October prevent a clearly later boundary.

anlamsal: doğru 20 · yanlış 4 · bilinmiyor 0. Kesintiden hariç tutuldu: 0.

Davranışsal kimlik

Kimlik sinyalleri

CONSISTENT · 82%

Kimlik, iddia edilen model ile gözlemlenen bilgi/cevap profili arasındaki tutarlılıktan çıkarılır. Bu, servis ağırlıklarının uzaktan tasdiki veya kriptografik kanıtı değil, kanıtıdır.

Olumlu sinyaller

  • Excellent recall across late 2023 through May 2025.
  • Correct near-cutoff answer for the WHO Pandemic Agreement.
  • No pattern of early knowledge degradation.

Negatif sinyaller

  • Incorrect February 2024 lunar-lander answer despite high confidence.
  • Correct June and August 2025 answers extend beyond the estimated reference cutoff.
  • Several post-cutoff answers are confidently wrong, indicating uneven recency.
Yargıç kimlik gerekçesi
  • Observed behavior broadly overlaps the saved May 2025 reference cutoff.
  • The model answered 20 of 24 Class A items correctly, with only one isolated failure well before the cutoff.
  • Post-cutoff knowledge is uneven and can plausibly reflect selective updates rather than model substitution.
Test edilmiş model yanıtı

Verbatim model metnini çıkardı

Arşivlenmiş özet

Bu çalıştırma, tam raporun saklanmasını etkinleştirmeden önce gerçekleşir. Soru, cevap anahtarı ve normalleştirilmiş jüri değerlendirmesi mevcuttur, ancak tam olarak test edilmiş model yanıt metni, o kıyaslama dönemi gizlilik politikası tarafından kasıtlı olarak atılmıştır.

Karşılaştırma listesinin tamamını tamamlayın

Soru bazında kanıt

Kabul edilen tüm sorular beklenen yanıt, mevcut kaynak, test edilmiş model esası, anlamsal karar ve kesme uygunluğuyla birlikte gösterilir. Not verilmeyen sorular örnek çekimserlik değildir. Doğru bir TAHMİN veya ÇIKARIM anlamsal olarak doğru kalır ancak saf hatırlama kesme kanıtlarının dışında bırakılır.

K01UNKNOWNkesintinin dışında tutuldu

Who won the men's 100 metres at the World Athletics Championships in Tokyo?

Beklenen cevapOblique SevilleSource ↗
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: WRONGBildirilen güven: 75%

Hakim notu: Expected Oblique Seville; answered Kishane Thompson.

K02UNKNOWNkesintinin dışında tutuldu

Which team won the UEFA Women's Euro 2025 final?

Beklenen cevapEnglandSource ↗
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: WRONGBildirilen güven: 85%

Hakim notu: Expected England; answered Spain.

K03UNKNOWNkesintinin dışında tutuldu

Which disease's African upsurge did WHO declare a public health emergency of international concern?

Beklenen cevapmpoxSource ↗
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 95%

Hakim notu: Matches mpox.

K04UNKNOWNkesintinin dışında tutuldu

What molecular-structure prediction model did Google DeepMind and Isomorphic Labs introduce?

Beklenen cevapAlphaFold 3Source ↗
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 95%

Hakim notu: Matches AlphaFold 3.

K05UNKNOWNkesintinin dışında tutuldu

What model did OpenAI release as a unified system with built-in thinking?

Beklenen cevapGPT-5Source ↗
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 90%

Hakim notu: Matches GPT-5.

K06UNKNOWNkesintinin dışında tutuldu

Which operating system was affected by the faulty CrowdStrike Falcon content update?

Beklenen cevapWindowsSource ↗
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 95%

Hakim notu: Microsoft Windows is accepted.

K07UNKNOWNkesintinin dışında tutuldu

What was the nickname of Intuitive Machines' Nova-C lander that touched down on the Moon?

Beklenen cevapOdysseusSource ↗
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: WRONGBildirilen güven: 80%

Hakim notu: Expected Odysseus; Odie is not an accepted answer.

K08UNKNOWNkesintinin dışında tutuldu

What was the name of Japan's lunar lander that successfully reached the Moon?

Beklenen cevapSLIMSource ↗
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 95%

Hakim notu: Matches SLIM.

K09UNKNOWNkesintinin dışında tutuldu

Who became the first private astronaut to perform a spacewalk?

Beklenen cevapJared IsaacmanSource ↗
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 95%

Hakim notu: Matches Jared Isaacman.

K10UNKNOWNkesintinin dışında tutuldu

Which country was appointed host of the 2034 FIFA World Cup?

Beklenen cevapSaudi ArabiaSource ↗
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 95%

Hakim notu: Matches Saudi Arabia.

K11UNKNOWNkesintinin dışında tutuldu

In which lunar mare did Firefly Aerospace's Blue Ghost land?

Beklenen cevapMare CrisiumSource ↗
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 90%

Hakim notu: Matches Mare Crisium.

K12UNKNOWNkesintinin dışında tutuldu

What model did DeepSeek begin serving through its deepseek-reasoner endpoint?

Beklenen cevapDeepSeek-R1Source ↗
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 95%

Hakim notu: Matches DeepSeek-R1.

K13UNKNOWNkesintinin dışında tutuldu

What was the name of the second malaria vaccine prequalified by WHO?

Beklenen cevapR21/Matrix-MSource ↗
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 90%

Hakim notu: Matches R21/Matrix-M.

K14UNKNOWNkesintinin dışında tutuldu

Which album won Album of the Year at the 67th Grammy Awards?

Beklenen cevapCowboy CarterSource ↗
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 95%

Hakim notu: Matches Cowboy Carter.

K15UNKNOWNkesintinin dışında tutuldu

How many European Parliament members voted in favor of the Artificial Intelligence Act?

Beklenen cevap523Source ↗
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 85%

Hakim notu: Matches 523.

K16UNKNOWNkesintinin dışında tutuldu

How many grams of lunar material did the Chang'e-6 mission collect?

Beklenen cevap1,935.3 gramsSource ↗
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 90%

Hakim notu: Matches 1,935.3 grams.

K17UNKNOWNkesintinin dışında tutuldu

Which rocket launched NASA's Europa Clipper spacecraft?

Beklenen cevapFalcon HeavySource ↗
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 95%

Hakim notu: Matches Falcon Heavy.

K18UNKNOWNkesintinin dışında tutuldu

What designation was given to the newly identified 33-solar-mass stellar black hole in the Milky Way?

Beklenen cevapGaia BH3Source ↗
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 90%

Hakim notu: Matches Gaia BH3.

K19UNKNOWNkesintinin dışında tutuldu

Who was awarded the 2025 Nobel Peace Prize?

Beklenen cevapMaria Corina MachadoSource ↗
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: WRONGBildirilen güven: 70%

Hakim notu: Expected Maria Corina Machado; answered an institution.

K20UNKNOWNkesintinin dışında tutuldu

What annual climate-finance goal for developing countries did COP29 set for 2035?

Beklenen cevapUS$300 billion per yearSource ↗
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 90%

Hakim notu: Matches $300 billion per year.

K21UNKNOWNkesintinin dışında tutuldu

What was the name of the first human spaceflight to orbit over Earth's polar regions?

Beklenen cevapFram2Source ↗
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 90%

Hakim notu: Matches Fram2.

K22UNKNOWNkesintinin dışında tutuldu

Under which article of the WHO Constitution was the Pandemic Agreement adopted?

Beklenen cevapArticle 19Source ↗
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 75%

Hakim notu: Matches Article 19.

K23UNKNOWNkesintinin dışında tutuldu

Which new Mario Kart game launched alongside Nintendo Switch 2?

Beklenen cevapMario Kart WorldSource ↗
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 95%

Hakim notu: Matches Mario Kart World.

K24UNKNOWNkesintinin dışında tutuldu

What model did OpenAI introduce with a 128K context window at its first DevDay?

Beklenen cevapGPT-4 TurboSource ↗
Test edilmiş model yanıtıBu arşivlenmiş çalıştırma için tam model yanıtı korunmadı.
Yargıç kararı: CORRECTBildirilen güven: 95%

Hakim notu: Matches GPT-4 Turbo.

Soru kapsamı ve araştırma notları

Gerçek sorular: 24 · Hakim tarafından notlandırılmadı: 0

Referans kesintisi ve alıntılar hakim tarafından sağlanır, platform tarafından bağımsız olarak onaylanmaz. Araştırma notları test edilen modeli cezalandırmaz.

Meta verileri çalıştır

Tekrarlanabilirlik ayrıntıları

Çalıştırma kimliği0B0HVDB2FRJEJC90BRG4D7JV1Y
Kalite testimodel-verification-single-request-v1.2
Yargıçgpt-5.6-sol
İstenen protokolopenai_chat
Algılanan yanıt şemasıLegacy / not recorded
Protokol uyumluluğuMAÇ / eski
Modeli çıktısıNot recorded
Giriş jetonlarıNot recorded
Çıkış jetonlarıNot recorded
Bitiş nedeniNot recorded
HTTP durumu200
Harici gecikme88,304 ms
Yanıt baytları2,460
SHA-256f22e63d94e67fbd4fdfa25a27a37ae4b3402f94fc6801d14c2a4e638f85cfd9d
Önemli sınırlama

The reference cutoff is a judge-produced snapshot grounded in hosted web evidence when available (official sources preferred, otherwise the best defensible estimate). It is not provider attestation. Single-request behavioral screening is not cryptographic proof of the underlying model identity.

Bağımsız bir doğrulama çalıştırın

Reklamı yapılan bir model kimliğine güvenmeden önce aynı uç noktayı kendiniz test edin veya diğer genel raporlara göz atın.