← 公的認証登録簿model-verification-single-request-v1.2
公開AIモデル検証レポート

deepseek-v4-flash

https://api.model-gate.com/v1/chat/completions

openai_chatgpt-5.6-solSep 6, 2026 16:39 UTC
従来の品質スコア87/100
CONSISTENT82% 評価の信頼性
永久報告書https://model-gate.com/ja/model-verification/results/0B0HVDB2FRJEJC90BRG4D7JV1Y
Telegram ↗X ↗
事実の想起83
知識の最新性82
幻覚耐性83
較正80
主張されているモデルdeepseek-v4-flash
裁判官決議モデルDeepSeek-V4-Flash-0731DeepSeek AI
エンドポイントホストapi.model-gate.com
外部応答モデルフィールドdeepseek-v4-flash
裁判官の分析

この検証結果が得られた理由

公開レポートは、/chat/verify の後にテスターに​​示される分析証拠を反映しています。審査員のスコアはルーブリック評価です。純粋なリコールのカットオフ境界に影響を与えることができるのは、明示的な正解または不正解の RECALL の回答のみです。

行動診断

ジャッジの採点根拠

4つの診断
事実の想起83/100

このアーカイブされた結果については、別の裁判官の理論的根拠は保持されていません。

知識の最新性82/100

このアーカイブされた結果については、別の裁判官の理論的根拠は保持されていません。

幻覚耐性83/100

このアーカイブされた結果については、別の裁判官の理論的根拠は保持されていません。

較正80/100

このアーカイブされた結果については、別の裁判官の理論的根拠は保持されていません。

過去のベンチマークのメモ: このアーカイブされた v1.4 の全体スコアでは、以前の固定診断集計が使用されています。これは再現性のために保持されており、v1.5 のモデル マッチ スコアとして解釈しないでください。

一時的な証拠

純粋な想起のタイムライン

0 リコールプローブ

実際の質問セットは、テスト済みモデルのリクエストの前にシャッフルされました。世代スロットの欠落はモデル棄権ではありません。タイムラインは、監査可能性を考慮して目標月を再構成します。明示的な「RECALL」の回答のみが完全な証拠となります。 INFERENCE、GUESS、UNKNOWN は表示されたままですが、境界は移動しません。

2023-11? K24UNKNOWN
2023-12? K13UNKNOWN
2024-01? K08UNKNOWN
2024-02? K07UNKNOWN
2024-03? K15UNKNOWN
2024-04? K18UNKNOWN
2024-05? K04UNKNOWN
2024-06? K16UNKNOWN
2024-07? K06UNKNOWN
2024-08? K03UNKNOWN
2024-09? K09UNKNOWN
2024-10? K17UNKNOWN
2024-11? K20UNKNOWN
2024-12? K10UNKNOWN
2025-01? K12UNKNOWN
2025-02? K14UNKNOWN
2025-03? K11UNKNOWN
2025-04? K21UNKNOWN
2025-05? K22UNKNOWN
2025-06? K23UNKNOWN
2025-07? K02UNKNOWN
2025-08? K05UNKNOWN
2025-09? K01UNKNOWN
2025-10? K19UNKNOWN
正しいリコール 間違ったリコール~ INFERENCE GUESS? UNKNOWN
0RECALL
0INFERENCE
0GUESS
0UNKNOWN
0正しいリコール
0間違ったリコール
時間的比較

知識のカットオフ比較

CONSISTENT
基準カットオフ2025-05ESTIMATED_WEB · 0%
サポートされている最新の RECALL0 適格な RECALL 回答
観察された境界不十分なRECALL証拠INSUFFICIENT_RECALL_EVIDENCE
カットオフアライメントCONSISTENT88/100 · 80% 自信
裁判官のメモ
  • Strong recall is nearly complete through the May 2025 reference cutoff.
  • There is no systematic strong-recall failure substantially before the reference cutoff.
  • Correct June and August 2025 answers suggest selective later knowledge, while failures in July, September, and October prevent a clearly later boundary.

セマンティック: 正しい 20 · 間違っている 4 · 未知 0. カットオフから除外されます: 0.

行動同一性

アイデンティティシグナル

CONSISTENT · 82%

同一性は、主張されたモデルと観察された知識/回答プロファイルの間の一貫性から推測されます。これは証拠であり、リモート認証や分量の暗号による証明ではありません。

ポジティブなシグナル

  • Excellent recall across late 2023 through May 2025.
  • Correct near-cutoff answer for the WHO Pandemic Agreement.
  • No pattern of early knowledge degradation.

負の信号

  • Incorrect February 2024 lunar-lander answer despite high confidence.
  • Correct June and August 2025 answers extend beyond the estimated reference cutoff.
  • Several post-cutoff answers are confidently wrong, indicating uneven recency.
裁判官のアイデンティティの理論的根拠
  • Observed behavior broadly overlaps the saved May 2025 reference cutoff.
  • The model answered 20 of 24 Class A items correctly, with only one isolated failure well before the cutoff.
  • Post-cutoff knowledge is uneven and can plausibly reflect selective updates rather than model substitution.
テスト済みモデルの応答

逐語的に抽出されたモデルテキスト

アーカイブされた概要

この実行は、オプトインによる完全なレポートの保持よりも前に行われます。チャレンジ、回答キー、および正規化された裁判官の評価は利用可能ですが、正確なテスト済みモデルの応答テキストは、ベンチマーク時代のプライバシー ポリシーによって意図的に破棄されました。

完全なベンチマークリスト

質問ごとの証拠

認められたすべての質問は、予想される回答、利用可能なソース、テストされたモデルの基礎、意味論的判定、およびカットオフ適格性とともに表示されます。採点されていない質問は模範棄権にはなりません。正しい GUESS または INFERENCE は、意味的には正しいままですが、純粋な想起のカットオフ証拠からは除外されます。

K01UNKNOWNカットオフから除外される

Who won the men's 100 metres at the World Athletics Championships in Tokyo?

予想される答えOblique SevilleSource ↗
テスト済みの模範解答このアーカイブされた実行では、正確なモデル応答は保持されませんでした。
裁判官の評決: WRONG報告された信頼性: 75%

裁判官メモ: Expected Oblique Seville; answered Kishane Thompson.

K02UNKNOWNカットオフから除外される

Which team won the UEFA Women's Euro 2025 final?

予想される答えEnglandSource ↗
テスト済みの模範解答このアーカイブされた実行では、正確なモデル応答は保持されませんでした。
裁判官の評決: WRONG報告された信頼性: 85%

裁判官メモ: Expected England; answered Spain.

K03UNKNOWNカットオフから除外される

Which disease's African upsurge did WHO declare a public health emergency of international concern?

予想される答えmpoxSource ↗
テスト済みの模範解答このアーカイブされた実行では、正確なモデル応答は保持されませんでした。
裁判官の評決: CORRECT報告された信頼性: 95%

裁判官メモ: Matches mpox.

K04UNKNOWNカットオフから除外される

What molecular-structure prediction model did Google DeepMind and Isomorphic Labs introduce?

予想される答えAlphaFold 3Source ↗
テスト済みの模範解答このアーカイブされた実行では、正確なモデル応答は保持されませんでした。
裁判官の評決: CORRECT報告された信頼性: 95%

裁判官メモ: Matches AlphaFold 3.

K05UNKNOWNカットオフから除外される

What model did OpenAI release as a unified system with built-in thinking?

予想される答えGPT-5Source ↗
テスト済みの模範解答このアーカイブされた実行では、正確なモデル応答は保持されませんでした。
裁判官の評決: CORRECT報告された信頼性: 90%

裁判官メモ: Matches GPT-5.

K06UNKNOWNカットオフから除外される

Which operating system was affected by the faulty CrowdStrike Falcon content update?

予想される答えWindowsSource ↗
テスト済みの模範解答このアーカイブされた実行では、正確なモデル応答は保持されませんでした。
裁判官の評決: CORRECT報告された信頼性: 95%

裁判官メモ: Microsoft Windows is accepted.

K07UNKNOWNカットオフから除外される

What was the nickname of Intuitive Machines' Nova-C lander that touched down on the Moon?

予想される答えOdysseusSource ↗
テスト済みの模範解答このアーカイブされた実行では、正確なモデル応答は保持されませんでした。
裁判官の評決: WRONG報告された信頼性: 80%

裁判官メモ: Expected Odysseus; Odie is not an accepted answer.

K08UNKNOWNカットオフから除外される

What was the name of Japan's lunar lander that successfully reached the Moon?

予想される答えSLIMSource ↗
テスト済みの模範解答このアーカイブされた実行では、正確なモデル応答は保持されませんでした。
裁判官の評決: CORRECT報告された信頼性: 95%

裁判官メモ: Matches SLIM.

K09UNKNOWNカットオフから除外される

Who became the first private astronaut to perform a spacewalk?

予想される答えJared IsaacmanSource ↗
テスト済みの模範解答このアーカイブされた実行では、正確なモデル応答は保持されませんでした。
裁判官の評決: CORRECT報告された信頼性: 95%

裁判官メモ: Matches Jared Isaacman.

K10UNKNOWNカットオフから除外される

Which country was appointed host of the 2034 FIFA World Cup?

予想される答えSaudi ArabiaSource ↗
テスト済みの模範解答このアーカイブされた実行では、正確なモデル応答は保持されませんでした。
裁判官の評決: CORRECT報告された信頼性: 95%

裁判官メモ: Matches Saudi Arabia.

K11UNKNOWNカットオフから除外される

In which lunar mare did Firefly Aerospace's Blue Ghost land?

予想される答えMare CrisiumSource ↗
テスト済みの模範解答このアーカイブされた実行では、正確なモデル応答は保持されませんでした。
裁判官の評決: CORRECT報告された信頼性: 90%

裁判官メモ: Matches Mare Crisium.

K12UNKNOWNカットオフから除外される

What model did DeepSeek begin serving through its deepseek-reasoner endpoint?

予想される答えDeepSeek-R1Source ↗
テスト済みの模範解答このアーカイブされた実行では、正確なモデル応答は保持されませんでした。
裁判官の評決: CORRECT報告された信頼性: 95%

裁判官メモ: Matches DeepSeek-R1.

K13UNKNOWNカットオフから除外される

What was the name of the second malaria vaccine prequalified by WHO?

予想される答えR21/Matrix-MSource ↗
テスト済みの模範解答このアーカイブされた実行では、正確なモデル応答は保持されませんでした。
裁判官の評決: CORRECT報告された信頼性: 90%

裁判官メモ: Matches R21/Matrix-M.

K14UNKNOWNカットオフから除外される

Which album won Album of the Year at the 67th Grammy Awards?

予想される答えCowboy CarterSource ↗
テスト済みの模範解答このアーカイブされた実行では、正確なモデル応答は保持されませんでした。
裁判官の評決: CORRECT報告された信頼性: 95%

裁判官メモ: Matches Cowboy Carter.

K15UNKNOWNカットオフから除外される

How many European Parliament members voted in favor of the Artificial Intelligence Act?

予想される答え523Source ↗
テスト済みの模範解答このアーカイブされた実行では、正確なモデル応答は保持されませんでした。
裁判官の評決: CORRECT報告された信頼性: 85%

裁判官メモ: Matches 523.

K16UNKNOWNカットオフから除外される

How many grams of lunar material did the Chang'e-6 mission collect?

予想される答え1,935.3 gramsSource ↗
テスト済みの模範解答このアーカイブされた実行では、正確なモデル応答は保持されませんでした。
裁判官の評決: CORRECT報告された信頼性: 90%

裁判官メモ: Matches 1,935.3 grams.

K17UNKNOWNカットオフから除外される

Which rocket launched NASA's Europa Clipper spacecraft?

予想される答えFalcon HeavySource ↗
テスト済みの模範解答このアーカイブされた実行では、正確なモデル応答は保持されませんでした。
裁判官の評決: CORRECT報告された信頼性: 95%

裁判官メモ: Matches Falcon Heavy.

K18UNKNOWNカットオフから除外される

What designation was given to the newly identified 33-solar-mass stellar black hole in the Milky Way?

予想される答えGaia BH3Source ↗
テスト済みの模範解答このアーカイブされた実行では、正確なモデル応答は保持されませんでした。
裁判官の評決: CORRECT報告された信頼性: 90%

裁判官メモ: Matches Gaia BH3.

K19UNKNOWNカットオフから除外される

Who was awarded the 2025 Nobel Peace Prize?

予想される答えMaria Corina MachadoSource ↗
テスト済みの模範解答このアーカイブされた実行では、正確なモデル応答は保持されませんでした。
裁判官の評決: WRONG報告された信頼性: 70%

裁判官メモ: Expected Maria Corina Machado; answered an institution.

K20UNKNOWNカットオフから除外される

What annual climate-finance goal for developing countries did COP29 set for 2035?

予想される答えUS$300 billion per yearSource ↗
テスト済みの模範解答このアーカイブされた実行では、正確なモデル応答は保持されませんでした。
裁判官の評決: CORRECT報告された信頼性: 90%

裁判官メモ: Matches $300 billion per year.

K21UNKNOWNカットオフから除外される

What was the name of the first human spaceflight to orbit over Earth's polar regions?

予想される答えFram2Source ↗
テスト済みの模範解答このアーカイブされた実行では、正確なモデル応答は保持されませんでした。
裁判官の評決: CORRECT報告された信頼性: 90%

裁判官メモ: Matches Fram2.

K22UNKNOWNカットオフから除外される

Under which article of the WHO Constitution was the Pandemic Agreement adopted?

予想される答えArticle 19Source ↗
テスト済みの模範解答このアーカイブされた実行では、正確なモデル応答は保持されませんでした。
裁判官の評決: CORRECT報告された信頼性: 75%

裁判官メモ: Matches Article 19.

K23UNKNOWNカットオフから除外される

Which new Mario Kart game launched alongside Nintendo Switch 2?

予想される答えMario Kart WorldSource ↗
テスト済みの模範解答このアーカイブされた実行では、正確なモデル応答は保持されませんでした。
裁判官の評決: CORRECT報告された信頼性: 95%

裁判官メモ: Matches Mario Kart World.

K24UNKNOWNカットオフから除外される

What model did OpenAI introduce with a 128K context window at its first DevDay?

予想される答えGPT-4 TurboSource ↗
テスト済みの模範解答このアーカイブされた実行では、正確なモデル応答は保持されませんでした。
裁判官の評決: CORRECT報告された信頼性: 95%

裁判官メモ: Matches GPT-4 Turbo.

質問範囲と調査ノート

事実に関する質問: 24 · 審査員によって採点されない: 0

参考文献のカットオフと引用は裁判官によって提供されるものであり、プラットフォームによって独自に確認されるものではありません。研究ノートは、テストされたモデルにペナルティを与えるものではありません。

メタデータの実行

再現性の詳細

実行ID0B0HVDB2FRJEJC90BRG4D7JV1Y
ベンチマークmodel-verification-single-request-v1.2
裁判官gpt-5.6-sol
要求されたプロトコルopenai_chat
検出された応答スキーマLegacy / not recorded
プロトコルの互換性マッチ / レガシー
モデル出力Not recorded
入力トークンNot recorded
出力トークンNot recorded
終了理由Not recorded
HTTPステータス200
外部レイテンシ88,304 ms
応答バイト2,460
SHA-256f22e63d94e67fbd4fdfa25a27a37ae4b3402f94fc6801d14c2a4e638f85cfd9d
重要な制限事項

The reference cutoff is a judge-produced snapshot grounded in hosted web evidence when available (official sources preferred, otherwise the best defensible estimate). It is not provider attestation. Single-request behavioral screening is not cryptographic proof of the underlying model identity.

独立した検証を実行する

アドバタイズされたモデル ID に依存する前に、同じエンドポイントを自分でテストするか、他の公開レポートを参照してください。