行動モデルの検証

AI エンドポイントが実際にどのように動作するかをテストする

外部 AI API に対して単一リクエストの動作フィンガープリントを実行します。 Model Gate がチャレンジを作成し、ブラウザーが外部エンドポイントを直接呼び出し、固定の評価者が応答をスコアリングします。

1 つの外部リクエスト外部キーはブラウザ内に残りますバージョン管理されたエバリュエーター
● ● ●
External endpoint
      ↓ browser AJAX
one transparent generated challenge
      ↓
behavioral fingerprint
      ↓
Model Gate judge
      ↓
score + identity signals
方法論

自己識別クイズではなく、行動画面

このテストは、経時的な事実の想起、自己報告の一貫性、棄権行動、信頼度の調整、厳密に構造化された出力コンプライアンスを組み合わせたものです。 API によって返されたモデル名はメタデータとして記録され、証拠としては扱われません。

01

チャレンジ

管理者が選択した固定の評価者は、隠された回答キーを持つ 1 つのコンパクトな課題を作成します。

02

ブラウザリクエスト

ブラウザはチャレンジを外部 HTTPS エンドポイントに直接送信します。外部 API キーが Model Gate に送信されることはありません。

03

採点

Model Gate は返された回答を評価し、再現率、最新性、幻覚耐性、キャリブレーション、および指示に従っているスコアを計算します。

コミュニティが検証済み

一貫した独立した結果をもたらすエンドポイント

ここにエンドポイントが表示されるのは、少なくとも 3 つの異なる Model Gate アカウントが 30 日以内に、平均スコアが少なくとも 80 でスコアの分散が低いテストを公開した場合に限られます。

終点主張されているモデルプロトコル評価者平均点独立したテスター最後にテストした
十分な独立した公開テストを備えたエンドポイントはまだありません。
最新の公開テスト

最近の行動評価

独自のテストを実行する →
87
CONSISTENT

deepseek-v4-flash

https://api.model-gate.com/v1/chat/completions

想起
83
最新性
82
幻覚耐性
83
gpt-5.6-sol · model-verification-single-request-v1.2 · Sep 6, 2026 16:39
100
PLAUSIBLE

deepseek-v4-flash

https://api.model-gate.com/v1/chat/completions

想起
100
最新性
100
幻覚耐性
100
gpt-5.6-sol · model-verification-single-request-v1.1 · Sep 6, 2026 09:53

1 つのリクエストで AI エンドポイントを検証する

Model Gate の請求キーを選択し、外部エンドポイントを入力して、ブラウザー側のテストを実行します。

オープンモデルの検証