検出結果

モデル: · モード · リレー

合計スコア
各項目は合格/不合格/エラーです。合計は重み付けされた結果であり、その中間になる可能性があります。
0 / 100
モデル認証 検証完了

モデルの自己申告による身元、ブランドの残留物、カモフラージュの一般的な兆候を調べます。

有線ではありません
思考サポート 検証完了

Claude思考/署名などのサーバー側の排他フィールドが透過的に送信されるかどうかを検証します。

有線ではありません
指令の正確な再現(アンチラップ) 検証完了

モデルは固定マークをそのまま再現するように求められ、指示がどの程度決定的に従うかをチェックします。

有線ではありません
システム競合テスト 検証完了

ユーザーのみを明示的なシステム + ユーザーと比較し、固定語が隠しディレクティブによってオーバーライドされているかどうかを確認します。

有線ではありません
極めて高い推論能力(整数論的計算) 検証完了

定型の推理質問を使用して、検証可能な回答が正しいかどうかを確認します。

有線ではありません
チャンネル検出 検証完了

応答 ID プレフィックスからホスティング チャネルを識別します。

有線ではありません
Claude トークナイザーの検証 検証完了

調整されたモデルのベースラインと比較して、固定ヒントを使用して input_token をカウントします。

有線ではありません
ミニマリスト入力トークン監査 検証完了

ミニマリスト リクエストを使用して、input_tokens が異常に高いかどうかを観察し、暗黙的なシステム インジェクションを特定します。

有線ではありません
行動スタイルの一貫性 検証完了

行動の好みと回答パターンを通じて、Claude シリーズの特徴を比較します。

有線ではありません
知識の正確さ 検証完了

Anthropic / Claude の一般知識の質問を使用して、バックエンドが Claude と主張されているとおりであるかどうかを相互検証します。

有線ではありません
モデル宣言の一貫性 検証完了

複数ラウンドの返品におけるリクエスト モデル、レスポンス モデル、アイデンティティの安定性を比較します。

有線ではありません
メッセージ構造の仕様 検証完了

メッセージ ID、SSE イベント シーケンス、およびコンテンツ ブロックが Anthropic 仕様に準拠しているかどうかを確認します。

有線ではありません
ツールの使用/構造化された出力 検証完了

tools_useブロック、tool_ID、関数名、パラメータのスキーマが標準化されているか確認してください。

有線ではありません
ストリーミングの一貫性 検証完了

ストリームと非ストリームのテキスト、トークン、および一貫性の終了理由を比較します。

有線ではありません
トークン使用の一貫性 検証完了

入力/出力/キャッシュ トークン フィールドが完全で本物であることを確認してください。

有線ではありません
同タイトルの公式比較 検証完了

同じ質問で、チャネルと公式 (またはベースライン) の間の入力消費と応答の動作を比較します。

有線ではありません
インジェクション検出を非表示にする 検証完了

ランダム化されたバリアントは、ノンス リーク、固定応答、不審なキャッシュの再利用などの異常なシグナルをクロスチェックします。

有線ではありません
安全保障の拒否と政策の安定性 検証完了

応答拒否シナリオと書き換え/エンコード/プログレッシブ バリアントを使用して、セキュリティ ポリシーが安定しているかどうかを確認します。

有線ではありません
長いコンテキストの信頼性 検証完了

干し草の中の針を使用して、長いコンテキスト ウィンドウが尊重されることを確認します。

有線ではありません
マルチモーダル/PDF 認識 検証完了

PDF プローブを送信して、文書理解リンクが転送ステーションによって削除されていないことを確認します。

有線ではありません
最初のトークン
合計時間
0ms
スループット (T/S)
入力トークン
0
出力トークン
0
What does each Claude check cover?
モデル認証
モデルの自己申告による身元、ブランドの残留物、カモフラージュの一般的な兆候を調べます。
思考サポート ⭐
Claude思考/署名などのサーバー側の排他フィールドが透過的に送信されるかどうかを検証します。
指令の正確な再現(アンチラップ)
モデルは固定マークをそのまま再現するように求められ、指示がどの程度決定的に従うかをチェックします。
システム競合テスト
ユーザーのみを明示的なシステム + ユーザーと比較し、固定語が隠しディレクティブによってオーバーライドされているかどうかを確認します。
ミニマリスト入力トークン監査
ミニマリスト リクエストを使用して、input_tokens が異常に高いかどうかを観察し、暗黙的なシステム インジェクションを特定します。
極めて高い推論能力(整数論的計算)
定型の推理質問を使用して、検証可能な回答が正しいかどうかを確認します。
チャンネル検出
応答 ID プレフィックスからホスティング チャネルを識別します。
Claude トークナイザーの検証
調整されたモデルのベースラインと比較して、固定ヒントを使用して input_token をカウントします。
行動スタイルの一貫性
行動の好みと回答パターンを通じて、Claude シリーズの特徴を比較します。
知識の正確さ
Anthropic / Claude の一般知識の質問を使用して、バックエンドが Claude と主張されているとおりであるかどうかを相互検証します。
モデル宣言の一貫性
複数ラウンドの返品におけるリクエスト モデル、レスポンス モデル、アイデンティティの安定性を比較します。
メッセージ構造の仕様
メッセージ ID、SSE イベント シーケンス、およびコンテンツ ブロックが Anthropic 仕様に準拠しているかどうかを確認します。
ツールの使用/構造化された出力
tools_useブロック、tool_ID、関数名、パラメータのスキーマが標準化されているか確認してください。
ストリーミングの一貫性
ストリームと非ストリームのテキスト、トークン、および一貫性の終了理由を比較します。
トークン使用の一貫性
入力/出力/キャッシュ トークン フィールドが完全で本物であることを確認してください。
同タイトルの公式比較
同じ質問で、チャネルと公式 (またはベースライン) の間の入力消費と応答の動作を比較します。
長いコンテキストの信頼性
干し草の中の針を使用して、長いコンテキスト ウィンドウが尊重されることを確認します。
マルチモーダル/PDF 認識
PDF プローブを送信して、文書理解リンクが転送ステーションによって削除されていないことを確認します。
インジェクション検出を非表示にする
ランダム化されたバリアントは、ノンス リーク、固定応答、不審なキャッシュの再利用などの異常なシグナルをクロスチェックします。
安全保障の拒否と政策の安定性
応答拒否シナリオと書き換え/エンコード/プログレッシブ バリアントを使用して、セキュリティ ポリシーが安定しているかどうかを確認します。

2026-09-08 · Sharing, languages, and scoring tweaks

This update improves report sharing and language switching, and lightly rebalances OpenAI / Gemini scoring emphasis.