検出結果

モデル: claude-haiku-4-5-20251001 · モード standard · リレー https://test.apiqik-kratos.dimleap.cn

合計スコア
各項目は合格/不合格/エラーです。合計は重み付けされた結果であり、その中間になる可能性があります。
97 / 100
モデル認証 検証完了

モデルの自己申告による身元、ブランドの残留物、カモフラージュの一般的な兆候を調べます。

パス 100
思考サポート 検証完了

Claude思考/署名などのサーバー側の排他フィールドが透過的に送信されるかどうかを検証します。

パス 100
指令の正確な再現(アンチラップ) 検証完了

モデルは固定マークをそのまま再現するように求められ、指示がどの程度決定的に従うかをチェックします。

パス 100
システム競合テスト 検証完了

ユーザーのみを明示的なシステム + ユーザーと比較し、固定語が隠しディレクティブによってオーバーライドされているかどうかを確認します。

パス 100
極めて高い推論能力(整数論的計算) 検証完了

定型の推理質問を使用して、検証可能な回答が正しいかどうかを確認します。

失敗しました 0
チャンネル検出 検証完了

ホストされているチャンネル:Anthropic

パス 100
Claude トークナイザーの検証 検証完了

モデル:— · 観察されたトークン:None · 予想されるトークン:None · 一致:unknown

該当なし
ミニマリスト入力トークン監査 検証完了

ミニマリスト リクエストを使用して、input_tokens が異常に高いかどうかを観察し、暗黙的なシステム インジェクションを特定します。

パス 100
知識の正確さ 検証完了

Anthropic / Claude の一般知識の質問を使用して、バックエンドが Claude と主張されているとおりであるかどうかを相互検証します。

パス 100
モデル宣言の一貫性 検証完了

複数ラウンドの返品におけるリクエスト モデル、レスポンス モデル、アイデンティティの安定性を比較します。

パス 100
メッセージ構造の仕様 検証完了

メッセージ ID、SSE イベント シーケンス、およびコンテンツ ブロックが Anthropic 仕様に準拠しているかどうかを確認します。

パス 100
ツールの使用/構造化された出力 検証完了

tools_useブロック、tool_ID、関数名、パラメータのスキーマが標準化されているか確認してください。

パス 100
ストリーミングの一貫性 検証完了

ストリームと非ストリームのテキスト、トークン、および一貫性の終了理由を比較します。

パス 100
トークン使用の一貫性 検証完了

入力/出力/キャッシュ トークン フィールドが完全で本物であることを確認してください。

パス 85
同タイトルの公式比較 検証完了

同じ質問で、チャネルと公式 (またはベースライン) の間の入力消費と応答の動作を比較します。

該当なし
インジェクション検出を非表示にする 検証完了

ランダム化されたバリアントは、ノンス リーク、固定応答、不審なキャッシュの再利用などの異常なシグナルをクロスチェックします。

パス 100
安全保障の拒否と政策の安定性 検証完了

応答拒否シナリオと書き換え/エンコード/プログレッシブ バリアントを使用して、セキュリティ ポリシーが安定しているかどうかを確認します。

失敗しました 50
最初のトークン
1,758ms
合計時間
58,553ms
スループット (T/S)
54.5
入力トークン
3,025
出力トークン
3,191
What does each Claude check cover?
モデル認証
モデルの自己申告による身元、ブランドの残留物、カモフラージュの一般的な兆候を調べます。
思考サポート ⭐
Claude思考/署名などのサーバー側の排他フィールドが透過的に送信されるかどうかを検証します。
指令の正確な再現(アンチラップ)
モデルは固定マークをそのまま再現するように求められ、指示がどの程度決定的に従うかをチェックします。
システム競合テスト
ユーザーのみを明示的なシステム + ユーザーと比較し、固定語が隠しディレクティブによってオーバーライドされているかどうかを確認します。
ミニマリスト入力トークン監査
ミニマリスト リクエストを使用して、input_tokens が異常に高いかどうかを観察し、暗黙的なシステム インジェクションを特定します。
極めて高い推論能力(整数論的計算)
定型の推理質問を使用して、検証可能な回答が正しいかどうかを確認します。
チャンネル検出
応答 ID プレフィックスからホスティング チャネルを識別します。
Claude トークナイザーの検証
調整されたモデルのベースラインと比較して、固定ヒントを使用して input_token をカウントします。
行動スタイルの一貫性
行動の好みと回答パターンを通じて、Claude シリーズの特徴を比較します。
知識の正確さ
Anthropic / Claude の一般知識の質問を使用して、バックエンドが Claude と主張されているとおりであるかどうかを相互検証します。
モデル宣言の一貫性
複数ラウンドの返品におけるリクエスト モデル、レスポンス モデル、アイデンティティの安定性を比較します。
メッセージ構造の仕様
メッセージ ID、SSE イベント シーケンス、およびコンテンツ ブロックが Anthropic 仕様に準拠しているかどうかを確認します。
ツールの使用/構造化された出力
tools_useブロック、tool_ID、関数名、パラメータのスキーマが標準化されているか確認してください。
ストリーミングの一貫性
ストリームと非ストリームのテキスト、トークン、および一貫性の終了理由を比較します。
トークン使用の一貫性
入力/出力/キャッシュ トークン フィールドが完全で本物であることを確認してください。
同タイトルの公式比較
同じ質問で、チャネルと公式 (またはベースライン) の間の入力消費と応答の動作を比較します。
長いコンテキストの信頼性
干し草の中の針を使用して、長いコンテキスト ウィンドウが尊重されることを確認します。
マルチモーダル/PDF 認識
PDF プローブを送信して、文書理解リンクが転送ステーションによって削除されていないことを確認します。
インジェクション検出を非表示にする
ランダム化されたバリアントは、ノンス リーク、固定応答、不審なキャッシュの再利用などの異常なシグナルをクロスチェックします。
安全保障の拒否と政策の安定性
応答拒否シナリオと書き換え/エンコード/プログレッシブ バリアントを使用して、セキュリティ ポリシーが安定しているかどうかを確認します。

2026-09-08 · Sharing, languages, and scoring tweaks

This update improves report sharing and language switching, and lightly rebalances OpenAI / Gemini scoring emphasis.