モデルの自己申告による身元、ブランドの残留物、カモフラージュの一般的な兆候を調べます。
検出結果
モデル: claude-opus-4-6 · モード quick · リレー https://unirouters.cc/
Claude思考/署名などのサーバー側の排他フィールドが透過的に送信されるかどうかを検証します。
モデルは固定マークをそのまま再現するように求められ、指示がどの程度決定的に従うかをチェックします。
ユーザーのみを明示的なシステム + ユーザーと比較し、固定語が隠しディレクティブによってオーバーライドされているかどうかを確認します。
定型の推理質問を使用して、検証可能な回答が正しいかどうかを確認します。
ホストされているチャンネル:Anthropic
モデル:claude-opus-4-6 · 観察されたトークン:9 · 予想されるトークン:12 · 一致:false
ミニマリスト リクエストを使用して、input_tokens が異常に高いかどうかを観察し、暗黙的なシステム インジェクションを特定します。
複数ラウンドの返品におけるリクエスト モデル、レスポンス モデル、アイデンティティの安定性を比較します。
メッセージ ID、SSE イベント シーケンス、およびコンテンツ ブロックが Anthropic 仕様に準拠しているかどうかを確認します。
ランダム化されたバリアントは、ノンス リーク、固定応答、不審なキャッシュの再利用などの異常なシグナルをクロスチェックします。
応答拒否シナリオと書き換え/エンコード/プログレッシブ バリアントを使用して、セキュリティ ポリシーが安定しているかどうかを確認します。
この結果をどう読むか?
接口没有返回完整 usage 字段,所以这次不能确认它有没有多算。
What does each Claude check cover?
- モデル認証
- モデルの自己申告による身元、ブランドの残留物、カモフラージュの一般的な兆候を調べます。
- 思考サポート ⭐
- Claude思考/署名などのサーバー側の排他フィールドが透過的に送信されるかどうかを検証します。
- 指令の正確な再現(アンチラップ)
- モデルは固定マークをそのまま再現するように求められ、指示がどの程度決定的に従うかをチェックします。
- システム競合テスト
- ユーザーのみを明示的なシステム + ユーザーと比較し、固定語が隠しディレクティブによってオーバーライドされているかどうかを確認します。
- ミニマリスト入力トークン監査
- ミニマリスト リクエストを使用して、input_tokens が異常に高いかどうかを観察し、暗黙的なシステム インジェクションを特定します。
- 極めて高い推論能力(整数論的計算)
- 定型の推理質問を使用して、検証可能な回答が正しいかどうかを確認します。
- チャンネル検出
- 応答 ID プレフィックスからホスティング チャネルを識別します。
- Claude トークナイザーの検証
- 調整されたモデルのベースラインと比較して、固定ヒントを使用して input_token をカウントします。
- 行動スタイルの一貫性
- 行動の好みと回答パターンを通じて、Claude シリーズの特徴を比較します。
- 知識の正確さ
- Anthropic / Claude の一般知識の質問を使用して、バックエンドが Claude と主張されているとおりであるかどうかを相互検証します。
- モデル宣言の一貫性
- 複数ラウンドの返品におけるリクエスト モデル、レスポンス モデル、アイデンティティの安定性を比較します。
- メッセージ構造の仕様
- メッセージ ID、SSE イベント シーケンス、およびコンテンツ ブロックが Anthropic 仕様に準拠しているかどうかを確認します。
- ツールの使用/構造化された出力
- tools_useブロック、tool_ID、関数名、パラメータのスキーマが標準化されているか確認してください。
- ストリーミングの一貫性
- ストリームと非ストリームのテキスト、トークン、および一貫性の終了理由を比較します。
- トークン使用の一貫性
- 入力/出力/キャッシュ トークン フィールドが完全で本物であることを確認してください。
- 同タイトルの公式比較
- 同じ質問で、チャネルと公式 (またはベースライン) の間の入力消費と応答の動作を比較します。
- 長いコンテキストの信頼性
- 干し草の中の針を使用して、長いコンテキスト ウィンドウが尊重されることを確認します。
- マルチモーダル/PDF 認識
- PDF プローブを送信して、文書理解リンクが転送ステーションによって削除されていないことを確認します。
- インジェクション検出を非表示にする
- ランダム化されたバリアントは、ノンス リーク、固定応答、不審なキャッシュの再利用などの異常なシグナルをクロスチェックします。
- 安全保障の拒否と政策の安定性
- 応答拒否シナリオと書き換え/エンコード/プログレッシブ バリアントを使用して、セキュリティ ポリシーが安定しているかどうかを確認します。