モデル認証
モデルの自己申告による身元、ブランドの残留物、カモフラージュの一般的な兆候を調べます。
pangolin は、thinking signature、プロトコル フィールド、および機能プローブを使用して、ネイティブ Claudeとラッパーまたはカットダウン バックエンドを区別します。
このページでは、サーバー側の署名検証に重点を置きます。実際のリクエストは、キーの上流アカウントに請求されます。
Claude判定は「Claudeに似ているか?」ではありません。 — サーバーの署名と Anthropic プロトコルの証拠が実際に存在するかどうかを確認します。
暗号グレードの ID については、Claude から始めます。プロトコルの互換性については、OpenAI / Gemini も確認してください。
上記のスキャン深度で更新されます。フル モードでは、該当するすべてのチェックがカバーされます。長いコンテキストのプローブには追加のオプトインが必要です。
モデルの自己申告による身元、ブランドの残留物、カモフラージュの一般的な兆候を調べます。
Claude思考/署名などのサーバー側の排他フィールドが透過的に送信されるかどうかを検証します。
モデルは固定マークをそのまま再現するように求められ、指示がどの程度決定的に従うかをチェックします。
ユーザーのみを明示的なシステム + ユーザーと比較し、固定語が隠しディレクティブによってオーバーライドされているかどうかを確認します。
ミニマリスト リクエストを使用して、input_tokens が異常に高いかどうかを観察し、暗黙的なシステム インジェクションを特定します。
定型の推理質問を使用して、検証可能な回答が正しいかどうかを確認します。
応答 ID プレフィックスからホスティング チャネルを識別します。
調整されたモデルのベースラインと比較して、固定ヒントを使用して input_token をカウントします。
行動の好みと回答パターンを通じて、Claude シリーズの特徴を比較します。
Anthropic / Claude の一般知識の質問を使用して、バックエンドが Claude と主張されているとおりであるかどうかを相互検証します。
複数ラウンドの返品におけるリクエスト モデル、レスポンス モデル、アイデンティティの安定性を比較します。
メッセージ ID、SSE イベント シーケンス、およびコンテンツ ブロックが Anthropic 仕様に準拠しているかどうかを確認します。
tools_useブロック、tool_ID、関数名、パラメータのスキーマが標準化されているか確認してください。
ストリームと非ストリームのテキスト、トークン、および一貫性の終了理由を比較します。
入力/出力/キャッシュ トークン フィールドが完全で本物であることを確認してください。
同じ質問で、チャネルと公式 (またはベースライン) の間の入力消費と応答の動作を比較します。
干し草の中の針を使用して、長いコンテキスト ウィンドウが尊重されることを確認します。
PDF プローブを送信して、文書理解リンクが転送ステーションによって削除されていないことを確認します。
ランダム化されたバリアントは、ノンス リーク、固定応答、不審なキャッシュの再利用などの異常なシグナルをクロスチェックします。
応答拒否シナリオと書き換え/エンコード/プログレッシブ バリアントを使用して、セキュリティ ポリシーが安定しているかどうかを確認します。