チャット完了の基本リクエストが安定して返されることを確認します。
検出結果
モデル: gpt-5.5 · モード full · リレー https://test.apiqik-kratos.dimleap.cn
リクエスト モデルとレスポンス モデルのフィールドを比較して、一致するかどうかを確認します。
tool_calls、関数名、パラメータ JSON、呼び出し構造を確認してください。
JSON スキーマ/厳密な出力制約が有効であることを確認します。
id、object、choices、finish_reason、usageなどのフィールドの形状を確認します。
一貫性を保つために、ストリームと非ストリームのテキストおよびトークンの使用状況を比較します。
プロンプト/完了/合計トークン計測関係を確認します。
モデルは固定マークをそのまま再現するように求められ、指示がどの程度決定的に従うかをチェックします。
ユーザーのみを明示的なシステム + ユーザーと比較し、固定語が隠しディレクティブによってオーバーライドされているかどうかを確認します。
ミニマリスト リクエストを使用して、input_tokens が異常に高いかどうかを観察し、暗黙的なシステム インジェクションを特定します。
同じ質問で、チャネルと公式 (またはベースライン) の間の入力消費と応答の動作を比較します。
ランダム化されたバリアントは、ノンス リーク、固定応答、不審なキャッシュの再利用などの異常なシグナルをクロスチェックします。
応答拒否シナリオと書き換え/エンコード/プログレッシブ バリアントを使用して、セキュリティ ポリシーが安定しているかどうかを確認します。
定型の推理質問を使用して、検証可能な回答が正しいかどうかを確認します。
コンテキスト ウィンドウが尊重されることを確認するには、needle-in-haystack を使用します。
この結果をどう読むか?
Token 数明显异常: usage 字段、token 增量或流式/非流式统计存在明显问题,有虚报或统计错误风险。
What does each OpenAI check cover?
- 基本的なお願い
- チャット完了の基本リクエストが安定して返されることを確認します。
- モデルの一貫性
- リクエスト モデルとレスポンス モデルのフィールドを比較して、一致するかどうかを確認します。
- 関数呼び出し
- tool_calls、関数名、パラメータ JSON、呼び出し構造を確認してください。
- 構造化された出力
- JSON スキーマ/厳密な出力制約が有効であることを確認します。
- プロトコルの規範性
- id、object、choices、finish_reason、usageなどのフィールドの形状を確認します。
- ストリーミングの一貫性
- 一貫性を保つために、ストリームと非ストリームのテキストおよびトークンの使用状況を比較します。
- トークンの課金
- プロンプト/完了/合計トークン計測関係を確認します。
- 同タイトルの公式比較
- 同じ質問で、チャネルと公式 (またはベースライン) の間の入力消費と応答の動作を比較します。
- 正確なコマンド再現(アンチケーシング)
- モデルは固定マークをそのまま再現するように求められ、指示がどの程度決定的に従うかをチェックします。
- システム競合テスト
- ユーザーのみを明示的なシステム + ユーザーと比較し、固定語が隠しディレクティブによってオーバーライドされているかどうかを確認します。
- ミニマリスト入力トークン監査
- ミニマリスト リクエストを使用して、input_tokens が異常に高いかどうかを観察し、暗黙的なシステム インジェクションを特定します。
- 極めて高い推論能力(整数論的計算)
- 定型の推理質問を使用して、検証可能な回答が正しいかどうかを確認します。
- 長いコンテキストの信頼性
- コンテキスト ウィンドウが尊重されることを確認するには、needle-in-haystack を使用します。
- インジェクション検出を非表示にする
- ランダム化されたバリアントは、ノンス リーク、固定応答、不審なキャッシュの再利用などの異常なシグナルをクロスチェックします。
- 安全保障の拒否と政策の安定性
- 応答拒否シナリオと書き換え/エンコード/プログレッシブ バリアントを使用して、セキュリティ ポリシーが安定しているかどうかを確認します。