検出結果

モデル: gpt-5.5 · モード standard · リレー https://test.apiqik-kratos.apiqik.com/

合計スコア
各項目は合格/不合格/エラーです。合計は重み付けされた結果であり、その中間になる可能性があります。
100 / 100
基本的なお願い 検証完了

チャット完了の基本リクエストが安定して返されることを確認します。

パス 100
モデルの一貫性 検証完了

リクエスト モデルとレスポンス モデルのフィールドを比較して、一致するかどうかを確認します。

パス 100
関数呼び出し 検証完了

tool_calls、関数名、パラメータ JSON、呼び出し構造を確認してください。

パス 100
構造化された出力 検証完了

JSON スキーマ/厳密な出力制約が有効であることを確認します。

パス 100
プロトコルの規範性 検証完了

id、object、choices、finish_reason、usageなどのフィールドの形状を確認します。

パス 100
ストリーミングの一貫性 検証完了

一貫性を保つために、ストリームと非ストリームのテキストおよびトークンの使用状況を比較します。

パス 100
トークンの課金 検証完了

プロンプト/完了/合計トークン計測関係を確認します。

パス 100
正確なコマンド再現(アンチケーシング) 検証完了

モデルは固定マークをそのまま再現するように求められ、指示がどの程度決定的に従うかをチェックします。

パス 100
システム競合テスト 検証完了

ユーザーのみを明示的なシステム + ユーザーと比較し、固定語が隠しディレクティブによってオーバーライドされているかどうかを確認します。

パス 100
ミニマリスト入力トークン監査 検証完了

ミニマリスト リクエストを使用して、input_tokens が異常に高いかどうかを観察し、暗黙的なシステム インジェクションを特定します。

パス 100
同タイトルの公式比較 検証完了

同じ質問で、チャネルと公式 (またはベースライン) の間の入力消費と応答の動作を比較します。

該当なし
インジェクション検出を非表示にする 検証完了

ランダム化されたバリアントは、ノンス リーク、固定応答、不審なキャッシュの再利用などの異常なシグナルをクロスチェックします。

パス 100
安全保障の拒否と政策の安定性 検証完了

応答拒否シナリオと書き換え/エンコード/プログレッシブ バリアントを使用して、セキュリティ ポリシーが安定しているかどうかを確認します。

失敗しました 50
極めて高い推論能力(整数論的計算) 検証完了

定型の推理質問を使用して、検証可能な回答が正しいかどうかを確認します。

パス 100
最初のトークン
2,319ms
合計時間
55,748ms
スループット (T/S)
43.1
入力トークン
1,333
出力トークン
2,401
What does each OpenAI check cover?
基本的なお願い
チャット完了の基本リクエストが安定して返されることを確認します。
モデルの一貫性
リクエスト モデルとレスポンス モデルのフィールドを比較して、一致するかどうかを確認します。
関数呼び出し
tool_calls、関数名、パラメータ JSON、呼び出し構造を確認してください。
構造化された出力
JSON スキーマ/厳密な出力制約が有効であることを確認します。
プロトコルの規範性
id、object、choices、finish_reason、usageなどのフィールドの形状を確認します。
ストリーミングの一貫性
一貫性を保つために、ストリームと非ストリームのテキストおよびトークンの使用状況を比較します。
トークンの課金
プロンプト/完了/合計トークン計測関係を確認します。
同タイトルの公式比較
同じ質問で、チャネルと公式 (またはベースライン) の間の入力消費と応答の動作を比較します。
正確なコマンド再現(アンチケーシング)
モデルは固定マークをそのまま再現するように求められ、指示がどの程度決定的に従うかをチェックします。
システム競合テスト
ユーザーのみを明示的なシステム + ユーザーと比較し、固定語が隠しディレクティブによってオーバーライドされているかどうかを確認します。
ミニマリスト入力トークン監査
ミニマリスト リクエストを使用して、input_tokens が異常に高いかどうかを観察し、暗黙的なシステム インジェクションを特定します。
極めて高い推論能力(整数論的計算)
定型の推理質問を使用して、検証可能な回答が正しいかどうかを確認します。
長いコンテキストの信頼性
コンテキスト ウィンドウが尊重されることを確認するには、needle-in-haystack を使用します。
インジェクション検出を非表示にする
ランダム化されたバリアントは、ノンス リーク、固定応答、不審なキャッシュの再利用などの異常なシグナルをクロスチェックします。
安全保障の拒否と政策の安定性
応答拒否シナリオと書き換え/エンコード/プログレッシブ バリアントを使用して、セキュリティ ポリシーが安定しているかどうかを確認します。

2026-09-08 · Sharing, languages, and scoring tweaks

This update improves report sharing and language switching, and lightly rebalances OpenAI / Gemini scoring emphasis.