确认 Chat Completions 基础请求能稳定返回。
检测结果如下
模型: gpt-5.5 · 模式 full · 中转站 https://test.apiqik-kratos.dimleap.cn
比对请求模型与响应 model 字段是否匹配。
检查 tool_calls、函数名、参数 JSON 和调用结构。
结构化输出正常: 返回内容是纯 JSON,且字段符合 schema。
核验 id、object、choices、finish_reason、usage 等字段形状。
比对 stream 与 non-stream 的文本和 token 使用一致性。
Token 数明显异常: usage 字段、token 增量或流式/非流式统计存在明显问题,有虚报或统计错误风险。
要求模型逐字复现固定标记,检查指令遵循的确定性。
对比仅 user 与显式 system+user,检查固定词是否被隐藏指令覆盖。
用极简请求观察 input_tokens 是否异常偏高,识别隐式 System 注入。
同题对比渠道与官方(或 baseline)的 input 消耗与响应行为。
未发现隐藏注入迹象
安全策略检测结果不充分
用固定推理题检查可验证的答案是否正确。
用 needle-in-haystack 验证上下文窗口是否兑现。
这份结果怎么理解?
Token 数明显异常: usage 字段、token 增量或流式/非流式统计存在明显问题,有虚报或统计错误风险。
OpenAI 检测项各自检查什么?
- 基础请求
- 确认 Chat Completions 基础请求能稳定返回。
- 模型一致性
- 比对请求模型与响应 model 字段是否匹配。
- 函数调用
- 检查 tool_calls、函数名、参数 JSON 和调用结构。
- 结构化输出
- 验证 JSON Schema / strict 输出约束是否生效。
- 协议规范性
- 核验 id、object、choices、finish_reason、usage 等字段形状。
- 流式一致性
- 比对 stream 与 non-stream 的文本和 token 使用一致性。
- Token 计费
- 检查 prompt / completion / total token 计量关系。
- 官方同题对比
- 同题对比渠道与官方(或 baseline)的 input 消耗与响应行为。
- 指令精确复现 (抗套壳)
- 要求模型逐字复现固定标记,检查指令遵循的确定性。
- System 冲突测试
- 对比仅 user 与显式 system+user,检查固定词是否被隐藏指令覆盖。
- 极简 Input Token 审计
- 用极简请求观察 input_tokens 是否异常偏高,识别隐式 System 注入。
- 极限推理能力 (数论计数)
- 用固定推理题检查可验证的答案是否正确。
- 长上下文真实性
- 用 needle-in-haystack 验证上下文窗口是否兑现。
- 隐藏注入检测
- 随机化变体交叉检查 nonce 泄露、固定回复、可疑缓存复用等异常信号。
- 安全拒答与策略稳定性
- 用拒答场景与改写/编码/渐进变体检查安全策略是否稳定。