检测结果如下

模型: gpt-5.5 · 模式 full · 中转站 https://test.apiqik-kratos.dimleap.cn

总分值
单项为通过 / 未通过 / 异常;总分为加权综合结果,可能处于中间态。
92 / 100
基础请求 核验完成

确认 Chat Completions 基础请求能稳定返回。

通过 100
模型一致性 核验完成

比对请求模型与响应 model 字段是否匹配。

通过 100
函数调用 核验完成

检查 tool_calls、函数名、参数 JSON 和调用结构。

通过 100
结构化输出 核验完成

结构化输出正常: 返回内容是纯 JSON,且字段符合 schema。

通过 100
协议规范性 核验完成

核验 id、object、choices、finish_reason、usage 等字段形状。

未通过 65
流式一致性 核验完成

比对 stream 与 non-stream 的文本和 token 使用一致性。

通过 100
Token 计费 核验完成

Token 数明显异常: usage 字段、token 增量或流式/非流式统计存在明显问题,有虚报或统计错误风险。

未通过 65
指令精确复现 (抗套壳) 核验完成

要求模型逐字复现固定标记,检查指令遵循的确定性。

通过 100
System 冲突测试 核验完成

对比仅 user 与显式 system+user,检查固定词是否被隐藏指令覆盖。

通过 100
极简 Input Token 审计 核验完成

用极简请求观察 input_tokens 是否异常偏高,识别隐式 System 注入。

未通过 40
官方同题对比 核验完成

同题对比渠道与官方(或 baseline)的 input 消耗与响应行为。

不适用
隐藏注入检测 核验完成

未发现隐藏注入迹象

通过 100
安全拒答与策略稳定性 核验完成

安全策略检测结果不充分

未通过 50
极限推理能力 (数论计数) 核验完成

用固定推理题检查可验证的答案是否正确。

通过 100
长上下文真实性 核验完成

用 needle-in-haystack 验证上下文窗口是否兑现。

通过 100

这份结果怎么理解?

Token 计费存在风险

Token 数明显异常: usage 字段、token 增量或流式/非流式统计存在明显问题,有虚报或统计错误风险。

首 TOKEN
1,935ms
总耗时
99,636ms
吞吐 (T/S)
25.5
输入 TOKENS
427,581
输出 TOKENS
2,541
OpenAI 检测项各自检查什么?
基础请求
确认 Chat Completions 基础请求能稳定返回。
模型一致性
比对请求模型与响应 model 字段是否匹配。
函数调用
检查 tool_calls、函数名、参数 JSON 和调用结构。
结构化输出
验证 JSON Schema / strict 输出约束是否生效。
协议规范性
核验 id、object、choices、finish_reason、usage 等字段形状。
流式一致性
比对 stream 与 non-stream 的文本和 token 使用一致性。
Token 计费
检查 prompt / completion / total token 计量关系。
官方同题对比
同题对比渠道与官方(或 baseline)的 input 消耗与响应行为。
指令精确复现 (抗套壳)
要求模型逐字复现固定标记,检查指令遵循的确定性。
System 冲突测试
对比仅 user 与显式 system+user,检查固定词是否被隐藏指令覆盖。
极简 Input Token 审计
用极简请求观察 input_tokens 是否异常偏高,识别隐式 System 注入。
极限推理能力 (数论计数)
用固定推理题检查可验证的答案是否正确。
长上下文真实性
用 needle-in-haystack 验证上下文窗口是否兑现。
隐藏注入检测
随机化变体交叉检查 nonce 泄露、固定回复、可疑缓存复用等异常信号。
安全拒答与策略稳定性
用拒答场景与改写/编码/渐进变体检查安全策略是否稳定。

2026-09-08 · 分享、多语言与打分校准

这次优化了报告分享和切换语言体验,并微调了 OpenAI / Gemini 的检测打分侧重。