检测结果如下

模型: gpt-5.5 · 模式 standard · 中转站 https://test.apiqik-kratos.apiqik.com/

总分值
单项为通过 / 未通过 / 异常;总分为加权综合结果,可能处于中间态。
100 / 100
基础请求 核验完成

确认 Chat Completions 基础请求能稳定返回。

通过 100
模型一致性 核验完成

比对请求模型与响应 model 字段是否匹配。

通过 100
函数调用 核验完成

检查 tool_calls、函数名、参数 JSON 和调用结构。

通过 100
结构化输出 核验完成

结构化输出正常: 返回内容是纯 JSON,且字段符合 schema。

通过 100
协议规范性 核验完成

核验 id、object、choices、finish_reason、usage 等字段形状。

通过 100
流式一致性 核验完成

比对 stream 与 non-stream 的文本和 token 使用一致性。

通过 100
Token 计费 核验完成

Token 数基本可信: usage 加法自洽,加长文本带来的 token 增量合理,流式和非流式统计也能对上。

通过 100
指令精确复现 (抗套壳) 核验完成

要求模型逐字复现固定标记,检查指令遵循的确定性。

通过 100
System 冲突测试 核验完成

对比仅 user 与显式 system+user,检查固定词是否被隐藏指令覆盖。

通过 100
极简 Input Token 审计 核验完成

用极简请求观察 input_tokens 是否异常偏高,识别隐式 System 注入。

通过 100
官方同题对比 核验完成

同题对比渠道与官方(或 baseline)的 input 消耗与响应行为。

不适用
隐藏注入检测 核验完成

未发现隐藏注入迹象

通过 100
安全拒答与策略稳定性 核验完成

安全策略检测结果不充分

未通过 50
极限推理能力 (数论计数) 核验完成

用固定推理题检查可验证的答案是否正确。

通过 100
首 TOKEN
2,319ms
总耗时
55,748ms
吞吐 (T/S)
43.1
输入 TOKENS
1,333
输出 TOKENS
2,401
OpenAI 检测项各自检查什么?
基础请求
确认 Chat Completions 基础请求能稳定返回。
模型一致性
比对请求模型与响应 model 字段是否匹配。
函数调用
检查 tool_calls、函数名、参数 JSON 和调用结构。
结构化输出
验证 JSON Schema / strict 输出约束是否生效。
协议规范性
核验 id、object、choices、finish_reason、usage 等字段形状。
流式一致性
比对 stream 与 non-stream 的文本和 token 使用一致性。
Token 计费
检查 prompt / completion / total token 计量关系。
官方同题对比
同题对比渠道与官方(或 baseline)的 input 消耗与响应行为。
指令精确复现 (抗套壳)
要求模型逐字复现固定标记,检查指令遵循的确定性。
System 冲突测试
对比仅 user 与显式 system+user,检查固定词是否被隐藏指令覆盖。
极简 Input Token 审计
用极简请求观察 input_tokens 是否异常偏高,识别隐式 System 注入。
极限推理能力 (数论计数)
用固定推理题检查可验证的答案是否正确。
长上下文真实性
用 needle-in-haystack 验证上下文窗口是否兑现。
隐藏注入检测
随机化变体交叉检查 nonce 泄露、固定回复、可疑缓存复用等异常信号。
安全拒答与策略稳定性
用拒答场景与改写/编码/渐进变体检查安全策略是否稳定。

2026-09-08 · 分享、多语言与打分校准

这次优化了报告分享和切换语言体验,并微调了 OpenAI / Gemini 的检测打分侧重。