检测结果如下

模型: gpt-5.6-sol · 模式 full · 中转站 https://gw.hbapis.com/

总分值
单项为通过 / 未通过 / 异常;总分为加权综合结果,可能处于中间态。
83 / 100
基础请求 核验完成

确认 Chat Completions 基础请求能稳定返回。

通过 100
模型一致性 核验完成

比对请求模型与响应 model 字段是否匹配。

通过 100
函数调用 核验完成

检查 tool_calls、函数名、参数 JSON 和调用结构。

通过 100
结构化输出 核验完成

结构化输出正常: 返回内容是纯 JSON,且字段符合 schema。

通过 100
协议规范性 核验完成

核验 id、object、choices、finish_reason、usage 等字段形状。

未通过 60
流式一致性 核验完成

比对 stream 与 non-stream 的文本和 token 使用一致性。

通过 100
Token 计费 核验异常

原因:上游拒绝请求(HTTP 400):The request parameters are invalid. Please check the field types, values, and required fields before retrying. (request id: 2026091714215984834191yhMy9r7O)

核验异常 0
指令精确复现 (抗套壳) 核验完成

要求模型逐字复现固定标记,检查指令遵循的确定性。

通过 100
System 冲突测试 核验完成

对比仅 user 与显式 system+user,检查固定词是否被隐藏指令覆盖。

通过 100
极简 Input Token 审计 核验完成

用极简请求观察 input_tokens 是否异常偏高,识别隐式 System 注入。

通过 100
官方同题对比 核验完成

同题对比渠道与官方(或 baseline)的 input 消耗与响应行为。

不适用
隐藏注入检测 核验完成

未发现隐藏注入迹象

通过 100
安全拒答与策略稳定性 核验完成

安全策略检测结果不充分

未通过 50
极限推理能力 (数论计数) 核验完成

用固定推理题检查可验证的答案是否正确。

通过 100
长上下文真实性 核验完成

用 needle-in-haystack 验证上下文窗口是否兑现。

未通过 67

这份结果怎么理解?

中转站疑似伪装成 OpenAI

响应的 usage 字段里出现了 Anthropic / Google 后端才会用的字段(如 claude_cache_creation_*、gemini_* 或 usage_source 自报非 openai)。这强烈暗示中转站把你的请求转发给了别的厂商后端再包装成 OpenAI 响应,所谓的 GPT 输出可能并非真正的 OpenAI 模型在生成。

Token 计费存在风险

Token 统计有明显偏差,建议留意是否存在多算或统计错误。

首 TOKEN
1,606ms
总耗时
100,741ms
吞吐 (T/S)
14.7
输入 TOKENS
165,085
输出 TOKENS
1,480
OpenAI 检测项各自检查什么?
基础请求
确认 Chat Completions 基础请求能稳定返回。
模型一致性
比对请求模型与响应 model 字段是否匹配。
函数调用
检查 tool_calls、函数名、参数 JSON 和调用结构。
结构化输出
验证 JSON Schema / strict 输出约束是否生效。
协议规范性
核验 id、object、choices、finish_reason、usage 等字段形状。
流式一致性
比对 stream 与 non-stream 的文本和 token 使用一致性。
Token 计费
检查 prompt / completion / total token 计量关系。
官方同题对比
同题对比渠道与官方(或 baseline)的 input 消耗与响应行为。
指令精确复现 (抗套壳)
要求模型逐字复现固定标记,检查指令遵循的确定性。
System 冲突测试
对比仅 user 与显式 system+user,检查固定词是否被隐藏指令覆盖。
极简 Input Token 审计
用极简请求观察 input_tokens 是否异常偏高,识别隐式 System 注入。
极限推理能力 (数论计数)
用固定推理题检查可验证的答案是否正确。
长上下文真实性
用 needle-in-haystack 验证上下文窗口是否兑现。
隐藏注入检测
随机化变体交叉检查 nonce 泄露、固定回复、可疑缓存复用等异常信号。
安全拒答与策略稳定性
用拒答场景与改写/编码/渐进变体检查安全策略是否稳定。

2026-09-08 · 分享、多语言与打分校准

这次优化了报告分享和切换语言体验,并微调了 OpenAI / Gemini 的检测打分侧重。