检测结果如下

模型: claude-opus-4-8 · 模式 full · 中转站 https://test.apiqik-kratos.apiqik.com

检测无效: 检测无效: 上游返回余额不足或用量限制错误。请更换有额度的 API key, 或降低检测模式/模型后重新检测。
总分值
单项为通过 / 未通过 / 异常;总分为加权综合结果,可能处于中间态。
0 / 100
模型身份验证 核验完成

检查模型自报身份、品牌残留和常见伪装痕迹。

通过 100
思考支持性 核验完成

验证 Claude thinking / signature 等服务端专属字段是否透传。

通过 100
指令精确复现 (抗套壳) 核验完成

要求模型逐字复现固定标记,检查指令遵循的确定性。

通过 100
System 冲突测试 核验完成

对比仅 user 与显式 system+user,检查固定词是否被隐藏指令覆盖。

通过 100
极限推理能力 (数论计数) 核验完成

用固定推理题检查可验证的答案是否正确。

通过 100
渠道检测 核验完成

托管渠道:Google Vertex

通过 100
Claude 分词器校验 核验完成

模型:claude-opus-4-8 · 观测 Token 数:12 · 预期 Token 数:12 · 匹配:true

通过 100
极简 Input Token 审计 核验完成

用极简请求观察 input_tokens 是否异常偏高,识别隐式 System 注入。

通过 100
行为风格一致性 核验完成

通过行为偏好和回答模式比对 Claude 系列特征。

通过 100
知识准确度 核验完成

用 Anthropic / Claude 常识题交叉验证后端是否像宣称的 Claude。

通过 100
模型声明一致性 核验异常

原因:上游余额不足或用量受限(HTTP 503):billing pipeline backlogged, retry later

核验异常 0
消息结构规范 核验完成

检查消息 ID、SSE 事件序列和 content block 是否符合 Anthropic 规范。

通过 75
Tool Use / 结构化输出 核验完成

检查 tool_use 块、toolu_ ID、函数名和参数 schema 是否规范。

通过 100
流式一致性 核验异常

原因:上游余额不足或用量受限(HTTP 503):billing pipeline backlogged, retry later

核验异常 0
Token 用量一致性 核验完成

Token 用量基本可信: usage 自洽且流式/非流式一致,但该中转站没有可用的 count_tokens 端点,无法做最强输入 token 交叉验证。

通过 85
官方同题对比 核验完成

同题对比渠道与官方(或 baseline)的 input 消耗与响应行为。

不适用
隐藏注入检测 核验异常

原因:整体超时

核验异常 0
安全拒答与策略稳定性 核验异常

原因:整体超时

核验异常 0
长上下文真实性 核验完成

用 needle-in-haystack 验证长上下文窗口是否兑现。

不适用
多模态 / PDF 识别 核验完成

提交 PDF 探针,确认文档理解链路没有被中转站剥离。

通过 100
首 TOKEN
5,838ms
总耗时
180,001ms
吞吐 (T/S)
14.7
输入 TOKENS
2,558
输出 TOKENS
2,651
Claude 检测项各自检查什么?
模型身份验证
检查模型自报身份、品牌残留和常见伪装痕迹。
思考支持性 ⭐
验证 Claude thinking / signature 等服务端专属字段是否透传。
指令精确复现 (抗套壳)
要求模型逐字复现固定标记,检查指令遵循的确定性。
System 冲突测试
对比仅 user 与显式 system+user,检查固定词是否被隐藏指令覆盖。
极简 Input Token 审计
用极简请求观察 input_tokens 是否异常偏高,识别隐式 System 注入。
极限推理能力 (数论计数)
用固定推理题检查可验证的答案是否正确。
渠道检测
从响应 ID 前缀识别托管渠道。
Claude 分词器校验
用固定提示的 input_tokens 计数与已校准模型基线比对。
行为风格一致性
通过行为偏好和回答模式比对 Claude 系列特征。
知识准确度
用 Anthropic / Claude 常识题交叉验证后端是否像宣称的 Claude。
模型声明一致性
比对请求模型、响应模型与多轮返回中的身份稳定性。
消息结构规范
检查消息 ID、SSE 事件序列和 content block 是否符合 Anthropic 规范。
Tool Use / 结构化输出
检查 tool_use 块、toolu_ ID、函数名和参数 schema 是否规范。
流式一致性
比对 stream 与 non-stream 的文本、token 和结束原因一致性。
Token 用量一致性
检查 input / output / cache token 字段是否完整且可信。
官方同题对比
同题对比渠道与官方(或 baseline)的 input 消耗与响应行为。
长上下文真实性
用 needle-in-haystack 验证长上下文窗口是否兑现。
多模态 / PDF 识别
提交 PDF 探针,确认文档理解链路没有被中转站剥离。
隐藏注入检测
随机化变体交叉检查 nonce 泄露、固定回复、可疑缓存复用等异常信号。
安全拒答与策略稳定性
用拒答场景与改写/编码/渐进变体检查安全策略是否稳定。

2026-09-08 · 分享、多语言与打分校准

这次优化了报告分享和切换语言体验,并微调了 OpenAI / Gemini 的检测打分侧重。