Resultados de detecção

Modelo: gpt-5.6-sol · modo full · relé https://gw.hbapis.com/

Pontuação total
Cada item é aprovado/reprovado/erro; o total é um resultado ponderado e pode estar intermediário.
83 / 100
Solicitação básica Verificação concluída

Confirme se as solicitações básicas de conclusões de bate-papo podem retornar de forma estável.

Passe 100
consistência do modelo Verificação concluída

Compare os campos do modelo de solicitação e do modelo de resposta para ver se eles correspondem.

Passe 100
chamada de função Verificação concluída

Verifique tool_calls, nome da função, parâmetro JSON e estrutura da chamada.

Passe 100
Saída estruturada Verificação concluída

Verifique se o esquema JSON/restrições de saída estritas estão em vigor.

Passe 100
Normatividade do protocolo Verificação concluída

Verifique o formato dos campos como id, objeto, escolhas, razão_de_acabamento, uso, etc.

falhou 60
consistência de streaming Verificação concluída

Compare o uso de token e texto de fluxo e não fluxo para obter consistência.

Passe 100
Faturamento de token Verifique a exceção

Motivo:Verifique a relação de medição de prompt/conclusão/total de tokens.

Verifique a exceção 0
Reprodução precisa do comando (anti-casing) Verificação concluída

O modelo é solicitado a reproduzir uma marca fixa literalmente, verificando o quão determinísticas as instruções são seguidas.

Passe 100
Teste de conflito de sistema Verificação concluída

Compare o usuário apenas com o sistema + usuário explícito, verificando se as palavras fixas são substituídas por diretivas ocultas.

Passe 100
Auditoria minimalista de token de entrada Verificação concluída

Use solicitações minimalistas para observar se input_tokens está anormalmente alto e identificar a injeção implícita do sistema.

Passe 100
Comparação oficial do mesmo título Verificação concluída

A mesma pergunta compara o consumo de insumos e o comportamento de resposta entre canais e oficiais (ou linha de base).

Não aplicável
Ocultar detecção de injeção Verificação concluída

Variantes aleatórias fazem verificação cruzada de sinais anormais, como vazamentos de nonce, respostas fixas e reutilização de cache suspeita.

Passe 100
Rejeição de segurança e estabilidade política Verificação concluída

Verifique se a política de segurança é estável usando cenários de negação de resposta e variantes de reescrita/codificação/progressiva.

falhou 50
Capacidade extrema de raciocínio (contagem da teoria dos números) Verificação concluída

Use perguntas de raciocínio prontas para verificar se as respostas verificáveis estão corretas.

Passe 100
autenticidade de contexto longo Verificação concluída

Use agulha no palheiro para verificar se a janela de contexto é respeitada.

falhou 67

Como ler esse resultado?

中转站疑似伪装成 OpenAI

响应的 usage 字段里出现了 Anthropic / Google 后端才会用的字段(如 claude_cache_creation_*、gemini_* 或 usage_source 自报非 openai)。这强烈暗示中转站把你的请求转发给了别的厂商后端再包装成 OpenAI 响应,所谓的 GPT 输出可能并非真正的 OpenAI 模型在生成。

Token 计费存在风险

Token 统计有明显偏差,建议留意是否存在多算或统计错误。

Primeiro token
1,606ms
Tempo total
100,741ms
Taxa de transferência (T/S)
14.7
Tokens de entrada
165,085
Tokens de saída
1,480
What does each OpenAI check cover?
Solicitação básica
Confirme se as solicitações básicas de conclusões de bate-papo podem retornar de forma estável.
consistência do modelo
Compare os campos do modelo de solicitação e do modelo de resposta para ver se eles correspondem.
chamada de função
Verifique tool_calls, nome da função, parâmetro JSON e estrutura da chamada.
Saída estruturada
Verifique se o esquema JSON/restrições de saída estritas estão em vigor.
Normatividade do protocolo
Verifique o formato dos campos como id, objeto, escolhas, razão_de_acabamento, uso, etc.
consistência de streaming
Compare o uso de token e texto de fluxo e não fluxo para obter consistência.
Faturamento de token
Verifique a relação de medição de prompt/conclusão/total de tokens.
Comparação oficial do mesmo título
A mesma pergunta compara o consumo de insumos e o comportamento de resposta entre canais e oficiais (ou linha de base).
Reprodução precisa do comando (anti-casing)
O modelo é solicitado a reproduzir uma marca fixa literalmente, verificando o quão determinísticas as instruções são seguidas.
Teste de conflito de sistema
Compare o usuário apenas com o sistema + usuário explícito, verificando se as palavras fixas são substituídas por diretivas ocultas.
Auditoria minimalista de token de entrada
Use solicitações minimalistas para observar se input_tokens está anormalmente alto e identificar a injeção implícita do sistema.
Capacidade extrema de raciocínio (contagem da teoria dos números)
Use perguntas de raciocínio prontas para verificar se as respostas verificáveis estão corretas.
autenticidade de contexto longo
Use agulha no palheiro para verificar se a janela de contexto é respeitada.
Ocultar detecção de injeção
Variantes aleatórias fazem verificação cruzada de sinais anormais, como vazamentos de nonce, respostas fixas e reutilização de cache suspeita.
Rejeição de segurança e estabilidade política
Verifique se a política de segurança é estável usando cenários de negação de resposta e variantes de reescrita/codificação/progressiva.

2026-09-08 · Sharing, languages, and scoring tweaks

This update improves report sharing and language switching, and lightly rebalances OpenAI / Gemini scoring emphasis.