Confirme se as solicitações básicas de conclusões de bate-papo podem retornar de forma estável.
Resultados de detecção
Modelo: gpt-5.6-sol · modo full · relé https://gw.hbapis.com/
Compare os campos do modelo de solicitação e do modelo de resposta para ver se eles correspondem.
Verifique tool_calls, nome da função, parâmetro JSON e estrutura da chamada.
Verifique se o esquema JSON/restrições de saída estritas estão em vigor.
Verifique o formato dos campos como id, objeto, escolhas, razão_de_acabamento, uso, etc.
Compare o uso de token e texto de fluxo e não fluxo para obter consistência.
Motivo:Verifique a relação de medição de prompt/conclusão/total de tokens.
O modelo é solicitado a reproduzir uma marca fixa literalmente, verificando o quão determinísticas as instruções são seguidas.
Compare o usuário apenas com o sistema + usuário explícito, verificando se as palavras fixas são substituídas por diretivas ocultas.
Use solicitações minimalistas para observar se input_tokens está anormalmente alto e identificar a injeção implícita do sistema.
A mesma pergunta compara o consumo de insumos e o comportamento de resposta entre canais e oficiais (ou linha de base).
Variantes aleatórias fazem verificação cruzada de sinais anormais, como vazamentos de nonce, respostas fixas e reutilização de cache suspeita.
Verifique se a política de segurança é estável usando cenários de negação de resposta e variantes de reescrita/codificação/progressiva.
Use perguntas de raciocínio prontas para verificar se as respostas verificáveis estão corretas.
Use agulha no palheiro para verificar se a janela de contexto é respeitada.
Como ler esse resultado?
响应的 usage 字段里出现了 Anthropic / Google 后端才会用的字段(如 claude_cache_creation_*、gemini_* 或 usage_source 自报非 openai)。这强烈暗示中转站把你的请求转发给了别的厂商后端再包装成 OpenAI 响应,所谓的 GPT 输出可能并非真正的 OpenAI 模型在生成。
Token 统计有明显偏差,建议留意是否存在多算或统计错误。
What does each OpenAI check cover?
- Solicitação básica
- Confirme se as solicitações básicas de conclusões de bate-papo podem retornar de forma estável.
- consistência do modelo
- Compare os campos do modelo de solicitação e do modelo de resposta para ver se eles correspondem.
- chamada de função
- Verifique tool_calls, nome da função, parâmetro JSON e estrutura da chamada.
- Saída estruturada
- Verifique se o esquema JSON/restrições de saída estritas estão em vigor.
- Normatividade do protocolo
- Verifique o formato dos campos como id, objeto, escolhas, razão_de_acabamento, uso, etc.
- consistência de streaming
- Compare o uso de token e texto de fluxo e não fluxo para obter consistência.
- Faturamento de token
- Verifique a relação de medição de prompt/conclusão/total de tokens.
- Comparação oficial do mesmo título
- A mesma pergunta compara o consumo de insumos e o comportamento de resposta entre canais e oficiais (ou linha de base).
- Reprodução precisa do comando (anti-casing)
- O modelo é solicitado a reproduzir uma marca fixa literalmente, verificando o quão determinísticas as instruções são seguidas.
- Teste de conflito de sistema
- Compare o usuário apenas com o sistema + usuário explícito, verificando se as palavras fixas são substituídas por diretivas ocultas.
- Auditoria minimalista de token de entrada
- Use solicitações minimalistas para observar se input_tokens está anormalmente alto e identificar a injeção implícita do sistema.
- Capacidade extrema de raciocínio (contagem da teoria dos números)
- Use perguntas de raciocínio prontas para verificar se as respostas verificáveis estão corretas.
- autenticidade de contexto longo
- Use agulha no palheiro para verificar se a janela de contexto é respeitada.
- Ocultar detecção de injeção
- Variantes aleatórias fazem verificação cruzada de sinais anormais, como vazamentos de nonce, respostas fixas e reutilização de cache suspeita.
- Rejeição de segurança e estabilidade política
- Verifique se a política de segurança é estável usando cenários de negação de resposta e variantes de reescrita/codificação/progressiva.