Resultados de detecção

Modelo: gpt-5.5 · modo full · relé https://test.apiqik-kratos.dimleap.cn

Pontuação total
Cada item é aprovado/reprovado/erro; o total é um resultado ponderado e pode estar intermediário.
92 / 100
Solicitação básica Verificação concluída

Confirme se as solicitações básicas de conclusões de bate-papo podem retornar de forma estável.

Passe 100
consistência do modelo Verificação concluída

Compare os campos do modelo de solicitação e do modelo de resposta para ver se eles correspondem.

Passe 100
chamada de função Verificação concluída

Verifique tool_calls, nome da função, parâmetro JSON e estrutura da chamada.

Passe 100
Saída estruturada Verificação concluída

Verifique se o esquema JSON/restrições de saída estritas estão em vigor.

Passe 100
Normatividade do protocolo Verificação concluída

Verifique o formato dos campos como id, objeto, escolhas, razão_de_acabamento, uso, etc.

falhou 65
consistência de streaming Verificação concluída

Compare o uso de token e texto de fluxo e não fluxo para obter consistência.

Passe 100
Faturamento de token Verificação concluída

Verifique a relação de medição de prompt/conclusão/total de tokens.

falhou 65
Reprodução precisa do comando (anti-casing) Verificação concluída

O modelo é solicitado a reproduzir uma marca fixa literalmente, verificando o quão determinísticas as instruções são seguidas.

Passe 100
Teste de conflito de sistema Verificação concluída

Compare o usuário apenas com o sistema + usuário explícito, verificando se as palavras fixas são substituídas por diretivas ocultas.

Passe 100
Auditoria minimalista de token de entrada Verificação concluída

Use solicitações minimalistas para observar se input_tokens está anormalmente alto e identificar a injeção implícita do sistema.

falhou 40
Comparação oficial do mesmo título Verificação concluída

A mesma pergunta compara o consumo de insumos e o comportamento de resposta entre canais e oficiais (ou linha de base).

Não aplicável
Ocultar detecção de injeção Verificação concluída

Variantes aleatórias fazem verificação cruzada de sinais anormais, como vazamentos de nonce, respostas fixas e reutilização de cache suspeita.

Passe 100
Rejeição de segurança e estabilidade política Verificação concluída

Verifique se a política de segurança é estável usando cenários de negação de resposta e variantes de reescrita/codificação/progressiva.

falhou 50
Capacidade extrema de raciocínio (contagem da teoria dos números) Verificação concluída

Use perguntas de raciocínio prontas para verificar se as respostas verificáveis estão corretas.

Passe 100
autenticidade de contexto longo Verificação concluída

Use agulha no palheiro para verificar se a janela de contexto é respeitada.

Passe 100

Como ler esse resultado?

Token 计费存在风险

Token 数明显异常: usage 字段、token 增量或流式/非流式统计存在明显问题,有虚报或统计错误风险。

Primeiro token
1,935ms
Tempo total
99,636ms
Taxa de transferência (T/S)
25.5
Tokens de entrada
427,581
Tokens de saída
2,541
What does each OpenAI check cover?
Solicitação básica
Confirme se as solicitações básicas de conclusões de bate-papo podem retornar de forma estável.
consistência do modelo
Compare os campos do modelo de solicitação e do modelo de resposta para ver se eles correspondem.
chamada de função
Verifique tool_calls, nome da função, parâmetro JSON e estrutura da chamada.
Saída estruturada
Verifique se o esquema JSON/restrições de saída estritas estão em vigor.
Normatividade do protocolo
Verifique o formato dos campos como id, objeto, escolhas, razão_de_acabamento, uso, etc.
consistência de streaming
Compare o uso de token e texto de fluxo e não fluxo para obter consistência.
Faturamento de token
Verifique a relação de medição de prompt/conclusão/total de tokens.
Comparação oficial do mesmo título
A mesma pergunta compara o consumo de insumos e o comportamento de resposta entre canais e oficiais (ou linha de base).
Reprodução precisa do comando (anti-casing)
O modelo é solicitado a reproduzir uma marca fixa literalmente, verificando o quão determinísticas as instruções são seguidas.
Teste de conflito de sistema
Compare o usuário apenas com o sistema + usuário explícito, verificando se as palavras fixas são substituídas por diretivas ocultas.
Auditoria minimalista de token de entrada
Use solicitações minimalistas para observar se input_tokens está anormalmente alto e identificar a injeção implícita do sistema.
Capacidade extrema de raciocínio (contagem da teoria dos números)
Use perguntas de raciocínio prontas para verificar se as respostas verificáveis estão corretas.
autenticidade de contexto longo
Use agulha no palheiro para verificar se a janela de contexto é respeitada.
Ocultar detecção de injeção
Variantes aleatórias fazem verificação cruzada de sinais anormais, como vazamentos de nonce, respostas fixas e reutilização de cache suspeita.
Rejeição de segurança e estabilidade política
Verifique se a política de segurança é estável usando cenários de negação de resposta e variantes de reescrita/codificação/progressiva.

2026-09-08 · Sharing, languages, and scoring tweaks

This update improves report sharing and language switching, and lightly rebalances OpenAI / Gemini scoring emphasis.