Confirme se as solicitações básicas de conclusões de bate-papo podem retornar de forma estável.
Resultados de detecção
Modelo: gpt-5.5 · modo standard · relé https://test.apiqik-kratos.apiqik.com/
Compare os campos do modelo de solicitação e do modelo de resposta para ver se eles correspondem.
Verifique tool_calls, nome da função, parâmetro JSON e estrutura da chamada.
Verifique se o esquema JSON/restrições de saída estritas estão em vigor.
Verifique o formato dos campos como id, objeto, escolhas, razão_de_acabamento, uso, etc.
Compare o uso de token e texto de fluxo e não fluxo para obter consistência.
Verifique a relação de medição de prompt/conclusão/total de tokens.
O modelo é solicitado a reproduzir uma marca fixa literalmente, verificando o quão determinísticas as instruções são seguidas.
Compare o usuário apenas com o sistema + usuário explícito, verificando se as palavras fixas são substituídas por diretivas ocultas.
Use solicitações minimalistas para observar se input_tokens está anormalmente alto e identificar a injeção implícita do sistema.
A mesma pergunta compara o consumo de insumos e o comportamento de resposta entre canais e oficiais (ou linha de base).
Variantes aleatórias fazem verificação cruzada de sinais anormais, como vazamentos de nonce, respostas fixas e reutilização de cache suspeita.
Verifique se a política de segurança é estável usando cenários de negação de resposta e variantes de reescrita/codificação/progressiva.
Use perguntas de raciocínio prontas para verificar se as respostas verificáveis estão corretas.
What does each OpenAI check cover?
- Solicitação básica
- Confirme se as solicitações básicas de conclusões de bate-papo podem retornar de forma estável.
- consistência do modelo
- Compare os campos do modelo de solicitação e do modelo de resposta para ver se eles correspondem.
- chamada de função
- Verifique tool_calls, nome da função, parâmetro JSON e estrutura da chamada.
- Saída estruturada
- Verifique se o esquema JSON/restrições de saída estritas estão em vigor.
- Normatividade do protocolo
- Verifique o formato dos campos como id, objeto, escolhas, razão_de_acabamento, uso, etc.
- consistência de streaming
- Compare o uso de token e texto de fluxo e não fluxo para obter consistência.
- Faturamento de token
- Verifique a relação de medição de prompt/conclusão/total de tokens.
- Comparação oficial do mesmo título
- A mesma pergunta compara o consumo de insumos e o comportamento de resposta entre canais e oficiais (ou linha de base).
- Reprodução precisa do comando (anti-casing)
- O modelo é solicitado a reproduzir uma marca fixa literalmente, verificando o quão determinísticas as instruções são seguidas.
- Teste de conflito de sistema
- Compare o usuário apenas com o sistema + usuário explícito, verificando se as palavras fixas são substituídas por diretivas ocultas.
- Auditoria minimalista de token de entrada
- Use solicitações minimalistas para observar se input_tokens está anormalmente alto e identificar a injeção implícita do sistema.
- Capacidade extrema de raciocínio (contagem da teoria dos números)
- Use perguntas de raciocínio prontas para verificar se as respostas verificáveis estão corretas.
- autenticidade de contexto longo
- Use agulha no palheiro para verificar se a janela de contexto é respeitada.
- Ocultar detecção de injeção
- Variantes aleatórias fazem verificação cruzada de sinais anormais, como vazamentos de nonce, respostas fixas e reutilização de cache suspeita.
- Rejeição de segurança e estabilidade política
- Verifique se a política de segurança é estável usando cenários de negação de resposta e variantes de reescrita/codificação/progressiva.