Examine a identidade autodeclarada do modelo, os resíduos da marca e os sinais comuns de camuflagem.
Resultados de detecção
Modelo: claude-haiku-4-5-20251001 · modo standard · relé https://test.apiqik-kratos.dimleap.cn
Verifique se os campos exclusivos do lado do servidor, como Claude pensamento/assinatura, são transmitidos de forma transparente.
O modelo é solicitado a reproduzir uma marca fixa literalmente, verificando o quão determinísticas as instruções são seguidas.
Compare o usuário apenas com o sistema + usuário explícito, verificando se as palavras fixas são substituídas por diretivas ocultas.
Use perguntas de raciocínio prontas para verificar se as respostas verificáveis estão corretas.
Canal hospedado:Anthropic
Modelo:— · Tokens observados:None · Tokens esperados:None · Partida:unknown
Use solicitações minimalistas para observar se input_tokens está anormalmente alto e identificar a injeção implícita do sistema.
Use perguntas de conhecimento geral Anthropic / Claude para validar cruzadamente se o back-end é tão reivindicado quanto Claude.
Comparando modelo de solicitação, modelo de resposta e estabilidade de identidade em múltiplas rodadas de devoluções.
Verifique IDs de mensagens, sequências de eventos SSE e blocos de conteúdo quanto à conformidade com as especificações Anthropic.
Verifique se o bloco tool_use, toolu_ ID, nome da função e esquema de parâmetros estão padronizados.
Compare texto de fluxo e não fluxo, token e motivo final para obter consistência.
Verifique se os campos de token de entrada/saída/cache estão completos e autênticos.
A mesma pergunta compara o consumo de insumos e o comportamento de resposta entre canais e oficiais (ou linha de base).
Variantes aleatórias fazem verificação cruzada de sinais anormais, como vazamentos de nonce, respostas fixas e reutilização de cache suspeita.
Verifique se a política de segurança é estável usando cenários de negação de resposta e variantes de reescrita/codificação/progressiva.
What does each Claude check cover?
- Autenticação de modelo
- Examine a identidade autodeclarada do modelo, os resíduos da marca e os sinais comuns de camuflagem.
- Pense solidário ⭐
- Verifique se os campos exclusivos do lado do servidor, como Claude pensamento/assinatura, são transmitidos de forma transparente.
- Reprodução precisa do comando (anti-casing)
- O modelo é solicitado a reproduzir uma marca fixa literalmente, verificando o quão determinísticas as instruções são seguidas.
- Teste de conflito de sistema
- Compare o usuário apenas com o sistema + usuário explícito, verificando se as palavras fixas são substituídas por diretivas ocultas.
- Auditoria minimalista de token de entrada
- Use solicitações minimalistas para observar se input_tokens está anormalmente alto e identificar a injeção implícita do sistema.
- Capacidade extrema de raciocínio (contagem da teoria dos números)
- Use perguntas de raciocínio prontas para verificar se as respostas verificáveis estão corretas.
- Detecção de canal
- Identifica o canal de hospedagem do prefixo do ID de resposta.
- Claude Verificação do tokenizador
- Conte input_tokens com dicas fixas em comparação com a linha de base do modelo calibrado.
- consistência do estilo comportamental
- Compare as características da série Claude por meio de preferências comportamentais e padrões de resposta.
- precisão do conhecimento
- Use perguntas de conhecimento geral Anthropic / Claude para validar cruzadamente se o back-end é tão reivindicado quanto Claude.
- Consistência da declaração do modelo
- Comparando modelo de solicitação, modelo de resposta e estabilidade de identidade em múltiplas rodadas de devoluções.
- Especificação da estrutura da mensagem
- Verifique IDs de mensagens, sequências de eventos SSE e blocos de conteúdo quanto à conformidade com as especificações Anthropic.
- Uso de ferramenta/saída estruturada
- Verifique se o bloco tool_use, toolu_ ID, nome da função e esquema de parâmetros estão padronizados.
- consistência de streaming
- Compare texto de fluxo e não fluxo, token e motivo final para obter consistência.
- Consistência de uso de token
- Verifique se os campos de token de entrada/saída/cache estão completos e autênticos.
- Comparação oficial do mesmo título
- A mesma pergunta compara o consumo de insumos e o comportamento de resposta entre canais e oficiais (ou linha de base).
- autenticidade de contexto longo
- Use agulha no palheiro para verificar se longas janelas de contexto são respeitadas.
- Reconhecimento multimodal/PDF
- Envie uma investigação em PDF para confirmar se o link de compreensão do documento não foi removido pela estação de transferência.
- Ocultar detecção de injeção
- Variantes aleatórias fazem verificação cruzada de sinais anormais, como vazamentos de nonce, respostas fixas e reutilização de cache suspeita.
- Rejeição de segurança e estabilidade política
- Verifique se a política de segurança é estável usando cenários de negação de resposta e variantes de reescrita/codificação/progressiva.