Resultados de detecção

Modelo: claude-opus-4-7 · modo full · relé https://test.apiqik-kratos.apiqik.com/

Pontuação total
Cada item é aprovado/reprovado/erro; o total é um resultado ponderado e pode estar intermediário.
98 / 100
Autenticação de modelo Verificação concluída

Examine a identidade autodeclarada do modelo, os resíduos da marca e os sinais comuns de camuflagem.

Passe 100
Pense solidário Verificação concluída

Verifique se os campos exclusivos do lado do servidor, como Claude pensamento/assinatura, são transmitidos de forma transparente.

Passe 100
Reprodução precisa do comando (anti-casing) Verificação concluída

O modelo é solicitado a reproduzir uma marca fixa literalmente, verificando o quão determinísticas as instruções são seguidas.

Passe 100
Teste de conflito de sistema Verificação concluída

Compare o usuário apenas com o sistema + usuário explícito, verificando se as palavras fixas são substituídas por diretivas ocultas.

Passe 100
Capacidade extrema de raciocínio (contagem da teoria dos números) Verificação concluída

Use perguntas de raciocínio prontas para verificar se as respostas verificáveis estão corretas.

Passe 100
Detecção de canal Verificação concluída

Canal hospedado:Anthropic

Passe 100
Claude Verificação do tokenizador Verificação concluída

Modelo:claude-opus-4-7 · Tokens observados:6 · Tokens esperados:17 · Partida:false

falhou 0
Auditoria minimalista de token de entrada Verificação concluída

Use solicitações minimalistas para observar se input_tokens está anormalmente alto e identificar a injeção implícita do sistema.

falhou 50
consistência do estilo comportamental Verificação concluída

Compare as características da série Claude por meio de preferências comportamentais e padrões de resposta.

Passe 100
precisão do conhecimento Verificação concluída

Use perguntas de conhecimento geral Anthropic / Claude para validar cruzadamente se o back-end é tão reivindicado quanto Claude.

Passe 100
Consistência da declaração do modelo Verificação concluída

Comparando modelo de solicitação, modelo de resposta e estabilidade de identidade em múltiplas rodadas de devoluções.

Passe 100
Especificação da estrutura da mensagem Verificação concluída

Verifique IDs de mensagens, sequências de eventos SSE e blocos de conteúdo quanto à conformidade com as especificações Anthropic.

Passe 100
Uso de ferramenta/saída estruturada Verificação concluída

Verifique se o bloco tool_use, toolu_ ID, nome da função e esquema de parâmetros estão padronizados.

Passe 100
consistência de streaming Verificação concluída

Compare texto de fluxo e não fluxo, token e motivo final para obter consistência.

Passe 100
Consistência de uso de token Verificação concluída

Verifique se os campos de token de entrada/saída/cache estão completos e autênticos.

Passe 85
Comparação oficial do mesmo título Verificação concluída

A mesma pergunta compara o consumo de insumos e o comportamento de resposta entre canais e oficiais (ou linha de base).

Não aplicável
Ocultar detecção de injeção Verificação concluída

Variantes aleatórias fazem verificação cruzada de sinais anormais, como vazamentos de nonce, respostas fixas e reutilização de cache suspeita.

Passe 100
Rejeição de segurança e estabilidade política Verificação concluída

Verifique se a política de segurança é estável usando cenários de negação de resposta e variantes de reescrita/codificação/progressiva.

falhou 50
autenticidade de contexto longo Verificação concluída

Use agulha no palheiro para verificar se longas janelas de contexto são respeitadas.

Passe 100
Reconhecimento multimodal/PDF Verificação concluída

Envie uma investigação em PDF para confirmar se o link de compreensão do documento não foi removido pela estação de transferência.

Passe 100
Primeiro token
5,226ms
Tempo total
252,668ms
Taxa de transferência (T/S)
19.1
Tokens de entrada
3,787
Tokens de saída
4,823
What does each Claude check cover?
Autenticação de modelo
Examine a identidade autodeclarada do modelo, os resíduos da marca e os sinais comuns de camuflagem.
Pense solidário ⭐
Verifique se os campos exclusivos do lado do servidor, como Claude pensamento/assinatura, são transmitidos de forma transparente.
Reprodução precisa do comando (anti-casing)
O modelo é solicitado a reproduzir uma marca fixa literalmente, verificando o quão determinísticas as instruções são seguidas.
Teste de conflito de sistema
Compare o usuário apenas com o sistema + usuário explícito, verificando se as palavras fixas são substituídas por diretivas ocultas.
Auditoria minimalista de token de entrada
Use solicitações minimalistas para observar se input_tokens está anormalmente alto e identificar a injeção implícita do sistema.
Capacidade extrema de raciocínio (contagem da teoria dos números)
Use perguntas de raciocínio prontas para verificar se as respostas verificáveis estão corretas.
Detecção de canal
Identifica o canal de hospedagem do prefixo do ID de resposta.
Claude Verificação do tokenizador
Conte input_tokens com dicas fixas em comparação com a linha de base do modelo calibrado.
consistência do estilo comportamental
Compare as características da série Claude por meio de preferências comportamentais e padrões de resposta.
precisão do conhecimento
Use perguntas de conhecimento geral Anthropic / Claude para validar cruzadamente se o back-end é tão reivindicado quanto Claude.
Consistência da declaração do modelo
Comparando modelo de solicitação, modelo de resposta e estabilidade de identidade em múltiplas rodadas de devoluções.
Especificação da estrutura da mensagem
Verifique IDs de mensagens, sequências de eventos SSE e blocos de conteúdo quanto à conformidade com as especificações Anthropic.
Uso de ferramenta/saída estruturada
Verifique se o bloco tool_use, toolu_ ID, nome da função e esquema de parâmetros estão padronizados.
consistência de streaming
Compare texto de fluxo e não fluxo, token e motivo final para obter consistência.
Consistência de uso de token
Verifique se os campos de token de entrada/saída/cache estão completos e autênticos.
Comparação oficial do mesmo título
A mesma pergunta compara o consumo de insumos e o comportamento de resposta entre canais e oficiais (ou linha de base).
autenticidade de contexto longo
Use agulha no palheiro para verificar se longas janelas de contexto são respeitadas.
Reconhecimento multimodal/PDF
Envie uma investigação em PDF para confirmar se o link de compreensão do documento não foi removido pela estação de transferência.
Ocultar detecção de injeção
Variantes aleatórias fazem verificação cruzada de sinais anormais, como vazamentos de nonce, respostas fixas e reutilização de cache suspeita.
Rejeição de segurança e estabilidade política
Verifique se a política de segurança é estável usando cenários de negação de resposta e variantes de reescrita/codificação/progressiva.

2026-09-08 · Sharing, languages, and scoring tweaks

This update improves report sharing and language switching, and lightly rebalances OpenAI / Gemini scoring emphasis.