Resultados de detecção

Modelo: claude-sonnet-5 · modo full · relé https://agi.tontian.com/

Pontuação total
Cada item é aprovado/reprovado/erro; o total é um resultado ponderado e pode estar intermediário.
27 / 100
Autenticação de modelo Verifique a exceção

Examine a identidade autodeclarada do modelo, os resíduos da marca e os sinais comuns de camuflagem.

Verifique a exceção 0
Pense solidário Verificação concluída

Verifique se os campos exclusivos do lado do servidor, como Claude pensamento/assinatura, são transmitidos de forma transparente.

Passe 100
Reprodução precisa do comando (anti-casing) Verifique a exceção

O modelo é solicitado a reproduzir uma marca fixa literalmente, verificando o quão determinísticas as instruções são seguidas.

Verifique a exceção 0
Teste de conflito de sistema Verifique a exceção

Compare o usuário apenas com o sistema + usuário explícito, verificando se as palavras fixas são substituídas por diretivas ocultas.

Verifique a exceção 0
Capacidade extrema de raciocínio (contagem da teoria dos números) Verifique a exceção

Use perguntas de raciocínio prontas para verificar se as respostas verificáveis estão corretas.

Verifique a exceção 0
Detecção de canal Verifique a exceção

Identifica o canal de hospedagem do prefixo do ID de resposta.

Verifique a exceção 0
Claude Verificação do tokenizador Verificação concluída

Modelo:— · Tokens observados:None · Tokens esperados:None · Partida:unknown

Não aplicável
Auditoria minimalista de token de entrada Verifique a exceção

Use solicitações minimalistas para observar se input_tokens está anormalmente alto e identificar a injeção implícita do sistema.

Verifique a exceção 0
consistência do estilo comportamental Verificação concluída

Compare as características da série Claude por meio de preferências comportamentais e padrões de resposta.

falhou 0
precisão do conhecimento Verificação concluída

Use perguntas de conhecimento geral Anthropic / Claude para validar cruzadamente se o back-end é tão reivindicado quanto Claude.

falhou 0
Consistência da declaração do modelo Verifique a exceção

Comparando modelo de solicitação, modelo de resposta e estabilidade de identidade em múltiplas rodadas de devoluções.

Verifique a exceção 0
Especificação da estrutura da mensagem Verificação concluída

Verifique IDs de mensagens, sequências de eventos SSE e blocos de conteúdo quanto à conformidade com as especificações Anthropic.

Passe 100
Uso de ferramenta/saída estruturada Verifique a exceção

Verifique se o bloco tool_use, toolu_ ID, nome da função e esquema de parâmetros estão padronizados.

Verifique a exceção 0
consistência de streaming Verifique a exceção

Compare texto de fluxo e não fluxo, token e motivo final para obter consistência.

Verifique a exceção 0
Consistência de uso de token Verifique a exceção

Verifique se os campos de token de entrada/saída/cache estão completos e autênticos.

Verifique a exceção 0
Comparação oficial do mesmo título Verifique a exceção

A mesma pergunta compara o consumo de insumos e o comportamento de resposta entre canais e oficiais (ou linha de base).

Verifique a exceção 0
Ocultar detecção de injeção Verificação concluída

Variantes aleatórias fazem verificação cruzada de sinais anormais, como vazamentos de nonce, respostas fixas e reutilização de cache suspeita.

Passe 100
Rejeição de segurança e estabilidade política Verificação concluída

Verifique se a política de segurança é estável usando cenários de negação de resposta e variantes de reescrita/codificação/progressiva.

falhou 50
autenticidade de contexto longo Verificação concluída

Use agulha no palheiro para verificar se longas janelas de contexto são respeitadas.

falhou 0
Reconhecimento multimodal/PDF Verificação concluída

Envie uma investigação em PDF para confirmar se o link de compreensão do documento não foi removido pela estação de transferência.

falhou 0

Como ler esse resultado?

Token 用量存在风险

usage 字段缺失或统计不自洽,建议不要直接依赖该中转站返回的 token 数做计费核算。

Primeiro token
1,881ms
Tempo total
25,087ms
Taxa de transferência (T/S)
63.9
Tokens de entrada
804
Tokens de saída
1,604
What does each Claude check cover?
Autenticação de modelo
Examine a identidade autodeclarada do modelo, os resíduos da marca e os sinais comuns de camuflagem.
Pense solidário ⭐
Verifique se os campos exclusivos do lado do servidor, como Claude pensamento/assinatura, são transmitidos de forma transparente.
Reprodução precisa do comando (anti-casing)
O modelo é solicitado a reproduzir uma marca fixa literalmente, verificando o quão determinísticas as instruções são seguidas.
Teste de conflito de sistema
Compare o usuário apenas com o sistema + usuário explícito, verificando se as palavras fixas são substituídas por diretivas ocultas.
Auditoria minimalista de token de entrada
Use solicitações minimalistas para observar se input_tokens está anormalmente alto e identificar a injeção implícita do sistema.
Capacidade extrema de raciocínio (contagem da teoria dos números)
Use perguntas de raciocínio prontas para verificar se as respostas verificáveis estão corretas.
Detecção de canal
Identifica o canal de hospedagem do prefixo do ID de resposta.
Claude Verificação do tokenizador
Conte input_tokens com dicas fixas em comparação com a linha de base do modelo calibrado.
consistência do estilo comportamental
Compare as características da série Claude por meio de preferências comportamentais e padrões de resposta.
precisão do conhecimento
Use perguntas de conhecimento geral Anthropic / Claude para validar cruzadamente se o back-end é tão reivindicado quanto Claude.
Consistência da declaração do modelo
Comparando modelo de solicitação, modelo de resposta e estabilidade de identidade em múltiplas rodadas de devoluções.
Especificação da estrutura da mensagem
Verifique IDs de mensagens, sequências de eventos SSE e blocos de conteúdo quanto à conformidade com as especificações Anthropic.
Uso de ferramenta/saída estruturada
Verifique se o bloco tool_use, toolu_ ID, nome da função e esquema de parâmetros estão padronizados.
consistência de streaming
Compare texto de fluxo e não fluxo, token e motivo final para obter consistência.
Consistência de uso de token
Verifique se os campos de token de entrada/saída/cache estão completos e autênticos.
Comparação oficial do mesmo título
A mesma pergunta compara o consumo de insumos e o comportamento de resposta entre canais e oficiais (ou linha de base).
autenticidade de contexto longo
Use agulha no palheiro para verificar se longas janelas de contexto são respeitadas.
Reconhecimento multimodal/PDF
Envie uma investigação em PDF para confirmar se o link de compreensão do documento não foi removido pela estação de transferência.
Ocultar detecção de injeção
Variantes aleatórias fazem verificação cruzada de sinais anormais, como vazamentos de nonce, respostas fixas e reutilização de cache suspeita.
Rejeição de segurança e estabilidade política
Verifique se a política de segurança é estável usando cenários de negação de resposta e variantes de reescrita/codificação/progressiva.

2026-09-08 · Sharing, languages, and scoring tweaks

This update improves report sharing and language switching, and lightly rebalances OpenAI / Gemini scoring emphasis.