Resultados de la detección

Modelo: claude-haiku-4-5-20251001 · modo standard · relé https://test.apiqik-kratos.apiqik.com

Puntuación total
Cada elemento es aprobado/fallado/error; el total es un resultado ponderado y puede estar en el medio.
70 / 100
Autenticación de modelo Verificación completada

Examina la identidad autoinformada del modelo, los residuos de marca y los signos comunes de camuflaje.

Pase 100
Piensa en apoyo Verificación completada

Verifique si los campos exclusivos del lado del servidor, como Claude pensamiento/firma, se transmiten de forma transparente.

falló 0
Reproducción precisa de comandos (anti-carcasa) Verificación completada

Se pide al modelo que reproduzca textualmente una marca fija, comprobando cuán deterministas se siguen las instrucciones.

Pase 100
Prueba de conflicto del sistema Verificación completada

Compare solo el usuario con el sistema explícito + usuario, verificando si las palabras fijas son anuladas por directivas ocultas.

Pase 100
Capacidad de razonamiento extrema (conteo de teoría de números) Verificación completada

Utilice preguntas de razonamiento enlatadas para comprobar si las respuestas verificables son correctas.

falló 0
Detección de canales Verificación completada

Canal alojado:Anthropic

Pase 100
Claude Verificación del tokenizador Verificación completada

modelo:— · Fichas observadas:None · Fichas esperadas:None · partido:unknown

No aplicable
Auditoría de token de entrada minimalista Verificación completada

Utilice solicitudes minimalistas para observar si input_tokens es anormalmente alto e identificar la inyección implícita del sistema.

Pase 100
exactitud del conocimiento Verificación completada

Utilice Anthropic / Claude preguntas de conocimientos generales para realizar una validación cruzada si el backend es tan afirmado como Claude.

Pase 100
Coherencia de la declaración del modelo Verificación completada

Comparación del modelo de solicitud, modelo de respuesta y estabilidad de la identidad en múltiples rondas de devoluciones.

Pase 100
Especificación de la estructura del mensaje Verificación completada

Verifique que los ID de mensajes, las secuencias de eventos SSE y los bloques de contenido cumplan con las especificaciones Anthropic.

Pase 100
Uso de herramientas/resultado estructurado Verificación completada

Compruebe si el bloque tool_use, el tool_ID, el nombre de la función y el esquema de parámetros están estandarizados.

Pase 100
consistencia de transmisión Verificación completada

Compare el texto, el token y el motivo final de la transmisión y no de la transmisión para garantizar la coherencia.

Pase 100
Coherencia en el uso de tokens Verificación completada

Compruebe que los campos de entrada/salida/token de caché estén completos y sean auténticos.

Pase 85
Comparación oficial del mismo título. Verificación completada

La misma pregunta compara el consumo de insumos y el comportamiento de respuesta entre canales y canales oficiales (o de referencia).

No aplicable
Ocultar detección de inyección Verificación completada

Las variantes aleatorias verifican señales anormales, como fugas de nonce, respuestas fijas y reutilización de caché sospechosa.

Pase 100
Rechazo a la seguridad y estabilidad política Verificación completada

Compruebe si la política de seguridad es estable utilizando escenarios de denegación de respuesta y variantes de reescritura/codificación/progresivas.

falló 50
Primera ficha
1,620ms
tiempo total
33,640ms
Rendimiento (T/S)
50.5
Fichas de entrada
2,859
Fichas de salida
1,698
What does each Claude check cover?
Autenticación de modelo
Examina la identidad autoinformada del modelo, los residuos de marca y los signos comunes de camuflaje.
Piensa en apoyo ⭐
Verifique si los campos exclusivos del lado del servidor, como Claude pensamiento/firma, se transmiten de forma transparente.
Reproducción precisa de comandos (anti-carcasa)
Se pide al modelo que reproduzca textualmente una marca fija, comprobando cuán deterministas se siguen las instrucciones.
Prueba de conflicto del sistema
Compare solo el usuario con el sistema explícito + usuario, verificando si las palabras fijas son anuladas por directivas ocultas.
Auditoría de token de entrada minimalista
Utilice solicitudes minimalistas para observar si input_tokens es anormalmente alto e identificar la inyección implícita del sistema.
Capacidad de razonamiento extrema (conteo de teoría de números)
Utilice preguntas de razonamiento enlatadas para comprobar si las respuestas verificables son correctas.
Detección de canales
Identifica el canal de alojamiento a partir del prefijo de ID de respuesta.
Claude Verificación del tokenizador
Cuente input_tokens con sugerencias fijas en comparación con la línea base del modelo calibrado.
coherencia del estilo de comportamiento
Compare las características de la serie Claude a través de preferencias de comportamiento y patrones de respuesta.
exactitud del conocimiento
Utilice Anthropic / Claude preguntas de conocimientos generales para realizar una validación cruzada si el backend es tan afirmado como Claude.
Coherencia de la declaración del modelo
Comparación del modelo de solicitud, modelo de respuesta y estabilidad de la identidad en múltiples rondas de devoluciones.
Especificación de la estructura del mensaje
Verifique que los ID de mensajes, las secuencias de eventos SSE y los bloques de contenido cumplan con las especificaciones Anthropic.
Uso de herramientas/resultado estructurado
Compruebe si el bloque tool_use, el tool_ID, el nombre de la función y el esquema de parámetros están estandarizados.
consistencia de transmisión
Compare el texto, el token y el motivo final de la transmisión y no de la transmisión para garantizar la coherencia.
Coherencia en el uso de tokens
Compruebe que los campos de entrada/salida/token de caché estén completos y sean auténticos.
Comparación oficial del mismo título.
La misma pregunta compara el consumo de insumos y el comportamiento de respuesta entre canales y canales oficiales (o de referencia).
autenticidad de contexto largo
Utilice la aguja en el pajar para verificar que se respeten las ventanas de contexto largas.
Reconocimiento multimodal/PDF
Envíe una prueba en PDF para confirmar que la estación de transferencia no ha eliminado el enlace de comprensión del documento.
Ocultar detección de inyección
Las variantes aleatorias verifican señales anormales, como fugas de nonce, respuestas fijas y reutilización de caché sospechosa.
Rechazo a la seguridad y estabilidad política
Compruebe si la política de seguridad es estable utilizando escenarios de denegación de respuesta y variantes de reescritura/codificación/progresivas.

2026-09-08 · Sharing, languages, and scoring tweaks

This update improves report sharing and language switching, and lightly rebalances OpenAI / Gemini scoring emphasis.