Examina la identidad autoinformada del modelo, los residuos de marca y los signos comunes de camuflaje.
Resultados de la detección
Modelo: claude-sonnet-5 · modo full · relé https://agi.tontian.com/
Verifique si los campos exclusivos del lado del servidor, como Claude pensamiento/firma, se transmiten de forma transparente.
Se pide al modelo que reproduzca textualmente una marca fija, comprobando cuán deterministas se siguen las instrucciones.
Compare solo el usuario con el sistema explícito + usuario, verificando si las palabras fijas son anuladas por directivas ocultas.
Utilice preguntas de razonamiento enlatadas para comprobar si las respuestas verificables son correctas.
Identifica el canal de alojamiento a partir del prefijo de ID de respuesta.
modelo:— · Fichas observadas:None · Fichas esperadas:None · partido:unknown
Utilice solicitudes minimalistas para observar si input_tokens es anormalmente alto e identificar la inyección implícita del sistema.
Compare las características de la serie Claude a través de preferencias de comportamiento y patrones de respuesta.
Utilice Anthropic / Claude preguntas de conocimientos generales para realizar una validación cruzada si el backend es tan afirmado como Claude.
Comparación del modelo de solicitud, modelo de respuesta y estabilidad de la identidad en múltiples rondas de devoluciones.
Verifique que los ID de mensajes, las secuencias de eventos SSE y los bloques de contenido cumplan con las especificaciones Anthropic.
Compruebe si el bloque tool_use, el tool_ID, el nombre de la función y el esquema de parámetros están estandarizados.
Compare el texto, el token y el motivo final de la transmisión y no de la transmisión para garantizar la coherencia.
Compruebe que los campos de entrada/salida/token de caché estén completos y sean auténticos.
La misma pregunta compara el consumo de insumos y el comportamiento de respuesta entre canales y canales oficiales (o de referencia).
Las variantes aleatorias verifican señales anormales, como fugas de nonce, respuestas fijas y reutilización de caché sospechosa.
Compruebe si la política de seguridad es estable utilizando escenarios de denegación de respuesta y variantes de reescritura/codificación/progresivas.
Utilice la aguja en el pajar para verificar que se respeten las ventanas de contexto largas.
Envíe una prueba en PDF para confirmar que la estación de transferencia no ha eliminado el enlace de comprensión del documento.
¿Cómo leer este resultado?
usage 字段缺失或统计不自洽,建议不要直接依赖该中转站返回的 token 数做计费核算。
What does each Claude check cover?
- Autenticación de modelo
- Examina la identidad autoinformada del modelo, los residuos de marca y los signos comunes de camuflaje.
- Piensa en apoyo ⭐
- Verifique si los campos exclusivos del lado del servidor, como Claude pensamiento/firma, se transmiten de forma transparente.
- Reproducción precisa de comandos (anti-carcasa)
- Se pide al modelo que reproduzca textualmente una marca fija, comprobando cuán deterministas se siguen las instrucciones.
- Prueba de conflicto del sistema
- Compare solo el usuario con el sistema explícito + usuario, verificando si las palabras fijas son anuladas por directivas ocultas.
- Auditoría de token de entrada minimalista
- Utilice solicitudes minimalistas para observar si input_tokens es anormalmente alto e identificar la inyección implícita del sistema.
- Capacidad de razonamiento extrema (conteo de teoría de números)
- Utilice preguntas de razonamiento enlatadas para comprobar si las respuestas verificables son correctas.
- Detección de canales
- Identifica el canal de alojamiento a partir del prefijo de ID de respuesta.
- Claude Verificación del tokenizador
- Cuente input_tokens con sugerencias fijas en comparación con la línea base del modelo calibrado.
- coherencia del estilo de comportamiento
- Compare las características de la serie Claude a través de preferencias de comportamiento y patrones de respuesta.
- exactitud del conocimiento
- Utilice Anthropic / Claude preguntas de conocimientos generales para realizar una validación cruzada si el backend es tan afirmado como Claude.
- Coherencia de la declaración del modelo
- Comparación del modelo de solicitud, modelo de respuesta y estabilidad de la identidad en múltiples rondas de devoluciones.
- Especificación de la estructura del mensaje
- Verifique que los ID de mensajes, las secuencias de eventos SSE y los bloques de contenido cumplan con las especificaciones Anthropic.
- Uso de herramientas/resultado estructurado
- Compruebe si el bloque tool_use, el tool_ID, el nombre de la función y el esquema de parámetros están estandarizados.
- consistencia de transmisión
- Compare el texto, el token y el motivo final de la transmisión y no de la transmisión para garantizar la coherencia.
- Coherencia en el uso de tokens
- Compruebe que los campos de entrada/salida/token de caché estén completos y sean auténticos.
- Comparación oficial del mismo título.
- La misma pregunta compara el consumo de insumos y el comportamiento de respuesta entre canales y canales oficiales (o de referencia).
- autenticidad de contexto largo
- Utilice la aguja en el pajar para verificar que se respeten las ventanas de contexto largas.
- Reconocimiento multimodal/PDF
- Envíe una prueba en PDF para confirmar que la estación de transferencia no ha eliminado el enlace de comprensión del documento.
- Ocultar detección de inyección
- Las variantes aleatorias verifican señales anormales, como fugas de nonce, respuestas fijas y reutilización de caché sospechosa.
- Rechazo a la seguridad y estabilidad política
- Compruebe si la política de seguridad es estable utilizando escenarios de denegación de respuesta y variantes de reescritura/codificación/progresivas.