Resultados de la detección

Modelo: gpt-5.6-sol · modo full · relé https://gw.hbapis.com/

Puntuación total
Cada elemento es aprobado/fallado/error; el total es un resultado ponderado y puede estar en el medio.
83 / 100
Solicitud básica Verificación completada

Confirme que las solicitudes básicas de finalización de chat puedan regresar de manera estable.

Pase 100
consistencia del modelo Verificación completada

Compare los campos del modelo de solicitud y del modelo de respuesta para ver si coinciden.

Pase 100
llamada de función Verificación completada

Verifique las llamadas a herramientas, el nombre de la función, el parámetro JSON y la estructura de la llamada.

Pase 100
Salida estructurada Verificación completada

Verifique que el esquema JSON/las restricciones de salida estrictas estén vigentes.

Pase 100
Normatividad del protocolo Verificación completada

Verifique la forma de campos como id, objeto, opciones, motivo_finalización, uso, etc.

falló 60
consistencia de transmisión Verificación completada

Compare el uso de tokens y texto de transmisión y no transmisión para lograr coherencia.

Pase 100
Facturación de tokens Verificar excepción

Razón:Verifique la relación de medición de aviso/finalización/total de tokens.

Verificar excepción 0
Reproducción precisa de comandos (anti-carcasa) Verificación completada

Se pide al modelo que reproduzca textualmente una marca fija, comprobando cuán deterministas se siguen las instrucciones.

Pase 100
Prueba de conflicto del sistema Verificación completada

Compare solo el usuario con el sistema explícito + usuario, verificando si las palabras fijas son anuladas por directivas ocultas.

Pase 100
Auditoría de token de entrada minimalista Verificación completada

Utilice solicitudes minimalistas para observar si input_tokens es anormalmente alto e identificar la inyección implícita del sistema.

Pase 100
Comparación oficial del mismo título. Verificación completada

La misma pregunta compara el consumo de insumos y el comportamiento de respuesta entre canales y canales oficiales (o de referencia).

No aplicable
Ocultar detección de inyección Verificación completada

Las variantes aleatorias verifican señales anormales, como fugas de nonce, respuestas fijas y reutilización de caché sospechosa.

Pase 100
Rechazo a la seguridad y estabilidad política Verificación completada

Compruebe si la política de seguridad es estable utilizando escenarios de denegación de respuesta y variantes de reescritura/codificación/progresivas.

falló 50
Capacidad de razonamiento extrema (conteo de teoría de números) Verificación completada

Utilice preguntas de razonamiento enlatadas para comprobar si las respuestas verificables son correctas.

Pase 100
autenticidad de contexto largo Verificación completada

Utilice la aguja en el pajar para verificar que se respete la ventana de contexto.

falló 67

¿Cómo leer este resultado?

中转站疑似伪装成 OpenAI

响应的 usage 字段里出现了 Anthropic / Google 后端才会用的字段(如 claude_cache_creation_*、gemini_* 或 usage_source 自报非 openai)。这强烈暗示中转站把你的请求转发给了别的厂商后端再包装成 OpenAI 响应,所谓的 GPT 输出可能并非真正的 OpenAI 模型在生成。

Token 计费存在风险

Token 统计有明显偏差,建议留意是否存在多算或统计错误。

Primera ficha
1,606ms
tiempo total
100,741ms
Rendimiento (T/S)
14.7
Fichas de entrada
165,085
Fichas de salida
1,480
What does each OpenAI check cover?
Solicitud básica
Confirme que las solicitudes básicas de finalización de chat puedan regresar de manera estable.
consistencia del modelo
Compare los campos del modelo de solicitud y del modelo de respuesta para ver si coinciden.
llamada de función
Verifique las llamadas a herramientas, el nombre de la función, el parámetro JSON y la estructura de la llamada.
Salida estructurada
Verifique que el esquema JSON/las restricciones de salida estrictas estén vigentes.
Normatividad del protocolo
Verifique la forma de campos como id, objeto, opciones, motivo_finalización, uso, etc.
consistencia de transmisión
Compare el uso de tokens y texto de transmisión y no transmisión para lograr coherencia.
Facturación de tokens
Verifique la relación de medición de aviso/finalización/total de tokens.
Comparación oficial del mismo título.
La misma pregunta compara el consumo de insumos y el comportamiento de respuesta entre canales y canales oficiales (o de referencia).
Reproducción precisa de comandos (anti-carcasa)
Se pide al modelo que reproduzca textualmente una marca fija, comprobando cuán deterministas se siguen las instrucciones.
Prueba de conflicto del sistema
Compare solo el usuario con el sistema explícito + usuario, verificando si las palabras fijas son anuladas por directivas ocultas.
Auditoría de token de entrada minimalista
Utilice solicitudes minimalistas para observar si input_tokens es anormalmente alto e identificar la inyección implícita del sistema.
Capacidad de razonamiento extrema (conteo de teoría de números)
Utilice preguntas de razonamiento enlatadas para comprobar si las respuestas verificables son correctas.
autenticidad de contexto largo
Utilice la aguja en el pajar para verificar que se respete la ventana de contexto.
Ocultar detección de inyección
Las variantes aleatorias verifican señales anormales, como fugas de nonce, respuestas fijas y reutilización de caché sospechosa.
Rechazo a la seguridad y estabilidad política
Compruebe si la política de seguridad es estable utilizando escenarios de denegación de respuesta y variantes de reescritura/codificación/progresivas.

2026-09-08 · Sharing, languages, and scoring tweaks

This update improves report sharing and language switching, and lightly rebalances OpenAI / Gemini scoring emphasis.