Confirme que las solicitudes básicas de finalización de chat puedan regresar de manera estable.
Resultados de la detección
Modelo: gpt-5.5 · modo standard · relé https://test.apiqik-kratos.apiqik.com/
Compare los campos del modelo de solicitud y del modelo de respuesta para ver si coinciden.
Verifique las llamadas a herramientas, el nombre de la función, el parámetro JSON y la estructura de la llamada.
Verifique que el esquema JSON/las restricciones de salida estrictas estén vigentes.
Verifique la forma de campos como id, objeto, opciones, motivo_finalización, uso, etc.
Compare el uso de tokens y texto de transmisión y no transmisión para lograr coherencia.
Verifique la relación de medición de aviso/finalización/total de tokens.
Se pide al modelo que reproduzca textualmente una marca fija, comprobando cuán deterministas se siguen las instrucciones.
Compare solo el usuario con el sistema explícito + usuario, verificando si las palabras fijas son anuladas por directivas ocultas.
Utilice solicitudes minimalistas para observar si input_tokens es anormalmente alto e identificar la inyección implícita del sistema.
La misma pregunta compara el consumo de insumos y el comportamiento de respuesta entre canales y canales oficiales (o de referencia).
Las variantes aleatorias verifican señales anormales, como fugas de nonce, respuestas fijas y reutilización de caché sospechosa.
Compruebe si la política de seguridad es estable utilizando escenarios de denegación de respuesta y variantes de reescritura/codificación/progresivas.
Utilice preguntas de razonamiento enlatadas para comprobar si las respuestas verificables son correctas.
What does each OpenAI check cover?
- Solicitud básica
- Confirme que las solicitudes básicas de finalización de chat puedan regresar de manera estable.
- consistencia del modelo
- Compare los campos del modelo de solicitud y del modelo de respuesta para ver si coinciden.
- llamada de función
- Verifique las llamadas a herramientas, el nombre de la función, el parámetro JSON y la estructura de la llamada.
- Salida estructurada
- Verifique que el esquema JSON/las restricciones de salida estrictas estén vigentes.
- Normatividad del protocolo
- Verifique la forma de campos como id, objeto, opciones, motivo_finalización, uso, etc.
- consistencia de transmisión
- Compare el uso de tokens y texto de transmisión y no transmisión para lograr coherencia.
- Facturación de tokens
- Verifique la relación de medición de aviso/finalización/total de tokens.
- Comparación oficial del mismo título.
- La misma pregunta compara el consumo de insumos y el comportamiento de respuesta entre canales y canales oficiales (o de referencia).
- Reproducción precisa de comandos (anti-carcasa)
- Se pide al modelo que reproduzca textualmente una marca fija, comprobando cuán deterministas se siguen las instrucciones.
- Prueba de conflicto del sistema
- Compare solo el usuario con el sistema explícito + usuario, verificando si las palabras fijas son anuladas por directivas ocultas.
- Auditoría de token de entrada minimalista
- Utilice solicitudes minimalistas para observar si input_tokens es anormalmente alto e identificar la inyección implícita del sistema.
- Capacidad de razonamiento extrema (conteo de teoría de números)
- Utilice preguntas de razonamiento enlatadas para comprobar si las respuestas verificables son correctas.
- autenticidad de contexto largo
- Utilice la aguja en el pajar para verificar que se respete la ventana de contexto.
- Ocultar detección de inyección
- Las variantes aleatorias verifican señales anormales, como fugas de nonce, respuestas fijas y reutilización de caché sospechosa.
- Rechazo a la seguridad y estabilidad política
- Compruebe si la política de seguridad es estable utilizando escenarios de denegación de respuesta y variantes de reescritura/codificación/progresivas.