Solicitud básica
Confirme que las solicitudes básicas de finalización de chat puedan regresar de manera estable.
pangolin verifica la forma de las terminaciones del chat, las llamadas de herramientas, la coherencia de la transmisión y las huellas digitales de uso para los pretendientes de GPT.
OpenAI no tiene una firma antifalsificación de servidor estilo Claude, por lo que esta página se centra en protocolos de alta confianza y comprobaciones de capacidad.
Evalúe si los puntos finales compatibles con GPT siguen las formas de OpenAI y realmente pasan por capacidades clave.
No es una prueba de identidad de grado criptográfico, pero es suficiente para detectar la mayoría de las fugas de adaptadores y las capacidades faltantes.
Actualizaciones con la profundidad de escaneo arriba. El modo completo cubre todas las comprobaciones aplicables. Las sondas de contexto prolongado necesitan una aceptación adicional.
Confirme que las solicitudes básicas de finalización de chat puedan regresar de manera estable.
Compare los campos del modelo de solicitud y del modelo de respuesta para ver si coinciden.
Verifique las llamadas a herramientas, el nombre de la función, el parámetro JSON y la estructura de la llamada.
Verifique que el esquema JSON/las restricciones de salida estrictas estén vigentes.
Verifique la forma de campos como id, objeto, opciones, motivo_finalización, uso, etc.
Compare el uso de tokens y texto de transmisión y no transmisión para lograr coherencia.
Verifique la relación de medición de aviso/finalización/total de tokens.
La misma pregunta compara el consumo de insumos y el comportamiento de respuesta entre canales y canales oficiales (o de referencia).
Se pide al modelo que reproduzca textualmente una marca fija, comprobando cuán deterministas se siguen las instrucciones.
Compare solo el usuario con el sistema explícito + usuario, verificando si las palabras fijas son anuladas por directivas ocultas.
Utilice solicitudes minimalistas para observar si input_tokens es anormalmente alto e identificar la inyección implícita del sistema.
Utilice preguntas de razonamiento enlatadas para comprobar si las respuestas verificables son correctas.
Las variantes aleatorias verifican señales anormales, como fugas de nonce, respuestas fijas y reutilización de caché sospechosa.
Compruebe si la política de seguridad es estable utilizando escenarios de denegación de respuesta y variantes de reescritura/codificación/progresivas.