Demande de base
Confirmez que les chemins compatibles Gemini OpenAI peuvent être renvoyés de manière stable.
pangolin sonde les relais Gemini via des API compatibles OpenAI pour le protocole, les capacités et l'utilisation du transfert de métadonnées.
Se concentre sur un protocole compatible et un comportement de réflexion par défaut – et non sur l’identité de qualité signature de Claude.
Mesure le comportement réel de Gemini sur les points de terminaison compatibles OpenAI utilisés par des relais tiers.
Le plus proche de la façon dont les relais Gemini tiers sont réellement utilisés.
Mises à jour avec la profondeur d'analyse ci-dessus. Le mode complet couvre toutes les vérifications applicables. Les sondes à contexte long nécessitent un opt-in supplémentaire.
Confirmez que les chemins compatibles Gemini OpenAI peuvent être renvoyés de manière stable.
Vérifiez response.model et la forme choices[].message de Chat Completions.
Vérifiez le nom de l'appel de fonction, l'objet paramètre et la structure de l'appel.
Vérifiez si les contraintes du schéma de réponse/de sortie JSON sont en vigueur.
Vérifiez id, object, choices, finish_reason, usage et les empreintes inter-protocoles dans usage.
Comparez les raisons de sortie et de fin du flux et du non-flux pour plus de cohérence.
Vérifiez l’intégrité et les relations de mesure des champs prompt / completion / total dans usage.
La même question compare la consommation d'intrants et le comportement de réponse entre les canaux et les autorités (ou référence).
Il est demandé au modèle de reproduire textuellement une note fixe, en vérifiant dans quelle mesure les instructions sont suivies de manière déterministe.
Comparez l'utilisateur uniquement à un système + utilisateur explicite, en vérifiant si les mots fixes sont remplacés par des directives cachées.
Utilisez des requêtes minimalistes pour observer si input_tokens est anormalement élevé et identifier l’injection système implicite.
Utilisez des questions de raisonnement prédéfinies pour vérifier si les réponses vérifiables sont correctes.
Les variantes aléatoires vérifient les signaux anormaux tels que les fuites occasionnelles, les réponses corrigées et la réutilisation suspecte du cache.
Vérifiez si la politique de sécurité est stable à l'aide de scénarios de déni de réponse et de variantes de réécriture/codage/progressive.