Résultats de détection

Modèle : gpt-5.6-sol · mode full · relais https://gw.hbapis.com/

Note totale
Chaque élément est réussite/échec/erreur ; le total est un résultat pondéré et peut se situer entre les deux.
83 / 100
Demande de base Vérification terminée

Confirmez que les demandes de base de fin de chat peuvent être renvoyées de manière stable.

Passer 100
cohérence du modèle Vérification terminée

Comparez les champs du modèle de demande et du modèle de réponse pour voir s’ils correspondent.

Passer 100
appel de fonction Vérification terminée

Vérifiez tool_calls, le nom de la fonction, le paramètre JSON et la structure des appels.

Passer 100
Sortie structurée Vérification terminée

Vérifiez que le schéma JSON/les contraintes de sortie strictes sont en vigueur.

Passer 100
La normativité du protocole Vérification terminée

Vérifiez la forme des champs tels que l'identifiant, l'objet, les choix, finish_reason, l'utilisation, etc.

échoué 60
cohérence du streaming Vérification terminée

Comparez l’utilisation du texte et des jetons en flux et hors flux pour plus de cohérence.

Passer 100
Facturation des jetons Vérifier l'exception

Raison :Vérifiez la relation invite/achèvement/mesure totale des jetons.

Vérifier l'exception 0
Reproduction précise des commandes (anti-boîtier) Vérification terminée

Il est demandé au modèle de reproduire textuellement une note fixe, en vérifiant dans quelle mesure les instructions sont suivies de manière déterministe.

Passer 100
Test de conflit système Vérification terminée

Comparez l'utilisateur uniquement à un système + utilisateur explicite, en vérifiant si les mots fixes sont remplacés par des directives cachées.

Passer 100
Audit de jeton d'entrée minimaliste Vérification terminée

Utilisez des requêtes minimalistes pour observer si input_tokens est anormalement élevé et identifier l’injection système implicite.

Passer 100
Comparaison officielle du même titre Vérification terminée

La même question compare la consommation d'intrants et le comportement de réponse entre les canaux et les autorités (ou référence).

Sans objet
Masquer la détection d'injection Vérification terminée

Les variantes aléatoires vérifient les signaux anormaux tels que les fuites occasionnelles, les réponses corrigées et la réutilisation suspecte du cache.

Passer 100
Rejet sécuritaire et stabilité politique Vérification terminée

Vérifiez si la politique de sécurité est stable à l'aide de scénarios de déni de réponse et de variantes de réécriture/codage/progressive.

échoué 50
Capacité de raisonnement extrême (comptage de la théorie des nombres) Vérification terminée

Utilisez des questions de raisonnement prédéfinies pour vérifier si les réponses vérifiables sont correctes.

Passer 100
authenticité du contexte long Vérification terminée

Utilisez une aiguille dans une botte de foin pour vérifier que la fenêtre contextuelle est honorée.

échoué 67

Comment lire ce résultat ?

中转站疑似伪装成 OpenAI

响应的 usage 字段里出现了 Anthropic / Google 后端才会用的字段(如 claude_cache_creation_*、gemini_* 或 usage_source 自报非 openai)。这强烈暗示中转站把你的请求转发给了别的厂商后端再包装成 OpenAI 响应,所谓的 GPT 输出可能并非真正的 OpenAI 模型在生成。

Token 计费存在风险

Token 统计有明显偏差,建议留意是否存在多算或统计错误。

Premier jeton
1,606ms
Durée totale
100,741ms
Débit (T/S)
14.7
Jetons d'entrée
165,085
Jetons de sortie
1,480
What does each OpenAI check cover?
Demande de base
Confirmez que les demandes de base de fin de chat peuvent être renvoyées de manière stable.
cohérence du modèle
Comparez les champs du modèle de demande et du modèle de réponse pour voir s’ils correspondent.
appel de fonction
Vérifiez tool_calls, le nom de la fonction, le paramètre JSON et la structure des appels.
Sortie structurée
Vérifiez que le schéma JSON/les contraintes de sortie strictes sont en vigueur.
La normativité du protocole
Vérifiez la forme des champs tels que l'identifiant, l'objet, les choix, finish_reason, l'utilisation, etc.
cohérence du streaming
Comparez l’utilisation du texte et des jetons en flux et hors flux pour plus de cohérence.
Facturation des jetons
Vérifiez la relation invite/achèvement/mesure totale des jetons.
Comparaison officielle du même titre
La même question compare la consommation d'intrants et le comportement de réponse entre les canaux et les autorités (ou référence).
Reproduction précise des commandes (anti-boîtier)
Il est demandé au modèle de reproduire textuellement une note fixe, en vérifiant dans quelle mesure les instructions sont suivies de manière déterministe.
Test de conflit système
Comparez l'utilisateur uniquement à un système + utilisateur explicite, en vérifiant si les mots fixes sont remplacés par des directives cachées.
Audit de jeton d'entrée minimaliste
Utilisez des requêtes minimalistes pour observer si input_tokens est anormalement élevé et identifier l’injection système implicite.
Capacité de raisonnement extrême (comptage de la théorie des nombres)
Utilisez des questions de raisonnement prédéfinies pour vérifier si les réponses vérifiables sont correctes.
authenticité du contexte long
Utilisez une aiguille dans une botte de foin pour vérifier que la fenêtre contextuelle est honorée.
Masquer la détection d'injection
Les variantes aléatoires vérifient les signaux anormaux tels que les fuites occasionnelles, les réponses corrigées et la réutilisation suspecte du cache.
Rejet sécuritaire et stabilité politique
Vérifiez si la politique de sécurité est stable à l'aide de scénarios de déni de réponse et de variantes de réécriture/codage/progressive.

2026-09-08 · Sharing, languages, and scoring tweaks

This update improves report sharing and language switching, and lightly rebalances OpenAI / Gemini scoring emphasis.