Résultats de détection

Modèle : · mode · relais

Note totale
Chaque élément est réussite/échec/erreur ; le total est un résultat pondéré et peut se situer entre les deux.
0 / 100
Authentification du modèle Vérification terminée

Examinez l'identité déclarée du modèle, les résidus de marque et les signes courants de camouflage.

Non câblé
Pensez solidaire Vérification terminée

Vérifiez si les champs exclusifs côté serveur tels que Claude réflexion/signature sont transmis de manière transparente.

Non câblé
Reproduction précise des commandes (anti-boîtier) Vérification terminée

Il est demandé au modèle de reproduire textuellement une note fixe, en vérifiant dans quelle mesure les instructions sont suivies de manière déterministe.

Non câblé
Test de conflit système Vérification terminée

Comparez l'utilisateur uniquement à un système + utilisateur explicite, en vérifiant si les mots fixes sont remplacés par des directives cachées.

Non câblé
Capacité de raisonnement extrême (comptage de la théorie des nombres) Vérification terminée

Utilisez des questions de raisonnement prédéfinies pour vérifier si les réponses vérifiables sont correctes.

Non câblé
Détection de canal Vérification terminée

Identifie le canal d'hébergement à partir du préfixe de l'ID de réponse.

Non câblé
Claude Vérification du tokeniseur Vérification terminée

Comptez les input_tokens avec des indices fixes par rapport à la référence du modèle calibré.

Non câblé
Audit de jeton d'entrée minimaliste Vérification terminée

Utilisez des requêtes minimalistes pour observer si input_tokens est anormalement élevé et identifier l’injection système implicite.

Non câblé
cohérence du style comportemental Vérification terminée

Comparez les caractéristiques de la série Claude à travers les préférences comportementales et les modèles de réponse.

Non câblé
exactitude des connaissances Vérification terminée

Utilisez les questions de connaissances générales Anthropic / Claude pour valider de manière croisée si le backend est aussi revendiqué que Claude.

Non câblé
Cohérence de la déclaration du modèle Vérification terminée

Comparaison du modèle de demande, du modèle de réponse et de la stabilité de l'identité dans plusieurs séries de retours.

Non câblé
Spécification de la structure du message Vérification terminée

Vérifiez la conformité des ID de message, des séquences d'événements SSE et des blocs de contenu avec les spécifications Anthropic.

Non câblé
Utilisation des outils/sortie structurée Vérification terminée

Vérifiez si le bloc tool_use, toolu_ ID, le nom de la fonction et le schéma des paramètres sont standardisés.

Non câblé
cohérence du streaming Vérification terminée

Comparez le texte du flux et du non-flux, le jeton et la raison de fin pour plus de cohérence.

Non câblé
Cohérence de l'utilisation des jetons Vérification terminée

Vérifiez que les champs d'entrée/sortie/jeton de cache sont complets et authentiques.

Non câblé
Comparaison officielle du même titre Vérification terminée

La même question compare la consommation d'intrants et le comportement de réponse entre les canaux et les autorités (ou référence).

Non câblé
Masquer la détection d'injection Vérification terminée

Les variantes aléatoires vérifient les signaux anormaux tels que les fuites occasionnelles, les réponses corrigées et la réutilisation suspecte du cache.

Non câblé
Rejet sécuritaire et stabilité politique Vérification terminée

Vérifiez si la politique de sécurité est stable à l'aide de scénarios de déni de réponse et de variantes de réécriture/codage/progressive.

Non câblé
authenticité du contexte long Vérification terminée

Utilisez une aiguille dans une botte de foin pour vérifier que les longues fenêtres contextuelles sont respectées.

Non câblé
Reconnaissance multimodale/PDF Vérification terminée

Soumettez une sonde PDF pour confirmer que le lien de compréhension du document n'a pas été supprimé par la station de transfert.

Non câblé
Premier jeton
Durée totale
0ms
Débit (T/S)
Jetons d'entrée
0
Jetons de sortie
0
What does each Claude check cover?
Authentification du modèle
Examinez l'identité déclarée du modèle, les résidus de marque et les signes courants de camouflage.
Pensez solidaire ⭐
Vérifiez si les champs exclusifs côté serveur tels que Claude réflexion/signature sont transmis de manière transparente.
Reproduction précise des commandes (anti-boîtier)
Il est demandé au modèle de reproduire textuellement une note fixe, en vérifiant dans quelle mesure les instructions sont suivies de manière déterministe.
Test de conflit système
Comparez l'utilisateur uniquement à un système + utilisateur explicite, en vérifiant si les mots fixes sont remplacés par des directives cachées.
Audit de jeton d'entrée minimaliste
Utilisez des requêtes minimalistes pour observer si input_tokens est anormalement élevé et identifier l’injection système implicite.
Capacité de raisonnement extrême (comptage de la théorie des nombres)
Utilisez des questions de raisonnement prédéfinies pour vérifier si les réponses vérifiables sont correctes.
Détection de canal
Identifie le canal d'hébergement à partir du préfixe de l'ID de réponse.
Claude Vérification du tokeniseur
Comptez les input_tokens avec des indices fixes par rapport à la référence du modèle calibré.
cohérence du style comportemental
Comparez les caractéristiques de la série Claude à travers les préférences comportementales et les modèles de réponse.
exactitude des connaissances
Utilisez les questions de connaissances générales Anthropic / Claude pour valider de manière croisée si le backend est aussi revendiqué que Claude.
Cohérence de la déclaration du modèle
Comparaison du modèle de demande, du modèle de réponse et de la stabilité de l'identité dans plusieurs séries de retours.
Spécification de la structure du message
Vérifiez la conformité des ID de message, des séquences d'événements SSE et des blocs de contenu avec les spécifications Anthropic.
Utilisation des outils/sortie structurée
Vérifiez si le bloc tool_use, toolu_ ID, le nom de la fonction et le schéma des paramètres sont standardisés.
cohérence du streaming
Comparez le texte du flux et du non-flux, le jeton et la raison de fin pour plus de cohérence.
Cohérence de l'utilisation des jetons
Vérifiez que les champs d'entrée/sortie/jeton de cache sont complets et authentiques.
Comparaison officielle du même titre
La même question compare la consommation d'intrants et le comportement de réponse entre les canaux et les autorités (ou référence).
authenticité du contexte long
Utilisez une aiguille dans une botte de foin pour vérifier que les longues fenêtres contextuelles sont respectées.
Reconnaissance multimodale/PDF
Soumettez une sonde PDF pour confirmer que le lien de compréhension du document n'a pas été supprimé par la station de transfert.
Masquer la détection d'injection
Les variantes aléatoires vérifient les signaux anormaux tels que les fuites occasionnelles, les réponses corrigées et la réutilisation suspecte du cache.
Rejet sécuritaire et stabilité politique
Vérifiez si la politique de sécurité est stable à l'aide de scénarios de déni de réponse et de variantes de réécriture/codage/progressive.

2026-09-08 · Sharing, languages, and scoring tweaks

This update improves report sharing and language switching, and lightly rebalances OpenAI / Gemini scoring emphasis.