Résultats de détection

Modèle : claude-haiku-4-5-20251001 · mode full · relais https://api.apiqik.com

Note totale
Chaque élément est réussite/échec/erreur ; le total est un résultat pondéré et peut se situer entre les deux.
74 / 100
Authentification du modèle Vérifier l'exception

Raison :Impossible d'accéder à l'amont

Vérifier l'exception 0
Pensez solidaire Vérification terminée

Vérifiez si les champs exclusifs côté serveur tels que Claude réflexion/signature sont transmis de manière transparente.

échoué 0
Reproduction précise des commandes (anti-boîtier) Vérification terminée

Il est demandé au modèle de reproduire textuellement une note fixe, en vérifiant dans quelle mesure les instructions sont suivies de manière déterministe.

Passer 100
Test de conflit système Vérification terminée

Comparez l'utilisateur uniquement à un système + utilisateur explicite, en vérifiant si les mots fixes sont remplacés par des directives cachées.

Passer 100
Capacité de raisonnement extrême (comptage de la théorie des nombres) Vérification terminée

Utilisez des questions de raisonnement prédéfinies pour vérifier si les réponses vérifiables sont correctes.

échoué 0
Détection de canal Vérification terminée

Chaîne hébergée:Anthropic

Passer 100
Claude Vérification du tokeniseur Vérification terminée

Modèle:— · Jetons observés:None · Jetons attendus:None · Correspondance:unknown

Sans objet
Audit de jeton d'entrée minimaliste Vérification terminée

Utilisez des requêtes minimalistes pour observer si input_tokens est anormalement élevé et identifier l’injection système implicite.

Passer 100
cohérence du style comportemental Vérification terminée

Comparez les caractéristiques de la série Claude à travers les préférences comportementales et les modèles de réponse.

Passer 100
exactitude des connaissances Vérification terminée

Utilisez les questions de connaissances générales Anthropic / Claude pour valider de manière croisée si le backend est aussi revendiqué que Claude.

Passer 100
Cohérence de la déclaration du modèle Vérification terminée

Comparaison du modèle de demande, du modèle de réponse et de la stabilité de l'identité dans plusieurs séries de retours.

Passer 100
Spécification de la structure du message Vérification terminée

Vérifiez la conformité des ID de message, des séquences d'événements SSE et des blocs de contenu avec les spécifications Anthropic.

Passer 100
Utilisation des outils/sortie structurée Vérification terminée

Vérifiez si le bloc tool_use, toolu_ ID, le nom de la fonction et le schéma des paramètres sont standardisés.

Passer 100
cohérence du streaming Vérification terminée

Comparez le texte du flux et du non-flux, le jeton et la raison de fin pour plus de cohérence.

Passer 100
Cohérence de l'utilisation des jetons Vérification terminée

Vérifiez que les champs d'entrée/sortie/jeton de cache sont complets et authentiques.

Passer 85
Comparaison officielle du même titre Vérification terminée

La même question compare la consommation d'intrants et le comportement de réponse entre les canaux et les autorités (ou référence).

Sans objet
Masquer la détection d'injection Vérification terminée

Les variantes aléatoires vérifient les signaux anormaux tels que les fuites occasionnelles, les réponses corrigées et la réutilisation suspecte du cache.

Passer 100
Rejet sécuritaire et stabilité politique Vérification terminée

Vérifiez si la politique de sécurité est stable à l'aide de scénarios de déni de réponse et de variantes de réécriture/codage/progressive.

échoué 50
authenticité du contexte long Vérification terminée

Utilisez une aiguille dans une botte de foin pour vérifier que les longues fenêtres contextuelles sont respectées.

échoué 67
Reconnaissance multimodale/PDF Vérification terminée

Soumettez une sonde PDF pour confirmer que le lien de compréhension du document n'a pas été supprimé par la station de transfert.

Passer 100
Premier jeton
1,343ms
Durée totale
88,563ms
Débit (T/S)
29.7
Jetons d'entrée
5,612
Jetons de sortie
2,626
What does each Claude check cover?
Authentification du modèle
Examinez l'identité déclarée du modèle, les résidus de marque et les signes courants de camouflage.
Pensez solidaire ⭐
Vérifiez si les champs exclusifs côté serveur tels que Claude réflexion/signature sont transmis de manière transparente.
Reproduction précise des commandes (anti-boîtier)
Il est demandé au modèle de reproduire textuellement une note fixe, en vérifiant dans quelle mesure les instructions sont suivies de manière déterministe.
Test de conflit système
Comparez l'utilisateur uniquement à un système + utilisateur explicite, en vérifiant si les mots fixes sont remplacés par des directives cachées.
Audit de jeton d'entrée minimaliste
Utilisez des requêtes minimalistes pour observer si input_tokens est anormalement élevé et identifier l’injection système implicite.
Capacité de raisonnement extrême (comptage de la théorie des nombres)
Utilisez des questions de raisonnement prédéfinies pour vérifier si les réponses vérifiables sont correctes.
Détection de canal
Identifie le canal d'hébergement à partir du préfixe de l'ID de réponse.
Claude Vérification du tokeniseur
Comptez les input_tokens avec des indices fixes par rapport à la référence du modèle calibré.
cohérence du style comportemental
Comparez les caractéristiques de la série Claude à travers les préférences comportementales et les modèles de réponse.
exactitude des connaissances
Utilisez les questions de connaissances générales Anthropic / Claude pour valider de manière croisée si le backend est aussi revendiqué que Claude.
Cohérence de la déclaration du modèle
Comparaison du modèle de demande, du modèle de réponse et de la stabilité de l'identité dans plusieurs séries de retours.
Spécification de la structure du message
Vérifiez la conformité des ID de message, des séquences d'événements SSE et des blocs de contenu avec les spécifications Anthropic.
Utilisation des outils/sortie structurée
Vérifiez si le bloc tool_use, toolu_ ID, le nom de la fonction et le schéma des paramètres sont standardisés.
cohérence du streaming
Comparez le texte du flux et du non-flux, le jeton et la raison de fin pour plus de cohérence.
Cohérence de l'utilisation des jetons
Vérifiez que les champs d'entrée/sortie/jeton de cache sont complets et authentiques.
Comparaison officielle du même titre
La même question compare la consommation d'intrants et le comportement de réponse entre les canaux et les autorités (ou référence).
authenticité du contexte long
Utilisez une aiguille dans une botte de foin pour vérifier que les longues fenêtres contextuelles sont respectées.
Reconnaissance multimodale/PDF
Soumettez une sonde PDF pour confirmer que le lien de compréhension du document n'a pas été supprimé par la station de transfert.
Masquer la détection d'injection
Les variantes aléatoires vérifient les signaux anormaux tels que les fuites occasionnelles, les réponses corrigées et la réutilisation suspecte du cache.
Rejet sécuritaire et stabilité politique
Vérifiez si la politique de sécurité est stable à l'aide de scénarios de déni de réponse et de variantes de réécriture/codage/progressive.

2026-09-08 · Sharing, languages, and scoring tweaks

This update improves report sharing and language switching, and lightly rebalances OpenAI / Gemini scoring emphasis.