Erkennungsergebnisse

Modell: · Modus · Relais

Gesamtpunktzahl
Jedes Element ist bestanden/nicht bestanden/fehlerhaft; die Summe ist ein gewichtetes Ergebnis und kann dazwischen liegen.
0 / 100
Modellauthentifizierung Verifizierung abgeschlossen

Untersuchen Sie die selbst angegebene Identität des Models, Markenrückstände und häufige Tarnzeichen.

Nicht verkabelt
Denken Sie unterstützend Verifizierung abgeschlossen

Überprüfen Sie, ob serverseitige exklusive Felder wie Claude Denken / Signatur transparent übertragen werden.

Nicht verkabelt
Genaue Befehlswiedergabe (Anti-Casing) Verifizierung abgeschlossen

Das Modell wird aufgefordert, eine feste Markierung wörtlich zu reproduzieren und dabei zu prüfen, wie deterministisch die Anweisungen befolgt werden.

Nicht verkabelt
Systemkonflikttests Verifizierung abgeschlossen

Vergleichen Sie Benutzer nur mit explizitem System+Benutzer und prüfen Sie, ob feste Wörter durch versteckte Anweisungen überschrieben werden.

Nicht verkabelt
Extreme Denkfähigkeit (zahlentheoretisches Zählen) Verifizierung abgeschlossen

Verwenden Sie vorgefertigte Argumentationsfragen, um zu überprüfen, ob überprüfbare Antworten richtig sind.

Nicht verkabelt
Kanalerkennung Verifizierung abgeschlossen

Identifiziert den Hosting-Kanal anhand des Antwort-ID-Präfixes.

Nicht verkabelt
Claude Tokenizer-Überprüfung Verifizierung abgeschlossen

Zählen Sie Eingabetokens mit festen Hinweisen im Vergleich zur kalibrierten Modellbasislinie.

Nicht verkabelt
Minimalistisches Input-Token-Audit Verifizierung abgeschlossen

Verwenden Sie minimalistische Anfragen, um zu beobachten, ob input_tokens ungewöhnlich hoch ist, und um implizite Systeminjektionen zu identifizieren.

Nicht verkabelt
Konsistenz des Verhaltensstils Verifizierung abgeschlossen

Vergleichen Sie die Merkmale der Claude-Serie anhand von Verhaltenspräferenzen und Antwortmustern.

Nicht verkabelt
Wissensgenauigkeit Verifizierung abgeschlossen

Verwenden Sie Anthropic / Claude allgemeine Wissensfragen, um zu überprüfen, ob das Backend den Ansprüchen von Claude entspricht.

Nicht verkabelt
Konsistenz der Modelldeklaration Verifizierung abgeschlossen

Vergleich des Anfragemodells, des Antwortmodells und der Identitätsstabilität in mehreren Rückgaberunden.

Nicht verkabelt
Spezifikation der Nachrichtenstruktur Verifizierung abgeschlossen

Überprüfen Sie Nachrichten-IDs, SSE-Ereignissequenzen und Inhaltsblöcke auf Übereinstimmung mit den Anthropic-Spezifikationen.

Nicht verkabelt
Werkzeugverwendung/strukturierte Ausgabe Verifizierung abgeschlossen

Überprüfen Sie, ob der Tool_use-Block, die Toolu_-ID, der Funktionsname und das Parameterschema standardisiert sind.

Nicht verkabelt
Streaming-Konsistenz Verifizierung abgeschlossen

Vergleichen Sie Stream- und Nicht-Stream-Text, Token und Endgrund auf Konsistenz.

Nicht verkabelt
Konsistenz der Token-Nutzung Verifizierung abgeschlossen

Überprüfen Sie, ob die Eingabe-/Ausgabe-/Cache-Token-Felder vollständig und authentisch sind.

Nicht verkabelt
Offizieller Vergleich desselben Titels Verifizierung abgeschlossen

Die gleiche Frage vergleicht den Input-Verbrauch und das Antwortverhalten zwischen Kanälen und offiziellen Kanälen (oder Baseline).

Nicht verkabelt
Injektionserkennung ausblenden Verifizierung abgeschlossen

Zufällige Varianten führen eine Gegenprüfung auf ungewöhnliche Signale wie Nonce-Lecks, korrigierte Antworten und verdächtige Cache-Wiederverwendung durch.

Nicht verkabelt
Sicherheitsverweigerung und politische Stabilität Verifizierung abgeschlossen

Überprüfen Sie, ob die Sicherheitsrichtlinie stabil ist, indem Sie Denial-of-Antwort-Szenarien und Umschreibungs-/Kodierungs-/progressive Varianten verwenden.

Nicht verkabelt
lange Kontextauthentizität Verifizierung abgeschlossen

Verwenden Sie „Nadel im Heuhaufen“, um zu überprüfen, ob lange Kontextfenster berücksichtigt werden.

Nicht verkabelt
Multimodale/PDF-Erkennung Verifizierung abgeschlossen

Senden Sie eine PDF-Prüfung, um zu bestätigen, dass der Link zum Dokumentverständnis nicht von der Übertragungsstation entfernt wurde.

Nicht verkabelt
Erstes Token
Gesamtzeit
0ms
Durchsatz (T/S)
Eingabe-Tokens
0
Ausgabetoken
0
What does each Claude check cover?
Modellauthentifizierung
Untersuchen Sie die selbst angegebene Identität des Models, Markenrückstände und häufige Tarnzeichen.
Denken Sie unterstützend ⭐
Überprüfen Sie, ob serverseitige exklusive Felder wie Claude Denken / Signatur transparent übertragen werden.
Genaue Befehlswiedergabe (Anti-Casing)
Das Modell wird aufgefordert, eine feste Markierung wörtlich zu reproduzieren und dabei zu prüfen, wie deterministisch die Anweisungen befolgt werden.
Systemkonflikttests
Vergleichen Sie Benutzer nur mit explizitem System+Benutzer und prüfen Sie, ob feste Wörter durch versteckte Anweisungen überschrieben werden.
Minimalistisches Input-Token-Audit
Verwenden Sie minimalistische Anfragen, um zu beobachten, ob input_tokens ungewöhnlich hoch ist, und um implizite Systeminjektionen zu identifizieren.
Extreme Denkfähigkeit (zahlentheoretisches Zählen)
Verwenden Sie vorgefertigte Argumentationsfragen, um zu überprüfen, ob überprüfbare Antworten richtig sind.
Kanalerkennung
Identifiziert den Hosting-Kanal anhand des Antwort-ID-Präfixes.
Claude Tokenizer-Überprüfung
Zählen Sie Eingabetokens mit festen Hinweisen im Vergleich zur kalibrierten Modellbasislinie.
Konsistenz des Verhaltensstils
Vergleichen Sie die Merkmale der Claude-Serie anhand von Verhaltenspräferenzen und Antwortmustern.
Wissensgenauigkeit
Verwenden Sie Anthropic / Claude allgemeine Wissensfragen, um zu überprüfen, ob das Backend den Ansprüchen von Claude entspricht.
Konsistenz der Modelldeklaration
Vergleich des Anfragemodells, des Antwortmodells und der Identitätsstabilität in mehreren Rückgaberunden.
Spezifikation der Nachrichtenstruktur
Überprüfen Sie Nachrichten-IDs, SSE-Ereignissequenzen und Inhaltsblöcke auf Übereinstimmung mit den Anthropic-Spezifikationen.
Werkzeugverwendung/strukturierte Ausgabe
Überprüfen Sie, ob der Tool_use-Block, die Toolu_-ID, der Funktionsname und das Parameterschema standardisiert sind.
Streaming-Konsistenz
Vergleichen Sie Stream- und Nicht-Stream-Text, Token und Endgrund auf Konsistenz.
Konsistenz der Token-Nutzung
Überprüfen Sie, ob die Eingabe-/Ausgabe-/Cache-Token-Felder vollständig und authentisch sind.
Offizieller Vergleich desselben Titels
Die gleiche Frage vergleicht den Input-Verbrauch und das Antwortverhalten zwischen Kanälen und offiziellen Kanälen (oder Baseline).
lange Kontextauthentizität
Verwenden Sie „Nadel im Heuhaufen“, um zu überprüfen, ob lange Kontextfenster berücksichtigt werden.
Multimodale/PDF-Erkennung
Senden Sie eine PDF-Prüfung, um zu bestätigen, dass der Link zum Dokumentverständnis nicht von der Übertragungsstation entfernt wurde.
Injektionserkennung ausblenden
Zufällige Varianten führen eine Gegenprüfung auf ungewöhnliche Signale wie Nonce-Lecks, korrigierte Antworten und verdächtige Cache-Wiederverwendung durch.
Sicherheitsverweigerung und politische Stabilität
Überprüfen Sie, ob die Sicherheitsrichtlinie stabil ist, indem Sie Denial-of-Antwort-Szenarien und Umschreibungs-/Kodierungs-/progressive Varianten verwenden.

2026-09-08 · Sharing, languages, and scoring tweaks

This update improves report sharing and language switching, and lightly rebalances OpenAI / Gemini scoring emphasis.