Erkennungsergebnisse

Modell: claude-opus-4-7 · Modus full · Relais https://test.apiqik-kratos.apiqik.com/

Gesamtpunktzahl
Jedes Element ist bestanden/nicht bestanden/fehlerhaft; die Summe ist ein gewichtetes Ergebnis und kann dazwischen liegen.
98 / 100
Modellauthentifizierung Verifizierung abgeschlossen

Untersuchen Sie die selbst angegebene Identität des Models, Markenrückstände und häufige Tarnzeichen.

Pass 100
Denken Sie unterstützend Verifizierung abgeschlossen

Überprüfen Sie, ob serverseitige exklusive Felder wie Claude Denken / Signatur transparent übertragen werden.

Pass 100
Genaue Befehlswiedergabe (Anti-Casing) Verifizierung abgeschlossen

Das Modell wird aufgefordert, eine feste Markierung wörtlich zu reproduzieren und dabei zu prüfen, wie deterministisch die Anweisungen befolgt werden.

Pass 100
Systemkonflikttests Verifizierung abgeschlossen

Vergleichen Sie Benutzer nur mit explizitem System+Benutzer und prüfen Sie, ob feste Wörter durch versteckte Anweisungen überschrieben werden.

Pass 100
Extreme Denkfähigkeit (zahlentheoretisches Zählen) Verifizierung abgeschlossen

Verwenden Sie vorgefertigte Argumentationsfragen, um zu überprüfen, ob überprüfbare Antworten richtig sind.

Pass 100
Kanalerkennung Verifizierung abgeschlossen

Gehosteter Kanal:Anthropic

Pass 100
Claude Tokenizer-Überprüfung Verifizierung abgeschlossen

Modell:claude-opus-4-7 · Beobachtete Token:6 · Erwartete Token:17 · Spiel:false

gescheitert 0
Minimalistisches Input-Token-Audit Verifizierung abgeschlossen

Verwenden Sie minimalistische Anfragen, um zu beobachten, ob input_tokens ungewöhnlich hoch ist, und um implizite Systeminjektionen zu identifizieren.

gescheitert 50
Konsistenz des Verhaltensstils Verifizierung abgeschlossen

Vergleichen Sie die Merkmale der Claude-Serie anhand von Verhaltenspräferenzen und Antwortmustern.

Pass 100
Wissensgenauigkeit Verifizierung abgeschlossen

Verwenden Sie Anthropic / Claude allgemeine Wissensfragen, um zu überprüfen, ob das Backend den Ansprüchen von Claude entspricht.

Pass 100
Konsistenz der Modelldeklaration Verifizierung abgeschlossen

Vergleich des Anfragemodells, des Antwortmodells und der Identitätsstabilität in mehreren Rückgaberunden.

Pass 100
Spezifikation der Nachrichtenstruktur Verifizierung abgeschlossen

Überprüfen Sie Nachrichten-IDs, SSE-Ereignissequenzen und Inhaltsblöcke auf Übereinstimmung mit den Anthropic-Spezifikationen.

Pass 100
Werkzeugverwendung/strukturierte Ausgabe Verifizierung abgeschlossen

Überprüfen Sie, ob der Tool_use-Block, die Toolu_-ID, der Funktionsname und das Parameterschema standardisiert sind.

Pass 100
Streaming-Konsistenz Verifizierung abgeschlossen

Vergleichen Sie Stream- und Nicht-Stream-Text, Token und Endgrund auf Konsistenz.

Pass 100
Konsistenz der Token-Nutzung Verifizierung abgeschlossen

Überprüfen Sie, ob die Eingabe-/Ausgabe-/Cache-Token-Felder vollständig und authentisch sind.

Pass 85
Offizieller Vergleich desselben Titels Verifizierung abgeschlossen

Die gleiche Frage vergleicht den Input-Verbrauch und das Antwortverhalten zwischen Kanälen und offiziellen Kanälen (oder Baseline).

Nicht zutreffend
Injektionserkennung ausblenden Verifizierung abgeschlossen

Zufällige Varianten führen eine Gegenprüfung auf ungewöhnliche Signale wie Nonce-Lecks, korrigierte Antworten und verdächtige Cache-Wiederverwendung durch.

Pass 100
Sicherheitsverweigerung und politische Stabilität Verifizierung abgeschlossen

Überprüfen Sie, ob die Sicherheitsrichtlinie stabil ist, indem Sie Denial-of-Antwort-Szenarien und Umschreibungs-/Kodierungs-/progressive Varianten verwenden.

gescheitert 50
lange Kontextauthentizität Verifizierung abgeschlossen

Verwenden Sie „Nadel im Heuhaufen“, um zu überprüfen, ob lange Kontextfenster berücksichtigt werden.

Pass 100
Multimodale/PDF-Erkennung Verifizierung abgeschlossen

Senden Sie eine PDF-Prüfung, um zu bestätigen, dass der Link zum Dokumentverständnis nicht von der Übertragungsstation entfernt wurde.

Pass 100
Erstes Token
5,226ms
Gesamtzeit
252,668ms
Durchsatz (T/S)
19.1
Eingabe-Tokens
3,787
Ausgabetoken
4,823
What does each Claude check cover?
Modellauthentifizierung
Untersuchen Sie die selbst angegebene Identität des Models, Markenrückstände und häufige Tarnzeichen.
Denken Sie unterstützend ⭐
Überprüfen Sie, ob serverseitige exklusive Felder wie Claude Denken / Signatur transparent übertragen werden.
Genaue Befehlswiedergabe (Anti-Casing)
Das Modell wird aufgefordert, eine feste Markierung wörtlich zu reproduzieren und dabei zu prüfen, wie deterministisch die Anweisungen befolgt werden.
Systemkonflikttests
Vergleichen Sie Benutzer nur mit explizitem System+Benutzer und prüfen Sie, ob feste Wörter durch versteckte Anweisungen überschrieben werden.
Minimalistisches Input-Token-Audit
Verwenden Sie minimalistische Anfragen, um zu beobachten, ob input_tokens ungewöhnlich hoch ist, und um implizite Systeminjektionen zu identifizieren.
Extreme Denkfähigkeit (zahlentheoretisches Zählen)
Verwenden Sie vorgefertigte Argumentationsfragen, um zu überprüfen, ob überprüfbare Antworten richtig sind.
Kanalerkennung
Identifiziert den Hosting-Kanal anhand des Antwort-ID-Präfixes.
Claude Tokenizer-Überprüfung
Zählen Sie Eingabetokens mit festen Hinweisen im Vergleich zur kalibrierten Modellbasislinie.
Konsistenz des Verhaltensstils
Vergleichen Sie die Merkmale der Claude-Serie anhand von Verhaltenspräferenzen und Antwortmustern.
Wissensgenauigkeit
Verwenden Sie Anthropic / Claude allgemeine Wissensfragen, um zu überprüfen, ob das Backend den Ansprüchen von Claude entspricht.
Konsistenz der Modelldeklaration
Vergleich des Anfragemodells, des Antwortmodells und der Identitätsstabilität in mehreren Rückgaberunden.
Spezifikation der Nachrichtenstruktur
Überprüfen Sie Nachrichten-IDs, SSE-Ereignissequenzen und Inhaltsblöcke auf Übereinstimmung mit den Anthropic-Spezifikationen.
Werkzeugverwendung/strukturierte Ausgabe
Überprüfen Sie, ob der Tool_use-Block, die Toolu_-ID, der Funktionsname und das Parameterschema standardisiert sind.
Streaming-Konsistenz
Vergleichen Sie Stream- und Nicht-Stream-Text, Token und Endgrund auf Konsistenz.
Konsistenz der Token-Nutzung
Überprüfen Sie, ob die Eingabe-/Ausgabe-/Cache-Token-Felder vollständig und authentisch sind.
Offizieller Vergleich desselben Titels
Die gleiche Frage vergleicht den Input-Verbrauch und das Antwortverhalten zwischen Kanälen und offiziellen Kanälen (oder Baseline).
lange Kontextauthentizität
Verwenden Sie „Nadel im Heuhaufen“, um zu überprüfen, ob lange Kontextfenster berücksichtigt werden.
Multimodale/PDF-Erkennung
Senden Sie eine PDF-Prüfung, um zu bestätigen, dass der Link zum Dokumentverständnis nicht von der Übertragungsstation entfernt wurde.
Injektionserkennung ausblenden
Zufällige Varianten führen eine Gegenprüfung auf ungewöhnliche Signale wie Nonce-Lecks, korrigierte Antworten und verdächtige Cache-Wiederverwendung durch.
Sicherheitsverweigerung und politische Stabilität
Überprüfen Sie, ob die Sicherheitsrichtlinie stabil ist, indem Sie Denial-of-Antwort-Szenarien und Umschreibungs-/Kodierungs-/progressive Varianten verwenden.

2026-09-08 · Sharing, languages, and scoring tweaks

This update improves report sharing and language switching, and lightly rebalances OpenAI / Gemini scoring emphasis.