Erkennungsergebnisse

Modell: claude-sonnet-5 · Modus full · Relais https://agi.tontian.com/

Gesamtpunktzahl
Jedes Element ist bestanden/nicht bestanden/fehlerhaft; die Summe ist ein gewichtetes Ergebnis und kann dazwischen liegen.
27 / 100
Modellauthentifizierung Ausnahme überprüfen

Untersuchen Sie die selbst angegebene Identität des Models, Markenrückstände und häufige Tarnzeichen.

Ausnahme überprüfen 0
Denken Sie unterstützend Verifizierung abgeschlossen

Überprüfen Sie, ob serverseitige exklusive Felder wie Claude Denken / Signatur transparent übertragen werden.

Pass 100
Genaue Befehlswiedergabe (Anti-Casing) Ausnahme überprüfen

Das Modell wird aufgefordert, eine feste Markierung wörtlich zu reproduzieren und dabei zu prüfen, wie deterministisch die Anweisungen befolgt werden.

Ausnahme überprüfen 0
Systemkonflikttests Ausnahme überprüfen

Vergleichen Sie Benutzer nur mit explizitem System+Benutzer und prüfen Sie, ob feste Wörter durch versteckte Anweisungen überschrieben werden.

Ausnahme überprüfen 0
Extreme Denkfähigkeit (zahlentheoretisches Zählen) Ausnahme überprüfen

Verwenden Sie vorgefertigte Argumentationsfragen, um zu überprüfen, ob überprüfbare Antworten richtig sind.

Ausnahme überprüfen 0
Kanalerkennung Ausnahme überprüfen

Identifiziert den Hosting-Kanal anhand des Antwort-ID-Präfixes.

Ausnahme überprüfen 0
Claude Tokenizer-Überprüfung Verifizierung abgeschlossen

Modell:— · Beobachtete Token:None · Erwartete Token:None · Spiel:unknown

Nicht zutreffend
Minimalistisches Input-Token-Audit Ausnahme überprüfen

Verwenden Sie minimalistische Anfragen, um zu beobachten, ob input_tokens ungewöhnlich hoch ist, und um implizite Systeminjektionen zu identifizieren.

Ausnahme überprüfen 0
Konsistenz des Verhaltensstils Verifizierung abgeschlossen

Vergleichen Sie die Merkmale der Claude-Serie anhand von Verhaltenspräferenzen und Antwortmustern.

gescheitert 0
Wissensgenauigkeit Verifizierung abgeschlossen

Verwenden Sie Anthropic / Claude allgemeine Wissensfragen, um zu überprüfen, ob das Backend den Ansprüchen von Claude entspricht.

gescheitert 0
Konsistenz der Modelldeklaration Ausnahme überprüfen

Vergleich des Anfragemodells, des Antwortmodells und der Identitätsstabilität in mehreren Rückgaberunden.

Ausnahme überprüfen 0
Spezifikation der Nachrichtenstruktur Verifizierung abgeschlossen

Überprüfen Sie Nachrichten-IDs, SSE-Ereignissequenzen und Inhaltsblöcke auf Übereinstimmung mit den Anthropic-Spezifikationen.

Pass 100
Werkzeugverwendung/strukturierte Ausgabe Ausnahme überprüfen

Überprüfen Sie, ob der Tool_use-Block, die Toolu_-ID, der Funktionsname und das Parameterschema standardisiert sind.

Ausnahme überprüfen 0
Streaming-Konsistenz Ausnahme überprüfen

Vergleichen Sie Stream- und Nicht-Stream-Text, Token und Endgrund auf Konsistenz.

Ausnahme überprüfen 0
Konsistenz der Token-Nutzung Ausnahme überprüfen

Überprüfen Sie, ob die Eingabe-/Ausgabe-/Cache-Token-Felder vollständig und authentisch sind.

Ausnahme überprüfen 0
Offizieller Vergleich desselben Titels Ausnahme überprüfen

Die gleiche Frage vergleicht den Input-Verbrauch und das Antwortverhalten zwischen Kanälen und offiziellen Kanälen (oder Baseline).

Ausnahme überprüfen 0
Injektionserkennung ausblenden Verifizierung abgeschlossen

Zufällige Varianten führen eine Gegenprüfung auf ungewöhnliche Signale wie Nonce-Lecks, korrigierte Antworten und verdächtige Cache-Wiederverwendung durch.

Pass 100
Sicherheitsverweigerung und politische Stabilität Verifizierung abgeschlossen

Überprüfen Sie, ob die Sicherheitsrichtlinie stabil ist, indem Sie Denial-of-Antwort-Szenarien und Umschreibungs-/Kodierungs-/progressive Varianten verwenden.

gescheitert 50
lange Kontextauthentizität Verifizierung abgeschlossen

Verwenden Sie „Nadel im Heuhaufen“, um zu überprüfen, ob lange Kontextfenster berücksichtigt werden.

gescheitert 0
Multimodale/PDF-Erkennung Verifizierung abgeschlossen

Senden Sie eine PDF-Prüfung, um zu bestätigen, dass der Link zum Dokumentverständnis nicht von der Übertragungsstation entfernt wurde.

gescheitert 0

Wie ist dieses Ergebnis zu lesen?

Token 用量存在风险

usage 字段缺失或统计不自洽,建议不要直接依赖该中转站返回的 token 数做计费核算。

Erstes Token
1,342ms
Gesamtzeit
24,506ms
Durchsatz (T/S)
61.5
Eingabe-Tokens
802
Ausgabetoken
1,508
What does each Claude check cover?
Modellauthentifizierung
Untersuchen Sie die selbst angegebene Identität des Models, Markenrückstände und häufige Tarnzeichen.
Denken Sie unterstützend ⭐
Überprüfen Sie, ob serverseitige exklusive Felder wie Claude Denken / Signatur transparent übertragen werden.
Genaue Befehlswiedergabe (Anti-Casing)
Das Modell wird aufgefordert, eine feste Markierung wörtlich zu reproduzieren und dabei zu prüfen, wie deterministisch die Anweisungen befolgt werden.
Systemkonflikttests
Vergleichen Sie Benutzer nur mit explizitem System+Benutzer und prüfen Sie, ob feste Wörter durch versteckte Anweisungen überschrieben werden.
Minimalistisches Input-Token-Audit
Verwenden Sie minimalistische Anfragen, um zu beobachten, ob input_tokens ungewöhnlich hoch ist, und um implizite Systeminjektionen zu identifizieren.
Extreme Denkfähigkeit (zahlentheoretisches Zählen)
Verwenden Sie vorgefertigte Argumentationsfragen, um zu überprüfen, ob überprüfbare Antworten richtig sind.
Kanalerkennung
Identifiziert den Hosting-Kanal anhand des Antwort-ID-Präfixes.
Claude Tokenizer-Überprüfung
Zählen Sie Eingabetokens mit festen Hinweisen im Vergleich zur kalibrierten Modellbasislinie.
Konsistenz des Verhaltensstils
Vergleichen Sie die Merkmale der Claude-Serie anhand von Verhaltenspräferenzen und Antwortmustern.
Wissensgenauigkeit
Verwenden Sie Anthropic / Claude allgemeine Wissensfragen, um zu überprüfen, ob das Backend den Ansprüchen von Claude entspricht.
Konsistenz der Modelldeklaration
Vergleich des Anfragemodells, des Antwortmodells und der Identitätsstabilität in mehreren Rückgaberunden.
Spezifikation der Nachrichtenstruktur
Überprüfen Sie Nachrichten-IDs, SSE-Ereignissequenzen und Inhaltsblöcke auf Übereinstimmung mit den Anthropic-Spezifikationen.
Werkzeugverwendung/strukturierte Ausgabe
Überprüfen Sie, ob der Tool_use-Block, die Toolu_-ID, der Funktionsname und das Parameterschema standardisiert sind.
Streaming-Konsistenz
Vergleichen Sie Stream- und Nicht-Stream-Text, Token und Endgrund auf Konsistenz.
Konsistenz der Token-Nutzung
Überprüfen Sie, ob die Eingabe-/Ausgabe-/Cache-Token-Felder vollständig und authentisch sind.
Offizieller Vergleich desselben Titels
Die gleiche Frage vergleicht den Input-Verbrauch und das Antwortverhalten zwischen Kanälen und offiziellen Kanälen (oder Baseline).
lange Kontextauthentizität
Verwenden Sie „Nadel im Heuhaufen“, um zu überprüfen, ob lange Kontextfenster berücksichtigt werden.
Multimodale/PDF-Erkennung
Senden Sie eine PDF-Prüfung, um zu bestätigen, dass der Link zum Dokumentverständnis nicht von der Übertragungsstation entfernt wurde.
Injektionserkennung ausblenden
Zufällige Varianten führen eine Gegenprüfung auf ungewöhnliche Signale wie Nonce-Lecks, korrigierte Antworten und verdächtige Cache-Wiederverwendung durch.
Sicherheitsverweigerung und politische Stabilität
Überprüfen Sie, ob die Sicherheitsrichtlinie stabil ist, indem Sie Denial-of-Antwort-Szenarien und Umschreibungs-/Kodierungs-/progressive Varianten verwenden.

2026-09-08 · Sharing, languages, and scoring tweaks

This update improves report sharing and language switching, and lightly rebalances OpenAI / Gemini scoring emphasis.