Erkennungsergebnisse

Modell: gpt-5.5 · Modus standard · Relais https://test.apiqik-kratos.apiqik.com/

Gesamtpunktzahl
Jedes Element ist bestanden/nicht bestanden/fehlerhaft; die Summe ist ein gewichtetes Ergebnis und kann dazwischen liegen.
100 / 100
Grundlegende Anfrage Verifizierung abgeschlossen

Stellen Sie sicher, dass die Basisanfragen für Chat-Abschlüsse stabil zurückgegeben werden können.

Pass 100
Modellkonsistenz Verifizierung abgeschlossen

Vergleichen Sie die Felder „Anforderungsmodell“ und „Antwortmodell“, um festzustellen, ob sie übereinstimmen.

Pass 100
Funktionsaufruf Verifizierung abgeschlossen

Überprüfen Sie die Tool-Aufrufe, den Funktionsnamen, den JSON-Parameter und die Aufrufstruktur.

Pass 100
Strukturierte Ausgabe Verifizierung abgeschlossen

Stellen Sie sicher, dass JSON-Schema/strikte Ausgabebeschränkungen wirksam sind.

Pass 100
Protokollnormativität Verifizierung abgeschlossen

Überprüfen Sie die Form von Feldern wie ID, Objekt, Auswahlmöglichkeiten, Zielgrund, Verwendung usw.

Pass 100
Streaming-Konsistenz Verifizierung abgeschlossen

Vergleichen Sie die Stream- und Nicht-Stream-Text- und Token-Nutzung, um Konsistenz zu gewährleisten.

Pass 100
Token-Abrechnung Verifizierung abgeschlossen

Überprüfen Sie die Beziehung zwischen Eingabeaufforderung, Abschluss und Gesamttokenmessung.

Pass 100
Genaue Befehlswiedergabe (Anti-Casing) Verifizierung abgeschlossen

Das Modell wird aufgefordert, eine feste Markierung wörtlich zu reproduzieren und dabei zu prüfen, wie deterministisch die Anweisungen befolgt werden.

Pass 100
Systemkonflikttests Verifizierung abgeschlossen

Vergleichen Sie Benutzer nur mit explizitem System+Benutzer und prüfen Sie, ob feste Wörter durch versteckte Anweisungen überschrieben werden.

Pass 100
Minimalistisches Input-Token-Audit Verifizierung abgeschlossen

Verwenden Sie minimalistische Anfragen, um zu beobachten, ob input_tokens ungewöhnlich hoch ist, und um implizite Systeminjektionen zu identifizieren.

Pass 100
Offizieller Vergleich desselben Titels Verifizierung abgeschlossen

Die gleiche Frage vergleicht den Input-Verbrauch und das Antwortverhalten zwischen Kanälen und offiziellen Kanälen (oder Baseline).

Nicht zutreffend
Injektionserkennung ausblenden Verifizierung abgeschlossen

Zufällige Varianten führen eine Gegenprüfung auf ungewöhnliche Signale wie Nonce-Lecks, korrigierte Antworten und verdächtige Cache-Wiederverwendung durch.

Pass 100
Sicherheitsverweigerung und politische Stabilität Verifizierung abgeschlossen

Überprüfen Sie, ob die Sicherheitsrichtlinie stabil ist, indem Sie Denial-of-Antwort-Szenarien und Umschreibungs-/Kodierungs-/progressive Varianten verwenden.

gescheitert 50
Extreme Denkfähigkeit (zahlentheoretisches Zählen) Verifizierung abgeschlossen

Verwenden Sie vorgefertigte Argumentationsfragen, um zu überprüfen, ob überprüfbare Antworten richtig sind.

Pass 100
Erstes Token
2,319ms
Gesamtzeit
55,748ms
Durchsatz (T/S)
43.1
Eingabe-Tokens
1,333
Ausgabetoken
2,401
What does each OpenAI check cover?
Grundlegende Anfrage
Stellen Sie sicher, dass die Basisanfragen für Chat-Abschlüsse stabil zurückgegeben werden können.
Modellkonsistenz
Vergleichen Sie die Felder „Anforderungsmodell“ und „Antwortmodell“, um festzustellen, ob sie übereinstimmen.
Funktionsaufruf
Überprüfen Sie die Tool-Aufrufe, den Funktionsnamen, den JSON-Parameter und die Aufrufstruktur.
Strukturierte Ausgabe
Stellen Sie sicher, dass JSON-Schema/strikte Ausgabebeschränkungen wirksam sind.
Protokollnormativität
Überprüfen Sie die Form von Feldern wie ID, Objekt, Auswahlmöglichkeiten, Zielgrund, Verwendung usw.
Streaming-Konsistenz
Vergleichen Sie die Stream- und Nicht-Stream-Text- und Token-Nutzung, um Konsistenz zu gewährleisten.
Token-Abrechnung
Überprüfen Sie die Beziehung zwischen Eingabeaufforderung, Abschluss und Gesamttokenmessung.
Offizieller Vergleich desselben Titels
Die gleiche Frage vergleicht den Input-Verbrauch und das Antwortverhalten zwischen Kanälen und offiziellen Kanälen (oder Baseline).
Genaue Befehlswiedergabe (Anti-Casing)
Das Modell wird aufgefordert, eine feste Markierung wörtlich zu reproduzieren und dabei zu prüfen, wie deterministisch die Anweisungen befolgt werden.
Systemkonflikttests
Vergleichen Sie Benutzer nur mit explizitem System+Benutzer und prüfen Sie, ob feste Wörter durch versteckte Anweisungen überschrieben werden.
Minimalistisches Input-Token-Audit
Verwenden Sie minimalistische Anfragen, um zu beobachten, ob input_tokens ungewöhnlich hoch ist, und um implizite Systeminjektionen zu identifizieren.
Extreme Denkfähigkeit (zahlentheoretisches Zählen)
Verwenden Sie vorgefertigte Argumentationsfragen, um zu überprüfen, ob überprüfbare Antworten richtig sind.
lange Kontextauthentizität
Verwenden Sie „Nadel im Heuhaufen“, um zu überprüfen, ob das Kontextfenster berücksichtigt wird.
Injektionserkennung ausblenden
Zufällige Varianten führen eine Gegenprüfung auf ungewöhnliche Signale wie Nonce-Lecks, korrigierte Antworten und verdächtige Cache-Wiederverwendung durch.
Sicherheitsverweigerung und politische Stabilität
Überprüfen Sie, ob die Sicherheitsrichtlinie stabil ist, indem Sie Denial-of-Antwort-Szenarien und Umschreibungs-/Kodierungs-/progressive Varianten verwenden.

2026-09-08 · Sharing, languages, and scoring tweaks

This update improves report sharing and language switching, and lightly rebalances OpenAI / Gemini scoring emphasis.