Erkennungsergebnisse

Modell: gpt-5.6-sol · Modus full · Relais https://gw.hbapis.com/

Gesamtpunktzahl
Jedes Element ist bestanden/nicht bestanden/fehlerhaft; die Summe ist ein gewichtetes Ergebnis und kann dazwischen liegen.
83 / 100
Grundlegende Anfrage Verifizierung abgeschlossen

Stellen Sie sicher, dass die Basisanfragen für Chat-Abschlüsse stabil zurückgegeben werden können.

Pass 100
Modellkonsistenz Verifizierung abgeschlossen

Vergleichen Sie die Felder „Anforderungsmodell“ und „Antwortmodell“, um festzustellen, ob sie übereinstimmen.

Pass 100
Funktionsaufruf Verifizierung abgeschlossen

Überprüfen Sie die Tool-Aufrufe, den Funktionsnamen, den JSON-Parameter und die Aufrufstruktur.

Pass 100
Strukturierte Ausgabe Verifizierung abgeschlossen

Stellen Sie sicher, dass JSON-Schema/strikte Ausgabebeschränkungen wirksam sind.

Pass 100
Protokollnormativität Verifizierung abgeschlossen

Überprüfen Sie die Form von Feldern wie ID, Objekt, Auswahlmöglichkeiten, Zielgrund, Verwendung usw.

gescheitert 60
Streaming-Konsistenz Verifizierung abgeschlossen

Vergleichen Sie die Stream- und Nicht-Stream-Text- und Token-Nutzung, um Konsistenz zu gewährleisten.

Pass 100
Token-Abrechnung Ausnahme überprüfen

Grund:Überprüfen Sie die Beziehung zwischen Eingabeaufforderung, Abschluss und Gesamttokenmessung.

Ausnahme überprüfen 0
Genaue Befehlswiedergabe (Anti-Casing) Verifizierung abgeschlossen

Das Modell wird aufgefordert, eine feste Markierung wörtlich zu reproduzieren und dabei zu prüfen, wie deterministisch die Anweisungen befolgt werden.

Pass 100
Systemkonflikttests Verifizierung abgeschlossen

Vergleichen Sie Benutzer nur mit explizitem System+Benutzer und prüfen Sie, ob feste Wörter durch versteckte Anweisungen überschrieben werden.

Pass 100
Minimalistisches Input-Token-Audit Verifizierung abgeschlossen

Verwenden Sie minimalistische Anfragen, um zu beobachten, ob input_tokens ungewöhnlich hoch ist, und um implizite Systeminjektionen zu identifizieren.

Pass 100
Offizieller Vergleich desselben Titels Verifizierung abgeschlossen

Die gleiche Frage vergleicht den Input-Verbrauch und das Antwortverhalten zwischen Kanälen und offiziellen Kanälen (oder Baseline).

Nicht zutreffend
Injektionserkennung ausblenden Verifizierung abgeschlossen

Zufällige Varianten führen eine Gegenprüfung auf ungewöhnliche Signale wie Nonce-Lecks, korrigierte Antworten und verdächtige Cache-Wiederverwendung durch.

Pass 100
Sicherheitsverweigerung und politische Stabilität Verifizierung abgeschlossen

Überprüfen Sie, ob die Sicherheitsrichtlinie stabil ist, indem Sie Denial-of-Antwort-Szenarien und Umschreibungs-/Kodierungs-/progressive Varianten verwenden.

gescheitert 50
Extreme Denkfähigkeit (zahlentheoretisches Zählen) Verifizierung abgeschlossen

Verwenden Sie vorgefertigte Argumentationsfragen, um zu überprüfen, ob überprüfbare Antworten richtig sind.

Pass 100
lange Kontextauthentizität Verifizierung abgeschlossen

Verwenden Sie „Nadel im Heuhaufen“, um zu überprüfen, ob das Kontextfenster berücksichtigt wird.

gescheitert 67

Wie ist dieses Ergebnis zu lesen?

中转站疑似伪装成 OpenAI

响应的 usage 字段里出现了 Anthropic / Google 后端才会用的字段(如 claude_cache_creation_*、gemini_* 或 usage_source 自报非 openai)。这强烈暗示中转站把你的请求转发给了别的厂商后端再包装成 OpenAI 响应,所谓的 GPT 输出可能并非真正的 OpenAI 模型在生成。

Token 计费存在风险

Token 统计有明显偏差,建议留意是否存在多算或统计错误。

Erstes Token
1,606ms
Gesamtzeit
100,741ms
Durchsatz (T/S)
14.7
Eingabe-Tokens
165,085
Ausgabetoken
1,480
What does each OpenAI check cover?
Grundlegende Anfrage
Stellen Sie sicher, dass die Basisanfragen für Chat-Abschlüsse stabil zurückgegeben werden können.
Modellkonsistenz
Vergleichen Sie die Felder „Anforderungsmodell“ und „Antwortmodell“, um festzustellen, ob sie übereinstimmen.
Funktionsaufruf
Überprüfen Sie die Tool-Aufrufe, den Funktionsnamen, den JSON-Parameter und die Aufrufstruktur.
Strukturierte Ausgabe
Stellen Sie sicher, dass JSON-Schema/strikte Ausgabebeschränkungen wirksam sind.
Protokollnormativität
Überprüfen Sie die Form von Feldern wie ID, Objekt, Auswahlmöglichkeiten, Zielgrund, Verwendung usw.
Streaming-Konsistenz
Vergleichen Sie die Stream- und Nicht-Stream-Text- und Token-Nutzung, um Konsistenz zu gewährleisten.
Token-Abrechnung
Überprüfen Sie die Beziehung zwischen Eingabeaufforderung, Abschluss und Gesamttokenmessung.
Offizieller Vergleich desselben Titels
Die gleiche Frage vergleicht den Input-Verbrauch und das Antwortverhalten zwischen Kanälen und offiziellen Kanälen (oder Baseline).
Genaue Befehlswiedergabe (Anti-Casing)
Das Modell wird aufgefordert, eine feste Markierung wörtlich zu reproduzieren und dabei zu prüfen, wie deterministisch die Anweisungen befolgt werden.
Systemkonflikttests
Vergleichen Sie Benutzer nur mit explizitem System+Benutzer und prüfen Sie, ob feste Wörter durch versteckte Anweisungen überschrieben werden.
Minimalistisches Input-Token-Audit
Verwenden Sie minimalistische Anfragen, um zu beobachten, ob input_tokens ungewöhnlich hoch ist, und um implizite Systeminjektionen zu identifizieren.
Extreme Denkfähigkeit (zahlentheoretisches Zählen)
Verwenden Sie vorgefertigte Argumentationsfragen, um zu überprüfen, ob überprüfbare Antworten richtig sind.
lange Kontextauthentizität
Verwenden Sie „Nadel im Heuhaufen“, um zu überprüfen, ob das Kontextfenster berücksichtigt wird.
Injektionserkennung ausblenden
Zufällige Varianten führen eine Gegenprüfung auf ungewöhnliche Signale wie Nonce-Lecks, korrigierte Antworten und verdächtige Cache-Wiederverwendung durch.
Sicherheitsverweigerung und politische Stabilität
Überprüfen Sie, ob die Sicherheitsrichtlinie stabil ist, indem Sie Denial-of-Antwort-Szenarien und Umschreibungs-/Kodierungs-/progressive Varianten verwenden.

2026-09-08 · Sharing, languages, and scoring tweaks

This update improves report sharing and language switching, and lightly rebalances OpenAI / Gemini scoring emphasis.