Stellen Sie sicher, dass die Basisanfragen für Chat-Abschlüsse stabil zurückgegeben werden können.
Erkennungsergebnisse
Modell: gpt-5.6-sol · Modus full · Relais https://gw.hbapis.com/
Vergleichen Sie die Felder „Anforderungsmodell“ und „Antwortmodell“, um festzustellen, ob sie übereinstimmen.
Überprüfen Sie die Tool-Aufrufe, den Funktionsnamen, den JSON-Parameter und die Aufrufstruktur.
Stellen Sie sicher, dass JSON-Schema/strikte Ausgabebeschränkungen wirksam sind.
Überprüfen Sie die Form von Feldern wie ID, Objekt, Auswahlmöglichkeiten, Zielgrund, Verwendung usw.
Vergleichen Sie die Stream- und Nicht-Stream-Text- und Token-Nutzung, um Konsistenz zu gewährleisten.
Grund:Überprüfen Sie die Beziehung zwischen Eingabeaufforderung, Abschluss und Gesamttokenmessung.
Das Modell wird aufgefordert, eine feste Markierung wörtlich zu reproduzieren und dabei zu prüfen, wie deterministisch die Anweisungen befolgt werden.
Vergleichen Sie Benutzer nur mit explizitem System+Benutzer und prüfen Sie, ob feste Wörter durch versteckte Anweisungen überschrieben werden.
Verwenden Sie minimalistische Anfragen, um zu beobachten, ob input_tokens ungewöhnlich hoch ist, und um implizite Systeminjektionen zu identifizieren.
Die gleiche Frage vergleicht den Input-Verbrauch und das Antwortverhalten zwischen Kanälen und offiziellen Kanälen (oder Baseline).
Zufällige Varianten führen eine Gegenprüfung auf ungewöhnliche Signale wie Nonce-Lecks, korrigierte Antworten und verdächtige Cache-Wiederverwendung durch.
Überprüfen Sie, ob die Sicherheitsrichtlinie stabil ist, indem Sie Denial-of-Antwort-Szenarien und Umschreibungs-/Kodierungs-/progressive Varianten verwenden.
Verwenden Sie vorgefertigte Argumentationsfragen, um zu überprüfen, ob überprüfbare Antworten richtig sind.
Verwenden Sie „Nadel im Heuhaufen“, um zu überprüfen, ob das Kontextfenster berücksichtigt wird.
Wie ist dieses Ergebnis zu lesen?
响应的 usage 字段里出现了 Anthropic / Google 后端才会用的字段(如 claude_cache_creation_*、gemini_* 或 usage_source 自报非 openai)。这强烈暗示中转站把你的请求转发给了别的厂商后端再包装成 OpenAI 响应,所谓的 GPT 输出可能并非真正的 OpenAI 模型在生成。
Token 统计有明显偏差,建议留意是否存在多算或统计错误。
What does each OpenAI check cover?
- Grundlegende Anfrage
- Stellen Sie sicher, dass die Basisanfragen für Chat-Abschlüsse stabil zurückgegeben werden können.
- Modellkonsistenz
- Vergleichen Sie die Felder „Anforderungsmodell“ und „Antwortmodell“, um festzustellen, ob sie übereinstimmen.
- Funktionsaufruf
- Überprüfen Sie die Tool-Aufrufe, den Funktionsnamen, den JSON-Parameter und die Aufrufstruktur.
- Strukturierte Ausgabe
- Stellen Sie sicher, dass JSON-Schema/strikte Ausgabebeschränkungen wirksam sind.
- Protokollnormativität
- Überprüfen Sie die Form von Feldern wie ID, Objekt, Auswahlmöglichkeiten, Zielgrund, Verwendung usw.
- Streaming-Konsistenz
- Vergleichen Sie die Stream- und Nicht-Stream-Text- und Token-Nutzung, um Konsistenz zu gewährleisten.
- Token-Abrechnung
- Überprüfen Sie die Beziehung zwischen Eingabeaufforderung, Abschluss und Gesamttokenmessung.
- Offizieller Vergleich desselben Titels
- Die gleiche Frage vergleicht den Input-Verbrauch und das Antwortverhalten zwischen Kanälen und offiziellen Kanälen (oder Baseline).
- Genaue Befehlswiedergabe (Anti-Casing)
- Das Modell wird aufgefordert, eine feste Markierung wörtlich zu reproduzieren und dabei zu prüfen, wie deterministisch die Anweisungen befolgt werden.
- Systemkonflikttests
- Vergleichen Sie Benutzer nur mit explizitem System+Benutzer und prüfen Sie, ob feste Wörter durch versteckte Anweisungen überschrieben werden.
- Minimalistisches Input-Token-Audit
- Verwenden Sie minimalistische Anfragen, um zu beobachten, ob input_tokens ungewöhnlich hoch ist, und um implizite Systeminjektionen zu identifizieren.
- Extreme Denkfähigkeit (zahlentheoretisches Zählen)
- Verwenden Sie vorgefertigte Argumentationsfragen, um zu überprüfen, ob überprüfbare Antworten richtig sind.
- lange Kontextauthentizität
- Verwenden Sie „Nadel im Heuhaufen“, um zu überprüfen, ob das Kontextfenster berücksichtigt wird.
- Injektionserkennung ausblenden
- Zufällige Varianten führen eine Gegenprüfung auf ungewöhnliche Signale wie Nonce-Lecks, korrigierte Antworten und verdächtige Cache-Wiederverwendung durch.
- Sicherheitsverweigerung und politische Stabilität
- Überprüfen Sie, ob die Sicherheitsrichtlinie stabil ist, indem Sie Denial-of-Antwort-Szenarien und Umschreibungs-/Kodierungs-/progressive Varianten verwenden.