Konfirmasikan bahwa permintaan dasar Penyelesaian Obrolan dapat kembali secara stabil.
Hasil deteksi
Model: gpt-5.6-sol · mode full · relai https://gw.hbapis.com/
Bandingkan bidang model permintaan dan model respons untuk melihat apakah keduanya cocok.
Periksa tool_calls, nama fungsi, parameter JSON, dan struktur panggilan.
Verifikasi bahwa Skema JSON/batasan keluaran yang ketat berlaku.
Verifikasi bentuk bidang seperti id, objek, pilihan, alasan_selesai, penggunaan, dll.
Bandingkan penggunaan teks dan token streaming dan non-stream untuk konsistensi.
Alasan:Periksa hubungan pengukuran prompt/penyelesaian/total token.
Model diminta untuk mereproduksi tanda tetap secara verbatim, memeriksa seberapa deterministik instruksi yang diikuti.
Bandingkan pengguna hanya dengan sistem+pengguna eksplisit, periksa apakah kata-kata tetap ditimpa oleh arahan tersembunyi.
Gunakan permintaan minimalis untuk mengamati apakah input_tokens sangat tinggi dan mengidentifikasi injeksi Sistem implisit.
Pertanyaan yang sama membandingkan konsumsi input dan perilaku respons antara saluran dan pejabat (atau baseline).
Varian acak memeriksa ulang sinyal abnormal seperti kebocoran nonce, balasan tetap, dan penggunaan kembali cache yang mencurigakan.
Periksa apakah kebijakan keamanan stabil menggunakan skenario penolakan jawaban dan varian penulisan ulang/pengkodean/progresif.
Gunakan pertanyaan penalaran terekam untuk memeriksa apakah jawaban yang dapat diverifikasi benar.
Gunakan needle-in-haystack untuk memverifikasi bahwa jendela konteks diterapkan.
Bagaimana cara membaca hasil ini?
响应的 usage 字段里出现了 Anthropic / Google 后端才会用的字段(如 claude_cache_creation_*、gemini_* 或 usage_source 自报非 openai)。这强烈暗示中转站把你的请求转发给了别的厂商后端再包装成 OpenAI 响应,所谓的 GPT 输出可能并非真正的 OpenAI 模型在生成。
Token 统计有明显偏差,建议留意是否存在多算或统计错误。
What does each OpenAI check cover?
- Permintaan dasar
- Konfirmasikan bahwa permintaan dasar Penyelesaian Obrolan dapat kembali secara stabil.
- konsistensi model
- Bandingkan bidang model permintaan dan model respons untuk melihat apakah keduanya cocok.
- panggilan fungsi
- Periksa tool_calls, nama fungsi, parameter JSON, dan struktur panggilan.
- Keluaran terstruktur
- Verifikasi bahwa Skema JSON/batasan keluaran yang ketat berlaku.
- Normativitas protokol
- Verifikasi bentuk bidang seperti id, objek, pilihan, alasan_selesai, penggunaan, dll.
- konsistensi streaming
- Bandingkan penggunaan teks dan token streaming dan non-stream untuk konsistensi.
- Penagihan token
- Periksa hubungan pengukuran prompt/penyelesaian/total token.
- Perbandingan resmi dengan judul yang sama
- Pertanyaan yang sama membandingkan konsumsi input dan perilaku respons antara saluran dan pejabat (atau baseline).
- Reproduksi perintah yang akurat (anti-casing)
- Model diminta untuk mereproduksi tanda tetap secara verbatim, memeriksa seberapa deterministik instruksi yang diikuti.
- Pengujian konflik sistem
- Bandingkan pengguna hanya dengan sistem+pengguna eksplisit, periksa apakah kata-kata tetap ditimpa oleh arahan tersembunyi.
- Audit Token Input Minimalis
- Gunakan permintaan minimalis untuk mengamati apakah input_tokens sangat tinggi dan mengidentifikasi injeksi Sistem implisit.
- Kemampuan penalaran yang ekstrim (penghitungan teori bilangan)
- Gunakan pertanyaan penalaran terekam untuk memeriksa apakah jawaban yang dapat diverifikasi benar.
- keaslian konteks panjang
- Gunakan needle-in-haystack untuk memverifikasi bahwa jendela konteks diterapkan.
- Sembunyikan deteksi injeksi
- Varian acak memeriksa ulang sinyal abnormal seperti kebocoran nonce, balasan tetap, dan penggunaan kembali cache yang mencurigakan.
- Penolakan keamanan dan stabilitas kebijakan
- Periksa apakah kebijakan keamanan stabil menggunakan skenario penolakan jawaban dan varian penulisan ulang/pengkodean/progresif.