Konfirmasikan bahwa permintaan dasar Penyelesaian Obrolan dapat kembali secara stabil.
Hasil deteksi
Model: gpt-5.5 · mode standard · relai https://test.apiqik-kratos.apiqik.com/
Bandingkan bidang model permintaan dan model respons untuk melihat apakah keduanya cocok.
Periksa tool_calls, nama fungsi, parameter JSON, dan struktur panggilan.
Verifikasi bahwa Skema JSON/batasan keluaran yang ketat berlaku.
Verifikasi bentuk bidang seperti id, objek, pilihan, alasan_selesai, penggunaan, dll.
Bandingkan penggunaan teks dan token streaming dan non-stream untuk konsistensi.
Periksa hubungan pengukuran prompt/penyelesaian/total token.
Model diminta untuk mereproduksi tanda tetap secara verbatim, memeriksa seberapa deterministik instruksi yang diikuti.
Bandingkan pengguna hanya dengan sistem+pengguna eksplisit, periksa apakah kata-kata tetap ditimpa oleh arahan tersembunyi.
Gunakan permintaan minimalis untuk mengamati apakah input_tokens sangat tinggi dan mengidentifikasi injeksi Sistem implisit.
Pertanyaan yang sama membandingkan konsumsi input dan perilaku respons antara saluran dan pejabat (atau baseline).
Varian acak memeriksa ulang sinyal abnormal seperti kebocoran nonce, balasan tetap, dan penggunaan kembali cache yang mencurigakan.
Periksa apakah kebijakan keamanan stabil menggunakan skenario penolakan jawaban dan varian penulisan ulang/pengkodean/progresif.
Gunakan pertanyaan penalaran terekam untuk memeriksa apakah jawaban yang dapat diverifikasi benar.
What does each OpenAI check cover?
- Permintaan dasar
- Konfirmasikan bahwa permintaan dasar Penyelesaian Obrolan dapat kembali secara stabil.
- konsistensi model
- Bandingkan bidang model permintaan dan model respons untuk melihat apakah keduanya cocok.
- panggilan fungsi
- Periksa tool_calls, nama fungsi, parameter JSON, dan struktur panggilan.
- Keluaran terstruktur
- Verifikasi bahwa Skema JSON/batasan keluaran yang ketat berlaku.
- Normativitas protokol
- Verifikasi bentuk bidang seperti id, objek, pilihan, alasan_selesai, penggunaan, dll.
- konsistensi streaming
- Bandingkan penggunaan teks dan token streaming dan non-stream untuk konsistensi.
- Penagihan token
- Periksa hubungan pengukuran prompt/penyelesaian/total token.
- Perbandingan resmi dengan judul yang sama
- Pertanyaan yang sama membandingkan konsumsi input dan perilaku respons antara saluran dan pejabat (atau baseline).
- Reproduksi perintah yang akurat (anti-casing)
- Model diminta untuk mereproduksi tanda tetap secara verbatim, memeriksa seberapa deterministik instruksi yang diikuti.
- Pengujian konflik sistem
- Bandingkan pengguna hanya dengan sistem+pengguna eksplisit, periksa apakah kata-kata tetap ditimpa oleh arahan tersembunyi.
- Audit Token Input Minimalis
- Gunakan permintaan minimalis untuk mengamati apakah input_tokens sangat tinggi dan mengidentifikasi injeksi Sistem implisit.
- Kemampuan penalaran yang ekstrim (penghitungan teori bilangan)
- Gunakan pertanyaan penalaran terekam untuk memeriksa apakah jawaban yang dapat diverifikasi benar.
- keaslian konteks panjang
- Gunakan needle-in-haystack untuk memverifikasi bahwa jendela konteks diterapkan.
- Sembunyikan deteksi injeksi
- Varian acak memeriksa ulang sinyal abnormal seperti kebocoran nonce, balasan tetap, dan penggunaan kembali cache yang mencurigakan.
- Penolakan keamanan dan stabilitas kebijakan
- Periksa apakah kebijakan keamanan stabil menggunakan skenario penolakan jawaban dan varian penulisan ulang/pengkodean/progresif.