Hasil deteksi

Model: gpt-5.5 · mode standard · relai https://test.apiqik-kratos.apiqik.com/

Skor total
Setiap item lulus/gagal/kesalahan; totalnya adalah hasil tertimbang dan mungkin berada di antara keduanya.
100 / 100
Permintaan dasar Verifikasi selesai

Konfirmasikan bahwa permintaan dasar Penyelesaian Obrolan dapat kembali secara stabil.

Lulus 100
konsistensi model Verifikasi selesai

Bandingkan bidang model permintaan dan model respons untuk melihat apakah keduanya cocok.

Lulus 100
panggilan fungsi Verifikasi selesai

Periksa tool_calls, nama fungsi, parameter JSON, dan struktur panggilan.

Lulus 100
Keluaran terstruktur Verifikasi selesai

Verifikasi bahwa Skema JSON/batasan keluaran yang ketat berlaku.

Lulus 100
Normativitas protokol Verifikasi selesai

Verifikasi bentuk bidang seperti id, objek, pilihan, alasan_selesai, penggunaan, dll.

Lulus 100
konsistensi streaming Verifikasi selesai

Bandingkan penggunaan teks dan token streaming dan non-stream untuk konsistensi.

Lulus 100
Penagihan token Verifikasi selesai

Periksa hubungan pengukuran prompt/penyelesaian/total token.

Lulus 100
Reproduksi perintah yang akurat (anti-casing) Verifikasi selesai

Model diminta untuk mereproduksi tanda tetap secara verbatim, memeriksa seberapa deterministik instruksi yang diikuti.

Lulus 100
Pengujian konflik sistem Verifikasi selesai

Bandingkan pengguna hanya dengan sistem+pengguna eksplisit, periksa apakah kata-kata tetap ditimpa oleh arahan tersembunyi.

Lulus 100
Audit Token Input Minimalis Verifikasi selesai

Gunakan permintaan minimalis untuk mengamati apakah input_tokens sangat tinggi dan mengidentifikasi injeksi Sistem implisit.

Lulus 100
Perbandingan resmi dengan judul yang sama Verifikasi selesai

Pertanyaan yang sama membandingkan konsumsi input dan perilaku respons antara saluran dan pejabat (atau baseline).

Tidak berlaku
Sembunyikan deteksi injeksi Verifikasi selesai

Varian acak memeriksa ulang sinyal abnormal seperti kebocoran nonce, balasan tetap, dan penggunaan kembali cache yang mencurigakan.

Lulus 100
Penolakan keamanan dan stabilitas kebijakan Verifikasi selesai

Periksa apakah kebijakan keamanan stabil menggunakan skenario penolakan jawaban dan varian penulisan ulang/pengkodean/progresif.

gagal 50
Kemampuan penalaran yang ekstrim (penghitungan teori bilangan) Verifikasi selesai

Gunakan pertanyaan penalaran terekam untuk memeriksa apakah jawaban yang dapat diverifikasi benar.

Lulus 100
Tanda pertama
2,319ms
Total waktu
55,748ms
Keluaran (T/S)
43.1
Token masukan
1,333
Token keluaran
2,401
What does each OpenAI check cover?
Permintaan dasar
Konfirmasikan bahwa permintaan dasar Penyelesaian Obrolan dapat kembali secara stabil.
konsistensi model
Bandingkan bidang model permintaan dan model respons untuk melihat apakah keduanya cocok.
panggilan fungsi
Periksa tool_calls, nama fungsi, parameter JSON, dan struktur panggilan.
Keluaran terstruktur
Verifikasi bahwa Skema JSON/batasan keluaran yang ketat berlaku.
Normativitas protokol
Verifikasi bentuk bidang seperti id, objek, pilihan, alasan_selesai, penggunaan, dll.
konsistensi streaming
Bandingkan penggunaan teks dan token streaming dan non-stream untuk konsistensi.
Penagihan token
Periksa hubungan pengukuran prompt/penyelesaian/total token.
Perbandingan resmi dengan judul yang sama
Pertanyaan yang sama membandingkan konsumsi input dan perilaku respons antara saluran dan pejabat (atau baseline).
Reproduksi perintah yang akurat (anti-casing)
Model diminta untuk mereproduksi tanda tetap secara verbatim, memeriksa seberapa deterministik instruksi yang diikuti.
Pengujian konflik sistem
Bandingkan pengguna hanya dengan sistem+pengguna eksplisit, periksa apakah kata-kata tetap ditimpa oleh arahan tersembunyi.
Audit Token Input Minimalis
Gunakan permintaan minimalis untuk mengamati apakah input_tokens sangat tinggi dan mengidentifikasi injeksi Sistem implisit.
Kemampuan penalaran yang ekstrim (penghitungan teori bilangan)
Gunakan pertanyaan penalaran terekam untuk memeriksa apakah jawaban yang dapat diverifikasi benar.
keaslian konteks panjang
Gunakan needle-in-haystack untuk memverifikasi bahwa jendela konteks diterapkan.
Sembunyikan deteksi injeksi
Varian acak memeriksa ulang sinyal abnormal seperti kebocoran nonce, balasan tetap, dan penggunaan kembali cache yang mencurigakan.
Penolakan keamanan dan stabilitas kebijakan
Periksa apakah kebijakan keamanan stabil menggunakan skenario penolakan jawaban dan varian penulisan ulang/pengkodean/progresif.

2026-09-08 · Sharing, languages, and scoring tweaks

This update improves report sharing and language switching, and lightly rebalances OpenAI / Gemini scoring emphasis.