Hasil deteksi

Model: gpt-5.5 · mode full · relai https://test.apiqik-kratos.dimleap.cn

Skor total
Setiap item lulus/gagal/kesalahan; totalnya adalah hasil tertimbang dan mungkin berada di antara keduanya.
92 / 100
Permintaan dasar Verifikasi selesai

Konfirmasikan bahwa permintaan dasar Penyelesaian Obrolan dapat kembali secara stabil.

Lulus 100
konsistensi model Verifikasi selesai

Bandingkan bidang model permintaan dan model respons untuk melihat apakah keduanya cocok.

Lulus 100
panggilan fungsi Verifikasi selesai

Periksa tool_calls, nama fungsi, parameter JSON, dan struktur panggilan.

Lulus 100
Keluaran terstruktur Verifikasi selesai

Verifikasi bahwa Skema JSON/batasan keluaran yang ketat berlaku.

Lulus 100
Normativitas protokol Verifikasi selesai

Verifikasi bentuk bidang seperti id, objek, pilihan, alasan_selesai, penggunaan, dll.

gagal 65
konsistensi streaming Verifikasi selesai

Bandingkan penggunaan teks dan token streaming dan non-stream untuk konsistensi.

Lulus 100
Penagihan token Verifikasi selesai

Periksa hubungan pengukuran prompt/penyelesaian/total token.

gagal 65
Reproduksi perintah yang akurat (anti-casing) Verifikasi selesai

Model diminta untuk mereproduksi tanda tetap secara verbatim, memeriksa seberapa deterministik instruksi yang diikuti.

Lulus 100
Pengujian konflik sistem Verifikasi selesai

Bandingkan pengguna hanya dengan sistem+pengguna eksplisit, periksa apakah kata-kata tetap ditimpa oleh arahan tersembunyi.

Lulus 100
Audit Token Input Minimalis Verifikasi selesai

Gunakan permintaan minimalis untuk mengamati apakah input_tokens sangat tinggi dan mengidentifikasi injeksi Sistem implisit.

gagal 40
Perbandingan resmi dengan judul yang sama Verifikasi selesai

Pertanyaan yang sama membandingkan konsumsi input dan perilaku respons antara saluran dan pejabat (atau baseline).

Tidak berlaku
Sembunyikan deteksi injeksi Verifikasi selesai

Varian acak memeriksa ulang sinyal abnormal seperti kebocoran nonce, balasan tetap, dan penggunaan kembali cache yang mencurigakan.

Lulus 100
Penolakan keamanan dan stabilitas kebijakan Verifikasi selesai

Periksa apakah kebijakan keamanan stabil menggunakan skenario penolakan jawaban dan varian penulisan ulang/pengkodean/progresif.

gagal 50
Kemampuan penalaran yang ekstrim (penghitungan teori bilangan) Verifikasi selesai

Gunakan pertanyaan penalaran terekam untuk memeriksa apakah jawaban yang dapat diverifikasi benar.

Lulus 100
keaslian konteks panjang Verifikasi selesai

Gunakan needle-in-haystack untuk memverifikasi bahwa jendela konteks diterapkan.

Lulus 100

Bagaimana cara membaca hasil ini?

Token 计费存在风险

Token 数明显异常: usage 字段、token 增量或流式/非流式统计存在明显问题,有虚报或统计错误风险。

Tanda pertama
1,935ms
Total waktu
99,636ms
Keluaran (T/S)
25.5
Token masukan
427,581
Token keluaran
2,541
What does each OpenAI check cover?
Permintaan dasar
Konfirmasikan bahwa permintaan dasar Penyelesaian Obrolan dapat kembali secara stabil.
konsistensi model
Bandingkan bidang model permintaan dan model respons untuk melihat apakah keduanya cocok.
panggilan fungsi
Periksa tool_calls, nama fungsi, parameter JSON, dan struktur panggilan.
Keluaran terstruktur
Verifikasi bahwa Skema JSON/batasan keluaran yang ketat berlaku.
Normativitas protokol
Verifikasi bentuk bidang seperti id, objek, pilihan, alasan_selesai, penggunaan, dll.
konsistensi streaming
Bandingkan penggunaan teks dan token streaming dan non-stream untuk konsistensi.
Penagihan token
Periksa hubungan pengukuran prompt/penyelesaian/total token.
Perbandingan resmi dengan judul yang sama
Pertanyaan yang sama membandingkan konsumsi input dan perilaku respons antara saluran dan pejabat (atau baseline).
Reproduksi perintah yang akurat (anti-casing)
Model diminta untuk mereproduksi tanda tetap secara verbatim, memeriksa seberapa deterministik instruksi yang diikuti.
Pengujian konflik sistem
Bandingkan pengguna hanya dengan sistem+pengguna eksplisit, periksa apakah kata-kata tetap ditimpa oleh arahan tersembunyi.
Audit Token Input Minimalis
Gunakan permintaan minimalis untuk mengamati apakah input_tokens sangat tinggi dan mengidentifikasi injeksi Sistem implisit.
Kemampuan penalaran yang ekstrim (penghitungan teori bilangan)
Gunakan pertanyaan penalaran terekam untuk memeriksa apakah jawaban yang dapat diverifikasi benar.
keaslian konteks panjang
Gunakan needle-in-haystack untuk memverifikasi bahwa jendela konteks diterapkan.
Sembunyikan deteksi injeksi
Varian acak memeriksa ulang sinyal abnormal seperti kebocoran nonce, balasan tetap, dan penggunaan kembali cache yang mencurigakan.
Penolakan keamanan dan stabilitas kebijakan
Periksa apakah kebijakan keamanan stabil menggunakan skenario penolakan jawaban dan varian penulisan ulang/pengkodean/progresif.

2026-09-08 · Sharing, languages, and scoring tweaks

This update improves report sharing and language switching, and lightly rebalances OpenAI / Gemini scoring emphasis.