Hasil deteksi

Model: gpt-5.6-sol · mode full · relai https://gw.hbapis.com/

Skor total
Setiap item lulus/gagal/kesalahan; totalnya adalah hasil tertimbang dan mungkin berada di antara keduanya.
83 / 100
Permintaan dasar Verifikasi selesai

Konfirmasikan bahwa permintaan dasar Penyelesaian Obrolan dapat kembali secara stabil.

Lulus 100
konsistensi model Verifikasi selesai

Bandingkan bidang model permintaan dan model respons untuk melihat apakah keduanya cocok.

Lulus 100
panggilan fungsi Verifikasi selesai

Periksa tool_calls, nama fungsi, parameter JSON, dan struktur panggilan.

Lulus 100
Keluaran terstruktur Verifikasi selesai

Verifikasi bahwa Skema JSON/batasan keluaran yang ketat berlaku.

Lulus 100
Normativitas protokol Verifikasi selesai

Verifikasi bentuk bidang seperti id, objek, pilihan, alasan_selesai, penggunaan, dll.

gagal 60
konsistensi streaming Verifikasi selesai

Bandingkan penggunaan teks dan token streaming dan non-stream untuk konsistensi.

Lulus 100
Penagihan token Verifikasi pengecualian

Alasan:Periksa hubungan pengukuran prompt/penyelesaian/total token.

Verifikasi pengecualian 0
Reproduksi perintah yang akurat (anti-casing) Verifikasi selesai

Model diminta untuk mereproduksi tanda tetap secara verbatim, memeriksa seberapa deterministik instruksi yang diikuti.

Lulus 100
Pengujian konflik sistem Verifikasi selesai

Bandingkan pengguna hanya dengan sistem+pengguna eksplisit, periksa apakah kata-kata tetap ditimpa oleh arahan tersembunyi.

Lulus 100
Audit Token Input Minimalis Verifikasi selesai

Gunakan permintaan minimalis untuk mengamati apakah input_tokens sangat tinggi dan mengidentifikasi injeksi Sistem implisit.

Lulus 100
Perbandingan resmi dengan judul yang sama Verifikasi selesai

Pertanyaan yang sama membandingkan konsumsi input dan perilaku respons antara saluran dan pejabat (atau baseline).

Tidak berlaku
Sembunyikan deteksi injeksi Verifikasi selesai

Varian acak memeriksa ulang sinyal abnormal seperti kebocoran nonce, balasan tetap, dan penggunaan kembali cache yang mencurigakan.

Lulus 100
Penolakan keamanan dan stabilitas kebijakan Verifikasi selesai

Periksa apakah kebijakan keamanan stabil menggunakan skenario penolakan jawaban dan varian penulisan ulang/pengkodean/progresif.

gagal 50
Kemampuan penalaran yang ekstrim (penghitungan teori bilangan) Verifikasi selesai

Gunakan pertanyaan penalaran terekam untuk memeriksa apakah jawaban yang dapat diverifikasi benar.

Lulus 100
keaslian konteks panjang Verifikasi selesai

Gunakan needle-in-haystack untuk memverifikasi bahwa jendela konteks diterapkan.

gagal 67

Bagaimana cara membaca hasil ini?

中转站疑似伪装成 OpenAI

响应的 usage 字段里出现了 Anthropic / Google 后端才会用的字段(如 claude_cache_creation_*、gemini_* 或 usage_source 自报非 openai)。这强烈暗示中转站把你的请求转发给了别的厂商后端再包装成 OpenAI 响应,所谓的 GPT 输出可能并非真正的 OpenAI 模型在生成。

Token 计费存在风险

Token 统计有明显偏差,建议留意是否存在多算或统计错误。

Tanda pertama
1,606ms
Total waktu
100,741ms
Keluaran (T/S)
14.7
Token masukan
165,085
Token keluaran
1,480
What does each OpenAI check cover?
Permintaan dasar
Konfirmasikan bahwa permintaan dasar Penyelesaian Obrolan dapat kembali secara stabil.
konsistensi model
Bandingkan bidang model permintaan dan model respons untuk melihat apakah keduanya cocok.
panggilan fungsi
Periksa tool_calls, nama fungsi, parameter JSON, dan struktur panggilan.
Keluaran terstruktur
Verifikasi bahwa Skema JSON/batasan keluaran yang ketat berlaku.
Normativitas protokol
Verifikasi bentuk bidang seperti id, objek, pilihan, alasan_selesai, penggunaan, dll.
konsistensi streaming
Bandingkan penggunaan teks dan token streaming dan non-stream untuk konsistensi.
Penagihan token
Periksa hubungan pengukuran prompt/penyelesaian/total token.
Perbandingan resmi dengan judul yang sama
Pertanyaan yang sama membandingkan konsumsi input dan perilaku respons antara saluran dan pejabat (atau baseline).
Reproduksi perintah yang akurat (anti-casing)
Model diminta untuk mereproduksi tanda tetap secara verbatim, memeriksa seberapa deterministik instruksi yang diikuti.
Pengujian konflik sistem
Bandingkan pengguna hanya dengan sistem+pengguna eksplisit, periksa apakah kata-kata tetap ditimpa oleh arahan tersembunyi.
Audit Token Input Minimalis
Gunakan permintaan minimalis untuk mengamati apakah input_tokens sangat tinggi dan mengidentifikasi injeksi Sistem implisit.
Kemampuan penalaran yang ekstrim (penghitungan teori bilangan)
Gunakan pertanyaan penalaran terekam untuk memeriksa apakah jawaban yang dapat diverifikasi benar.
keaslian konteks panjang
Gunakan needle-in-haystack untuk memverifikasi bahwa jendela konteks diterapkan.
Sembunyikan deteksi injeksi
Varian acak memeriksa ulang sinyal abnormal seperti kebocoran nonce, balasan tetap, dan penggunaan kembali cache yang mencurigakan.
Penolakan keamanan dan stabilitas kebijakan
Periksa apakah kebijakan keamanan stabil menggunakan skenario penolakan jawaban dan varian penulisan ulang/pengkodean/progresif.

2026-09-08 · Sharing, languages, and scoring tweaks

This update improves report sharing and language switching, and lightly rebalances OpenAI / Gemini scoring emphasis.