Permintaan dasar
Konfirmasikan bahwa permintaan dasar Penyelesaian Obrolan dapat kembali secara stabil.
pangolin memeriksa bentuk Penyelesaian Obrolan, panggilan alat, konsistensi streaming, dan sidik jari penggunaan untuk orang yang berpura-pura GPT.
OpenAI tidak memiliki tanda tangan anti-pemalsuan server bergaya Claude, jadi halaman ini berfokus pada protokol berkeyakinan tinggi dan pemeriksaan kemampuan.
Evaluasi apakah titik akhir yang kompatibel dengan GPT mengikuti bentuk OpenAI dan benar-benar melewati kemampuan utama.
Bukan bukti identitas tingkat kripto — tetapi cukup untuk menangkap sebagian besar kebocoran adaptor dan kemampuan yang hilang.
Pembaruan dengan kedalaman Pindai di atas. Mode penuh mencakup semua pemeriksaan yang berlaku. Penyelidikan konteks panjang memerlukan keikutsertaan ekstra.
Konfirmasikan bahwa permintaan dasar Penyelesaian Obrolan dapat kembali secara stabil.
Bandingkan bidang model permintaan dan model respons untuk melihat apakah keduanya cocok.
Periksa tool_calls, nama fungsi, parameter JSON, dan struktur panggilan.
Verifikasi bahwa Skema JSON/batasan keluaran yang ketat berlaku.
Verifikasi bentuk bidang seperti id, objek, pilihan, alasan_selesai, penggunaan, dll.
Bandingkan penggunaan teks dan token streaming dan non-stream untuk konsistensi.
Periksa hubungan pengukuran prompt/penyelesaian/total token.
Pertanyaan yang sama membandingkan konsumsi input dan perilaku respons antara saluran dan pejabat (atau baseline).
Model diminta untuk mereproduksi tanda tetap secara verbatim, memeriksa seberapa deterministik instruksi yang diikuti.
Bandingkan pengguna hanya dengan sistem+pengguna eksplisit, periksa apakah kata-kata tetap ditimpa oleh arahan tersembunyi.
Gunakan permintaan minimalis untuk mengamati apakah input_tokens sangat tinggi dan mengidentifikasi injeksi Sistem implisit.
Gunakan pertanyaan penalaran terekam untuk memeriksa apakah jawaban yang dapat diverifikasi benar.
Varian acak memeriksa ulang sinyal abnormal seperti kebocoran nonce, balasan tetap, dan penggunaan kembali cache yang mencurigakan.
Periksa apakah kebijakan keamanan stabil menggunakan skenario penolakan jawaban dan varian penulisan ulang/pengkodean/progresif.