Periksa identitas model yang dilaporkan sendiri, residu merek, dan tanda-tanda umum kamuflase.
Hasil deteksi
Model: claude-opus-4-6 · mode quick · relai https://unirouters.cc/
Verifikasi apakah bidang eksklusif sisi server seperti Claude pemikiran / tanda tangan dikirimkan secara transparan.
Model diminta untuk mereproduksi tanda tetap secara verbatim, memeriksa seberapa deterministik instruksi yang diikuti.
Bandingkan pengguna hanya dengan sistem+pengguna eksplisit, periksa apakah kata-kata tetap ditimpa oleh arahan tersembunyi.
Gunakan pertanyaan penalaran terekam untuk memeriksa apakah jawaban yang dapat diverifikasi benar.
Saluran yang dihosting:Anthropic
Model:claude-opus-4-6 · Token yang diamati:9 · Token yang diharapkan:12 · Cocok:false
Gunakan permintaan minimalis untuk mengamati apakah input_tokens sangat tinggi dan mengidentifikasi injeksi Sistem implisit.
Membandingkan model permintaan, model respons, dan stabilitas identitas dalam beberapa putaran pengembalian.
Periksa ID pesan, urutan peristiwa SSE, dan blok konten untuk kesesuaian dengan spesifikasi Anthropic.
Varian acak memeriksa ulang sinyal abnormal seperti kebocoran nonce, balasan tetap, dan penggunaan kembali cache yang mencurigakan.
Periksa apakah kebijakan keamanan stabil menggunakan skenario penolakan jawaban dan varian penulisan ulang/pengkodean/progresif.
Bagaimana cara membaca hasil ini?
接口没有返回完整 usage 字段,所以这次不能确认它有没有多算。
What does each Claude check cover?
- Otentikasi model
- Periksa identitas model yang dilaporkan sendiri, residu merek, dan tanda-tanda umum kamuflase.
- Berpikirlah mendukung ⭐
- Verifikasi apakah bidang eksklusif sisi server seperti Claude pemikiran / tanda tangan dikirimkan secara transparan.
- Reproduksi perintah yang akurat (anti-casing)
- Model diminta untuk mereproduksi tanda tetap secara verbatim, memeriksa seberapa deterministik instruksi yang diikuti.
- Pengujian konflik sistem
- Bandingkan pengguna hanya dengan sistem+pengguna eksplisit, periksa apakah kata-kata tetap ditimpa oleh arahan tersembunyi.
- Audit Token Input Minimalis
- Gunakan permintaan minimalis untuk mengamati apakah input_tokens sangat tinggi dan mengidentifikasi injeksi Sistem implisit.
- Kemampuan penalaran yang ekstrim (penghitungan teori bilangan)
- Gunakan pertanyaan penalaran terekam untuk memeriksa apakah jawaban yang dapat diverifikasi benar.
- Deteksi saluran
- Mengidentifikasi saluran hosting dari awalan ID respons.
- Claude Verifikasi Tokenizer
- Hitung input_tokens dengan petunjuk tetap dibandingkan dengan garis dasar model yang dikalibrasi.
- konsistensi gaya perilaku
- Bandingkan karakteristik seri Claude melalui preferensi perilaku dan pola jawaban.
- keakuratan pengetahuan
- Gunakan Anthropic / Claude pertanyaan pengetahuan umum untuk melakukan validasi silang apakah backend diklaim seperti Claude.
- Konsistensi deklarasi model
- Membandingkan model permintaan, model respons, dan stabilitas identitas dalam beberapa putaran pengembalian.
- Spesifikasi struktur pesan
- Periksa ID pesan, urutan peristiwa SSE, dan blok konten untuk kesesuaian dengan spesifikasi Anthropic.
- Penggunaan Alat/Keluaran Terstruktur
- Periksa apakah blok tool_use, toolu_ ID, nama fungsi dan skema parameter sudah terstandarisasi.
- konsistensi streaming
- Bandingkan teks streaming dan non-aliran, token, dan alasan akhir untuk konsistensi.
- Konsistensi penggunaan token
- Periksa apakah kolom token input/output/cache sudah lengkap dan asli.
- Perbandingan resmi dengan judul yang sama
- Pertanyaan yang sama membandingkan konsumsi input dan perilaku respons antara saluran dan pejabat (atau baseline).
- keaslian konteks panjang
- Gunakan needle-in-haystack untuk memverifikasi bahwa jendela konteks panjang diterapkan.
- Pengenalan multimodal/PDF
- Kirimkan penyelidikan PDF untuk mengonfirmasi bahwa tautan pemahaman dokumen belum dihapus oleh stasiun transfer.
- Sembunyikan deteksi injeksi
- Varian acak memeriksa ulang sinyal abnormal seperti kebocoran nonce, balasan tetap, dan penggunaan kembali cache yang mencurigakan.
- Penolakan keamanan dan stabilitas kebijakan
- Periksa apakah kebijakan keamanan stabil menggunakan skenario penolakan jawaban dan varian penulisan ulang/pengkodean/progresif.