Hasil deteksi

Model: claude-opus-4-8 · mode full · relai https://test.apiqik-kratos.apiqik.com

Deteksi tidak valid: 检测无效: 上游返回余额不足或用量限制错误。请更换有额度的 API key, 或降低检测模式/模型后重新检测。
Skor total
Setiap item lulus/gagal/kesalahan; totalnya adalah hasil tertimbang dan mungkin berada di antara keduanya.
0 / 100
Otentikasi model Verifikasi selesai

Periksa identitas model yang dilaporkan sendiri, residu merek, dan tanda-tanda umum kamuflase.

Lulus 100
Berpikirlah mendukung Verifikasi selesai

Verifikasi apakah bidang eksklusif sisi server seperti Claude pemikiran / tanda tangan dikirimkan secara transparan.

Lulus 100
Reproduksi perintah yang akurat (anti-casing) Verifikasi selesai

Model diminta untuk mereproduksi tanda tetap secara verbatim, memeriksa seberapa deterministik instruksi yang diikuti.

Lulus 100
Pengujian konflik sistem Verifikasi selesai

Bandingkan pengguna hanya dengan sistem+pengguna eksplisit, periksa apakah kata-kata tetap ditimpa oleh arahan tersembunyi.

Lulus 100
Kemampuan penalaran yang ekstrim (penghitungan teori bilangan) Verifikasi selesai

Gunakan pertanyaan penalaran terekam untuk memeriksa apakah jawaban yang dapat diverifikasi benar.

Lulus 100
Deteksi saluran Verifikasi selesai

Saluran yang dihosting:Google Vertex

Lulus 100
Claude Verifikasi Tokenizer Verifikasi selesai

Model:claude-opus-4-8 · Token yang diamati:12 · Token yang diharapkan:12 · Cocok:true

Lulus 100
Audit Token Input Minimalis Verifikasi selesai

Gunakan permintaan minimalis untuk mengamati apakah input_tokens sangat tinggi dan mengidentifikasi injeksi Sistem implisit.

Lulus 100
konsistensi gaya perilaku Verifikasi selesai

Bandingkan karakteristik seri Claude melalui preferensi perilaku dan pola jawaban.

Lulus 100
keakuratan pengetahuan Verifikasi selesai

Gunakan Anthropic / Claude pertanyaan pengetahuan umum untuk melakukan validasi silang apakah backend diklaim seperti Claude.

Lulus 100
Konsistensi deklarasi model Verifikasi pengecualian

Membandingkan model permintaan, model respons, dan stabilitas identitas dalam beberapa putaran pengembalian.

Verifikasi pengecualian 0
Spesifikasi struktur pesan Verifikasi selesai

Periksa ID pesan, urutan peristiwa SSE, dan blok konten untuk kesesuaian dengan spesifikasi Anthropic.

Lulus 75
Penggunaan Alat/Keluaran Terstruktur Verifikasi selesai

Periksa apakah blok tool_use, toolu_ ID, nama fungsi dan skema parameter sudah terstandarisasi.

Lulus 100
konsistensi streaming Verifikasi pengecualian

Bandingkan teks streaming dan non-aliran, token, dan alasan akhir untuk konsistensi.

Verifikasi pengecualian 0
Konsistensi penggunaan token Verifikasi selesai

Periksa apakah kolom token input/output/cache sudah lengkap dan asli.

Lulus 85
Perbandingan resmi dengan judul yang sama Verifikasi selesai

Pertanyaan yang sama membandingkan konsumsi input dan perilaku respons antara saluran dan pejabat (atau baseline).

Tidak berlaku
Sembunyikan deteksi injeksi Verifikasi pengecualian

Alasan:Batas waktu keseluruhan

Verifikasi pengecualian 0
Penolakan keamanan dan stabilitas kebijakan Verifikasi pengecualian

Alasan:Batas waktu keseluruhan

Verifikasi pengecualian 0
keaslian konteks panjang Verifikasi selesai

Gunakan needle-in-haystack untuk memverifikasi bahwa jendela konteks panjang diterapkan.

Tidak berlaku
Pengenalan multimodal/PDF Verifikasi selesai

Kirimkan penyelidikan PDF untuk mengonfirmasi bahwa tautan pemahaman dokumen belum dihapus oleh stasiun transfer.

Lulus 100
Tanda pertama
5,838ms
Total waktu
180,001ms
Keluaran (T/S)
14.7
Token masukan
2,558
Token keluaran
2,651
What does each Claude check cover?
Otentikasi model
Periksa identitas model yang dilaporkan sendiri, residu merek, dan tanda-tanda umum kamuflase.
Berpikirlah mendukung ⭐
Verifikasi apakah bidang eksklusif sisi server seperti Claude pemikiran / tanda tangan dikirimkan secara transparan.
Reproduksi perintah yang akurat (anti-casing)
Model diminta untuk mereproduksi tanda tetap secara verbatim, memeriksa seberapa deterministik instruksi yang diikuti.
Pengujian konflik sistem
Bandingkan pengguna hanya dengan sistem+pengguna eksplisit, periksa apakah kata-kata tetap ditimpa oleh arahan tersembunyi.
Audit Token Input Minimalis
Gunakan permintaan minimalis untuk mengamati apakah input_tokens sangat tinggi dan mengidentifikasi injeksi Sistem implisit.
Kemampuan penalaran yang ekstrim (penghitungan teori bilangan)
Gunakan pertanyaan penalaran terekam untuk memeriksa apakah jawaban yang dapat diverifikasi benar.
Deteksi saluran
Mengidentifikasi saluran hosting dari awalan ID respons.
Claude Verifikasi Tokenizer
Hitung input_tokens dengan petunjuk tetap dibandingkan dengan garis dasar model yang dikalibrasi.
konsistensi gaya perilaku
Bandingkan karakteristik seri Claude melalui preferensi perilaku dan pola jawaban.
keakuratan pengetahuan
Gunakan Anthropic / Claude pertanyaan pengetahuan umum untuk melakukan validasi silang apakah backend diklaim seperti Claude.
Konsistensi deklarasi model
Membandingkan model permintaan, model respons, dan stabilitas identitas dalam beberapa putaran pengembalian.
Spesifikasi struktur pesan
Periksa ID pesan, urutan peristiwa SSE, dan blok konten untuk kesesuaian dengan spesifikasi Anthropic.
Penggunaan Alat/Keluaran Terstruktur
Periksa apakah blok tool_use, toolu_ ID, nama fungsi dan skema parameter sudah terstandarisasi.
konsistensi streaming
Bandingkan teks streaming dan non-aliran, token, dan alasan akhir untuk konsistensi.
Konsistensi penggunaan token
Periksa apakah kolom token input/output/cache sudah lengkap dan asli.
Perbandingan resmi dengan judul yang sama
Pertanyaan yang sama membandingkan konsumsi input dan perilaku respons antara saluran dan pejabat (atau baseline).
keaslian konteks panjang
Gunakan needle-in-haystack untuk memverifikasi bahwa jendela konteks panjang diterapkan.
Pengenalan multimodal/PDF
Kirimkan penyelidikan PDF untuk mengonfirmasi bahwa tautan pemahaman dokumen belum dihapus oleh stasiun transfer.
Sembunyikan deteksi injeksi
Varian acak memeriksa ulang sinyal abnormal seperti kebocoran nonce, balasan tetap, dan penggunaan kembali cache yang mencurigakan.
Penolakan keamanan dan stabilitas kebijakan
Periksa apakah kebijakan keamanan stabil menggunakan skenario penolakan jawaban dan varian penulisan ulang/pengkodean/progresif.

2026-09-08 · Sharing, languages, and scoring tweaks

This update improves report sharing and language switching, and lightly rebalances OpenAI / Gemini scoring emphasis.