ผลการตรวจจับ

รุ่น: claude-haiku-4-5 · โหมด quick · รีเลย์ https://test.apiqik-kratos.apiqik.com

คะแนนรวม
แต่ละรายการผ่าน / ล้มเหลว / ผิดพลาด ผลรวมเป็นผลลัพธ์แบบถ่วงน้ำหนักและอาจอยู่ระหว่างนั้น
98 / 100
การรับรองความถูกต้องของโมเดล การยืนยันเสร็จสมบูรณ์

ตรวจสอบตัวตนที่รายงานด้วยตนเองของโมเดล ร่องรอยของแบรนด์ และสัญญาณทั่วไปของการอำพราง

ผ่าน 100
คิดให้กำลังใจ การยืนยันเสร็จสมบูรณ์

ตรวจสอบว่าช่องพิเศษฝั่งเซิร์ฟเวอร์ เช่น Claude การคิด / ลายเซ็น ถูกส่งอย่างโปร่งใสหรือไม่

ผ่าน 100
การสร้างคำสั่งที่แม่นยำ (ป้องกันเคส) การยืนยันเสร็จสมบูรณ์

แบบจำลองจะถูกขอให้ทำซ้ำเครื่องหมายคงที่ทุกคำ โดยตรวจสอบว่าปฏิบัติตามคำแนะนำที่กำหนดไว้อย่างไร

ผ่าน 100
การทดสอบความขัดแย้งของระบบ การยืนยันเสร็จสมบูรณ์

เปรียบเทียบผู้ใช้เฉพาะกับระบบ+ผู้ใช้ที่ชัดเจน โดยตรวจสอบว่าคำที่ตายตัวถูกแทนที่โดยคำสั่งที่ซ่อนอยู่หรือไม่

ผ่าน 100
ความสามารถในการใช้เหตุผลขั้นสุดยอด (การนับทฤษฎีจำนวน) การยืนยันเสร็จสมบูรณ์

ใช้คำถามที่ให้เหตุผลแบบกระป๋องเพื่อตรวจสอบว่าคำตอบที่ตรวจสอบได้นั้นถูกต้องหรือไม่

ล้มเหลว 0
การตรวจจับช่อง การยืนยันเสร็จสมบูรณ์

ช่องที่โฮสต์:AWS Bedrock

ผ่าน 100
Claude การตรวจสอบโทเค็นไนเซอร์ การยืนยันเสร็จสมบูรณ์

รุ่น:— · โทเค็นที่สังเกตได้:None · โทเค็นที่คาดหวัง:None · ตรงกัน:unknown

ไม่สามารถใช้ได้
การตรวจสอบโทเค็นอินพุตที่เรียบง่าย การยืนยันเสร็จสมบูรณ์

ใช้คำขอแบบมินิมัลลิสต์เพื่อสังเกตว่า input_token สูงผิดปกติหรือไม่ และระบุการแทรกระบบโดยนัย

ผ่าน 100
ความสอดคล้องของการประกาศแบบจำลอง การยืนยันเสร็จสมบูรณ์

การเปรียบเทียบโมเดลคำขอ โมเดลการตอบสนอง และความเสถียรของตัวตนในการส่งคืนหลายรอบ

ผ่าน 100
ข้อกำหนดโครงสร้างข้อความ การยืนยันเสร็จสมบูรณ์

ตรวจสอบรหัสข้อความ ลำดับเหตุการณ์ SSE และบล็อกเนื้อหาว่าเป็นไปตามข้อกำหนด Anthropic

ผ่าน 100
ซ่อนการตรวจจับการฉีด ตรวจสอบข้อยกเว้น

เหตุผล:หมดเวลาโดยรวม

ตรวจสอบข้อยกเว้น 0
การปฏิเสธความปลอดภัยและความมั่นคงของนโยบาย ตรวจสอบข้อยกเว้น

เหตุผล:หมดเวลาโดยรวม

ตรวจสอบข้อยกเว้น 0

จะอ่านผลลัพธ์นี้ได้อย่างไร?

暂时无法判断 Token 是否虚报

接口没有返回完整 usage 字段,所以这次不能确认它有没有多算。

โทเค็นแรก
เวลาทั้งหมด
60,001ms
ปริมาณงาน (T/S)
32.4
โทเค็นอินพุต
544
โทเค็นเอาท์พุต
1,947
What does each Claude check cover?
การรับรองความถูกต้องของโมเดล
ตรวจสอบตัวตนที่รายงานด้วยตนเองของโมเดล ร่องรอยของแบรนด์ และสัญญาณทั่วไปของการอำพราง
คิดให้กำลังใจ ⭐
ตรวจสอบว่าช่องพิเศษฝั่งเซิร์ฟเวอร์ เช่น Claude การคิด / ลายเซ็น ถูกส่งอย่างโปร่งใสหรือไม่
การสร้างคำสั่งที่แม่นยำ (ป้องกันเคส)
แบบจำลองจะถูกขอให้ทำซ้ำเครื่องหมายคงที่ทุกคำ โดยตรวจสอบว่าปฏิบัติตามคำแนะนำที่กำหนดไว้อย่างไร
การทดสอบความขัดแย้งของระบบ
เปรียบเทียบผู้ใช้เฉพาะกับระบบ+ผู้ใช้ที่ชัดเจน โดยตรวจสอบว่าคำที่ตายตัวถูกแทนที่โดยคำสั่งที่ซ่อนอยู่หรือไม่
การตรวจสอบโทเค็นอินพุตที่เรียบง่าย
ใช้คำขอแบบมินิมัลลิสต์เพื่อสังเกตว่า input_token สูงผิดปกติหรือไม่ และระบุการแทรกระบบโดยนัย
ความสามารถในการใช้เหตุผลขั้นสุดยอด (การนับทฤษฎีจำนวน)
ใช้คำถามที่ให้เหตุผลแบบกระป๋องเพื่อตรวจสอบว่าคำตอบที่ตรวจสอบได้นั้นถูกต้องหรือไม่
การตรวจจับช่อง
ระบุช่องทางการโฮสต์จากคำนำหน้า ID การตอบกลับ
Claude การตรวจสอบโทเค็นไนเซอร์
นับ input_tokens ด้วยคำแนะนำคงที่เมื่อเปรียบเทียบกับบรรทัดฐานของโมเดลที่ปรับเทียบแล้ว
ความสม่ำเสมอของรูปแบบพฤติกรรม
เปรียบเทียบคุณลักษณะของซีรีส์ Claude ผ่านการตั้งค่าพฤติกรรมและรูปแบบคำตอบ
ความแม่นยำของความรู้
ใช้ Anthropic / Claude คำถามความรู้ทั่วไปเพื่อตรวจสอบข้ามว่าแบ็กเอนด์อ้างสิทธิ์เป็น Claude หรือไม่
ความสอดคล้องของการประกาศแบบจำลอง
การเปรียบเทียบโมเดลคำขอ โมเดลการตอบสนอง และความเสถียรของตัวตนในการส่งคืนหลายรอบ
ข้อกำหนดโครงสร้างข้อความ
ตรวจสอบรหัสข้อความ ลำดับเหตุการณ์ SSE และบล็อกเนื้อหาว่าเป็นไปตามข้อกำหนด Anthropic
การใช้เครื่องมือ/เอาท์พุตที่มีโครงสร้าง
ตรวจสอบว่าบล็อก tool_use, toolu_ ID, ชื่อฟังก์ชัน และสคีมาพารามิเตอร์เป็นแบบมาตรฐานหรือไม่
ความสม่ำเสมอของการสตรีม
เปรียบเทียบข้อความ โทเค็น และเหตุผลสิ้นสุดสำหรับความสอดคล้องกันของข้อความแบบสตรีมและไม่ใช่สตรีม
ความสอดคล้องในการใช้โทเค็น
ตรวจสอบว่าช่องโทเค็นอินพุต / เอาท์พุต / แคชครบถ้วนและเป็นของแท้
การเปรียบเทียบชื่อเดียวกันอย่างเป็นทางการ
คำถามเดียวกันจะเปรียบเทียบการบริโภคอินพุตและพฤติกรรมการตอบสนองระหว่างช่องทางกับทางการ (หรือพื้นฐาน)
ความถูกต้องของบริบทที่ยาวนาน
ใช้เข็มในกองหญ้าเพื่อตรวจสอบว่าหน้าต่างบริบทที่ยาวได้รับการปฏิบัติตาม
การรับรู้หลายรูปแบบ/PDF
ส่งการสอบสวน PDF เพื่อยืนยันว่าสถานีถ่ายโอนไม่ได้ถอดลิงก์การทำความเข้าใจเอกสารออก
ซ่อนการตรวจจับการฉีด
ตัวแปรแบบสุ่มตรวจสอบข้ามเพื่อตรวจสอบสัญญาณที่ผิดปกติ เช่น การรั่วไหลของ nonce การตอบกลับแบบตายตัว และการใช้แคชซ้ำที่น่าสงสัย
การปฏิเสธความปลอดภัยและความมั่นคงของนโยบาย
ตรวจสอบว่านโยบายความปลอดภัยมีเสถียรภาพหรือไม่โดยใช้สถานการณ์การปฏิเสธคำตอบและการเขียนใหม่/การเข้ารหัส/รูปแบบที่ก้าวหน้า

2026-09-08 · Sharing, languages, and scoring tweaks

This update improves report sharing and language switching, and lightly rebalances OpenAI / Gemini scoring emphasis.