ตรวจสอบตัวตนที่รายงานด้วยตนเองของโมเดล ร่องรอยของแบรนด์ และสัญญาณทั่วไปของการอำพราง
ผลการตรวจจับ
รุ่น: claude-opus-5 · โหมด full · รีเลย์ https://agi.tontian.com/
ตรวจสอบว่าช่องพิเศษฝั่งเซิร์ฟเวอร์ เช่น Claude การคิด / ลายเซ็น ถูกส่งอย่างโปร่งใสหรือไม่
แบบจำลองจะถูกขอให้ทำซ้ำเครื่องหมายคงที่ทุกคำ โดยตรวจสอบว่าปฏิบัติตามคำแนะนำที่กำหนดไว้อย่างไร
เปรียบเทียบผู้ใช้เฉพาะกับระบบ+ผู้ใช้ที่ชัดเจน โดยตรวจสอบว่าคำที่ตายตัวถูกแทนที่โดยคำสั่งที่ซ่อนอยู่หรือไม่
ใช้คำถามที่ให้เหตุผลแบบกระป๋องเพื่อตรวจสอบว่าคำตอบที่ตรวจสอบได้นั้นถูกต้องหรือไม่
ช่องที่โฮสต์:Anthropic
รุ่น:— · โทเค็นที่สังเกตได้:None · โทเค็นที่คาดหวัง:None · ตรงกัน:unknown
ใช้คำขอแบบมินิมัลลิสต์เพื่อสังเกตว่า input_token สูงผิดปกติหรือไม่ และระบุการแทรกระบบโดยนัย
เปรียบเทียบคุณลักษณะของซีรีส์ Claude ผ่านการตั้งค่าพฤติกรรมและรูปแบบคำตอบ
ใช้ Anthropic / Claude คำถามความรู้ทั่วไปเพื่อตรวจสอบข้ามว่าแบ็กเอนด์อ้างสิทธิ์เป็น Claude หรือไม่
การเปรียบเทียบโมเดลคำขอ โมเดลการตอบสนอง และความเสถียรของตัวตนในการส่งคืนหลายรอบ
ตรวจสอบรหัสข้อความ ลำดับเหตุการณ์ SSE และบล็อกเนื้อหาว่าเป็นไปตามข้อกำหนด Anthropic
ตรวจสอบว่าบล็อก tool_use, toolu_ ID, ชื่อฟังก์ชัน และสคีมาพารามิเตอร์เป็นแบบมาตรฐานหรือไม่
เปรียบเทียบข้อความ โทเค็น และเหตุผลสิ้นสุดสำหรับความสอดคล้องกันของข้อความแบบสตรีมและไม่ใช่สตรีม
ตรวจสอบว่าช่องโทเค็นอินพุต / เอาท์พุต / แคชครบถ้วนและเป็นของแท้
คำถามเดียวกันจะเปรียบเทียบการบริโภคอินพุตและพฤติกรรมการตอบสนองระหว่างช่องทางกับทางการ (หรือพื้นฐาน)
ตัวแปรแบบสุ่มตรวจสอบข้ามเพื่อตรวจสอบสัญญาณที่ผิดปกติ เช่น การรั่วไหลของ nonce การตอบกลับแบบตายตัว และการใช้แคชซ้ำที่น่าสงสัย
ตรวจสอบว่านโยบายความปลอดภัยมีเสถียรภาพหรือไม่โดยใช้สถานการณ์การปฏิเสธคำตอบและการเขียนใหม่/การเข้ารหัส/รูปแบบที่ก้าวหน้า
ใช้เข็มในกองหญ้าเพื่อตรวจสอบว่าหน้าต่างบริบทที่ยาวได้รับการปฏิบัติตาม
ส่งการสอบสวน PDF เพื่อยืนยันว่าสถานีถ่ายโอนไม่ได้ถอดลิงก์การทำความเข้าใจเอกสารออก
จะอ่านผลลัพธ์นี้ได้อย่างไร?
Token 用量存在风险: usage 字段缺失、长短 prompt 增量异常、输出 token 超出请求上限,或 stream 与 non-stream token 统计不一致。
What does each Claude check cover?
- การรับรองความถูกต้องของโมเดล
- ตรวจสอบตัวตนที่รายงานด้วยตนเองของโมเดล ร่องรอยของแบรนด์ และสัญญาณทั่วไปของการอำพราง
- คิดให้กำลังใจ ⭐
- ตรวจสอบว่าช่องพิเศษฝั่งเซิร์ฟเวอร์ เช่น Claude การคิด / ลายเซ็น ถูกส่งอย่างโปร่งใสหรือไม่
- การสร้างคำสั่งที่แม่นยำ (ป้องกันเคส)
- แบบจำลองจะถูกขอให้ทำซ้ำเครื่องหมายคงที่ทุกคำ โดยตรวจสอบว่าปฏิบัติตามคำแนะนำที่กำหนดไว้อย่างไร
- การทดสอบความขัดแย้งของระบบ
- เปรียบเทียบผู้ใช้เฉพาะกับระบบ+ผู้ใช้ที่ชัดเจน โดยตรวจสอบว่าคำที่ตายตัวถูกแทนที่โดยคำสั่งที่ซ่อนอยู่หรือไม่
- การตรวจสอบโทเค็นอินพุตที่เรียบง่าย
- ใช้คำขอแบบมินิมัลลิสต์เพื่อสังเกตว่า input_token สูงผิดปกติหรือไม่ และระบุการแทรกระบบโดยนัย
- ความสามารถในการใช้เหตุผลขั้นสุดยอด (การนับทฤษฎีจำนวน)
- ใช้คำถามที่ให้เหตุผลแบบกระป๋องเพื่อตรวจสอบว่าคำตอบที่ตรวจสอบได้นั้นถูกต้องหรือไม่
- การตรวจจับช่อง
- ระบุช่องทางการโฮสต์จากคำนำหน้า ID การตอบกลับ
- Claude การตรวจสอบโทเค็นไนเซอร์
- นับ input_tokens ด้วยคำแนะนำคงที่เมื่อเปรียบเทียบกับบรรทัดฐานของโมเดลที่ปรับเทียบแล้ว
- ความสม่ำเสมอของรูปแบบพฤติกรรม
- เปรียบเทียบคุณลักษณะของซีรีส์ Claude ผ่านการตั้งค่าพฤติกรรมและรูปแบบคำตอบ
- ความแม่นยำของความรู้
- ใช้ Anthropic / Claude คำถามความรู้ทั่วไปเพื่อตรวจสอบข้ามว่าแบ็กเอนด์อ้างสิทธิ์เป็น Claude หรือไม่
- ความสอดคล้องของการประกาศแบบจำลอง
- การเปรียบเทียบโมเดลคำขอ โมเดลการตอบสนอง และความเสถียรของตัวตนในการส่งคืนหลายรอบ
- ข้อกำหนดโครงสร้างข้อความ
- ตรวจสอบรหัสข้อความ ลำดับเหตุการณ์ SSE และบล็อกเนื้อหาว่าเป็นไปตามข้อกำหนด Anthropic
- การใช้เครื่องมือ/เอาท์พุตที่มีโครงสร้าง
- ตรวจสอบว่าบล็อก tool_use, toolu_ ID, ชื่อฟังก์ชัน และสคีมาพารามิเตอร์เป็นแบบมาตรฐานหรือไม่
- ความสม่ำเสมอของการสตรีม
- เปรียบเทียบข้อความ โทเค็น และเหตุผลสิ้นสุดสำหรับความสอดคล้องกันของข้อความแบบสตรีมและไม่ใช่สตรีม
- ความสอดคล้องในการใช้โทเค็น
- ตรวจสอบว่าช่องโทเค็นอินพุต / เอาท์พุต / แคชครบถ้วนและเป็นของแท้
- การเปรียบเทียบชื่อเดียวกันอย่างเป็นทางการ
- คำถามเดียวกันจะเปรียบเทียบการบริโภคอินพุตและพฤติกรรมการตอบสนองระหว่างช่องทางกับทางการ (หรือพื้นฐาน)
- ความถูกต้องของบริบทที่ยาวนาน
- ใช้เข็มในกองหญ้าเพื่อตรวจสอบว่าหน้าต่างบริบทที่ยาวได้รับการปฏิบัติตาม
- การรับรู้หลายรูปแบบ/PDF
- ส่งการสอบสวน PDF เพื่อยืนยันว่าสถานีถ่ายโอนไม่ได้ถอดลิงก์การทำความเข้าใจเอกสารออก
- ซ่อนการตรวจจับการฉีด
- ตัวแปรแบบสุ่มตรวจสอบข้ามเพื่อตรวจสอบสัญญาณที่ผิดปกติ เช่น การรั่วไหลของ nonce การตอบกลับแบบตายตัว และการใช้แคชซ้ำที่น่าสงสัย
- การปฏิเสธความปลอดภัยและความมั่นคงของนโยบาย
- ตรวจสอบว่านโยบายความปลอดภัยมีเสถียรภาพหรือไม่โดยใช้สถานการณ์การปฏิเสธคำตอบและการเขียนใหม่/การเข้ารหัส/รูปแบบที่ก้าวหน้า