ผลการตรวจจับ

รุ่น: claude-sonnet-5 · โหมด full · รีเลย์ https://agi.tontian.com/

คะแนนรวม
แต่ละรายการผ่าน / ล้มเหลว / ผิดพลาด ผลรวมเป็นผลลัพธ์แบบถ่วงน้ำหนักและอาจอยู่ระหว่างนั้น
27 / 100
การรับรองความถูกต้องของโมเดล ตรวจสอบข้อยกเว้น

ตรวจสอบตัวตนที่รายงานด้วยตนเองของโมเดล ร่องรอยของแบรนด์ และสัญญาณทั่วไปของการอำพราง

ตรวจสอบข้อยกเว้น 0
คิดให้กำลังใจ การยืนยันเสร็จสมบูรณ์

ตรวจสอบว่าช่องพิเศษฝั่งเซิร์ฟเวอร์ เช่น Claude การคิด / ลายเซ็น ถูกส่งอย่างโปร่งใสหรือไม่

ผ่าน 100
การสร้างคำสั่งที่แม่นยำ (ป้องกันเคส) ตรวจสอบข้อยกเว้น

แบบจำลองจะถูกขอให้ทำซ้ำเครื่องหมายคงที่ทุกคำ โดยตรวจสอบว่าปฏิบัติตามคำแนะนำที่กำหนดไว้อย่างไร

ตรวจสอบข้อยกเว้น 0
การทดสอบความขัดแย้งของระบบ ตรวจสอบข้อยกเว้น

เปรียบเทียบผู้ใช้เฉพาะกับระบบ+ผู้ใช้ที่ชัดเจน โดยตรวจสอบว่าคำที่ตายตัวถูกแทนที่โดยคำสั่งที่ซ่อนอยู่หรือไม่

ตรวจสอบข้อยกเว้น 0
ความสามารถในการใช้เหตุผลขั้นสุดยอด (การนับทฤษฎีจำนวน) ตรวจสอบข้อยกเว้น

ใช้คำถามที่ให้เหตุผลแบบกระป๋องเพื่อตรวจสอบว่าคำตอบที่ตรวจสอบได้นั้นถูกต้องหรือไม่

ตรวจสอบข้อยกเว้น 0
การตรวจจับช่อง ตรวจสอบข้อยกเว้น

ระบุช่องทางการโฮสต์จากคำนำหน้า ID การตอบกลับ

ตรวจสอบข้อยกเว้น 0
Claude การตรวจสอบโทเค็นไนเซอร์ การยืนยันเสร็จสมบูรณ์

รุ่น:— · โทเค็นที่สังเกตได้:None · โทเค็นที่คาดหวัง:None · ตรงกัน:unknown

ไม่สามารถใช้ได้
การตรวจสอบโทเค็นอินพุตที่เรียบง่าย ตรวจสอบข้อยกเว้น

ใช้คำขอแบบมินิมัลลิสต์เพื่อสังเกตว่า input_token สูงผิดปกติหรือไม่ และระบุการแทรกระบบโดยนัย

ตรวจสอบข้อยกเว้น 0
ความสม่ำเสมอของรูปแบบพฤติกรรม การยืนยันเสร็จสมบูรณ์

เปรียบเทียบคุณลักษณะของซีรีส์ Claude ผ่านการตั้งค่าพฤติกรรมและรูปแบบคำตอบ

ล้มเหลว 0
ความแม่นยำของความรู้ การยืนยันเสร็จสมบูรณ์

ใช้ Anthropic / Claude คำถามความรู้ทั่วไปเพื่อตรวจสอบข้ามว่าแบ็กเอนด์อ้างสิทธิ์เป็น Claude หรือไม่

ล้มเหลว 0
ความสอดคล้องของการประกาศแบบจำลอง ตรวจสอบข้อยกเว้น

การเปรียบเทียบโมเดลคำขอ โมเดลการตอบสนอง และความเสถียรของตัวตนในการส่งคืนหลายรอบ

ตรวจสอบข้อยกเว้น 0
ข้อกำหนดโครงสร้างข้อความ การยืนยันเสร็จสมบูรณ์

ตรวจสอบรหัสข้อความ ลำดับเหตุการณ์ SSE และบล็อกเนื้อหาว่าเป็นไปตามข้อกำหนด Anthropic

ผ่าน 100
การใช้เครื่องมือ/เอาท์พุตที่มีโครงสร้าง ตรวจสอบข้อยกเว้น

ตรวจสอบว่าบล็อก tool_use, toolu_ ID, ชื่อฟังก์ชัน และสคีมาพารามิเตอร์เป็นแบบมาตรฐานหรือไม่

ตรวจสอบข้อยกเว้น 0
ความสม่ำเสมอของการสตรีม ตรวจสอบข้อยกเว้น

เปรียบเทียบข้อความ โทเค็น และเหตุผลสิ้นสุดสำหรับความสอดคล้องกันของข้อความแบบสตรีมและไม่ใช่สตรีม

ตรวจสอบข้อยกเว้น 0
ความสอดคล้องในการใช้โทเค็น ตรวจสอบข้อยกเว้น

ตรวจสอบว่าช่องโทเค็นอินพุต / เอาท์พุต / แคชครบถ้วนและเป็นของแท้

ตรวจสอบข้อยกเว้น 0
การเปรียบเทียบชื่อเดียวกันอย่างเป็นทางการ ตรวจสอบข้อยกเว้น

คำถามเดียวกันจะเปรียบเทียบการบริโภคอินพุตและพฤติกรรมการตอบสนองระหว่างช่องทางกับทางการ (หรือพื้นฐาน)

ตรวจสอบข้อยกเว้น 0
ซ่อนการตรวจจับการฉีด การยืนยันเสร็จสมบูรณ์

ตัวแปรแบบสุ่มตรวจสอบข้ามเพื่อตรวจสอบสัญญาณที่ผิดปกติ เช่น การรั่วไหลของ nonce การตอบกลับแบบตายตัว และการใช้แคชซ้ำที่น่าสงสัย

ผ่าน 100
การปฏิเสธความปลอดภัยและความมั่นคงของนโยบาย การยืนยันเสร็จสมบูรณ์

ตรวจสอบว่านโยบายความปลอดภัยมีเสถียรภาพหรือไม่โดยใช้สถานการณ์การปฏิเสธคำตอบและการเขียนใหม่/การเข้ารหัส/รูปแบบที่ก้าวหน้า

ล้มเหลว 50
ความถูกต้องของบริบทที่ยาวนาน การยืนยันเสร็จสมบูรณ์

ใช้เข็มในกองหญ้าเพื่อตรวจสอบว่าหน้าต่างบริบทที่ยาวได้รับการปฏิบัติตาม

ล้มเหลว 0
การรับรู้หลายรูปแบบ/PDF การยืนยันเสร็จสมบูรณ์

ส่งการสอบสวน PDF เพื่อยืนยันว่าสถานีถ่ายโอนไม่ได้ถอดลิงก์การทำความเข้าใจเอกสารออก

ล้มเหลว 0

จะอ่านผลลัพธ์นี้ได้อย่างไร?

Token 用量存在风险

usage 字段缺失或统计不自洽,建议不要直接依赖该中转站返回的 token 数做计费核算。

โทเค็นแรก
1,881ms
เวลาทั้งหมด
25,087ms
ปริมาณงาน (T/S)
63.9
โทเค็นอินพุต
804
โทเค็นเอาท์พุต
1,604
What does each Claude check cover?
การรับรองความถูกต้องของโมเดล
ตรวจสอบตัวตนที่รายงานด้วยตนเองของโมเดล ร่องรอยของแบรนด์ และสัญญาณทั่วไปของการอำพราง
คิดให้กำลังใจ ⭐
ตรวจสอบว่าช่องพิเศษฝั่งเซิร์ฟเวอร์ เช่น Claude การคิด / ลายเซ็น ถูกส่งอย่างโปร่งใสหรือไม่
การสร้างคำสั่งที่แม่นยำ (ป้องกันเคส)
แบบจำลองจะถูกขอให้ทำซ้ำเครื่องหมายคงที่ทุกคำ โดยตรวจสอบว่าปฏิบัติตามคำแนะนำที่กำหนดไว้อย่างไร
การทดสอบความขัดแย้งของระบบ
เปรียบเทียบผู้ใช้เฉพาะกับระบบ+ผู้ใช้ที่ชัดเจน โดยตรวจสอบว่าคำที่ตายตัวถูกแทนที่โดยคำสั่งที่ซ่อนอยู่หรือไม่
การตรวจสอบโทเค็นอินพุตที่เรียบง่าย
ใช้คำขอแบบมินิมัลลิสต์เพื่อสังเกตว่า input_token สูงผิดปกติหรือไม่ และระบุการแทรกระบบโดยนัย
ความสามารถในการใช้เหตุผลขั้นสุดยอด (การนับทฤษฎีจำนวน)
ใช้คำถามที่ให้เหตุผลแบบกระป๋องเพื่อตรวจสอบว่าคำตอบที่ตรวจสอบได้นั้นถูกต้องหรือไม่
การตรวจจับช่อง
ระบุช่องทางการโฮสต์จากคำนำหน้า ID การตอบกลับ
Claude การตรวจสอบโทเค็นไนเซอร์
นับ input_tokens ด้วยคำแนะนำคงที่เมื่อเปรียบเทียบกับบรรทัดฐานของโมเดลที่ปรับเทียบแล้ว
ความสม่ำเสมอของรูปแบบพฤติกรรม
เปรียบเทียบคุณลักษณะของซีรีส์ Claude ผ่านการตั้งค่าพฤติกรรมและรูปแบบคำตอบ
ความแม่นยำของความรู้
ใช้ Anthropic / Claude คำถามความรู้ทั่วไปเพื่อตรวจสอบข้ามว่าแบ็กเอนด์อ้างสิทธิ์เป็น Claude หรือไม่
ความสอดคล้องของการประกาศแบบจำลอง
การเปรียบเทียบโมเดลคำขอ โมเดลการตอบสนอง และความเสถียรของตัวตนในการส่งคืนหลายรอบ
ข้อกำหนดโครงสร้างข้อความ
ตรวจสอบรหัสข้อความ ลำดับเหตุการณ์ SSE และบล็อกเนื้อหาว่าเป็นไปตามข้อกำหนด Anthropic
การใช้เครื่องมือ/เอาท์พุตที่มีโครงสร้าง
ตรวจสอบว่าบล็อก tool_use, toolu_ ID, ชื่อฟังก์ชัน และสคีมาพารามิเตอร์เป็นแบบมาตรฐานหรือไม่
ความสม่ำเสมอของการสตรีม
เปรียบเทียบข้อความ โทเค็น และเหตุผลสิ้นสุดสำหรับความสอดคล้องกันของข้อความแบบสตรีมและไม่ใช่สตรีม
ความสอดคล้องในการใช้โทเค็น
ตรวจสอบว่าช่องโทเค็นอินพุต / เอาท์พุต / แคชครบถ้วนและเป็นของแท้
การเปรียบเทียบชื่อเดียวกันอย่างเป็นทางการ
คำถามเดียวกันจะเปรียบเทียบการบริโภคอินพุตและพฤติกรรมการตอบสนองระหว่างช่องทางกับทางการ (หรือพื้นฐาน)
ความถูกต้องของบริบทที่ยาวนาน
ใช้เข็มในกองหญ้าเพื่อตรวจสอบว่าหน้าต่างบริบทที่ยาวได้รับการปฏิบัติตาม
การรับรู้หลายรูปแบบ/PDF
ส่งการสอบสวน PDF เพื่อยืนยันว่าสถานีถ่ายโอนไม่ได้ถอดลิงก์การทำความเข้าใจเอกสารออก
ซ่อนการตรวจจับการฉีด
ตัวแปรแบบสุ่มตรวจสอบข้ามเพื่อตรวจสอบสัญญาณที่ผิดปกติ เช่น การรั่วไหลของ nonce การตอบกลับแบบตายตัว และการใช้แคชซ้ำที่น่าสงสัย
การปฏิเสธความปลอดภัยและความมั่นคงของนโยบาย
ตรวจสอบว่านโยบายความปลอดภัยมีเสถียรภาพหรือไม่โดยใช้สถานการณ์การปฏิเสธคำตอบและการเขียนใหม่/การเข้ารหัส/รูปแบบที่ก้าวหน้า

2026-09-08 · Sharing, languages, and scoring tweaks

This update improves report sharing and language switching, and lightly rebalances OpenAI / Gemini scoring emphasis.