ผลการตรวจจับ

รุ่น: gpt-5.5 · โหมด full · รีเลย์ https://test.apiqik-kratos.dimleap.cn

คะแนนรวม
แต่ละรายการผ่าน / ล้มเหลว / ผิดพลาด ผลรวมเป็นผลลัพธ์แบบถ่วงน้ำหนักและอาจอยู่ระหว่างนั้น
92 / 100
คำขอพื้นฐาน การยืนยันเสร็จสมบูรณ์

ยืนยันว่าคำขอพื้นฐานสำหรับการเสร็จสิ้นการแชทสามารถกลับมาได้อย่างเสถียร

ผ่าน 100
ความสม่ำเสมอของโมเดล การยืนยันเสร็จสมบูรณ์

เปรียบเทียบฟิลด์โมเดลคำขอและโมเดลการตอบสนองเพื่อดูว่าตรงกันหรือไม่

ผ่าน 100
การเรียกใช้ฟังก์ชัน การยืนยันเสร็จสมบูรณ์

ตรวจสอบ tool_calls ชื่อฟังก์ชัน พารามิเตอร์ JSON และโครงสร้างการโทร

ผ่าน 100
เอาต์พุตที่มีโครงสร้าง การยืนยันเสร็จสมบูรณ์

ตรวจสอบว่า JSON Schema / ข้อจำกัดเอาต์พุตที่เข้มงวดมีผลบังคับใช้

ผ่าน 100
ความเป็นมาตรฐานของพิธีสาร การยืนยันเสร็จสมบูรณ์

ตรวจสอบรูปร่างของฟิลด์ เช่น ID, วัตถุ, ตัวเลือก, finish_reason, การใช้งาน ฯลฯ

ล้มเหลว 65
ความสม่ำเสมอของการสตรีม การยืนยันเสร็จสมบูรณ์

เปรียบเทียบข้อความและโทเค็นแบบสตรีมและไม่ใช่สตรีมเพื่อความสอดคล้องกัน

ผ่าน 100
การเรียกเก็บเงินโทเค็น การยืนยันเสร็จสมบูรณ์

ตรวจสอบความสัมพันธ์ของพรอมต์ / ความสมบูรณ์ / การวัดโทเค็นทั้งหมด

ล้มเหลว 65
การสร้างคำสั่งที่แม่นยำ (ป้องกันเคส) การยืนยันเสร็จสมบูรณ์

แบบจำลองจะถูกขอให้ทำซ้ำเครื่องหมายคงที่ทุกคำ โดยตรวจสอบว่าปฏิบัติตามคำแนะนำที่กำหนดไว้อย่างไร

ผ่าน 100
การทดสอบความขัดแย้งของระบบ การยืนยันเสร็จสมบูรณ์

เปรียบเทียบผู้ใช้เฉพาะกับระบบ+ผู้ใช้ที่ชัดเจน โดยตรวจสอบว่าคำที่ตายตัวถูกแทนที่โดยคำสั่งที่ซ่อนอยู่หรือไม่

ผ่าน 100
การตรวจสอบโทเค็นอินพุตที่เรียบง่าย การยืนยันเสร็จสมบูรณ์

ใช้คำขอแบบมินิมัลลิสต์เพื่อสังเกตว่า input_token สูงผิดปกติหรือไม่ และระบุการแทรกระบบโดยนัย

ล้มเหลว 40
การเปรียบเทียบชื่อเดียวกันอย่างเป็นทางการ การยืนยันเสร็จสมบูรณ์

คำถามเดียวกันจะเปรียบเทียบการบริโภคอินพุตและพฤติกรรมการตอบสนองระหว่างช่องทางกับทางการ (หรือพื้นฐาน)

ไม่สามารถใช้ได้
ซ่อนการตรวจจับการฉีด การยืนยันเสร็จสมบูรณ์

ตัวแปรแบบสุ่มตรวจสอบข้ามเพื่อตรวจสอบสัญญาณที่ผิดปกติ เช่น การรั่วไหลของ nonce การตอบกลับแบบตายตัว และการใช้แคชซ้ำที่น่าสงสัย

ผ่าน 100
การปฏิเสธความปลอดภัยและความมั่นคงของนโยบาย การยืนยันเสร็จสมบูรณ์

ตรวจสอบว่านโยบายความปลอดภัยมีเสถียรภาพหรือไม่โดยใช้สถานการณ์การปฏิเสธคำตอบและการเขียนใหม่/การเข้ารหัส/รูปแบบที่ก้าวหน้า

ล้มเหลว 50
ความสามารถในการใช้เหตุผลขั้นสุดยอด (การนับทฤษฎีจำนวน) การยืนยันเสร็จสมบูรณ์

ใช้คำถามที่ให้เหตุผลแบบกระป๋องเพื่อตรวจสอบว่าคำตอบที่ตรวจสอบได้นั้นถูกต้องหรือไม่

ผ่าน 100
ความถูกต้องของบริบทที่ยาวนาน การยืนยันเสร็จสมบูรณ์

ใช้เข็มในกองหญ้าเพื่อตรวจสอบว่าหน้าต่างบริบทได้รับเกียรติ

ผ่าน 100

จะอ่านผลลัพธ์นี้ได้อย่างไร?

Token 计费存在风险

Token 数明显异常: usage 字段、token 增量或流式/非流式统计存在明显问题,有虚报或统计错误风险。

โทเค็นแรก
1,935ms
เวลาทั้งหมด
99,636ms
ปริมาณงาน (T/S)
25.5
โทเค็นอินพุต
427,581
โทเค็นเอาท์พุต
2,541
What does each OpenAI check cover?
คำขอพื้นฐาน
ยืนยันว่าคำขอพื้นฐานสำหรับการเสร็จสิ้นการแชทสามารถกลับมาได้อย่างเสถียร
ความสม่ำเสมอของโมเดล
เปรียบเทียบฟิลด์โมเดลคำขอและโมเดลการตอบสนองเพื่อดูว่าตรงกันหรือไม่
การเรียกใช้ฟังก์ชัน
ตรวจสอบ tool_calls ชื่อฟังก์ชัน พารามิเตอร์ JSON และโครงสร้างการโทร
เอาต์พุตที่มีโครงสร้าง
ตรวจสอบว่า JSON Schema / ข้อจำกัดเอาต์พุตที่เข้มงวดมีผลบังคับใช้
ความเป็นมาตรฐานของพิธีสาร
ตรวจสอบรูปร่างของฟิลด์ เช่น ID, วัตถุ, ตัวเลือก, finish_reason, การใช้งาน ฯลฯ
ความสม่ำเสมอของการสตรีม
เปรียบเทียบข้อความและโทเค็นแบบสตรีมและไม่ใช่สตรีมเพื่อความสอดคล้องกัน
การเรียกเก็บเงินโทเค็น
ตรวจสอบความสัมพันธ์ของพรอมต์ / ความสมบูรณ์ / การวัดโทเค็นทั้งหมด
การเปรียบเทียบชื่อเดียวกันอย่างเป็นทางการ
คำถามเดียวกันจะเปรียบเทียบการบริโภคอินพุตและพฤติกรรมการตอบสนองระหว่างช่องทางกับทางการ (หรือพื้นฐาน)
การสร้างคำสั่งที่แม่นยำ (ป้องกันเคส)
แบบจำลองจะถูกขอให้ทำซ้ำเครื่องหมายคงที่ทุกคำ โดยตรวจสอบว่าปฏิบัติตามคำแนะนำที่กำหนดไว้อย่างไร
การทดสอบความขัดแย้งของระบบ
เปรียบเทียบผู้ใช้เฉพาะกับระบบ+ผู้ใช้ที่ชัดเจน โดยตรวจสอบว่าคำที่ตายตัวถูกแทนที่โดยคำสั่งที่ซ่อนอยู่หรือไม่
การตรวจสอบโทเค็นอินพุตที่เรียบง่าย
ใช้คำขอแบบมินิมัลลิสต์เพื่อสังเกตว่า input_token สูงผิดปกติหรือไม่ และระบุการแทรกระบบโดยนัย
ความสามารถในการใช้เหตุผลขั้นสุดยอด (การนับทฤษฎีจำนวน)
ใช้คำถามที่ให้เหตุผลแบบกระป๋องเพื่อตรวจสอบว่าคำตอบที่ตรวจสอบได้นั้นถูกต้องหรือไม่
ความถูกต้องของบริบทที่ยาวนาน
ใช้เข็มในกองหญ้าเพื่อตรวจสอบว่าหน้าต่างบริบทได้รับเกียรติ
ซ่อนการตรวจจับการฉีด
ตัวแปรแบบสุ่มตรวจสอบข้ามเพื่อตรวจสอบสัญญาณที่ผิดปกติ เช่น การรั่วไหลของ nonce การตอบกลับแบบตายตัว และการใช้แคชซ้ำที่น่าสงสัย
การปฏิเสธความปลอดภัยและความมั่นคงของนโยบาย
ตรวจสอบว่านโยบายความปลอดภัยมีเสถียรภาพหรือไม่โดยใช้สถานการณ์การปฏิเสธคำตอบและการเขียนใหม่/การเข้ารหัส/รูปแบบที่ก้าวหน้า

2026-09-08 · Sharing, languages, and scoring tweaks

This update improves report sharing and language switching, and lightly rebalances OpenAI / Gemini scoring emphasis.