ยืนยันว่าคำขอพื้นฐานสำหรับการเสร็จสิ้นการแชทสามารถกลับมาได้อย่างเสถียร
ผลการตรวจจับ
รุ่น: gpt-5.6-sol · โหมด full · รีเลย์ https://gw.hbapis.com/
เปรียบเทียบฟิลด์โมเดลคำขอและโมเดลการตอบสนองเพื่อดูว่าตรงกันหรือไม่
ตรวจสอบ tool_calls ชื่อฟังก์ชัน พารามิเตอร์ JSON และโครงสร้างการโทร
ตรวจสอบว่า JSON Schema / ข้อจำกัดเอาต์พุตที่เข้มงวดมีผลบังคับใช้
ตรวจสอบรูปร่างของฟิลด์ เช่น ID, วัตถุ, ตัวเลือก, finish_reason, การใช้งาน ฯลฯ
เปรียบเทียบข้อความและโทเค็นแบบสตรีมและไม่ใช่สตรีมเพื่อความสอดคล้องกัน
เหตุผล:ตรวจสอบความสัมพันธ์ของพรอมต์ / ความสมบูรณ์ / การวัดโทเค็นทั้งหมด
แบบจำลองจะถูกขอให้ทำซ้ำเครื่องหมายคงที่ทุกคำ โดยตรวจสอบว่าปฏิบัติตามคำแนะนำที่กำหนดไว้อย่างไร
เปรียบเทียบผู้ใช้เฉพาะกับระบบ+ผู้ใช้ที่ชัดเจน โดยตรวจสอบว่าคำที่ตายตัวถูกแทนที่โดยคำสั่งที่ซ่อนอยู่หรือไม่
ใช้คำขอแบบมินิมัลลิสต์เพื่อสังเกตว่า input_token สูงผิดปกติหรือไม่ และระบุการแทรกระบบโดยนัย
คำถามเดียวกันจะเปรียบเทียบการบริโภคอินพุตและพฤติกรรมการตอบสนองระหว่างช่องทางกับทางการ (หรือพื้นฐาน)
ตัวแปรแบบสุ่มตรวจสอบข้ามเพื่อตรวจสอบสัญญาณที่ผิดปกติ เช่น การรั่วไหลของ nonce การตอบกลับแบบตายตัว และการใช้แคชซ้ำที่น่าสงสัย
ตรวจสอบว่านโยบายความปลอดภัยมีเสถียรภาพหรือไม่โดยใช้สถานการณ์การปฏิเสธคำตอบและการเขียนใหม่/การเข้ารหัส/รูปแบบที่ก้าวหน้า
ใช้คำถามที่ให้เหตุผลแบบกระป๋องเพื่อตรวจสอบว่าคำตอบที่ตรวจสอบได้นั้นถูกต้องหรือไม่
ใช้เข็มในกองหญ้าเพื่อตรวจสอบว่าหน้าต่างบริบทได้รับเกียรติ
จะอ่านผลลัพธ์นี้ได้อย่างไร?
响应的 usage 字段里出现了 Anthropic / Google 后端才会用的字段(如 claude_cache_creation_*、gemini_* 或 usage_source 自报非 openai)。这强烈暗示中转站把你的请求转发给了别的厂商后端再包装成 OpenAI 响应,所谓的 GPT 输出可能并非真正的 OpenAI 模型在生成。
Token 统计有明显偏差,建议留意是否存在多算或统计错误。
What does each OpenAI check cover?
- คำขอพื้นฐาน
- ยืนยันว่าคำขอพื้นฐานสำหรับการเสร็จสิ้นการแชทสามารถกลับมาได้อย่างเสถียร
- ความสม่ำเสมอของโมเดล
- เปรียบเทียบฟิลด์โมเดลคำขอและโมเดลการตอบสนองเพื่อดูว่าตรงกันหรือไม่
- การเรียกใช้ฟังก์ชัน
- ตรวจสอบ tool_calls ชื่อฟังก์ชัน พารามิเตอร์ JSON และโครงสร้างการโทร
- เอาต์พุตที่มีโครงสร้าง
- ตรวจสอบว่า JSON Schema / ข้อจำกัดเอาต์พุตที่เข้มงวดมีผลบังคับใช้
- ความเป็นมาตรฐานของพิธีสาร
- ตรวจสอบรูปร่างของฟิลด์ เช่น ID, วัตถุ, ตัวเลือก, finish_reason, การใช้งาน ฯลฯ
- ความสม่ำเสมอของการสตรีม
- เปรียบเทียบข้อความและโทเค็นแบบสตรีมและไม่ใช่สตรีมเพื่อความสอดคล้องกัน
- การเรียกเก็บเงินโทเค็น
- ตรวจสอบความสัมพันธ์ของพรอมต์ / ความสมบูรณ์ / การวัดโทเค็นทั้งหมด
- การเปรียบเทียบชื่อเดียวกันอย่างเป็นทางการ
- คำถามเดียวกันจะเปรียบเทียบการบริโภคอินพุตและพฤติกรรมการตอบสนองระหว่างช่องทางกับทางการ (หรือพื้นฐาน)
- การสร้างคำสั่งที่แม่นยำ (ป้องกันเคส)
- แบบจำลองจะถูกขอให้ทำซ้ำเครื่องหมายคงที่ทุกคำ โดยตรวจสอบว่าปฏิบัติตามคำแนะนำที่กำหนดไว้อย่างไร
- การทดสอบความขัดแย้งของระบบ
- เปรียบเทียบผู้ใช้เฉพาะกับระบบ+ผู้ใช้ที่ชัดเจน โดยตรวจสอบว่าคำที่ตายตัวถูกแทนที่โดยคำสั่งที่ซ่อนอยู่หรือไม่
- การตรวจสอบโทเค็นอินพุตที่เรียบง่าย
- ใช้คำขอแบบมินิมัลลิสต์เพื่อสังเกตว่า input_token สูงผิดปกติหรือไม่ และระบุการแทรกระบบโดยนัย
- ความสามารถในการใช้เหตุผลขั้นสุดยอด (การนับทฤษฎีจำนวน)
- ใช้คำถามที่ให้เหตุผลแบบกระป๋องเพื่อตรวจสอบว่าคำตอบที่ตรวจสอบได้นั้นถูกต้องหรือไม่
- ความถูกต้องของบริบทที่ยาวนาน
- ใช้เข็มในกองหญ้าเพื่อตรวจสอบว่าหน้าต่างบริบทได้รับเกียรติ
- ซ่อนการตรวจจับการฉีด
- ตัวแปรแบบสุ่มตรวจสอบข้ามเพื่อตรวจสอบสัญญาณที่ผิดปกติ เช่น การรั่วไหลของ nonce การตอบกลับแบบตายตัว และการใช้แคชซ้ำที่น่าสงสัย
- การปฏิเสธความปลอดภัยและความมั่นคงของนโยบาย
- ตรวจสอบว่านโยบายความปลอดภัยมีเสถียรภาพหรือไม่โดยใช้สถานการณ์การปฏิเสธคำตอบและการเขียนใหม่/การเข้ารหัส/รูปแบบที่ก้าวหน้า