نتائج الكشف

الموديل: gpt-5.6-sol · الوضع full · التتابع https://gw.hbapis.com/

مجموع الدرجات
كل عنصر هو تمرير / فشل / خطأ؛ المجموع هو نتيجة مرجحة وقد يكون بينهما.
83 / 100
الطلب الأساسي اكتمل التحقق

تأكد من أن الطلبات الأساسية لإتمامات الدردشة يمكن أن تعود بشكل ثابت.

تمرير 100
اتساق النموذج اكتمل التحقق

قارن بين حقلي نموذج الطلب ونموذج الاستجابة لمعرفة ما إذا كانا متطابقين.

تمرير 100
استدعاء وظيفة اكتمل التحقق

تحقق من مكالمات_الأداة واسم الوظيفة والمعلمة JSON وبنية الاتصال.

تمرير 100
إخراج منظم اكتمل التحقق

تحقق من أن مخطط JSON / قيود الإخراج الصارمة سارية المفعول.

تمرير 100
معيارية البروتوكول اكتمل التحقق

تحقق من شكل الحقول مثل المعرف والكائن والاختيارات وسبب_الإنهاء والاستخدام وما إلى ذلك.

فشل 60
اتساق التدفق اكتمل التحقق

قارن بين النص المتدفق وغير المتدفق واستخدام الرمز المميز لتحقيق الاتساق.

تمرير 100
الفواتير الرمزية التحقق من الاستثناء

السبب:تحقق من علاقة قياس الرمز المميز الفوري/الإكمال/الإجمالي.

التحقق من الاستثناء 0
استنساخ دقيق للأوامر (مضاد للغلاف) اكتمل التحقق

يُطلب من النموذج إعادة إنتاج علامة ثابتة حرفيًا، والتحقق من مدى حتمية اتباع التعليمات.

تمرير 100
اختبار تعارض النظام اكتمل التحقق

قارن المستخدم فقط بمستخدم النظام + المستخدم الصريح، وتحقق مما إذا كانت الكلمات الثابتة قد تم تجاوزها بواسطة التوجيهات المخفية.

تمرير 100
الحد الأدنى من تدقيق رمز الإدخال اكتمل التحقق

استخدم الطلبات البسيطة لملاحظة ما إذا كانت رموز الإدخال مرتفعة بشكل غير طبيعي وتحديد حقن النظام الضمني.

تمرير 100
المقارنة الرسمية التي تحمل نفس العنوان اكتمل التحقق

يقارن نفس السؤال استهلاك المدخلات وسلوك الاستجابة بين القنوات والمسؤول (أو خط الأساس).

لا ينطبق
إخفاء كشف الحقن اكتمل التحقق

تقوم المتغيرات العشوائية بالتحقق من وجود إشارات غير طبيعية مثل التسريبات غير المتوقعة، والردود الثابتة، وإعادة استخدام ذاكرة التخزين المؤقت المشبوهة.

تمرير 100
الرفض الأمني واستقرار السياسة اكتمل التحقق

تحقق مما إذا كانت سياسة الأمان مستقرة باستخدام سيناريوهات رفض الإجابة وإعادة الكتابة/التشفير/المتغيرات التقدمية.

فشل 50
القدرة على الاستدلال الشديد (العد النظري للأعداد) اكتمل التحقق

استخدم الأسئلة المنطقية الجاهزة للتحقق من صحة الإجابات التي يمكن التحقق منها.

تمرير 100
أصالة السياق الطويل اكتمل التحقق

استخدم إبرة في كومة قش للتحقق من احترام نافذة السياق.

فشل 67

كيف تقرأ هذه النتيجة؟

中转站疑似伪装成 OpenAI

响应的 usage 字段里出现了 Anthropic / Google 后端才会用的字段(如 claude_cache_creation_*、gemini_* 或 usage_source 自报非 openai)。这强烈暗示中转站把你的请求转发给了别的厂商后端再包装成 OpenAI 响应,所谓的 GPT 输出可能并非真正的 OpenAI 模型在生成。

Token 计费存在风险

Token 统计有明显偏差,建议留意是否存在多算或统计错误。

الرمز الأول
1,606ms
الوقت الإجمالي
100,741ms
الإنتاجية (T/S)
14.7
رموز الإدخال
165,085
رموز الإخراج
1,480
What does each OpenAI check cover?
الطلب الأساسي
تأكد من أن الطلبات الأساسية لإتمامات الدردشة يمكن أن تعود بشكل ثابت.
اتساق النموذج
قارن بين حقلي نموذج الطلب ونموذج الاستجابة لمعرفة ما إذا كانا متطابقين.
استدعاء وظيفة
تحقق من مكالمات_الأداة واسم الوظيفة والمعلمة JSON وبنية الاتصال.
إخراج منظم
تحقق من أن مخطط JSON / قيود الإخراج الصارمة سارية المفعول.
معيارية البروتوكول
تحقق من شكل الحقول مثل المعرف والكائن والاختيارات وسبب_الإنهاء والاستخدام وما إلى ذلك.
اتساق التدفق
قارن بين النص المتدفق وغير المتدفق واستخدام الرمز المميز لتحقيق الاتساق.
الفواتير الرمزية
تحقق من علاقة قياس الرمز المميز الفوري/الإكمال/الإجمالي.
المقارنة الرسمية التي تحمل نفس العنوان
يقارن نفس السؤال استهلاك المدخلات وسلوك الاستجابة بين القنوات والمسؤول (أو خط الأساس).
استنساخ دقيق للأوامر (مضاد للغلاف)
يُطلب من النموذج إعادة إنتاج علامة ثابتة حرفيًا، والتحقق من مدى حتمية اتباع التعليمات.
اختبار تعارض النظام
قارن المستخدم فقط بمستخدم النظام + المستخدم الصريح، وتحقق مما إذا كانت الكلمات الثابتة قد تم تجاوزها بواسطة التوجيهات المخفية.
الحد الأدنى من تدقيق رمز الإدخال
استخدم الطلبات البسيطة لملاحظة ما إذا كانت رموز الإدخال مرتفعة بشكل غير طبيعي وتحديد حقن النظام الضمني.
القدرة على الاستدلال الشديد (العد النظري للأعداد)
استخدم الأسئلة المنطقية الجاهزة للتحقق من صحة الإجابات التي يمكن التحقق منها.
أصالة السياق الطويل
استخدم إبرة في كومة قش للتحقق من احترام نافذة السياق.
إخفاء كشف الحقن
تقوم المتغيرات العشوائية بالتحقق من وجود إشارات غير طبيعية مثل التسريبات غير المتوقعة، والردود الثابتة، وإعادة استخدام ذاكرة التخزين المؤقت المشبوهة.
الرفض الأمني واستقرار السياسة
تحقق مما إذا كانت سياسة الأمان مستقرة باستخدام سيناريوهات رفض الإجابة وإعادة الكتابة/التشفير/المتغيرات التقدمية.

2026-09-08 · Sharing, languages, and scoring tweaks

This update improves report sharing and language switching, and lightly rebalances OpenAI / Gemini scoring emphasis.