Tespit sonuçları

Model: gpt-5.5 · mod standard · röle https://test.apiqik-kratos.apiqik.com/

Toplam puan
Her öğe başarılı / başarısız / hatadır; toplam, ağırlıklı bir sonuçtur ve ikisinin arasında olabilir.
100 / 100
Temel istek Doğrulama tamamlandı

Sohbet Tamamlama temel isteklerinin istikrarlı bir şekilde geri dönebildiğini doğrulayın.

Geçmek 100
model tutarlılığı Doğrulama tamamlandı

Eşleşip eşleşmediklerini görmek için istek modeli ve yanıt modeli alanlarını karşılaştırın.

Geçmek 100
işlev çağrısı Doğrulama tamamlandı

tool_calls'ı, işlev adını, JSON parametresini ve çağrı yapısını kontrol edin.

Geçmek 100
Yapılandırılmış çıktı Doğrulama tamamlandı

JSON Şeması/katı çıktı kısıtlamalarının etkin olduğunu doğrulayın.

Geçmek 100
Protokol normatifliği Doğrulama tamamlandı

Kimlik, nesne, seçimler, bitiş_nedeni, kullanım vb. alanların şeklini doğrulayın.

Geçmek 100
akış tutarlılığı Doğrulama tamamlandı

Tutarlılık için akışlı ve akışsız metin ve belirteç kullanımını karşılaştırın.

Geçmek 100
Jeton faturalandırma Doğrulama tamamlandı

İstem/tamamlama/toplam belirteç ölçümü ilişkisini kontrol edin.

Geçmek 100
Doğru komut çoğaltımı (karşı koruma) Doğrulama tamamlandı

Talimatların ne kadar belirleyici bir şekilde takip edildiğini kontrol ederek modelden sabit bir işareti kelimesi kelimesine yeniden üretmesi istenir.

Geçmek 100
Sistem çakışması testi Doğrulama tamamlandı

Sabit sözcüklerin gizli yönergeler tarafından geçersiz kılınıp kılınmadığını kontrol ederek kullanıcıyı yalnızca açık sistem+kullanıcıyla karşılaştırın.

Geçmek 100
Minimalist Giriş Jetonu Denetimi Doğrulama tamamlandı

input_tokens'ın anormal derecede yüksek olup olmadığını gözlemlemek ve örtülü Sistem enjeksiyonunu tanımlamak için minimalist istekleri kullanın.

Geçmek 100
Aynı başlığın resmi karşılaştırması Doğrulama tamamlandı

Aynı soru, kanallar ile resmi (veya temel) arasındaki girdi tüketimini ve yanıt davranışını karşılaştırır.

Geçerli değil
Enjeksiyon algılamayı gizle Doğrulama tamamlandı

Rastgeleleştirilmiş değişkenler, tek seferlik sızıntılar, sabit yanıtlar ve şüpheli önbellek yeniden kullanımı gibi anormal sinyalleri çapraz kontrol eder.

Geçmek 100
Güvenlik reddi ve politika istikrarı Doğrulama tamamlandı

Yanıt reddi senaryolarını ve yeniden yazma/kodlama/aşamalı değişkenleri kullanarak güvenlik politikasının istikrarlı olup olmadığını kontrol edin.

başarısız oldu 50
Aşırı muhakeme yeteneği (sayı teorisi sayma) Doğrulama tamamlandı

Doğrulanabilir yanıtların doğru olup olmadığını kontrol etmek için hazır akıl yürütme sorularını kullanın.

Geçmek 100
İlk jeton
2,319ms
Toplam süre
55,748ms
Verim (T/S)
43.1
Giriş jetonları
1,333
Çıkış jetonları
2,401
What does each OpenAI check cover?
Temel istek
Sohbet Tamamlama temel isteklerinin istikrarlı bir şekilde geri dönebildiğini doğrulayın.
model tutarlılığı
Eşleşip eşleşmediklerini görmek için istek modeli ve yanıt modeli alanlarını karşılaştırın.
işlev çağrısı
tool_calls'ı, işlev adını, JSON parametresini ve çağrı yapısını kontrol edin.
Yapılandırılmış çıktı
JSON Şeması/katı çıktı kısıtlamalarının etkin olduğunu doğrulayın.
Protokol normatifliği
Kimlik, nesne, seçimler, bitiş_nedeni, kullanım vb. alanların şeklini doğrulayın.
akış tutarlılığı
Tutarlılık için akışlı ve akışsız metin ve belirteç kullanımını karşılaştırın.
Jeton faturalandırma
İstem/tamamlama/toplam belirteç ölçümü ilişkisini kontrol edin.
Aynı başlığın resmi karşılaştırması
Aynı soru, kanallar ile resmi (veya temel) arasındaki girdi tüketimini ve yanıt davranışını karşılaştırır.
Doğru komut çoğaltımı (karşı koruma)
Talimatların ne kadar belirleyici bir şekilde takip edildiğini kontrol ederek modelden sabit bir işareti kelimesi kelimesine yeniden üretmesi istenir.
Sistem çakışması testi
Sabit sözcüklerin gizli yönergeler tarafından geçersiz kılınıp kılınmadığını kontrol ederek kullanıcıyı yalnızca açık sistem+kullanıcıyla karşılaştırın.
Minimalist Giriş Jetonu Denetimi
input_tokens'ın anormal derecede yüksek olup olmadığını gözlemlemek ve örtülü Sistem enjeksiyonunu tanımlamak için minimalist istekleri kullanın.
Aşırı muhakeme yeteneği (sayı teorisi sayma)
Doğrulanabilir yanıtların doğru olup olmadığını kontrol etmek için hazır akıl yürütme sorularını kullanın.
uzun bağlam özgünlüğü
Bağlam penceresinin dikkate alındığını doğrulamak için samanlıktaki iğneyi kullanın.
Enjeksiyon algılamayı gizle
Rastgeleleştirilmiş değişkenler, tek seferlik sızıntılar, sabit yanıtlar ve şüpheli önbellek yeniden kullanımı gibi anormal sinyalleri çapraz kontrol eder.
Güvenlik reddi ve politika istikrarı
Yanıt reddi senaryolarını ve yeniden yazma/kodlama/aşamalı değişkenleri kullanarak güvenlik politikasının istikrarlı olup olmadığını kontrol edin.

2026-09-08 · Sharing, languages, and scoring tweaks

This update improves report sharing and language switching, and lightly rebalances OpenAI / Gemini scoring emphasis.