Результаты обнаружения

Модель: gpt-5.5 · режим full · реле https://test.apiqik-kratos.dimleap.cn

Общий балл
Каждый пункт соответствует критериям «пройдено/не пройдено/ошибка»; общая сумма является взвешенным результатом и может находиться между ними.
92 / 100
Основной запрос Проверка завершена

Убедитесь, что основные запросы завершения чата могут стабильно возвращаться.

Пройти 100
согласованность модели Проверка завершена

Сравните поля модели запроса и модели ответа, чтобы увидеть, совпадают ли они.

Пройти 100
вызов функции Проверка завершена

Проверьтеtool_calls, имя функции, параметр JSON и структуру вызова.

Пройти 100
Структурированный вывод Проверка завершена

Убедитесь, что действуют JSON-схема/строгие ограничения вывода.

Пройти 100
Нормативность протокола Проверка завершена

Проверьте форму таких полей, как идентификатор, объект, выбор, Finish_reason, использование и т. д.

не удалось 65
согласованность потоковой передачи Проверка завершена

Сравните потоковые и непоточные текстовые сообщения и использование токенов на предмет единообразия.

Пройти 100
Биллинг токенов Проверка завершена

Проверьте взаимосвязь между запросом/завершением/общим счетчиком токенов.

не удалось 65
Точное воспроизведение команд (антикорпус) Проверка завершена

Модель просят дословно воспроизвести фиксированную отметку, проверяя, насколько детерминированно выполняются инструкции.

Пройти 100
Тестирование системных конфликтов Проверка завершена

Сравнивайте user only с явным system+user, проверяя, не переопределяются ли фиксированные слова скрытыми директивами.

Пройти 100
Минималистичный аудит входных токенов Проверка завершена

Используйте минималистские запросы, чтобы определить, является ли входной_токен аномально высоким, и выявить неявное внедрение системы.

не удалось 40
Официальное сравнение одного и того же названия Проверка завершена

В том же вопросе сравнивается потребление ресурсов и поведение реакции между каналами и официальным (или базовым уровнем).

Не применимо
Скрыть обнаружение инъекции Проверка завершена

Случайные варианты перепроверяются на наличие аномальных сигналов, таких как утечки nonce, фиксированные ответы и подозрительное повторное использование кэша.

Пройти 100
Отказ от безопасности и стабильность политики Проверка завершена

Проверьте, стабильна ли политика безопасности, используя сценарии отказа в ответе и варианты перезаписи/кодирования/прогрессивных вариантов.

не удалось 50
Чрезвычайные способности к рассуждению (счет по теории чисел) Проверка завершена

Используйте готовые аргументирующие вопросы, чтобы проверить, верны ли проверяемые ответы.

Пройти 100
подлинность длинного контекста Проверка завершена

Используйте иголку в стоге сена, чтобы убедиться, что контекстное окно учитывается.

Пройти 100

Как прочитать этот результат?

Token 计费存在风险

Token 数明显异常: usage 字段、token 增量或流式/非流式统计存在明显问题,有虚报或统计错误风险。

Первый токен
1,935ms
Общее время
99,636ms
Пропускная способность (Т/С)
25.5
Входные токены
427,581
Выходные токены
2,541
What does each OpenAI check cover?
Основной запрос
Убедитесь, что основные запросы завершения чата могут стабильно возвращаться.
согласованность модели
Сравните поля модели запроса и модели ответа, чтобы увидеть, совпадают ли они.
вызов функции
Проверьтеtool_calls, имя функции, параметр JSON и структуру вызова.
Структурированный вывод
Убедитесь, что действуют JSON-схема/строгие ограничения вывода.
Нормативность протокола
Проверьте форму таких полей, как идентификатор, объект, выбор, Finish_reason, использование и т. д.
согласованность потоковой передачи
Сравните потоковые и непоточные текстовые сообщения и использование токенов на предмет единообразия.
Биллинг токенов
Проверьте взаимосвязь между запросом/завершением/общим счетчиком токенов.
Официальное сравнение одного и того же названия
В том же вопросе сравнивается потребление ресурсов и поведение реакции между каналами и официальным (или базовым уровнем).
Точное воспроизведение команд (антикорпус)
Модель просят дословно воспроизвести фиксированную отметку, проверяя, насколько детерминированно выполняются инструкции.
Тестирование системных конфликтов
Сравнивайте user only с явным system+user, проверяя, не переопределяются ли фиксированные слова скрытыми директивами.
Минималистичный аудит входных токенов
Используйте минималистские запросы, чтобы определить, является ли входной_токен аномально высоким, и выявить неявное внедрение системы.
Чрезвычайные способности к рассуждению (счет по теории чисел)
Используйте готовые аргументирующие вопросы, чтобы проверить, верны ли проверяемые ответы.
подлинность длинного контекста
Используйте иголку в стоге сена, чтобы убедиться, что контекстное окно учитывается.
Скрыть обнаружение инъекции
Случайные варианты перепроверяются на наличие аномальных сигналов, таких как утечки nonce, фиксированные ответы и подозрительное повторное использование кэша.
Отказ от безопасности и стабильность политики
Проверьте, стабильна ли политика безопасности, используя сценарии отказа в ответе и варианты перезаписи/кодирования/прогрессивных вариантов.

2026-09-08 · Sharing, languages, and scoring tweaks

This update improves report sharing and language switching, and lightly rebalances OpenAI / Gemini scoring emphasis.