Результаты обнаружения

Модель: claude-haiku-4-5-20251001-thinking · режим full · реле https://test.apiqik-kratos.apiqik.com

Общий балл
Каждый пункт соответствует критериям «пройдено/не пройдено/ошибка»; общая сумма является взвешенным результатом и может находиться между ними.
71 / 100
Аутентификация модели Проверка завершена

Изучите самооценку модели, остатки бренда и общие признаки камуфляжа.

Пройти 100
Думайте о поддержке Проверка завершена

Убедитесь, что эксклюзивные поля на стороне сервера, такие как Claude мышление/подпись, передаются прозрачно.

не удалось 0
Точное воспроизведение команд (антикорпус) Проверка завершена

Модель просят дословно воспроизвести фиксированную отметку, проверяя, насколько детерминированно выполняются инструкции.

Пройти 100
Тестирование системных конфликтов Проверка завершена

Сравнивайте user only с явным system+user, проверяя, не переопределяются ли фиксированные слова скрытыми директивами.

Пройти 100
Чрезвычайные способности к рассуждению (счет по теории чисел) Проверка завершена

Используйте готовые аргументирующие вопросы, чтобы проверить, верны ли проверяемые ответы.

Пройти 100
Обнаружение канала Проверка завершена

Размещенный канал:Anthropic

Пройти 100
Claude Проверка токенайзера Проверка завершена

Модель:— · Наблюдаемые токены:None · Ожидаемые токены:None · Матч:unknown

Не применимо
Минималистичный аудит входных токенов Проверка завершена

Используйте минималистские запросы, чтобы определить, является ли входной_токен аномально высоким, и выявить неявное внедрение системы.

Пройти 100
постоянство стиля поведения Проверка завершена

Сравните характеристики серии Claude через поведенческие предпочтения и модели ответов.

Пройти 100
точность знаний Проверка завершена

Используйте вопросы общего характера Anthropic/Claude, чтобы перекрестно проверить, соответствует ли бэкэнд заявленному значению Claude.

Пройти 100
Согласованность объявления модели Проверка завершена

Сравнение модели запроса, модели ответа и стабильности личности в нескольких раундах возврата.

не удалось 60
Спецификация структуры сообщения Проверка завершена

Проверьте идентификаторы сообщений, последовательности событий SSE и блоки контента на соответствие спецификациям Anthropic.

Пройти 100
Использование инструмента/структурированный результат Проверка завершена

Проверьте, стандартизированы ли блокtool_use, идентификаторtoolu_, имя функции и схема параметров.

Пройти 100
согласованность потоковой передачи Проверка завершена

Сравните потоковый и непоточный текст, токен и конечную причину согласованности.

не удалось 60
Согласованность использования токенов Проверка завершена

Убедитесь, что поля токена ввода/вывода/кэша заполнены и аутентичны.

не удалось 70
Официальное сравнение одного и того же названия Проверка завершена

В том же вопросе сравнивается потребление ресурсов и поведение реакции между каналами и официальным (или базовым уровнем).

Не применимо
Скрыть обнаружение инъекции Проверка завершена

Случайные варианты перепроверяются на наличие аномальных сигналов, таких как утечки nonce, фиксированные ответы и подозрительное повторное использование кэша.

Пройти 100
Отказ от безопасности и стабильность политики Проверка завершена

Проверьте, стабильна ли политика безопасности, используя сценарии отказа в ответе и варианты перезаписи/кодирования/прогрессивных вариантов.

не удалось 50
подлинность длинного контекста Проверка завершена

Используйте иглу в стоге сена, чтобы убедиться, что длинные контекстные окна соблюдаются.

Не применимо
Распознавание мультимодальных/PDF Проверка завершена

Отправьте проверку PDF, чтобы убедиться, что ссылка на понимание документа не была удалена станцией передачи.

Пройти 100

Как прочитать этот результат?

Token 用量存在风险

Token 用量存在风险: usage 字段缺失、长短 prompt 增量异常、输出 token 超出请求上限,或 stream 与 non-stream token 统计不一致。

Первый токен
1,502ms
Общее время
64,923ms
Пропускная способность (Т/С)
123.8
Входные токены
5,658
Выходные токены
8,039
What does each Claude check cover?
Аутентификация модели
Изучите самооценку модели, остатки бренда и общие признаки камуфляжа.
Думайте о поддержке ⭐
Убедитесь, что эксклюзивные поля на стороне сервера, такие как Claude мышление/подпись, передаются прозрачно.
Точное воспроизведение команд (антикорпус)
Модель просят дословно воспроизвести фиксированную отметку, проверяя, насколько детерминированно выполняются инструкции.
Тестирование системных конфликтов
Сравнивайте user only с явным system+user, проверяя, не переопределяются ли фиксированные слова скрытыми директивами.
Минималистичный аудит входных токенов
Используйте минималистские запросы, чтобы определить, является ли входной_токен аномально высоким, и выявить неявное внедрение системы.
Чрезвычайные способности к рассуждению (счет по теории чисел)
Используйте готовые аргументирующие вопросы, чтобы проверить, верны ли проверяемые ответы.
Обнаружение канала
Идентифицирует канал хостинга по префиксу идентификатора ответа.
Claude Проверка токенайзера
Подсчитайте input_tokens с фиксированными подсказками по сравнению с калиброванной базовой линией модели.
постоянство стиля поведения
Сравните характеристики серии Claude через поведенческие предпочтения и модели ответов.
точность знаний
Используйте вопросы общего характера Anthropic/Claude, чтобы перекрестно проверить, соответствует ли бэкэнд заявленному значению Claude.
Согласованность объявления модели
Сравнение модели запроса, модели ответа и стабильности личности в нескольких раундах возврата.
Спецификация структуры сообщения
Проверьте идентификаторы сообщений, последовательности событий SSE и блоки контента на соответствие спецификациям Anthropic.
Использование инструмента/структурированный результат
Проверьте, стандартизированы ли блокtool_use, идентификаторtoolu_, имя функции и схема параметров.
согласованность потоковой передачи
Сравните потоковый и непоточный текст, токен и конечную причину согласованности.
Согласованность использования токенов
Убедитесь, что поля токена ввода/вывода/кэша заполнены и аутентичны.
Официальное сравнение одного и того же названия
В том же вопросе сравнивается потребление ресурсов и поведение реакции между каналами и официальным (или базовым уровнем).
подлинность длинного контекста
Используйте иглу в стоге сена, чтобы убедиться, что длинные контекстные окна соблюдаются.
Распознавание мультимодальных/PDF
Отправьте проверку PDF, чтобы убедиться, что ссылка на понимание документа не была удалена станцией передачи.
Скрыть обнаружение инъекции
Случайные варианты перепроверяются на наличие аномальных сигналов, таких как утечки nonce, фиксированные ответы и подозрительное повторное использование кэша.
Отказ от безопасности и стабильность политики
Проверьте, стабильна ли политика безопасности, используя сценарии отказа в ответе и варианты перезаписи/кодирования/прогрессивных вариантов.

2026-09-08 · Sharing, languages, and scoring tweaks

This update improves report sharing and language switching, and lightly rebalances OpenAI / Gemini scoring emphasis.