Kết quả phát hiện

Model: gpt-5.5 · chế độ full · rơle https://test.apiqik-kratos.dimleap.cn

Tổng số điểm
Mỗi mục đều đạt/không đạt/lỗi; tổng số là kết quả có trọng số và có thể ở giữa.
92 / 100
Yêu cầu cơ bản Đã hoàn tất xác minh

Xác nhận rằng các yêu cầu cơ bản của tính năng Hoàn thành cuộc trò chuyện có thể quay trở lại ổn định.

Vượt qua 100
tính nhất quán của mô hình Đã hoàn tất xác minh

So sánh các trường mô hình yêu cầu và mô hình phản hồi để xem chúng có khớp không.

Vượt qua 100
gọi hàm Đã hoàn tất xác minh

Kiểm tra tool_calls, tên hàm, tham số JSON và cấu trúc lệnh gọi.

Vượt qua 100
Đầu ra có cấu trúc Đã hoàn tất xác minh

Xác minh rằng Lược đồ JSON/các ràng buộc đầu ra nghiêm ngặt có hiệu lực.

Vượt qua 100
Tính quy chuẩn của giao thức Đã hoàn tất xác minh

Xác minh hình dạng của các trường như id, đối tượng, lựa chọn, finish_reason, cách sử dụng, v.v.

thất bại 65
tính nhất quán phát trực tuyến Đã hoàn tất xác minh

So sánh việc sử dụng mã thông báo và văn bản trong luồng và không phải luồng để đảm bảo tính nhất quán.

Vượt qua 100
Thanh toán mã thông báo Đã hoàn tất xác minh

Kiểm tra mối quan hệ đo lường lời nhắc/hoàn thành/tổng số mã thông báo.

thất bại 65
Tái tạo lệnh chính xác (chống vỏ) Đã hoàn tất xác minh

Mô hình được yêu cầu tái tạo nguyên văn một dấu cố định, kiểm tra mức độ tuân theo các hướng dẫn xác định.

Vượt qua 100
Kiểm tra xung đột hệ thống Đã hoàn tất xác minh

Chỉ so sánh người dùng với hệ thống + người dùng rõ ràng, kiểm tra xem các từ cố định có bị ghi đè bởi các lệnh ẩn hay không.

Vượt qua 100
Kiểm tra mã thông báo đầu vào tối giản Đã hoàn tất xác minh

Sử dụng các yêu cầu tối giản để quan sát xem liệu input_tokens có cao bất thường hay không và xác định việc tiêm Hệ thống tiềm ẩn.

thất bại 40
So sánh chính thức của cùng một tiêu đề Đã hoàn tất xác minh

Câu hỏi tương tự so sánh mức tiêu thụ đầu vào và hành vi phản hồi giữa các kênh và kênh chính thức (hoặc đường cơ sở).

Không áp dụng
Ẩn phát hiện tiêm Đã hoàn tất xác minh

Các biến thể ngẫu nhiên kiểm tra chéo các tín hiệu bất thường như rò rỉ không liên tục, phản hồi cố định và sử dụng lại bộ đệm đáng ngờ.

Vượt qua 100
Từ chối bảo mật và ổn định chính sách Đã hoàn tất xác minh

Kiểm tra xem chính sách bảo mật có ổn định hay không bằng cách sử dụng các kịch bản từ chối trả lời và viết lại/mã hóa/các biến thể lũy tiến.

thất bại 50
Khả năng suy luận cực cao (đếm lý thuyết số) Đã hoàn tất xác minh

Sử dụng các câu hỏi lý luận soạn sẵn để kiểm tra xem các câu trả lời có thể kiểm chứng được có đúng hay không.

Vượt qua 100
tính xác thực của bối cảnh dài Đã hoàn tất xác minh

Sử dụng kim trong haystack để xác minh rằng cửa sổ ngữ cảnh được tôn trọng.

Vượt qua 100

Làm thế nào để đọc kết quả này?

Token 计费存在风险

Token 数明显异常: usage 字段、token 增量或流式/非流式统计存在明显问题,有虚报或统计错误风险。

Mã thông báo đầu tiên
1,935ms
Tổng thời gian
99,636ms
Thông lượng (T/S)
25.5
Mã thông báo đầu vào
427,581
Mã thông báo đầu ra
2,541
What does each OpenAI check cover?
Yêu cầu cơ bản
Xác nhận rằng các yêu cầu cơ bản của tính năng Hoàn thành cuộc trò chuyện có thể quay trở lại ổn định.
tính nhất quán của mô hình
So sánh các trường mô hình yêu cầu và mô hình phản hồi để xem chúng có khớp không.
gọi hàm
Kiểm tra tool_calls, tên hàm, tham số JSON và cấu trúc lệnh gọi.
Đầu ra có cấu trúc
Xác minh rằng Lược đồ JSON/các ràng buộc đầu ra nghiêm ngặt có hiệu lực.
Tính quy chuẩn của giao thức
Xác minh hình dạng của các trường như id, đối tượng, lựa chọn, finish_reason, cách sử dụng, v.v.
tính nhất quán phát trực tuyến
So sánh việc sử dụng mã thông báo và văn bản trong luồng và không phải luồng để đảm bảo tính nhất quán.
Thanh toán mã thông báo
Kiểm tra mối quan hệ đo lường lời nhắc/hoàn thành/tổng số mã thông báo.
So sánh chính thức của cùng một tiêu đề
Câu hỏi tương tự so sánh mức tiêu thụ đầu vào và hành vi phản hồi giữa các kênh và kênh chính thức (hoặc đường cơ sở).
Tái tạo lệnh chính xác (chống vỏ)
Mô hình được yêu cầu tái tạo nguyên văn một dấu cố định, kiểm tra mức độ tuân theo các hướng dẫn xác định.
Kiểm tra xung đột hệ thống
Chỉ so sánh người dùng với hệ thống + người dùng rõ ràng, kiểm tra xem các từ cố định có bị ghi đè bởi các lệnh ẩn hay không.
Kiểm tra mã thông báo đầu vào tối giản
Sử dụng các yêu cầu tối giản để quan sát xem liệu input_tokens có cao bất thường hay không và xác định việc tiêm Hệ thống tiềm ẩn.
Khả năng suy luận cực cao (đếm lý thuyết số)
Sử dụng các câu hỏi lý luận soạn sẵn để kiểm tra xem các câu trả lời có thể kiểm chứng được có đúng hay không.
tính xác thực của bối cảnh dài
Sử dụng kim trong haystack để xác minh rằng cửa sổ ngữ cảnh được tôn trọng.
Ẩn phát hiện tiêm
Các biến thể ngẫu nhiên kiểm tra chéo các tín hiệu bất thường như rò rỉ không liên tục, phản hồi cố định và sử dụng lại bộ đệm đáng ngờ.
Từ chối bảo mật và ổn định chính sách
Kiểm tra xem chính sách bảo mật có ổn định hay không bằng cách sử dụng các kịch bản từ chối trả lời và viết lại/mã hóa/các biến thể lũy tiến.

2026-09-08 · Sharing, languages, and scoring tweaks

This update improves report sharing and language switching, and lightly rebalances OpenAI / Gemini scoring emphasis.