AI API 릴레이 리더보드
pangolin은 공개 커뮤니티 탐지를 집계하고 베이지안 가중치 점수(더 많은 테스트 + 안정적인 점수 → 더 높은 순위)를 기준으로 릴레이 순위를 지정합니다. 7 릴레이에 대한 28 공개 보고서를 기반으로 합니다(6 2개 이상의 테스트가 메인 보드에 적합함).
🏆 메인보드 상단 7
베이지안 가중치 점수로 정렬 - 테스트가 많을수록 점수의 신뢰성이 높아집니다.
1
94
중앙값
2
test.apiqik-kratos.dimleap.cn
일반적인 문제: 극한의 추론 능력(정수론 계산)、 미니멀리스트 입력 토큰 감사、 토큰 빌링
97
중앙값
3
96
중앙값
4
75
중앙값
5
69
중앙값
6
27
중앙값
7
83
중앙값
보드의 점수는 어떻게 매겨지나요? 규칙을 확장하려면 클릭하세요.
각 공개 /r/{job_id} 보고서는 base_url domain로 그룹화되어 이 보드에 피드를 제공합니다. 순위는 Bayesian-weighted score(사전=50, 사전_가중치=5)를 사용합니다. 일회성 완벽한 100은 ~58.3 순위에 불과합니다. 메인 보드에 오르려면 완벽에 가까운 꾸준한 실행이 ≥10번 필요합니다. 이는 행운의 단일 실행 후 새로운 릴레이가 차트 1위를 차지하는 것을 막습니다. UI "중앙값"은 과거 점수의 중앙값입니다(직관의 경우). 정렬 순서는 베이지안 가중치를 사용합니다.
단일 샘플 릴레이는 메인 보드에서 떨어져 있지만(소음 제어) 전체 목록의 맨 아래에 계속 나타납니다.