AI API リレー リーダーボード
pangolin はパブリック コミュニティの検出を集計し、ベイジアン加重スコアによってリレーをランク付けします (より多くのテスト + より安定したスコア → より高いランク)。 7 リレーにわたる 28 公開レポートに基づいています (6 2 つ以上のテストでメインボードの資格が得られます)。
🏆メインボードトップ 7
ベイジアン加重スコアで並べ替え - テストが多いほどスコアの信頼性が高くなります
1
94
中央値
2
test.apiqik-kratos.dimleap.cn
よくある問題: 極めて高い推論能力(整数論的計算)、 ミニマリスト入力トークン監査、 トークンの課金
97
中央値
3
96
中央値
4
75
中央値
5
69
中央値
6
27
中央値
7
83
中央値
ボードはどのように採点されますか? クリックしてルールを展開します
各公開 /r/{job_id} レポートは、base_url domain ごとにグループ化されてこの掲示板にフィードされます。ランキングでは Bayesian-weighted score (prior=50、prior_weight=5) を使用します。1 回限りのパーフェクト 100 はランク ~58.3 のみです。メインボードに上がるには、ほぼ完璧に近い安定したランを 10 回以上必要とします。これにより、幸運な 1 回のランで新しいリレーがチャートのトップに立つことができなくなりました。 UI の「中央値」は、過去のスコアの中央値です (直感的に)。並べ替え順序にはベイジアン重みが使用されます。
シングルサンプル リレーはメイン ボード (ノイズ制御) から外れていますが、完全なリストの最後に表示されます。