AI API リレー リーダーボード

pangolin はパブリック コミュニティの検出を集計し、ベイジアン加重スコアによってリレーをランク付けします (より多くのテスト + より安定したスコア → より高いランク)。 7 リレーにわたる 28 公開レポートに基づいています (6 2 つ以上のテストでメインボードの資格が得られます)。 10分ごとに更新される · リレーをテストしたいですか? 家に帰ります

🏆メインボードトップ 7

ベイジアン加重スコアで並べ替え - テストが多いほどスコアの信頼性が高くなります

3
3

unirouters.cc

2 検出 · Claude · 最後 2026-09-15 · 全履歴 →

よくある問題: 極めて高い推論能力(整数論的計算)Claude トークナイザーの検証

96 中央値
7

gw.hbapis.com

1 検出 · OpenAI · 最後 2026-09-17 · 単一サンプル — 参照のみ · 全履歴 →

よくある問題: 長いコンテキストの信頼性メッセージ構造の仕様

83 中央値
ボードはどのように採点されますか? クリックしてルールを展開します

各公開 /r/{job_id} レポートは、base_url domain ごとにグループ化されてこの掲示板にフィードされます。ランキングでは Bayesian-weighted score (prior=50、prior_weight=5) を使用します。1 回限りのパーフェクト 100 はランク ~58.3 のみです。メインボードに上がるには、ほぼ完璧に近い安定したランを 10 回以上必要とします。これにより、幸運な 1 回のランで新しいリレーがチャートのトップに立つことができなくなりました。 UI の「中央値」は、過去のスコアの中央値です (直感的に)。並べ替え順序にはベイジアン重みが使用されます。

シングルサンプル リレーはメイン ボード (ノイズ制御) から外れていますが、完全なリストの最後に表示されます。

2026-09-08 · Sharing, languages, and scoring tweaks

This update improves report sharing and language switching, and lightly rebalances OpenAI / Gemini scoring emphasis.