test.apiqik-kratos.apiqik.com
Problemas comunes: Capacidad de razonamiento extrema (conteo de teoría de números)、 Piensa en apoyo
pangolin agrega detecciones de comunidades públicas y clasifica los relevos según la puntuación ponderada bayesiana (más pruebas + puntuaciones más estables → clasificación más alta). Basado en 28 informes públicos en 7 relés (6 con ≥2 pruebas califican para la placa principal).
Ordenado por puntuación ponderada bayesiana: más pruebas hacen que la puntuación sea más confiable
Problemas comunes: Capacidad de razonamiento extrema (conteo de teoría de números)、 Piensa en apoyo
Problemas comunes: Capacidad de razonamiento extrema (conteo de teoría de números)、 Auditoría de token de entrada minimalista、 Facturación de tokens
Problemas comunes: Capacidad de razonamiento extrema (conteo de teoría de números)、 Claude Verificación del tokenizador
Problemas comunes: Capacidad de razonamiento extrema (conteo de teoría de números)、 Piensa en apoyo
Problemas comunes: Auditoría de token de entrada minimalista、 Prueba de conflicto del sistema
Problemas comunes: coherencia del estilo de comportamiento、 exactitud del conocimiento
Problemas comunes: autenticidad de contexto largo、 Especificación de la estructura del mensaje
Cada informe público /r/{job_id} alimenta este tablero, agrupado por base_url domain. La clasificación utiliza un Bayesian-weighted score (antes=50, prior_weight=5): un 100 perfecto único solo clasifica ~58,3; necesitas ≥10 carreras constantes casi perfectas para ascender en el tablero principal. Eso evita que un nuevo relevo encabece la lista después de una sola carrera afortunada. La “mediana” de la interfaz de usuario es la mediana de puntuaciones pasadas (para intuición); el orden de clasificación utiliza el peso bayesiano.
Los relés de muestra única permanecen fuera del tablero principal (control de ruido) pero aún aparecen al final de la lista completa.