Conceptos básicos del relevo
Una retransmisión de API de IA es un proxy de terceros que reenvía sus solicitudes a OpenAI, Anthropic o Google y devuelve la respuesta. Los relés varían ampliamente: algunos pasan 1:1, otros reescriben campos, intercambian modelos o inyectan indicaciones del sistema. Esta sección explica qué es un relé, por qué la gente usa uno y dónde están los riesgos.
¿Qué es un relé API de IA?
#
Un relé (también llamado espejo o proxy) es un servicio de reenvío de terceros que envía sus solicitudes a OpenAI, Anthropic o Google y devuelve la respuesta. Motivos comunes: acceso bloqueado a dominios oficiales en algunas regiones, precios mayoristas o una interfaz unificada para múltiples proveedores.
¿Por qué utilizar un relé? ¿No puedo llamar directamente a la API oficial?
#
Tres razones comunes: ① El acceso a anthropic.com/openai.com puede requerir una VPN en algunas regiones; ② Algunas empresas de retransmisión revenden cuotas mayoristas agrupadas entre un 30% y un 70% por debajo del precio de lista oficial; ③ Algunos retransmisiones exponen Claude, GPT y Gemini a través de una única API compatible con OpenAI para que mantenga una integración.
¿En qué se diferencia un relé de la API oficial?
#
Las API oficiales tienen campos, firmas y formatos de error fijos. Los relés difieren enormemente: algunos pasan 1:1, otros reescriben campos de uso, eliminan bloques de pensamiento, sustituyen modelos o inyectan indicaciones adicionales del sistema. pangolín detecta lo que realmente sucede en el medio.
¿Son legales los relevos? ¿Podría meterme en problemas?
#
Legalmente es un área gris y depende del acuerdo. Riesgos prácticos: ① Exit risk — los relés pueden cerrarse, aumentar los precios o desaparecer con el saldo prepago; tenga cuidado con las recargas importantes; ② Responses may not match the official API: los relés pueden intercambiar modelos, eliminar capacidades o informar erróneamente tokens, lo que perjudica la confiabilidad posterior; ③ Prompts may be logged — para datos confidenciales o de usuario, evite retransmisiones desconocidas. Comience poco a poco, elija operadores acreditados y considere optar directamente por un uso de alto riesgo.
¿Cuáles son los riesgos de utilizar la clave API de un relé?
#
pangolin ha probado muchos relés. Cinco trampas comunes (todas vistas en la naturaleza): ① Silent model substitution: pagas por GPT pero obtienes Claude u otro modelo más económico. La respuesta superficial parece buena, pero el tono, el razonamiento y los hábitos divergen, lo que resulta arriesgado para el trabajo de producción. ② Advanced features break: JSON estricto, entrada de PDF, llamada de herramientas y capacidades similares a menudo fallan cuando el modelo de backend se cambió por uno más barato que no las admite. ③ Billing numbers you can't trust: el mismo mensaje puede costar cantidades diferentes en cada ejecución; algunos relés ocultan por completo el uso de tokens, por lo que no se pueden conciliar cargos que puedan exceder los precios oficiales sin un registro de auditoría. ④ Models listed but not available: un repetidor puede anunciar docenas de modelos y luego devolver model_not_found para algunos. comprobaciones previas al vuelo de pangolin antes de esperar medio minuto para obtener un informe de cero. ⑤ Rules change without notice: una clave que funcionó ayer puede requerir repentinamente una actualización, alcanzar los límites del grupo o ser prohibida. Pruebe con una balanza pequeña y ejecute pangolin antes de recargas grandes.
Autenticidad
Los relevos falsos son el mayor problema de la industria: crees que estás en Claude pero obtienes Kiro o Amazon Q; crees que estás en GPT-4o pero el backend es Claude Haiku. Esta sección cubre tácticas de suplantación de identidad comunes y cómo detectarlas.
¿Cómo sé que voy a ser Claude / GPT / Gemini real y no un sustituto?
#
Tres ángulos: ① Campos de protocolo (prefijos de identificación, objeto, motivo_finalización que coinciden con las especificaciones oficiales); ② Huellas dactilares de capacidad (firma de pensamiento, PDF multimodal, forma de llamada de función); ③ Resistencia y uso de la inyección (conflictos del sistema, auditoría de entrada mínima, rastros de uso externo). pangolin los combina en comprobaciones de varios niveles: el modo completo ejecuta ~18 elementos para Claude.
¿Cuáles son las tácticas comunes de suplantación de identidad de retransmisiones?
#
Cinco comunes: ① Ejecute Kiro / Amazon Q / Bedrock como sustituto de Claude; ② Enrutar solicitudes GPT a un backend de Claude (los campos de uso pierden residuo de claude_*); ③ Cambie GPT-4o por GPT-4o-mini para reducir costos; ④ Bloques de pensamiento de tira, PDF multimodal y otras capacidades avanzadas; ⑤ Inyecte indicaciones adicionales del sistema o preámbulos ocultos para reescribir la identidad o el comportamiento.
¿Puedo verificar el modelo preguntando "¿Quién eres?"
#
No. Los modelos modernos están entrenados para responder preguntas de identidad y los relés pueden inyectar indicaciones del sistema para que el modelo diga "Soy Claude". El pangolín pondera los controles de identidad en sólo un 5%, una señal auxiliar débil. En su lugar, confíe en las señales cifradas como si fueran firmas pensantes.
¿Cómo puedo detectar a Kiro/Amazon Q haciéndose pasar por Claude?
#
Kiro y Amazon Q son las puertas de enlace suplentes de Claude de Amazon. Sus respuestas carecen de firmas de pensamiento de Claude: utilizan la interfaz simplificada de AWS Bedrock, que no devuelve firmas del lado del servidor. pangolin obtiene una puntuación de think_signature de 0 y no pasa la comprobación general.
¿Cómo puedo saber si un repetidor envía solicitudes GPT a un backend de Claude?
#
Consulta el campo de uso. OpenAI nativo solo tiene tokens de aviso, tokens de finalización y tokens totales. Si ve claude_cache_creation_5_m_tokens, use_source: anthropic o similar, es casi seguro que el relé esté realizando una conversión de protocolo. pangolin señala esa huella digital como crítica.
Relés Claude API
Claude es el protocolo más profundo de pangolin: la firma mental de Claude es una señal cifrada y verificable que solo pangolin utiliza actualmente en producción.
¿Qué es una firma pensante? ¿Por qué es el estándar de oro para la autenticidad?
#
Cuando se habilita el pensamiento extendido, Claude devuelve una firma cifrada generada por el servidor en el campo de firma, normalmente entre 500 y 2000 caracteres. Anthropic lo genera en el lado del servidor con verificación criptográfica; de manera realista, los relés no pueden falsificarlo. pangolin lo pondera al 25% como detector de núcleos.
¿Cómo elijo un relé de código Claude?
#
Cuatro comprobaciones: ① Ejecute pangolin y confirme que la firma de pensamiento tiene una puntuación de 100; ② Busque campos extranjeros en uso más allá de claude_*; ③ Compare el comportamiento de transmisión con el de no transmisión (los relés a menudo tratan las rutas de manera diferente); ④ Confirme que los ID de los mensajes utilicen los prefijos msg_ / toolu_ / srvtoolu_.
¿Qué cubre la detección de Claude del pangolín?
#
El modo completo muestra ~18 tarjetas UI (~19 detectores). El peso central sigue siendo la firma del pensamiento (25%); el resto cubre identidad/comportamiento/conocimiento, reproducción de instrucciones, conflictos del sistema, auditoría de entrada mínima, canal y tokenizador, uso de herramientas, coherencia de transmisión, uso de tokens y comparación oficial del mismo mensaje; el modo completo agrega PDF y sondas de contexto largo opcionales. enfoques rápidos en la autenticidad del núcleo y la resistencia a la inyección; el estándar agrega integridad del protocolo y comparación oficial; profundiza plenamente los controles de capacidad.
¿Por qué mi relevo Claude no devuelve bloqueos de pensamiento en el modo de transmisión?
#
Desviación de API conocida en Claude Opus 4.7: con pensamiento adaptativo + transmisión + resumido, las transmisiones SSE pueden omitir bloques de pensamiento mientras funcionan sin transmisión. El detector de firmas de pensamiento de pangolin recurre a no flujo para mayor confiabilidad.
¿Por qué la detección consume tokens? ¿Cuánto cuesta?
#
La detección envía solicitudes reales. El modo estándar ejecuta ~12 llamadas API, ~3000–5000 tokens en total (dependiendo de si se activa el pensamiento). En Haiku ~$0,012, Soneto ~$0,05, Opus ~$0,20. pangolin en sí es gratuito: usted paga cargos por tokens ascendentes.
¿Una puntuación de 0 significa que el relevo es completamente inútil?
#
Depende. Causas comunes: ① Clave API no válida o agotada (se muestra un banner no válido); ② El relé no es compatible con el modelo elegido (la verificación previa devuelve 422); ③ Relé realmente pobre. Lea los detalles de cada detector, no solo la puntuación total.
Relés OpenAI
OpenAI no tiene ninguna señal cifrada como la firma pensante. pangolin se centra en el cumplimiento de protocolos y en la toma de huellas dactilares de la capa de adaptador, capturando retransmisiones que disfrazan los backends de Anthropic o Google como GPT.
¿Qué evidencia directa muestra que un relevo de GPT es en realidad Claude?
#
El campo de uso es la señal más clara. El verdadero OpenAI nativo solo tiene tokens de aviso, tokens de finalización y tokens totales. claude_cache_creation_5_m_tokens, use_source: anthropic, o input_tokens/output_tokens (nombramiento antrópico) indican fuertemente la conversión del protocolo. pangolín los marca como críticos y falla el detector.
Mi ejecución de GPT-4o obtuvo una puntuación de 75 con un veredicto marginal: ¿cómo leo eso?
#
75 está en el rango de aprobación, pero cualquier problema crítico (especialmente los críticos de múltiples protocolos) degrada el veredicto a marginal: círculo amarillo, advertencia de riesgo. Normalmente la API funciona pero el relé está convirtiendo protocolos; es posible que no estés en GPT real.
¿Qué significa cuando Response_format=json_schema estricto no funciona?
#
El modo estricto de OpenAI debería devolver JSON puro, no vallas de código Markdown. Si obtiene ```json {...} ```, o el relé no pasó el formato de respuesta o el modelo subyacente (probablemente no GPT) no comprende el modo estricto. pangolin usa el indicador markdown_json_seen para distinguir los dos.
El relé devuelve el modelo gpt-4o pero las respuestas no parecen GPT. ¿Y ahora qué?
#
El campo modelo es sólo una cadena; Los relés pueden configurar cualquier cosa. Verificar con otras señales: ① el detector de protocolo pangolín escanea las huellas dactilares de uso; ② Diferencias de comportamiento (GPT tiende a ser conciso, Claude es más educado y detallado); ③ Token CV en llamadas repetidas (detector de consistencia de modelo).
¿Qué pasa si la verificación previa muestra 0 modelos OpenAI disponibles?
#
pangolin enumera cuántos modelos de esa clave coinciden con el protocolo. Si está en OpenAI pero ve 0 modelos GPT, una tarjeta amarilla explica que la clave tiene modelos X Claude / Y Gemini en su lugar: un clic para cambiar y probar allí.
Relés API de Gemini
pangolin prueba Gemini a través de la ruta compatible con OpenAI (POST /chat/completions) porque la mayoría de los retransmisores Gemini de terceros lo utilizan. Gemini 3 por defecto piensa, lo que afecta a max_tokens y a los informes de uso.
¿Por qué los relevos Gemini a menudo devuelven model_not_found?
#
Tres causas: ① Los proxy de retransmisión solo son algunos modelos Gemini (muchos solo tienen una vista previa 3.x, no 2.5); ② El nombre no coincide (gemini-2.5-flash frente a modelos/gemini-2.5-flash); ③ Modelo retirado. La verificación previa de pangolin detecta modelos muertos en ~500 ms y sugiere alternativas.
¿Cuál debería ser max_completion_tokens para la detección de vista previa de Gemini 3.x?
#
Al menos 64 años, idealmente 128+. Gemini 3 permite pensar de forma predeterminada, consumiendo entre 30 y 60 tokens de razonamiento antes del texto. Si max es demasiado pequeño (<32), el pensamiento llena el presupuesto y obtienes texto vacío con Finish_reason=length. Los detectores de pangolines utilizan 64–384.
¿Pangolin todavía admite la generación de contenido nativo de Gemini?
#
No. Solo queda la ruta compatible con OpenAI (POST /chat/completions): cubre la mayoría de los repetidores de terceros y el punto final oficial de Google /v1beta/openai. Los informes nativos heredados de Gemini aún se pueden abrir.
¿Cómo elijo un relevo de Gemini?
#
Tres niveles: ① Debe admitir gemini-2.5-flash o gemini-3-flash-preview (estable en 2026); ② puntuación del protocolo pangolín ≥ 80; ③ el uso no tiene residuos extraños fuera de gemini_* (sin conversión de protocolo silenciosa). pangolin ordena listas de modelos por recomendación.
¿Puedo probar la API Gemini oficial de Google con pangolin?
#
Sí. Establezca base_url en https://generativelanguage.googleapis.com/v1beta/openai y api_key en su clave Google AI Studio AIza.... El punto final oficial compatible funciona como base para comparar retransmisiones de terceros.
Usando pangolín
Cómo utilizar la herramienta, leer informes y autohospedarse.
¿Cómo uso el pangolín? ¿El camino más corto?
#
Tres pasos: ① Abra el sitio y vaya a la página de verificación de Claude / OpenAI / Gemini; ② Ingrese retransmisión base_url + api_key y elija un modelo (el menú desplegable enumera lo que está disponible para esa clave); ③ Haga clic en Iniciar: informe en 30 a 60 segundos. Compártelo a través de /r/{job_id} o descarga JPG.
¿Cuál es la diferencia entre estándar, rápido y completo?
#
Quick cubre las sondas principales de autenticidad, conectividad y inyección, lo que es bueno para una clasificación rápida; el estándar agrega integridad del protocolo, llamada de herramientas, coherencia de transmisión, uso de tokens y comparación oficial del mismo mensaje: recomendación predeterminada; full agrega huellas dactilares de comportamiento, precisión del conocimiento, PDF y sondas de contexto largo opcionales. Las páginas de Claude ejecutan la firma pensante en todos los modos.
¿Cómo leo las puntuaciones de los informes?
#
Total ponderado: ≥85 excelente (verde) / 70–84 aprobado (verde claro) / 50–69 marginal (amarillo) / <50 reprobado (rojo). Cualquier problema crítico del detector limita el veredicto a marginal (amarillo) incluso por encima de 70. Amplíe las sub_verificaciones de cada detector para obtener más detalles.
¿Quién puede ver el enlace de un informe /r/xxx?
#
Cualquiera que tenga el enlace (anónimo, sin cifrar). Los informes nunca almacenan su clave API en texto sin formato, solo en forma redactada (sk-y7xU••••••0h). No comparta URL para retransmisiones privadas. Están previstos informes privados de suscripción voluntaria.
¿Puedo alojar pangolines localmente?
#
Sí, código totalmente abierto. clonar → pip install -e .[web] → uvicorn web.server:app. CLI funciona de forma independiente: detección de detector de relé --base-url... --api-key... --modo completo. Ver LÉAME.
Privacidad y seguridad
Entregar una clave API a una herramienta de detección es delicado. El manejo de datos de pangolin es auditable: el código es de código abierto y usted puede autohospedarse.
¿Pangolin almacena mi clave API?
#
No. La clave completa reside únicamente en un titular en memoria durante la ejecución; se borra después de un éxito, un error, una cancelación o una interrupción; nunca se escribe en registros de trabajo, registros o disco. Para valores controlados por el usuario/ascendente y claves dinámicas, eliminamos la clave sin formato y las formas canónicas urllib.parse.quote(key, safe=''), quote_plus(key, safe=''); %XX hexadecimal no distingue entre mayúsculas y minúsculas. Se mantienen las claves de protocolo/esquema fijas. No prometemos capturar porcentajes de codificación no canónicos de bytes no reservados, Base64, cifrado o transformaciones arbitrarias.
¿Cómo se compara la privacidad con cctest.ai?
#
cctest.ai también afirma no cargar claves, sino código cerrado, no verificable. pangolin está completamente abierto: clonar y ejecutar (git clone... && uvicorn web.server:app) o auditar el código del servidor en GitHub.
¿La detección llama ascendente y cuesta dinero?
#
Sí, pero poco. Modo estándar ~12 solicitudes reales, entre 3000 y 5000 tokens en total. Aproximadamente Haiku $ 0,012, Sonnet $ 0,05, Opus $ 0,20, pagados al upstream (retransmisión u oficial), no a pangolin.
¿Qué datos personales hay en un informe? ¿Puedo eliminarlo?
#
Los informes contienen: ① base_url (fragmentos de clave API eliminados si están incrustados); ② api_key redactado; ③ resultados de la detección. Sin nombre, correo electrónico o IP. Para eliminar un informe, abra una incidencia de GitHub.
Comparación de herramientas
Las pruebas de relevo no se limitan únicamente a los pangolines. Esta sección contrasta al pangolín con sus pares y cómo elegir un relevo.
¿En qué se diferencia pangolin de cctest.ai?
#
cctest cubre a Claude solo con controles anti-evasión de caja negra pero con dimensiones poco profundas. pangolin cubre tres protocolos (Claude/OpenAI/Gemini), firma de pensamiento cifrado, cambio automático entre protocolos, detección de modelo muerto previo al envío, código abierto completo y huellas digitales del adaptador OpenAI para "GPT que en realidad es Claude".
¿En qué se diferencia pangolin de hvoy.ai?
#
hvoy admite tres protocolos pero realiza comprobaciones superficiales (principalmente el cumplimiento del protocolo). pangolin agrega una firma de pensamiento cifrada en Claude (única), huellas dactilares de conversión de protocolo en OpenAI (usage_source, etc. en un nivel crítico) y soporte Gemini para modelos de pensamiento por defecto: cobertura más profunda.
¿Cómo se relacionan los sitios de clasificación de relevos con el pangolín?
#
Se trata de reseñas subjetivas o clasificaciones basadas en anuncios; pangolín es una prueba técnica objetiva. Utilice ambos: haga una lista corta de reputación y luego verifique con pangolin.
¿Cómo elijo un relé? ¿Métricas duras?
#
pangolin recomienda cinco controles estrictos: ① firma de pensamiento ≥ 100; ② protocolo critic_issue_count = 0; ③ el uso de transmisión / no transmisión es consistente; ④ la identificación del modelo coincide con el modelo solicitado (pase model_consistency); ⑤ complete_tokens CV <0,10 en repeticiones (estabilidad).
没找到答案?
直接跑一次检测看实际结果 — pangolin 的报告 details 里包含具体的扣分原因,通常自带答案。