Noções básicas de relé
Um retransmissor de API AI é um proxy de terceiros que encaminha suas solicitações para OpenAI, Anthropic ou Google e retorna a resposta. Os relés variam amplamente – alguns passam por 1:1, outros reescrevem campos, trocam modelos ou injetam prompts do sistema. Esta seção explica o que é um relé, por que as pessoas o utilizam e onde estão os riscos.
O que é uma retransmissão de API de IA?
#
Um retransmissor (também chamado de espelho ou proxy) é um serviço de encaminhamento de terceiros que envia suas solicitações para OpenAI, Anthropic ou Google e retorna a resposta. Motivos comuns: acesso bloqueado a domínios oficiais em algumas regiões, preços de atacado ou uma interface unificada para vários provedores.
Por que usar um relé? Não posso ligar diretamente para a API oficial?
#
Três motivos comuns: ① O acesso a anthropic.com/openai.com pode exigir uma VPN em algumas regiões; ② Alguns revendedores revendem cotas agrupadas no atacado 30–70% abaixo do preço de tabela oficial; ③ Alguns relés expõem Claude, GPT e Gemini por meio de uma única API compatível com OpenAI para que você mantenha uma integração.
Qual a diferença entre um relé e uma API oficial?
#
APIs oficiais têm campos, assinaturas e formatos de erro fixos. Os relés diferem enormemente – alguns passam por 1:1, outros reescrevem campos de uso, eliminam blocos de pensamento, substituem modelos ou injetam prompts extras do sistema. o pangolim detecta o que realmente acontece no meio.
Os relés são legais? Eu poderia ter problemas?
#
Legalmente é uma área cinzenta e depende do acordo. Riscos práticos: ① Exit risk — os relés podem desligar, aumentar os preços ou desaparecer com o saldo pré-pago; seja cauteloso com grandes recargas; ② Responses may not match the official API — os relés podem trocar modelos, retirar recursos ou reportar tokens incorretamente, prejudicando a confiabilidade downstream; ③ Prompts may be logged — para dados confidenciais ou do usuário, evite retransmissões desconhecidas. Comece pequeno, escolha operadores respeitáveis e considere ir direto para uso de alto risco.
Quais são os riscos de usar uma chave de API de retransmissão?
#
pangolin testou muitos relés. Cinco armadilhas comuns (todas vistas na natureza): ① Silent model substitution — você paga pelo GPT, mas recebe Claude ou outro modelo mais barato. A resposta superficial parece boa, mas o tom, o raciocínio e os hábitos divergem – arriscado para o trabalho de produção. ② Advanced features break — JSON estrito, entrada de PDF, chamada de ferramenta e recursos semelhantes geralmente falham quando o modelo de back-end é trocado por um mais barato que não os suporta. ③ Billing numbers you can't trust — o mesmo prompt pode custar valores diferentes a cada corrida; algumas retransmissões ocultam totalmente o uso do token, portanto, você não pode reconciliar cobranças que possam exceder o preço oficial sem trilha de auditoria. ④ Models listed but not available — um relé pode anunciar dezenas de modelos e retornar model_not_found para alguns. verificações de pré-voo do Pangolin antes de esperar meio minuto por um relatório totalmente zero. ⑤ Rules change without notice — uma chave que funcionou ontem pode exigir repentinamente uma atualização, atingir os limites do grupo ou ser banida. Teste com uma balança pequena e execute o pangolim antes de grandes recargas.
Autenticidade
Relés falsos são o maior problema da indústria – você pensa que está no Claude, mas compra o Kiro ou o Amazon Q; você pensa que está no GPT-4o, mas o backend é Claude Haiku. Esta seção aborda táticas comuns de falsificação e como detectá-las.
Como posso saber se estou conseguindo o verdadeiro Claude/GPT/Gemini e não um substituto?
#
Três ângulos: ① Campos de protocolo (prefixos de id, objeto, razão de acabamento correspondem às especificações oficiais); ② Capacidade de impressões digitais (assinatura pensante, PDF multimodal, formato de chamada de função); ③ Resistência e uso de injeção (conflitos de sistema, auditoria mínima de entrada, rastros de uso estrangeiro). pangolin combina isso em verificações de vários níveis – o modo completo executa cerca de 18 itens para Claude.
Quais são as táticas comuns de falsificação de retransmissão?
#
Cinco mais comuns: ① Executar Kiro/Amazon Q/Bedrock como substituto de Claude; ② Encaminhar solicitações GPT para um backend Claude (campos de uso vazam resíduo Claude_*); ③ Trocar GPT-4o por GPT-4o-mini para reduzir custos; ④ Tirar blocos de pensamento, PDF multimodal e outros recursos avançados; ⑤ Injete prompts extras do sistema ou preâmbulos ocultos para reescrever a identidade ou o comportamento.
Posso verificar o modelo perguntando "Quem é você?"
#
Não. Os modelos modernos são treinados para responder a questões de identidade, e os relés podem injetar avisos do sistema para que o modelo diga "Eu sou Claude". O pangolim avalia as verificações de identidade em apenas 5% – um sinal auxiliar fraco. Em vez disso, confie em sinais criptografados, como uma assinatura pensante.
Como faço para identificar Kiro/Amazon Q se passando por Claude?
#
Kiro e Amazon Q são gateways substitutos de Claude da Amazon. Suas respostas não possuem assinaturas de pensamento de Claude — elas usam a interface simplificada do AWS Bedrock, que não retorna assinaturas do lado do servidor. pangolin pontua thinking_signature em 0 e falha na verificação geral.
Como posso saber se um relé envia solicitações GPT para um back-end do Claude?
#
Verifique o campo de uso. OpenAI nativo possui apenas prompt_tokens, complete_tokens e total_tokens. Se você vir claude_cache_creation_5_m_tokens, usage_source: anthropic ou similar, é quase certo que o relé está fazendo a conversão de protocolo. O pangolim sinaliza essa impressão digital como crítica.
Retransmissões da API Claude
Claude é o protocolo mais profundo do pangolim – a assinatura de pensamento de Claude é um sinal criptografado e verificável que apenas o pangolim usa atualmente na produção.
O que é uma assinatura pensante? Por que é o padrão ouro de autenticidade?
#
Quando o pensamento estendido está ativado, Claude retorna uma assinatura criptografada gerada pelo servidor no campo de assinatura, normalmente de 500 a 2.000 caracteres. A Anthropic o gera no lado do servidor com verificação criptográfica – os relés não podem forjá-lo de forma realista. o pangolim pesa 25% como detector central.
Como escolho um relé de código Claude?
#
Quatro verificações: ① Execute o pangolim e confirme a pontuação da assinatura de pensamento 100; ② Procure campos estrangeiros em uso além de claude_*; ③ Compare o comportamento de fluxo e não fluxo (os relés geralmente tratam os caminhos de maneira diferente); ④ Confirme os IDs das mensagens usando os prefixos msg_ / toolu_ / srvtoolu_.
O que a detecção de Claude do pangolim cobre?
#
O modo completo mostra ~18 cartões UI (~19 detectores). O peso central continua sendo a assinatura do pensamento (25%); o restante cobre identidade/comportamento/conhecimento, reprodução de instruções, conflitos de sistema, auditoria de entrada mínima, canal e tokenizador, uso de ferramentas, consistência de streaming, uso de token e comparação oficial no mesmo prompt; o modo completo adiciona PDF e testes opcionais de contexto longo. foco rápido na autenticidade central e resistência à injeção; o padrão adiciona integridade do protocolo e comparação oficial; full aprofunda as verificações de capacidade.
Por que meu relé Claude não retorna blocos de pensamento no modo stream?
#
Desvio de API conhecido no Claude Opus 4.7 — com pensamento adaptativo + streaming + resumido, os fluxos SSE podem omitir blocos de pensamento enquanto os não fluxos funcionam. O detector thinking_signature do pangolin volta para não-stream para obter confiabilidade.
Por que a detecção consome tokens? Quanto custa isso?
#
A detecção envia solicitações reais. O modo padrão executa aproximadamente 12 chamadas de API, aproximadamente 3.000 a 5.000 tokens no total (dependendo se o pensamento é acionado). Em Haiku ~$0,012, Soneto ~$0,05, Opus ~$0,20. O próprio pangolim é gratuito – você paga taxas de token upstream.
Uma pontuação 0 significa que o relé é completamente inútil?
#
Depende. Causas comuns: ① Chave de API inválida ou esgotada (banner inválido mostrado); ② O relé não suporta o modelo escolhido (o comprovante retorna 422); ③ Relé genuinamente ruim. Leia os detalhes de cada detector, não apenas a pontuação total.
Relés OpenAI
OpenAI não tem sinal criptografado como assinatura pensante. O pangolin se concentra na conformidade do protocolo e na impressão digital da camada do adaptador – capturando retransmissões que disfarçam os back-ends da Anthropic ou do Google como GPT.
Que evidência direta mostra que um relé GPT é na verdade Claude?
#
O campo de uso é o sinal mais claro. O verdadeiro OpenAI nativo possui apenas prompt_tokens, complete_tokens e total_tokens. claude_cache_creation_5_m_tokens, usage_source: anthropic ou input_tokens/output_tokens (nomeação antrópica) indicam fortemente a conversão de protocolo. o pangolim marca esses pontos como críticos e falha no detector.
Minha corrida GPT-4o marcou 75 com veredicto marginal – como posso ler isso?
#
75 está na faixa de aprovação, mas quaisquer problemas críticos (especialmente críticos de múltiplos protocolos) rebaixam o veredicto para marginal – círculo amarelo, aviso de risco. Normalmente a API funciona, mas o relé está convertendo protocolos; você pode não estar no GPT real.
O que significa quando response_format=json_schema strict não funciona?
#
O modo estrito OpenAI deve retornar JSON puro, não barreiras de código Markdown. Se você obtiver ```json {...} ```, ou o relé não passou pelo response_format ou o modelo subjacente (provavelmente não GPT) não entende o modo estrito. pangolin usa o sinalizador markdown_json_seen para distinguir os dois.
O relé retorna o modelo gpt-4o, mas as respostas não parecem GPT – e agora?
#
O campo model é apenas uma string; relés podem definir qualquer coisa. Verifique com outros sinais: ① detector de protocolo pangolim verifica impressões digitais de uso; ② Diferenças comportamentais (GPT tende a ser conciso, Claude mais educado e prolixo); ③ CV do token em chamadas repetidas (detector model_consistency).
E se o comprovante mostrar 0 modelos OpenAI disponíveis?
#
pangolin lista quantos modelos nessa chave correspondem ao protocolo. Se você estiver no OpenAI, mas vir modelos 0 GPT, um cartão amarelo explica que a chave possui modelos X Claude / Y Gemini – um clique para alternar e testar lá.
Retransmissões da API Gemini
O pangolin testa o Gemini por meio do caminho compatível com OpenAI (POST /chat/completions) porque a maioria dos relés Gemini de terceiros o utilizam. O padrão do Gemini 3 é pensar, o que afeta max_tokens e relatórios de uso.
Por que os relés Gemini geralmente retornam model_not_found?
#
Três causas: ① Relay proxies apenas alguns modelos Gemini (muitos carregam apenas visualização 3.x, não 2.5); ② Incompatibilidade de nomes (gemini-2.5-flash vs modelos/gemini-2.5-flash); ③ Modelo aposentado. O pré-vôo do Pangolin captura modelos mortos em aproximadamente 500 ms e sugere alternativas.
O que deve ser max_completion_tokens para detecção de visualização do Gemini 3.x?
#
Pelo menos 64, idealmente 128+. O Gemini 3 permite pensar por padrão, consumindo de 30 a 60 reasoning_tokens antes do texto. Se o máximo for muito pequeno (<32), o pensamento preenche o orçamento e você obtém um texto vazio com finish_reason=length. os detectores de pangolim usam 64–384.
O Pangolin ainda oferece suporte ao GenerateContent nativo do Gemini?
#
Não. Apenas o caminho compatível com OpenAI (POST /chat/completions) permanece — ele cobre a maioria dos relés de terceiros e o endpoint /v1beta/openai oficial do Google. Os relatórios legados do Gemini Native ainda podem ser abertos.
Como escolho um relé Gemini?
#
Três níveis: ① Deve suportar gemini-2.5-flash ou gemini-3-flash-preview (2026 estável); ② pontuação do protocolo pangolim ≥ 80; ③ o uso não tem resíduos estranhos fora de gemini_* (sem conversão silenciosa de protocolo). pangolin classifica listas de modelos por recomendação.
Posso testar a API Gemini oficial do Google com o pangolim?
#
Sim. Defina base_url como https://generativelanguage.googleapis.com/v1beta/openai e api_key como sua chave do Google AI Studio AIza.... O endpoint oficial compatível funciona como base para comparar retransmissões de terceiros.
Usando pangolim
Como usar a ferramenta, ler relatórios e se auto-hospedar.
Como faço para usar o pangolim? Caminho mais curto?
#
Três passos: ① Abra o site e vá para a página de verificação do Claude/OpenAI/Gemini; ② Insira relé base_url + api_key e escolha um modelo (o menu suspenso lista o que está disponível para essa chave); ③ Clique em Iniciar — relatório em 30–60s. Compartilhe via /r/{job_id} ou baixe JPG.
Qual é a diferença entre padrão, rápido e completo?
#
quick cobre autenticidade central, conectividade e sondas de injeção – bom para triagem rápida; o padrão adiciona integridade de protocolo, chamada de ferramenta, consistência de streaming, uso de token e comparação oficial no mesmo prompt – recomendação padrão; full adiciona impressão digital de comportamento, precisão de conhecimento, PDF e sondagens opcionais de contexto longo. As páginas de Claude executam assinatura pensante em todos os modos.
Como leio as pontuações do relatório?
#
Total ponderado: ≥85 excelente (verde) / 70–84 aprovado (verde claro) / 50–69 marginal (amarelo) / <50 reprovado (vermelho). Qualquer problema crítico do detector limita o veredicto no marginal (amarelo), mesmo acima de 70. Expanda as subverificações de cada detector para obter detalhes.
Quem pode ver um link de relatório /r/xxx?
#
Qualquer pessoa com o link (anônimo, não criptografado). Os relatórios nunca armazenam sua chave de API em texto simples — apenas em formato editado (sk-y7xU••••••0h). Não compartilhe URLs para retransmissões privadas. Relatórios privados opt-in estão planejados.
Posso auto-hospedar o pangolim localmente?
#
Sim – código totalmente aberto. clone → pip install -e .[web] → uvicorn web.server:app. CLI funciona de forma independente: detector de relé detecta --base-url ... --api-key ... --mode full. Consulte LEIA-ME.
Privacidade e segurança
Entregar uma chave de API a uma ferramenta de detecção é confidencial. O tratamento de dados do Pangolin é auditável – o código é de código aberto e você pode se auto-hospedar.
O Pangolin armazena minha chave de API?
#
Não. A chave completa permanece apenas em um suporte na memória durante a execução; ele é apagado após sucesso, falha, cancelamento ou interrupção — nunca gravado em registros de trabalho, logs ou disco. Para valores controlados pelo usuário/upstream e chaves dinâmicas, removemos a chave bruta e os formulários canônicos urllib.parse.quote(key, safe=''), quote_plus(key, safe=''); %XX hexadecimal não diferencia maiúsculas de minúsculas. Chaves fixas de protocolo/esquema são mantidas. Não prometemos capturar codificação percentual não canônica de bytes não reservados, Base64, criptografia ou transformações arbitrárias.
Como a privacidade se compara ao cctest.ai?
#
cctest.ai também afirma não fazer upload de chaves, mas de código fechado – não verificável. pangolin está totalmente aberto: clone e execute (git clone ... && uvicorn web.server:app) ou audite o código do servidor no GitHub.
A detecção chama upstream e custa dinheiro?
#
Sim, mas pouco. Modo padrão ~ 12 solicitações reais, total de 3.000 a 5.000 tokens. Aproximadamente Haiku $ 0,012, Soneto $ 0,05, Opus $ 0,20 - pago ao upstream (retransmissão ou oficial), não ao pangolim.
Quais dados pessoais estão em um relatório? Posso excluí-lo?
#
Os relatórios contêm: ① base_url (fragmentos de chave de API removidos se incorporados); ② api_key editado; ③ resultados de detecção. Sem nome, e-mail ou IP. Para excluir um relatório, abra um problema no GitHub.
Comparação de ferramentas
O teste de retransmissão não é apenas o pangolim. Esta seção compara o pangolim com seus pares e como escolher um revezamento.
Qual a diferença entre o pangolim e o cctest.ai?
#
cctest cobre Claude apenas com verificações anti-evasão de caixa preta, mas com dimensões superficiais. pangolin cobre três protocolos (Claude / OpenAI / Gemini), assinatura de pensamento criptografada, troca automática de protocolo cruzado, detecção de modelo morto pré-envio, código aberto completo e impressões digitais do adaptador OpenAI para "GPT que na verdade é Claude".
Qual a diferença entre o pangolim e o hvoy.ai?
#
hvoy suporta três protocolos, mas verificações superficiais (principalmente conformidade de protocolo). pangolin adiciona assinatura de pensamento criptografada em Claude (único), impressões digitais de conversão de protocolo em OpenAI (usage_source etc. em nível crítico) e suporte Gemini para modelos de pensamento por padrão – cobertura mais profunda.
Como os sites de classificação de retransmissão se relacionam com o pangolim?
#
Essas são análises subjetivas ou classificações baseadas em anúncios; pangolim é um teste técnico objetivo. Use ambos: faça uma lista restrita de reputação e depois verifique com o pangolim.
Como escolho um relé? Métricas difíceis?
#
Pangolin recomenda cinco verificações rigorosas: ① assinatura de pensamento ≥ 100; ② protocolo critic_issue_count = 0; ③ uso consistente de fluxo / não fluxo; ④ o ID do modelo corresponde ao modelo solicitado (passe model_consistency); ⑤ CV de complete_tokens <0,10 entre repetições (estabilidade).
没找到答案?
直接跑一次检测看实际结果 — pangolin 的报告 details 里包含具体的扣分原因,通常自带答案。