Em maio de 2026, o Reddit fechou o acesso não autenticado aos .json endpoints — aquele truque de "adicione .json a qualquer URL", que sustentou dezenas de scripts, dashboards e projetos pessoais por anos. Verificação em 28 de julho de 2026: uma solicitação para https://www.reddit.com/r/webscraping/top.json?t=week com um User-Agent de navegador comum retorna 403 Forbidden. Ao mesmo tempo, o robots.txt do Reddit contém apenas duas linhas significativas: User-agent: * e Disallow: / — referindo-se à Public Content Policy.
Isso muda não o "como contornar", mas como agora construir um pipeline de coleta de dados do Reddit. Abaixo está um esquema funcional para 2026: o que está realmente disponível, quais são os limites, onde são necessários proxies e onde eles não ajudarão.
O que exatamente quebrou: uma breve cronologia
- Junho de 2023 — O Reddit introduziu uma tarifa paga de $0,24 por 1000 chamadas de API para aplicativos de alta carga. Consequência: fechamento do Apollo (o desenvolvedor avaliava o custo de acesso em cerca de $20 milhões por ano), saída da maioria dos clientes de terceiros e parada do Pushshift — um arquivo público de postagens e comentários, que sustentava metade das pesquisas acadêmicas.
- Maio de 2026 — descontinuação do
.jsonnão autenticado. Ferramentas que "apenas acessavam URLs" pararam de funcionar; o tráfego passou a ser protegido pelo Cloudflare com verificação de sessão. - Outubro de 2025 — até o presente — processo do Reddit contra Perplexity AI, Oxylabs UAB, AWMProxy e SerpApi (Distrito Sul de Nova Iorque, juiz Engelmaier). O Reddit acusa os réus de extração industrial de seu conteúdo através dos resultados do Google e revenda de dados, citando as disposições anti-contorno do DMCA. Foi apresentada a primeira ação modificada; em março de 2026, o caso estava na fase de motion to dismiss. Os réus negam as violações: a Perplexity chama isso de tentativa de fechar dados públicos, a SerpApi e a Oxylabs afirmam que têm acesso à web pública dentro da lei.
A conclusão prática do terceiro ponto é que a coleta de dados do Reddit contornando a API oficial é uma zona de risco jurídico, não técnico, e o preço do erro para um projeto comercial é medido não em banimentos, mas em processos. Mais detalhes sobre como os tribunais em 2026 interpretam a extração de dados dos resultados foram discutidos em nosso material sobre a decisão do caso Google e SerpApi.
API de Dados Oficial: limites reais de 2026
Este é o único caminho que não gera reivindicações legais. Números que você precisa saber antes de projetar:
- 100 solicitações por minuto para clientes OAuth. A janela é média em cerca de 10 minutos, ou seja, picos curtos são permitidos.
- 10 solicitações por minuto sem OAuth — isso não é suficiente para nada além de depuração.
- O limite é contado por chave de aplicativo, e não por usuário final. Cinco fluxos em um token não dão capacidade cinco vezes maior — eles simplesmente queimam um orçamento cinco vezes mais rápido.
- O plano gratuito cobre projetos pessoais, bots, ferramentas de moderação e pesquisas acadêmicas. Não há contador financeiro, apenas um teto de frequência.
- Uso comercial requer contrato e aprovação manual; tarifa — $0,24 por 1000 chamadas. Segundo estimativas de plataformas do setor, o limiar de entrada em um contrato comercial começa em cerca de $12.000 por ano.
- Treinamento de modelos de ML com dados da API é estritamente proibido pelas condições da API de Dados. Licenças para treinamento são contratos privados separados (o acordo do Reddit com o Google foi avaliado na imprensa em cerca de $60 milhões por ano).
Headers que devem ser sempre analisados
O Reddit fornece três cabeçalhos em cada resposta: X-Ratelimit-Used, X-Ratelimit-Remaining e X-Ratelimit-Reset. Esta é a única fonte confiável sobre seu orçamento — não uma constante no código e não uma velha wiki com o número "60 solicitações por minuto" (que está desatualizada desde 2023).
Requisitos para User-Agent
O Reddit espera uma string descritiva única no formato platform:app_id:version (by /u/username). User-Agents universais e vazios são severamente cortados em frequência — isso é a primeira coisa a verificar se os limites estão se esgotando antes do esperado.
Passo a passo: como construir um pipeline que não falha
- Registre um script-app nas configurações do Reddit e obtenha client_id/client_secret. Para carga somente leitura, este é o tipo mais simples de aplicativo.
- Defina um User-Agent correto conforme o formato acima. Não copie a string de um tutorial de outra pessoa —
app_ide nome de usuário devem ser seus. - Leia
X-Ratelimit-Remainingem cada resposta, e não apenas em caso de erro. Quando o restante cai para cerca de 20 solicitações, passe para um ritmo uniforme: atraso por chamada = segundos até a reinicialização da janela ÷ solicitações restantes. Assim, você distribui a cota pela janela em vez de bater em uma parede. - Trate 429 corretamente. A primeira pausa deve ser retirada do cabeçalho
Retry-After. Depois, um backoff exponencial com jitter:wait = 2^attempt + random(). O jitter é obrigatório: sem ele, clientes paralelos repetem a solicitação de forma síncrona e causam uma segunda cascata de falhas. - Cache as leituras com TTL. Repetir uma solicitação para a mesma listagem é a causa mais comum de esgotamento da cota em projetos de monitoramento.
- Escale rotacionando tokens, não fluxos. Cada token OAuth carrega um contador independente; vários aplicativos em diferentes contas com distribuição round-robin (em Python —
itertools.cycle) aumentam a capacidade linearmente. Importante: para carga comercial, isso não substitui um contrato com o Reddit — é uma forma de se encaixar nos limites justos, e não de contorná-los. - Planeje contornar o limite de listagem. O Reddit retorna no máximo cerca de 1000 elementos por listagem (100 por página, cursor
after). Conteúdo mais antigo não está disponível através dos endpoints padrão. A solução padrão é não "furar" o limite, mas cortar a amostra por tempo e fazer várias solicitações estreitas em vez de uma ampla. - Para dados históricos, busque um índice, não a API. Após o fechamento do Pushshift, sua lacuna é preenchida por índices externos como PullPush (gratuito, mas sem SLA) e APIs de busca comerciais com seu próprio índice e outros limites. Para trabalho acadêmico, o Reddit tem um programa separado chamado Reddit for Researchers.
Armadilhas que serão descobertas tarde demais
PRAW adormece o fluxo, mas não salva de tudo. O limitador embutido do PRAW lê os cabeçalhos e coloca pausas — isso funciona bem para um script de thread única. O estado atual pode ser visto através de reddit.auth.limits. Isso quebra em dois casos: em multithreading com credenciais compartilhadas (as instâncias não veem o consumo uma da outra) e em código assíncrono, onde o bloqueio time.sleep trava o event loop.
Agentes de IA queimam a cota sem perceber. Um passo de raciocínio do agente facilmente se desdobra em 10–15 chamadas de ferramentas. Dez sessões paralelas significam 100–150 solicitações simultâneas, ou seja, todo o orçamento por minuto em segundos. Se você está construindo um agente sobre o Reddit, o limitador deve estar no nível do pool, e não em uma chamada separada.
Polling sem backoff. Verificação de atualizações "a cada N segundos" sem pausa exponencial é a segunda causa mais frequente de 429, após o token geral.
Onde proxies são realmente necessários e onde não são
Vamos ser honestos: proxies não aumentam seu limite da API oficial. A cota está vinculada à chave do aplicativo, e não ao IP de saída, e tentar "multiplicá-la" mudando o endereço não funciona e contraria os termos. As tarefas que proxies realmente resolvem no pipeline do Reddit são diferentes:
- Acesso geográfico e conectividade. O Reddit está indisponível ou parcialmente restrito em vários países, e redes corporativas o bloqueiam como uma rede social. Um nó de saída estável na região necessária é uma questão de disponibilidade de infraestrutura, e não de contornar limites. Para tarefas de servidor com IP fixo, geralmente é suficiente usar proxies de datacenter.
- Resultados regionais. Parte do conteúdo e recomendações do Reddit são entregues levando em conta a geografia da solicitação; se você está analisando o que a audiência de um país específico vê, precisa de uma saída exatamente de lá.
- Descentralização da infraestrutura. Quando vários serviços independentes (coleta, monitoramento de menções, análise) vivem em um único servidor, um único IP se torna um ponto comum de falha para todas as integrações ao mesmo tempo.
- Trabalho com contas próprias. Para moderação, gestão de comunidades e atividades legítimas de SMM com vários perfis, a ligação "conta ↔ IP fixo" é uma higiene básica. Aqui, são adequados proxies residenciais com sessão sticky.
Mas o que proxies não farão: não legalizarão a coleta comercial contornando o contrato, não removerão o limite de listagem de 1000 elementos e não cancelarão Disallow: / no robots.txt. A abordagem geral para trabalhar com limites de plataformas está na análise sobre limitação de taxa na API e o papel dos proxies.
Conclusão
O Reddit em 2026 deixou de ser "um conjunto de dados aberto que pode ser acessado via .json". O esquema funcional é o seguinte: acesso OAuth oficial + limitador justo nos cabeçalhos + rotação de tokens dentro das regras + índice externo para histórico. Proxies nessa estrutura são responsáveis pela disponibilidade e geografia, e não por contornar cotas — e essa é a única função em que eles oferecem um resultado previsível.
Se seu projeto é comercial, planeje o orçamento para um contrato com o Reddit com antecedência: a história judicial com Perplexity, Oxylabs e SerpApi mostra que a plataforma está disposta a gastar muito mais na proteção de seus dados do que custa o acesso legal.
```