En mayo de 2026, Reddit cerró el acceso no autenticado a los endpoints .json — ese truco de "agrega .json a cualquier URL", en el que se apoyaron durante años decenas de scripts, paneles de control y proyectos personales. Verificación del 28 de julio de 2026: una solicitud a https://www.reddit.com/r/webscraping/top.json?t=week con un User-Agent de navegador normal devuelve 403 Forbidden. Al mismo tiempo, el robots.txt de Reddit contiene solo dos líneas significativas: User-agent: * y Disallow: / — haciendo referencia a la Política de Contenido Público.
Esto no cambia el "cómo eludir", sino cómo ahora construir un pipeline de recolección de datos de Reddit. A continuación, una esquema operativo para 2026: qué está realmente disponible, cuáles son los límites, dónde se necesitan proxies y dónde no ayudarán.
Qué exactamente se rompió: cronología breve
- Junio de 2023 — Reddit introdujo una tarifa de $0.24 por 1000 llamadas a la API para aplicaciones de alta carga. Consecuencia: cierre de Apollo (el desarrollador valoraba el costo de acceso en aproximadamente $20 millones al año), salida de la mayoría de los clientes de terceros y detención de Pushshift — un archivo público de publicaciones y comentarios, en el que se basaba la mitad de las investigaciones académicas.
- Mayo de 2026 — deprecación del
.jsonno autenticado. Las herramientas que "simplemente llamaban a la URL" dejaron de funcionar; el tráfico pasó a través de la protección de Cloudflare con verificación de sesión. - Octubre de 2025 — hasta la fecha — demanda de Reddit contra Perplexity AI, Oxylabs UAB, AWMProxy y SerpApi (Distrito Sur de Nueva York, juez Engelmaier). Reddit acusa a los demandados de extraer su contenido industrialmente a través de los resultados de Google y revender datos, citando disposiciones anti-elusión del DMCA. Se presentó la primera demanda modificada; a partir de marzo de 2026, el caso está en la etapa de motion to dismiss. Los demandados niegan las violaciones: Perplexity lo califica como un intento de cerrar datos públicos, SerpApi y Oxylabs afirman que tienen acceso a la web pública dentro de la ley.
La conclusión práctica del tercer punto: la recolección de datos de Reddit eludiendo la API oficial es una zona de riesgo legal, no técnico, y el costo de un error para un proyecto comercial se mide no en prohibiciones, sino en demandas. Más sobre cómo los tribunales en 2026 interpretan la extracción de datos de los resultados, lo discutimos en el material sobre la decisión del caso Google y SerpApi.
API de Datos Oficial: límites reales 2026
Este es el único camino que no crea reclamaciones legales. Números que debes saber antes de diseñar:
- 100 solicitudes por minuto para el cliente OAuth. La ventana se promedia aproximadamente durante 10 minutos, es decir, picos cortos son permitidos.
- 10 solicitudes por minuto sin OAuth — esto no es suficiente para nada más que para depuración.
- El límite se considera por clave de aplicación, no por usuario final. Cinco hilos en un token no dan cinco veces la capacidad — simplemente queman un presupuesto cinco veces más rápido.
- El plan gratuito cubre proyectos personales, bots, herramientas de moderación e investigaciones académicas. No hay contador monetario, solo un techo de frecuencia.
- El uso comercial requiere un contrato y aprobación manual; la tarifa es de $0.24 por 1000 llamadas. Según estimaciones de plataformas de la industria, el umbral de entrada para un contrato comercial comienza alrededor de $12,000 al año.
- El entrenamiento de modelos de ML con datos de la API está estrictamente prohibido por los términos de la API de Datos. Las licencias para el entrenamiento son contratos privados separados (se estima que el acuerdo de Reddit con Google en la prensa fue de aproximadamente $60 millones al año).
Encabezados que siempre deben ser analizados
Reddit devuelve tres encabezados en cada respuesta: X-Ratelimit-Used, X-Ratelimit-Remaining y X-Ratelimit-Reset. Esta es la única fuente confiable de verdad sobre tu presupuesto — no es una constante en el código ni una antigua wiki con el número "60 solicitudes por minuto" (que está desactualizada desde 2023).
Requisitos para User-Agent
Reddit espera una cadena descriptiva única en el formato platform:app_id:version (by /u/username). User-Agents universales y vacíos son severamente limitados en frecuencia — esto es lo primero que debes verificar si los límites se agotan antes de lo previsto.
Paso a paso: cómo construir un pipeline que no se caiga
- Registra una script-app en la configuración de Reddit y obtén client_id/client_secret. Para cargas de solo lectura, este es el tipo de aplicación más simple.
- Establece un User-Agent correcto según el formato anterior. No copies la cadena de un tutorial ajeno —
app_idy el nombre deben ser los tuyos. - Lee
X-Ratelimit-Remainingen cada respuesta, no solo en caso de error. Cuando el resto cae a aproximadamente 20 solicitudes, pasa a un ritmo uniforme: retraso por llamada = segundos hasta el reinicio de la ventana ÷ solicitudes restantes. Así distribuyes la cuota a lo largo de la ventana en lugar de chocar contra una pared. - Maneja correctamente el 429. Toma la primera pausa del encabezado
Retry-After. Luego, un retroceso exponencial con jitter:wait = 2^attempt + random(). El jitter es obligatorio: sin él, los clientes paralelos repiten la solicitud de manera sincrónica y causan una segunda cascada de fallos. - Cachea lecturas con TTL. Volver a solicitar el mismo listado es la razón más común de agotamiento de la cuota en proyectos de monitoreo.
- Escala rotando tokens, no hilos. Cada token OAuth lleva un contador independiente; varias aplicaciones en diferentes cuentas con distribución round-robin (en Python —
itertools.cycle) aumentan la capacidad de manera lineal. Importante: para cargas comerciales, esto no reemplaza un contrato con Reddit — es una forma de ajustarse a límites justos, no de eludirlos. - Prevé eludir el límite de listados. Reddit devuelve un máximo de alrededor de 1000 elementos por listado (100 por página, cursor
after). Contenido más antiguo no está disponible a través de los endpoints estándar. La solución estándar no es "romper" el límite, sino cortar la muestra por tiempo y hacer varias solicitudes estrechas en lugar de una amplia. - Para datos históricos, busca un índice, no la API. Después del cierre de Pushshift, su nicho es ocupado por índices externos como PullPush (gratis, pero sin SLA) y APIs de búsqueda comerciales con su propio índice y otros límites. Para trabajo académico, Reddit tiene un programa separado llamado Reddit for Researchers.
Trampas que se descubren tarde
PRAW adormece el flujo, pero no salva de todo. El limitador integrado de PRAW lee los encabezados y establece pausas por sí mismo — esto funciona muy bien para un script de un solo hilo. El estado actual se puede ver a través de reddit.auth.limits. Esto falla en dos casos: en multihilo con credenciales compartidas (las instancias no ven el consumo entre sí) y en código async, donde el bloqueador time.sleep cuelga el event loop.
Los agentes de IA queman la cuota sin que te des cuenta. Un solo paso de razonamiento de un agente fácilmente se despliega en 10–15 llamadas a herramientas. Diez sesiones paralelas son 100–150 solicitudes simultáneas, es decir, todo el presupuesto por minuto en segundos. Si estás construyendo un agente sobre Reddit, el limitador es necesario a nivel de pool, no de llamada individual.
Polling sin retroceso. Verificar actualizaciones "cada N segundos" sin una pausa exponencial es la segunda causa más frecuente de 429 después del token general.
Dónde realmente se necesitan proxies y dónde no
Seamos honestos: los proxies no aumentan tu límite de la API oficial. La cuota está vinculada a la clave de la aplicación, no a la IP de salida, y tratar de "multiplicarla" cambiando la dirección no funciona y va en contra de los términos. Las tareas que los proxies realmente resuelven en el pipeline de Reddit son diferentes:
- Acceso geográfico y conectividad. Reddit no está disponible o está parcialmente restringido en varios países, y las redes corporativas lo bloquean como una red social. Un nodo de salida estable en la región necesaria es una cuestión de disponibilidad de infraestructura, no de eludir límites. Para tareas de servidor con IP constante, generalmente es suficiente con proxies de centros de datos.
- Resultados regionales. Parte del contenido y recomendaciones de Reddit se entregan teniendo en cuenta la geografía de la solicitud; si estás analizando lo que ve la audiencia de un país específico, necesitas una salida precisamente desde allí.
- Distribución de infraestructura. Cuando varios servicios independientes (recolección, monitoreo de menciones, análisis) viven en un mismo servidor, una única IP se convierte en un punto único de falla para todas las integraciones a la vez.
- Trabajo con cuentas propias. Para moderación, gestión de comunidades y actividad legítima de SMM desde varios perfiles, la asociación "cuenta ↔ IP constante" es una higiene básica. Aquí son apropiados proxies residenciales con sesión sticky.
Pero lo que los proxies no harán: no legalizarán la recolección comercial eludiendo el contrato, no eliminarán el límite de listado de 1000 elementos y no anularán Disallow: / en robots.txt. El enfoque general para trabajar con los límites de las plataformas se detalla en el análisis sobre limitación de tasa en API y el papel de los proxies.
Conclusión
Reddit en 2026 dejó de ser "un conjunto de datos abierto que se puede obtener con .json". El esquema operativo se ve así: acceso OAuth oficial + limitador justo en los encabezados + rotación de tokens dentro de las reglas + índice externo para historia. Los proxies en este esquema son responsables de la disponibilidad y geografía, no de eludir cuotas — y esta es la única función en la que ofrecen un resultado predecible.
Si tu proyecto es comercial, planifica el presupuesto para el contrato con Reddit por adelantado: la historia judicial con Perplexity, Oxylabs y SerpApi muestra que la plataforma está dispuesta a gastar mucho más en proteger sus datos que lo que cuesta el acceso legal.
```