> ## Documentation Index
> Fetch the complete documentation index at: https://www.octoparse.com/docs/llms.txt
> Use this file to discover all available pages before exploring further.

# Minería de datos de redes sociales

> Cómo recopilar publicaciones, perfiles, interacciones y tendencias públicas respetando los límites de la plataforma, la privacidad y las API.

Los datos de redes sociales son útiles porque reflejan lenguaje, atención, quejas, tendencias, creadores, comunidades y reacciones públicas casi en tiempo real. También constituyen una de las categorías de datos web con más riesgos: las plataformas imponen condiciones estrictas, las expectativas de los usuarios varían y los perfiles pueden contener información personal.

Usa el web scraping con precaución. Recopila solo datos públicos que tengas permitido utilizar, evita el contenido privado o protegido por inicio de sesión y prioriza las API oficiales cuando ofrezcan el acceso necesario.

## Qué recopilan los equipos

Proyectos habituales:

* Monitoreo de marcas y opiniones
* Descubrimiento de creadores o influencers
* Análisis de reseñas y quejas públicas
* Detección de tendencias
* Investigación de contratación y empresas
* Investigación de comunidades
* Análisis de contenido de la competencia

Los campos útiles dependen de la plataforma, pero suelen incluir texto, metadatos del autor, marca de tiempo, recuentos de interacción, URL multimedia, URL del perfil, hashtags, comentarios y enlaces de origen.

## Mapa de plataformas

| Plataforma | Datos públicos habituales                                                    | Casos de uso frecuentes                                                     |
| ---------- | ---------------------------------------------------------------------------- | --------------------------------------------------------------------------- |
| Reddit     | Publicaciones, comentarios, subreddits, puntuaciones, marcas de tiempo       | Investigación de comunidades, opinión, comentarios sobre productos          |
| YouTube    | Metadatos de vídeos, comentarios, canales, visualizaciones, Me gusta         | Descubrimiento de creadores, análisis de reseñas, seguimiento de tendencias |
| TikTok     | Vídeos públicos, textos, perfiles de creadores, interacciones                | Investigación de creadores, monitoreo de tendencias                         |
| X/Twitter  | Publicaciones, perfiles, recuentos de republicaciones, Me gusta y respuestas | Noticias, opinión, monitoreo de eventos                                     |
| LinkedIn   | Perfiles públicos, páginas de empresas, empleos, publicaciones               | Selección de personal, investigación B2B, señales de contratación           |

La API LinkedIn Scraper de Bright Data, por ejemplo, se organiza en torno a perfiles, empresas, empleos y publicaciones. El ecosistema de LinkedIn de Apify tiene actores separados para perfiles, empresas y empleos. Esto refleja una pauta general: una red social no es un único conjunto de datos. Trata cada tipo de página como un flujo independiente, con sus propios límites y riesgos.

## Datos públicos frente a datos de la cuenta

La distinción más importante es el nivel de acceso.

* **Datos públicos**: visibles sin iniciar sesión o al visitar una URL pública.
* **Datos públicos con inicio de sesión**: pueden requerir autenticación, pero pertenecen a páginas públicas.
* **Datos privados o restringidos**: mensajes directos, grupos privados, perfiles no públicos, analíticas privadas o datos sujetos a permisos.

Evita datos privados o sujetos a permisos salvo que tengas autorización explícita. Extraer contenido tras una pantalla de inicio de sesión aumenta los riesgos legales, éticos y para la cuenta.

## Desafíos técnicos

Las plataformas sociales son dinámicas y cuentan con defensas intensivas.

* Son habituales el desplazamiento infinito y las API basadas en cursores.
* Las publicaciones pueden eliminarse o editarse.
* Los recuentos de interacción cambian continuamente.
* Los resultados de búsqueda pueden personalizarse o variar por región.
* Los avisos de inicio de sesión y los límites aparecen rápidamente.
* Los sistemas anti-bot analizan la IP, la huella digital, el comportamiento y la confianza de la cuenta.

Para el monitoreo continuo, guarda instantáneas inmutables. Una publicación eliminada posteriormente puede seguir siendo relevante para el análisis, pero necesitas marcas de tiempo y un proceso para gestionar eliminaciones.

## Calidad de los datos

Los datos sociales contienen mucho ruido. Incorpora filtros y contexto al flujo:

* Detección de idioma
* Detección de duplicados y republicaciones
* Filtrado de spam o cuentas bot
* Normalización de periodos
* Extracción de hashtags y menciones
* Contexto del autor o la comunidad
* Tasa de interacción en lugar de interacción bruta

Para analizar opiniones, no dependas únicamente del texto extraído. El sarcasmo, la jerga, los textos citados y las campañas coordinadas pueden distorsionar los modelos sencillos.

## Cumplimiento y ética

El web scraping social debe regirse de forma más estricta que la extracción corriente de productos o directorios.

* Respeta las condiciones de la plataforma y robots.txt.
* Prioriza las API oficiales para usos regulados o recurrentes.
* Evita los datos personales sensibles cuando sea posible.
* Limita los campos a lo que necesita el proyecto.
* No desanonimices usuarios ni combines conjuntos de datos de forma perjudicial.
* Cumple los requisitos de retirada, eliminación y exclusión aplicables.

En investigación, documenta las fechas, términos de búsqueda, límites de muestreo y restricciones. Para usos comerciales, implica pronto a los equipos jurídico y de privacidad.

## Cuándo ayudan las plantillas

Las plantillas y API de scraper gestionadas ayudan a obtener datos estructurados de páginas habituales: empleos de LinkedIn, empresas públicas, comentarios de YouTube, publicaciones de Reddit o perfiles públicos de TikTok. Gestionan la Paginación, los reintentos, el anti-bloqueo y la asignación de campos.

Los flujos personalizados son mejores cuando la pregunta de investigación es acotada, la plataforma cambia a menudo o el análisis exige un muestreo cuidadoso. En la minería de datos sociales, el método de recopilación condiciona las conclusiones. Trátalo como parte del análisis, no como una simple tarea de infraestructura.
