Blog · BL-08
Análisis de datos en Xiaohongshu: cómo usar la exportación de notas y las instantáneas históricas
A partir de la práctica de exportación de datos por parte de creadores, comprende los valores acumulados e intervalos, las fechas de instantáneas, los incrementos de favoritos, la deduplicación y las muestras faltantes para evitar comparar periodos y notas diferentes.
Tras exportar los datos de notas en Xiaohongshu, si deseas conocer los favoritos añadidos recientemente, debes confirmar primero si el campo corresponde a un valor acumulado o a un intervalo, y después comparar dos observaciones de la misma nota y bajo el mismo criterio. Con una sola tabla de totales actuales suele ser imposible reconstruir la trayectoria de crecimiento de cada día pasado; importar el archivo repetidamente cada día tampoco generará de forma automática datos históricos fiables.
El proyecto xhs-trail compartido por DeanThompson en V2EX ofrece un enfoque concreto: observar los cambios de las notas a lo largo del tiempo utilizando la tabla exportada desde el panel de creador. Lo valioso de su propuesta es la idea de conservar múltiples observaciones, no trasladar las funciones del autor cambiando de nombre.
Este artículo verifica la publicación original, el archivo README del autor y la documentación de herramientas relacionada hasta el 2026 de 9 de 5, ofreciendo un método de procesamiento de datos independiente. No hemos instalado ni auditado este proyecto, ni hemos accedido al panel con sesión iniciada en Xiaohongshu; las entradas de exportación específicas, los campos y el alcance disponible quedan sujetos a tu cuenta real autorizada.
Los datos de tu propio panel y los datos de notas públicas son diferentes
Las notas públicas, los textos de comentarios y los informes de estadísticas de creadores ayudan a responder preguntas distintas. Los primeros sirven para estudiar contenido de debate público, mientras que los segundos pueden ayudarte a revisar tu propio rendimiento de impresiones, lecturas o conversiones, aunque primero debes revisar qué ofrece el informe real y no deducir métricas privadas inaccesibles a partir de los puntos públicos.
Por ejemplo, "qué preguntan más los usuarios en los comentarios" y "qué nota tiene mejor conversión de favoritos" no son la misma pregunta. El primero requiere una muestra de comentarios consultable y el segundo un criterio claro de favoritos y lecturas. Incluso si ambos conjuntos de datos incluyen enlaces a notas, no deben combinarse en una tabla sin indicación de procedencia.
La guía de comentarios masivos de Xiaohongshu dentro del sitio analiza la obtención de comentarios en listas de notas conocidas, no la interfaz de estadísticas privadas de cuentas de la competencia. Antes de seleccionar datos, sitúa el problema analítico en la entrada correcta para evitar rodeos.
En el caso de tu propia cuenta, si ya puedes obtener un archivo exportado adecuado, puedes realizar primero el procesamiento sin conexión de forma correcta antes de decidir si requieres otro acceso de datos autorizado. El artículo no asume que la recolección automática sea más idónea que la exportación manual, ni amplía los permisos de exportación a un uso arbitrario.
Distingue primero la fecha de estadística, la fecha de exportación y la fecha de importación
El README del autor recuerda explícitamente asignar una fecha de datos clara al nombre de archivo predeterminado para evitar catalogar erróneamente datos antiguos en el día de hoy. Este aviso responde a un problema frecuente: que un archivo entre al sistema hoy no significa que refleje la situación de negocio de hoy.
Recomendamos registrar por separado al menos tres tiempos: el momento o intervalo estadístico cubierto por el informe, la hora de exportación real y el momento de entrada al sistema analítico. Conserva la zona horaria si es necesario. La hora de modificación del archivo puede servir para revisar operaciones con archivos, pero no debe convertirse en el criterio único de la fecha estadística.
Supongamos que importas de forma tardía el viernes el informe del miércoles; si el programa archiva según la hora de importación, el miércoles se registrará erróneamente como ausente y el viernes aparecerán dos instantáneas en conflicto. Aunque después la resta sea totalmente correcta, la tendencia ya se habrá dibujado mal.
Exportar varias veces el mismo día también exige reglas de revisión: ¿conservar distintos momentos de observación o adoptar la última versión confirmada? Ambos diseños son válidos, pero no deben decidirse de forma fortuita según qué archivo se arrastró al último momento a la página. Los archivos repetidos deben identificarse como importaciones duplicadas y los archivos con modificaciones deben conservar el criterio de sustitución.
Los valores acumulados se pueden restar, los valores de intervalo no se restan de cualquier manera
Lo primero que debes comprobar no es la fórmula, sino la definición de los campos. Si una columna representa los favoritos acumulados hasta cierto momento, la diferencia entre dos instantáneas de la misma nota puede indicar el cambio neto observado en dicho intervalo. Si una columna representa de por sí los "favoritos de los últimos siete días", restar hoy menos ayer arroja la diferencia de dos ventanas móviles, no los favoritos nuevos de hoy.
A continuación se muestra un caso sintético empleado únicamente para ilustrar el método. Los favoritos acumulados de cierta nota el lunes a las 09:00 eran 120, el miércoles a las 09:00 eran 165, y la diferencia es 45. Puedes afirmar que el valor acumulado aumentó netamente en 45 entre ambos momentos, pero no puedes atribuir todo 45 al miércoles ni asegurar que el martes y el miércoles aumentaron 22.5 cada uno.
Si el negocio requiere verdaderamente un ritmo medio, puedes señalarlo por separado como "cambio neto diario medio en un intervalo de 48 horas" conservando al mismo tiempo el intervalo de tiempo real. El valor medio es un resultado de cálculo y no dos puntos de datos diarios que nunca se observaron de manera efectiva.
Tampoco se deben recortar las diferencias negativas directamente a cero. Comprueba primero si se trata de la misma nota, si se utiliza el mismo criterio estadístico y si se ha importado una revisión anterior. Al confirmar que persiste una diferencia negativa, debe conservarse como una reducción neta observada o un cambio pendiente de explicar, en lugar de inventar un motivo de depuración determinado por la plataforma. Aquí se calculan diferencias de conteo y no una reconstrucción del comportamiento individual del usuario.
Conecta las instantáneas mediante la identidad de la nota, no mediante el título
Los títulos pueden modificarse y los artículos de una misma serie también pueden tener títulos similares. Da prioridad al uso de un identificador de nota autorizado y confirmado para que sirva de base de correlación entre instantáneas; en el procesamiento multicuenta también debe conservarse el ámbito de la cuenta. Las coincidencias candidatas basadas únicamente en "título y fecha de publicación" exigen verificación en caso de conflicto y no deben asumirse silenciosamente como clave principal permanente.
Antes de importar debes verificar si aparecen claves duplicadas en el mismo lote de datos. Si una nota aparece dos veces en la tabla izquierda y dos veces en la derecha, una combinación ordinaria podría generar cuatro filas, haciendo que parezca que tanto el crecimiento como las muestras se han duplicado. La documentación de combinación de pandas proporciona validate="one_to_one" para comprobar la unicidad de las claves de combinación en ambos lados, mientras que indicator permite distinguir los registros que aparecen en un solo lado.
Incluso sin utilizar pandas, vale la pena conservar esta comprobación: confirma primero qué representa una fila antes de realizar la combinación. No te limites a tomar el valor máximo tras ver filas duplicadas; las repeticiones pueden deberse a una reexportación de archivos o bien a una mezcla de cuentas o criterios estadísticos, y el tratamiento para cada caso es diferente.
Si utilizas SQLite para almacenar las instantáneas, la explicación oficial de UPSERT indica que se basa en restricciones de unicidad para gestionar los conflictos. Una base de datos previene escrituras duplicadas, pero desconoce si has seleccionado una fecha de instantánea errónea. Debes determinar primero las reglas de unicidad de cuenta, nota, momento estadístico y criterio antes de decidir si una importación repetida se ignora, se rechaza o se registra como una revisión.
La ausencia de una tabla no significa que el crecimiento de ese día sea cero
Si una nota no aparece en la exportación actual, puede deberse a un rango de filtrado diferente, a un archivo incompleto o a un fallo de coincidencia. A partir de su mera ausencia no puede determinarse que la nota haya sido eliminada ni tampoco restablecer sus métricas acumuladas a cero.
Al comparar dos instantáneas, se aconseja dividir los registros entre aquellos presentes en ambos lados, los presentes solo en la anterior y los presentes solo en la posterior. Únicamente los registros comunes cuya identidad y criterio coincidan de forma confirmada deben pasar a la comparación directa de diferencias. Las notas aparecidas recientemente sin un valor anterior fiable deben mostrarse de manera individual con su observación actual, sin asumir por defecto que antes valían cero.
El informe también debe hacer público este límite. Por ejemplo, decir "esta comparación cubre las notas emparejables de ambos archivos" es más exacto que redactarlo incondicionalmente como "crecimiento de toda la cuenta esta semana". Si deseas calcular un agregado para toda la cuenta, necesitas confirmar el alcance de exportación y el tratamiento de los datos faltantes en lugar de sumar directamente todas las filas restables.
El planificador de supervisión de reputación multiplataforma del sitio analiza principios similares: las brechas de recolección no pueden convertirse en valores de cero a nivel de negocio. Este principio se aplica por igual tanto si los datos provienen de una interfaz como de Excel.
Al comparar el rendimiento de contenidos, otorga además a las notas la misma oportunidad de observación
Una nota publicada hace 30 días y una nota publicada ayer tienen valores acumulados distintos que no indican diferencias en la calidad del contenido. Puedes compararlas primero de acuerdo con una ventana de observación idéntica tras su publicación, por ejemplo, los cambios disponibles en un periodo de duración equivalente tras publicarse; aquellas notas que carezcan de suficientes instantáneas se marcarán como no comparables de momento.
Al comparar tasas de favoritos, especifica también si el denominador corresponde a lecturas, visualizaciones o impresiones, y confirma que numerador y denominador proceden del mismo criterio. Si pretendes obtener una tasa combinada de toda la muestra, por regla general debes sumar por separado el numerador y el denominador antes de realizar la división; promediar directamente la tasa de cada pieza otorga el mismo peso a las notas con pocas lecturas que a aquellas con muchas. Ambas estadísticas responden a preguntas diferentes y no deben recibir la misma denominación de "tasa media de favoritos".
Por último, convierte los resultados en pistas para la siguiente decisión de contenido en lugar de atribuirlos al algoritmo. Si una nota antigua registra un incremento observable constante, te puede sugerir revisar su temática y la demanda en los comentarios, pero a través de la instantánea por sí sola no es posible demostrar qué clase de mecanismo de recomendación obtuvo ni garantizar con ello que la próxima repetición del mismo tema vaya a tener éxito.
Lo que verdaderamente exige el análisis de datos en Xiaohongshu no es solo una tabla mayor, sino la capacidad de explicar de cada número a qué objeto, en qué momento y bajo qué criterio pertenece. Si pones en orden primero las fechas, las identidades, los incrementos y el tratamiento de los datos faltantes, incluso una cantidad reducida de exportaciones autorizadas resultará más útil que una "lista de crecimiento" incapaz de restituir su proceso de cálculo.