Tech Insights

¿Cuántos datos históricos necesitas para pronosticar métricas de IoT?

Cuántos datos históricos de IoT necesita realmente un pronóstico: la regla ligada a tu ciclo estacional, por qué más no siempre es mejor y cómo empezar antes de tener años acumulados.

David Hall ·
¿Cuántos datos históricos necesitas para pronosticar métricas de IoT?

“Todavía no podemos pronosticar, no tenemos suficientes datos” es una de las razones más comunes por las que un proyecto predictivo nunca arranca. Suena responsable. Por lo general está equivocada, o al menos es demasiado vaga para actuar sobre ella, porque la respuesta honesta no es un número fijo de filas. Depende del ritmo de aquello que estás prediciendo.

El error detrás de la excusa es tratar el volumen de datos como el requisito. Lo que un pronóstico realmente necesita es suficiente historia para ver el patrón repetirse. Una señal que cicla a diario llega a ese punto en semanas. Una señal que cicla cada año no, sin importar cuántas lecturas por segundo recopiles mientras tanto. Si aciertas con esta distinción, normalmente puedes empezar mucho antes de lo que temías.

La regla que importa: cubre el ciclo unas cuantas veces

Un pronóstico aprende al ver que un patrón ocurre más de una vez. Así que el requisito está ligado a tu ciclo relevante más largo, no a un conteo de filas.

Si tu señal se repite a diario, como carga energética, ocupación o consumo de agua, quieres al menos unas cuantas semanas de historia para que el modelo vea las formas de los días laborales y de fin de semana varias veces. Si el ciclo dominante es semanal, quieres un par de meses. Si es estacional a lo largo del año, realmente necesitas más de un año, y no hay atajo, porque un modelo no puede pronosticar un verano que nunca ha visto.

Una alta frecuencia de muestreo no sustituye el lapso de tiempo. Un millón de lecturas de tres días todavía le muestra al modelo solo tres días. Para pronosticar, la cobertura de calendario le gana al volumen bruto casi siempre.

Una señal cíclica que se repite, con las primeras repeticiones sombreadas como historia suficiente

Más datos no es automáticamente mejor

Hay una segunda trampa del otro lado: acumular años de historia y alimentar todo eso al modelo. Los datos viejos pueden hacer daño. Si tu proceso cambió, una línea fue actualizada, un edificio fue renovado, una estructura de tarifas se modificó, entonces los datos de antes del cambio le enseñan al modelo un mundo que ya no existe. Va a pronosticar el pasado.

Una postura práctica: usa suficiente historia para cubrir tu ciclo varias veces, prefiere los datos recientes y muéstrate dispuesto a cortar cualquier cosa anterior a un cambio de escalón conocido. Un modelo entrenado con el último periodo representativo normalmente le gana a uno entrenado con todo desde la instalación.

Lo que necesitas también depende del modelo

Los modelos más simples tienen más hambre de estructura que de volumen. Una línea base estacional o un ajuste con Prophet pueden producir un pronóstico útil a partir de unos pocos ciclos de datos limpios. Los modelos de aprendizaje profundo, un LSTM en particular, son lo opuesto: quieren muchos ejemplos para aprender patrones no lineales, y sobreajustan gravemente con historias cortas, produciendo tonterías con mucha confianza.

Esta es otra razón para empezar simple. Al inicio de un despliegue, cuando la historia es escasa, un modelo estacional no solo es más fácil, es más apropiado. Guarda los modelos hambrientos de datos para cuando tengas tanto el volumen como una necesidad comprobada.

Cómo empezar antes de tener “suficiente”

No tienes que esperar a ciegas mientras los datos se acumulan. Lanza el pronóstico más simple en cuanto tengas unos pocos ciclos, una media móvil y luego una línea base estacional, y déjalo correr. Sus primeras predicciones serán toscas. Está bien, porque también lo estás calificando, así que aprendes exactamente qué tan tosco es y observas cómo el error se reduce a medida que la historia se acumula.

Correr un pronóstico débil en vivo te enseña más que esperar por un conjunto de datos perfecto. Saca a la luz problemas de calidad de datos, huecos y desvíos mientras lo que está en juego es poco, y le da a los operadores algo a lo que reaccionar y corregir. Para cuando tengas suficiente historia para un modelo serio, ya tienes un ciclo en funcionamiento donde colocarlo.

La respuesta corta

Suficiente historia significa unas cuantas repeticiones de tu ciclo importante más largo, ponderada hacia los datos recientes, cortada en el último cambio real de tu proceso. Para la mayoría de las señales de IoT con patrón diario eso son semanas, no años. Empieza con un modelo simple ahora, califícalo y mejóralo a medida que los datos lo justifiquen.

El ciclo que hace esto fácil, leer datos recientes, pronosticar, calificar, repetir, corre según un horario en TagoIO Analytics, así que puedes empezar a pronosticar la misma semana en que tus sensores entran en línea.

También puedes descubrir hasta dónde te lleva tu historial sin escribir nada. Inicia sesión en TagoIO Analytics en sight.tago.io/login con tu cuenta de TagoIO, elige una señal y entrena un modelo en minutos. Genera pronósticos y detección de anomalías a partir de los datos que ya tienes, sin código y sin un científico de datos.