Historiadores de datos y calidad del agua: transformando flujos de sensores en registros

Introducción técnica · Perspectiva de ingeniería · Publicado: 29 de septiembre de 2026

Puntos clave

  • Un data historian es el sistema de registro de todo lo que cambia en un proceso a lo largo del tiempo. Recopila datos de proceso con marca temporal de sensores, PLC, DCS y sistemas SCADA —comúnmente mediante protocolos como OPC UA o Modbus— y registra cada medición como un par etiqueta-valor con una marca temporal y un código de calidad [1].
  • La compresión es lo que hace asequible almacenar durante años a alta frecuencia. Con 10,000 etiquetas registrando una vez por segundo, el almacenamiento bruto asciende a aproximadamente 27 GB por día (unos 10 TB por año sin comprimir), y la compresión swinging-door normalmente lo reduce por un factor de 10-20 [2].
  • En las plantas de agua, las bases de datos historian de SCADA registran datos continuos del proceso —turbidez, residuales de cloro, valores CT, rendimiento de filtros— en los intervalos exigidos por las normas de agua potable de la EPA en 40 CFR Part 141, razón por la cual los inspectores cada vez piden más el registro del historian en lugar del libro de bitácora [3].
  • Un hueco en el archivo debe permanecer visible. Un intervalo en el que no se recopilaron valores válidos —colector caído, comunicaciones perdidas, la fuente dejó de responder— nunca debe interpolarse silenciosamente como si la señal simplemente se hubiera mantenido estable [4].
  • El formato de salida ya existe. Water Quality Exchange (WQX) de la EPA es el marco estándar mediante el cual más de 900 organizaciones federales, estatales, tribales y otras presentan datos de monitoreo de calidad del agua al almacén nacional de datos [5].
  • Comprobación de escala: una empresa mediana de servicios con 100,000 medidores inteligentes generando lecturas horarias produce aproximadamente 8.7 millones de filas de medidor por día, y la ingesta total diaria, incluida la telemetría SCADA, puede superar los 10 millones de filas [6].

Qué es un Historian — y qué no es

Un data historian es software especializado diseñado para recopilar, almacenar y recuperar datos de proceso con marca temporal procedentes de equipos industriales —sensores, PLC, sistemas de control distribuido, SCADA. Se conecta a dispositivos de planta mediante protocolos industriales como OPC UA, OPC DA y Modbus, y registra cada medición como un par etiqueta-valor con una marca temporal y un código de calidad, aplicando compresión industrial para que años de series temporales de alta frecuencia sigan siendo almacenables y consultables. En industrias de proceso, incluido el tratamiento de agua, el historian es el sistema de registro de todo lo que cambia en el proceso con el tiempo [1].

Tres aclaraciones evitan la mayor parte de la confusión. Primero, un historian no es el sistema de control: el PLC decide y actúa en milisegundos, mientras que el historian recuerda. Segundo, no es una base de datos empresarial de propósito general. Las bases de datos transaccionales priorizan la precisión por registro; un historian está construido para la ingesta secuencial y de alta velocidad de valores ordenados por tiempo y para una recuperación rápida por ventanas temporales. Tercero, no es un data lake. El historian conserva la verdad bruta del proceso en unidades de ingeniería, y las plataformas de analítica se construyen sobre él en lugar de reemplazarlo.

Para la calidad del agua, esta distinción importa porque las propias mediciones —pH, conductividad, turbidez, residual de cloro, oxígeno disuelto— son la base probatoria tanto para el control del proceso como para la presentación regulatoria. Dónde vive esa evidencia, y cuán honestamente se almacena, determina lo que la planta podrá demostrar después.

Compresión, marcas temporales y códigos de calidad: la maquinaria de la evidencia

Los historians se ganan su lugar con un esquema de filtrado en dos etapas que vale la pena explicar a cualquiera que alguna vez se haya preguntado por qué la tendencia parece “demasiado suave” o por qué el archivo no creció durante una década.

Etapa uno — reporte por excepción. En la interfaz, un nuevo valor se transmite aguas arriba solo cuando difiere del último valor transmitido en más de una banda muerta configurada. Una señal plana casi no genera tráfico; una señal cambiante reporta cada movimiento significativo.

Etapa dos — compresión swinging-door. Dentro del archivo, algoritmos como el método de trending swinging-door almacenan un nuevo punto solo cuando la desviación respecto a la línea recta que conecta los puntos almacenados previamente supera una desviación de compresión. El resultado es una aproximación lineal por tramos cuyo error queda acotado por la tolerancia configurada. La aritmética de ingeniería publicada muestra la magnitud del efecto: 10,000 etiquetas registrando una vez por segundo generan del orden de 27 GB por día de datos brutos, unos 10 TB por año, y la compresión swinging-door suele reducir eso entre 10 y 20 veces [2].

Dos ajustes deciden si esta maquinaria fortalece o debilita un registro de calidad del agua:

  • Desviación de compresión es una decisión de fidelidad. Para etiquetas críticas para el cumplimiento, muchas plantas almacenan cada valor sin pérdida y reservan la compresión para señales no críticas y de cambio rápido. Una banda muerta incorrecta en una etiqueta de residual de cloro puede aplanar una excursión breve que un regulador querría ver.
  • Semántica de interpolación decide qué significa una visualización de tendencia. La mayoría de los historians pueden devolver valores registrados o valores interpolados entre puntos registrados. Ambas son vistas legítimas, pero un informe que trate silenciosamente valores interpolados como mediciones es un informe que está esperando avergonzar a su autor.

Los códigos de calidad son el tercer pilar. Cada valor almacenado lleva una bandera —bueno, malo o incierto [1]— y una planta disciplinada hace que esas banderas formen parte del registro en lugar de un detalle interno. Cuando un sensor estaba siendo calibrado a las 02:00, los datos de esa ventana deberían decirlo para siempre.

Dónde encaja el Historian en la cadena de datos de calidad del agua

La planta moderna de agua es un sistema en capas, y el historian ocupa una capa específica dentro de él. Los sensores de campo miden; los PLC y RTU controlan y amortiguan; la capa SCADA alarma y supervisa; el historian archiva; las capas de reporting y analítica consumen. En la práctica, los sistemas SCADA de agua se conectan a instrumentos y controladores mediante Modbus TCP/IP, DNP3 y OPC UA, y las bases de datos historian de SCADA registran datos continuos del proceso —turbidez, residuales de cloro, valores CT, rendimiento de filtros— en los intervalos requeridos por las normas de agua potable de la EPA bajo 40 CFR Part 141 y reglas estatales comparables [3].

Los volúmenes justifican la arquitectura. Una empresa mediana con 100,000 puntos finales AMI generando lecturas horarias produce aproximadamente 8.7 millones de filas de datos de medidor por día, y si se incluye la telemetría SCADA de plantas y estaciones de bombeo, la ingesta diaria puede superar los 10 millones de filas —antes de contar sensores de calidad del agua o muestras de laboratorio [6].

Capa de la cadena de datos Responsabilidad Puntos de selección que importan
Sensores y analizadores de campo Medir y convertir en señales; origen de la calidad de los datos Salida digital nativa (Modbus RTU/TCP o equivalente); muestreo simultáneo multiparámetro desde una sola sonda; estados de fallo autoinformados
Capa PLC / RTU Control en tiempo real; almacenamiento intermedio de comunicaciones Store-and-forward ante pérdida de comunicación para que no se cree un hueco en el archivo aguas abajo
Capa SCADA / HMI Alarmas, vista del operador, puntos de ajuste Disciplina de gestión de alarmas; sincronización temporal entre sitios
Data historian Archivo con marca temporal; compresión; códigos de calidad Resolución (bruto frente a comprimido por etiqueta), horizonte de retención, estrategia de banda muerta, visibilidad del código de calidad
Reporting, analítica, nube Promedios, exportaciones de cumplimiento, modelos de IA Rutas de exportación estándar (SQL, REST); estructuras de datos compatibles con WQX; sincronización gobernada en la nube en lugar de cargas ad hoc

Valores malos, huecos y las reglas que mantienen honestos los registros

Dos patrones de falla explican la mayor parte del dolor en los registros de calidad del agua basados en historians, y ambos tienen respuestas correctas bien establecidas.

El primero es el hueco: un intervalo en el que el archivo no contiene datos válidos porque la recopilación se detuvo —un colector caído, comunicaciones perdidas, el instrumento fuera de línea. El manejo correcto es explícito. El archivo debe marcar la ausencia en lugar de rellenarla, y la recuperación a través de un hueco nunca debe interpolar silenciosamente como si la señal se hubiera mantenido estable [4]. Un hueco que se ve honestamente es una señal de operación: qué falló, cuándo y durante cuánto tiempo. Un hueco suavizado es un registro fabricado.

El segundo es el valor malo: una lectura que llegó pero es incorrecta, ya sea por burbujas en el sensor, una sonda que deriva en mitad de una calibración o un valor de comunicaciones congelado. El código de calidad del historian es el vehículo correcto [1]. Marque el valor como incierto o malo, consérvelo en el archivo, exclúyalo de los promedios de forma consciente y registre la acción de mantenimiento que lo explicó. Editar manualmente datos históricos de proceso para rellenar huecos o corregir valores viola las expectativas básicas de integridad de datos y no sobreviviría a una auditoría; la corrección pertenece a la configuración —sensores redundantes, conmutación automática de fuente, umbrales de calidad— no a los datos.

Cómo sacar de nuevo los registros: auditorías, informes y la nube

El beneficio del historian llega cuando alguien hace una pregunta: un inspector, un ingeniero de procesos, un modelo de IA. Los inspectores cada vez quieren más registros de monitoreo continuo en lugar de lecturas puntuales, porque un puñado de entradas manuales por turno no puede demostrar cumplimiento continuo. Un historian convierte el informe mensual de una tarea de compilación manual en un trabajo de exportación [3].

Para informes ambientales y del entorno, el formato de destino ya existe. Water Quality Exchange de la EPA define un conjunto estándar de elementos de datos al que los socios de datos asignan sus registros antes de enviarlos al almacén nacional de datos STORET, y por él fluye la calidad del agua enviada por más de 900 organizaciones federales, estatales, tribales y otras [5]. Una planta cuyo modelo interno de datos —unidades, marcas temporales, calificadores de resultados— refleja esa disciplina encuentra trivial la exportación. Una que inventa sus propias convenciones descubre que se convierte en un proyecto.

Las plataformas en la nube encajan aguas abajo del historian, no al lado de él. El archivo permanece cerca del sistema de control donde viven sus escritores; copias gobernadas, resumidas o de fidelidad completa fluyen hacia afuera para analítica. El objetivo de diseño se expresa mejor en una sola línea: sensores que alimentan su modelo de agua con IA, no solo su panel. Eso exige que el modelo vea datos sincronizados, marcados con calidad y multiparámetro, con marcas temporales honestas —exactamente el contrato que ofrece un historian bien configurado. Los analizadores multiparámetro en línea de Shanghai ChiMay están construidos como fuentes para ese contrato, publicando salida digital Modbus con muestreo simultáneo de parámetros; la documentación del producto se recopila en la página en línea de analizadores de agua multiparámetro de Shanghai ChiMay.

Lista de verificación de selección

  • Resolución por clase de etiqueta. Decida qué etiquetas son críticas para el cumplimiento y almacénelas sin pérdida; comprima el resto deliberadamente en lugar de hacerlo por defecto.
  • Horizonte de retención. Iguale o supere el período de retención de registros que exija su regulador, y verifique que los datos archivados (no solo los en línea) sigan siendo consultables.
  • Interfaces. OPC UA o DA y Modbus en el lado de recolección [1]; SQL, REST y exportaciones de archivos en el lado de consumo; estructuras mapeables a WQX para informes ambientales [5].
  • Disciplina temporal. Un solo reloj para SCADA, historians e instrumentos. La incertidumbre de la marca temporal es corrupción de datos que ningún algoritmo de compresión puede reparar.
  • Transparencia del código de calidad. Si el historian sabe que un valor es malo, todo consumidor —tendencia, informe, modelo— debe poder saberlo también.
  • Comportamiento ante huecos. Confirme que el sistema muestra los huecos como huecos [4], y que los ajustes de excepción y compresión están documentados por etiqueta [2].

El historian es infraestructura poco glamorosa, que es precisamente por eso que decide resultados. Cuando llega la auditoría o se entrena el modelo, la planta que puede producir un registro completo, honesto y con marca temporal gana por hechos.

Referencias

[1] boTec — Process Historian (glosario). Define el data historian como software especializado que recopila, almacena y recupera datos de proceso con marca temporal procedentes de sensores, PLC, DCS y SCADA a través de protocolos como OPC UA, OPC DA y Modbus, registrando cada medición como un par etiqueta-valor con marca temporal y código de calidad.
https://botec.com/glossary/process-historian

[2] SYMESTIC — Industrial Data Historian: Time-Series DBs & Compression. Desarrolla la aritmética de almacenamiento para 10,000 etiquetas registrando cada segundo: aproximadamente 27 GB por día en bruto y 10 TB por año sin comprimir, reducidos por un factor típico de 10-20 con compresión swinging-door.
https://www.symestic.com/en-us/what-is/industrial-data-historian

[3] NFM Consulting — How SCADA Systems Work in Water Treatment Plants. Describe los protocolos SCADA de agua (Modbus TCP/IP, DNP3, OPC UA) y señala que las bases de datos historian de SCADA registran datos continuos del proceso —turbidez, residuales de cloro, valores CT, rendimiento de filtros— en los intervalos exigidos por la EPA 40 CFR Part 141 y las normas estatales.
https://www.nfmconsulting.com/knowledge/how-scada-works-water-treatment-plants

[4] Merobix — What Are Data Gaps in Historians? Explica que un data gap es un intervalo en el que el archivo no contiene datos válidos porque la recopilación se detuvo, y que los huecos deben registrarse explícitamente en lugar de interpolarse silenciosamente como si la señal se hubiera mantenido estable.
https://www.merobix.com/blog/what-is-a-data-gap-historian

[5] U.S. EPA — Water Quality Data / Water Quality Exchange (WQX). Describe WQX como el formato universal para compartir datos de calidad del agua, con envíos de más de 900 agencias federales, estatales y tribales y otras organizaciones.
https://19january2025snapshot.epa.gov/waterdata/water-quality-data

[6] TigerData — Water Utilities Database: How to Store and Query SCADA, AMI, and Quality Data at Scale. Estima una empresa mediana de servicios con 100,000 puntos finales AMI en aproximadamente 8.7 millones de filas de medidor por día, con una ingesta diaria total que supera los 10 millones de filas cuando se incluye la telemetría SCADA.
https://www.tigerdata.com/learn/water-utilities-database-how-to-store-query-scada-ami-quality-data-at-scale

Sobre el autor: Escrito por el equipo editorial técnico de Shanghai ChiMay — el grupo detrás de la documentación de analizadores de calidad del agua en línea de Shanghai ChiMay, trabajando a diario en proyectos de pH, conductividad y sensado multiparámetro donde la integración a nivel Modbus y los datos listos para historian forman parte del producto, no una ocurrencia tardía.