
Dados de Proveniência para Rastreabilidade e Confiabilidade de Indicadores do Saneamento Básico
Resumo:
Contextualização: O processo de formulação, aplicação e acompanhamento de políticas públicas, exige com que o tomador de decisão se baseie em dados e em indicadores. No planejamento das cidades, as entidades públicas e privadas processam elevados volumes de dados brutos para formar esses indicadores. Problema: A ausência de mecanismos de rastreabilidade e de linhagem no processo de conversão de registros brutos em indicadores estruturados gera dificuldades analíticas e restringe a auditoria da informação gerada, dificultando o processo de construção e acompanhamento de políticas públicas. Focando no setor de saneamento básico, por muitas vezes os indicadores são gerados de maneira manual. Com o processo de transição digital, cada vez mais as empresas de saneamento básico estão gerando dados das suas plantas de tratamento e distrição por meio de sensores, nesse cenário, se torna possível a captura não somente do indicador gerado, e sim, de todo o processo de coleta, transformação e armazenamento dos dados utilizados para gerar o indicador. Objetivo: Por meio de um framework computacional direcionado à integração, ao processamento e à gestão de metadados de proveniência aplicados a dados de saneamento básico, promovemos as propriedades de reprodutibilidade e rastreabilidade das variáveis e dos indicadores de Saneamento Básico. Metodologia: Estruturamos a pesquisa através da metodologia Design Science Research. Inicialmente, executamos uma Revisão Sistemática da Literatura e propusemos uma taxonomia para proveniência de dados estruturada em oito dimensões técnicas. Na sequência, aplicamos um método de alinhamento de instrumentos normativos estatais e utilizamos o modelo conceitual PROV-DM para arquitetar os fluxos de proveniência. Instanciamos os modelos computacionais por meio de rotinas programadas em Python e uma ferramenta de proveniência. Resultados: Apresentamos uma taxonomia para proveniência de dados de indicadores para auxiliar na modelagem da proveniência prospectiva e retrospectiva dos indicadores de saneamento básico. Capturamos a proveniência retrospectiva para gerar grafos direcionais. Estes artefatos documentam as instâncias de execução e a linhagem dos dados e dos indicadores, a exemplo do Índice de Atendimento Total de Água. Conclusões: Com todas as etapas superadas, pretendemos que a implementação do framework forneça a capacidade técnica para auditar o ciclo de vida da informação e reduz o risco de anomalias nas bases de dados governamentais. Concluímos que o framework anexa uma camada de explicabilidade, viabilizando a validação de operações para os sistemas de suporte à decisão nas cidades.
Abstract:
Contextualization: The process of formulating, applying, and monitoring public policies requires decision-makers to base actions on data and indicators. In city planning, public and private entities process raw data volumes to form these indicators. Problem: The absence of traceability and lineage mechanisms in the conversion process of raw records into structured indicators generates analytical difficulties and restricts the auditing of the generated information, hindering the process of constructing and monitoring public policies. Focusing on the basic sanitation sector, indicators are frequently generated manually. With the digital transition process, basic sanitation companies generate data from their treatment and distribution plants through sensors. In this scenario, it becomes possible to capture not only the generated indicator but the entire process of collection, transformation, and storage of the data used to generate the indicator. Objective: Through a computational framework directed at the integration, processing, and management of provenance metadata applied to basic sanitation data, the properties of reproducibility and traceability of the variables and indicators of Basic Sanitation are promoted. Methodology: The research is structured through the Design Science Research methodology. Initially, a Systematic Literature Review is executed, and a data provenance taxonomy structured in eight technical dimensions is proposed. Subsequently, an alignment method for state normative instruments is applied, and the PROV-DM conceptual model is used to architect the provenance flows. The computational models are instantiated through routines programmed in Python and a provenance tool. Results: A data provenance taxonomy for indicators is presented to assist in modeling the prospective and retrospective provenance of basic sanitation indicators. Retrospective provenance is captured to generate directional graphs. These artifacts document the execution instances and the lineage of the data and indicators, such as the Total Water Service Index. Conclusions: With all stages completed, the framework implementation provides the technical capacity to audit the information lifecycle and reduces the risk of anomalies in governmental databases. The framework attaches an explainability layer, enabling the validation of operations for decision support systems in cities.
Banca examinadora:
Profa. Flavia Cristina Bernardini, UFF – Presidente
Prof. Daniel Cardoso Moraes de Oliveira, UFF
Prof. Marcos Vinicius Naves Bêdo, UFF
Profa. Raissa dos Santos Barcellos, UERJ