GERAÇÃO E VALIDAÇÃO DE BASE DE DADOS SINTÉTICA PARA ANÁLISE DE POTENCIAL HÍDRICO FOLIAR A PARTIR
DE ESTATÍSTICAS DESCRITIVAS EM ENGENHARIA AGRÍCOLA
Dados sintéricos; Aprendizagem de máquinas; Modelagem de Surrogados; Inteligência Artificial.
A restrição ao acesso de dados brutos de pesquisa, motivada por questões de confidencialidade, propriedade intelectual ou barreiras legais, representa um obstáculo significativo à reprodutibilidade científica e ao desenvolvimento colaborativo de modelos preditivos. Esta tese propõe e valida um pipeline metodológico para a reconstrução de bases de dados sintéticas utilizando exclusivamente estatísticas descritivas agregadas e matrizes de correlação, aplicado ao monitoramento do potencial hídrico foliar (Ψ𝑤) do cafeeiro (Coffea arabica L.). A metodologia integra propriedades univariadas com dependências multivariadas para superar as limitações da síntese independente. Um conjunto de dados de 882 amostras e 101 variáveis foi reconstruído e submetido a um rigoroso protocolo de validação. Os resultados demonstraram alta fidelidade estatística, atingindo um escore global de similaridade Kolmogorov-Smirnov (KS) de 90,93% e uma similaridade de correlação de 81,87%. Observou-se uma robusta predominância de variáveis nos estratos superiores, com 97,1% do dataset apresentando similaridade acima de 70%, o que confirma que a base sintética mimetiza com precisão as distribuições marginais e a estrutura de dependência do dataset real. No que tange à utilidade preditiva, houve forte concordância entre os modelos treinados em ambos os domínios. Embora os dados sintéticos apresentem uma leve tendência de linearização, modelos de ensemble mantiveram desempenho consistente (𝑅2>0,84) em ambos os ambientes. A análise de parsimônia revelou que o sinal sintético é suficientemente íntegro para permitir que regressores eficientes atinjam alta acurácia em tempos de processamento reduzidos (inferiores a 0,2 segundos). Esta pesquisa conclui que tabelas estatísticas estáticas podem ser transformadas em ambientes preditivos dinâmicos e funcionalmente fiéis, democratizando o acesso a dados na Engenharia Agrícola e garantindo a conformidade institucional e a privacidade.