José Rui Roque da Silva Fernandes
Modelos de Linguagem de Larga Escala para a Deteção de Anomalias em Dados Geoespaciais
Resumo
A qualidade de dados geoespaciais é tipicamente avaliada por meio de regras codificadas manualmente ou de ferramentas de qualidade de dados (FQDs) de cobertura restrita a formatos e vocabulários específicos, com a extensibilidade ainda dependente de codificação manual. Modelos de Linguagem de Larga Escala (LLMs) surgem como alternativa para avaliar defeitos sensíveis ao contexto, sem a codificação exaustiva de regras, o que representa um tópico pouco explorado na avaliação da qualidade de dados geoespaciais. Este trabalho propõe investigar quatro estratégias de uso do LLM (zero-shot, zero-shot com tool-use, few-shot e few-shot com tool-use) para a detecção de anomalias geoespaciais segundo os grupos de elementos da ISO 19157, avaliadas contra o padrão-ouro produzido por poluição controlada de dados reais. O protocolo metodológico combina modelo de linguagem, estratégia de uso e anomalia sobre cinco conjuntos de dados geoespaciais reais, submetidos a um processo controlado de poluição de dados. Espera-se, como contribuições, uma análise comparativa dessas estratégias e modelos e uma pipeline de qualidade de dados geoespaciais baseada em LLM, avaliada empiricamente.
