Tiberio Lins Padilha
Uma Arquitetura Multimodal para Avaliação Semântica de Acessibilidade WEB em Critérios da WCAG 2.2
Resumo
A avaliação automatizada de acessibilidade web permite identificar diversas falhas estruturais, mas apresenta limitações quando a verificação depende da interpretação do conteúdo e do contexto em que determinados elementos são apresentados. Essa limitação é particularmente relevante no critério 1.1.1 das diretrizes definidas na WCAG (Web Content Accessibility Guidelines), que trata de alternativas textuais para conteúdos não textuais. A simples presença do atributo alt, por exemplo, não garante que a alternativa textual represente adequadamente a informação ou a função transmitida pela imagem. Inicialmente, esta pesquisa propõe investigar uma arquitetura multimodal para apoiar a avaliação do Critério 1.1.1, combinando informações provenientes de uma página web renderizada com evidências visuais e textuais. A abordagem utiliza o Playwright para carregar a página, identificar elementos não textuais e coletar informações do DOM, do contexto textual e da representação visual dos elementos. Essas informações são posteriormente analisadas por um modelo de visão e linguagem da família Qwen2-VL, com o objetivo de identificar diferentes tipos de inadequação nas alternativas textuais e de produzir sugestões de correção. A avaliação será realizada por meio de um benchmark controlado, composto por páginas web que contêm situações conformes e não conformes ao Critério 1.1.1. Os resultados da abordagem proposta serão comparados aos obtidos por meio de ferramentas automatizadas de avaliação de acessibilidade, como WAVE, Google Lighthouse e AccessMonitor. O desempenho será analisado por meio de precisão, revocação e F1-score, considerando também o desempenho por categoria de falha. Complementarmente, as classificações e sugestões de correção produzidas pelo modelo serão submetidas à avaliação qualitativa. Resultados preliminares obtidos em uma página experimental baseada no portal da Universidade Federal de Alagoas indicam que a combinação de informações visuais e estruturais pode auxiliar na identificação de situações que não são adequadamente verificadas por regras sintáticas. Esses resultados são tratados como evidências iniciais de viabilidade, não como validação definitiva da hipótese. A pesquisa pretende, portanto, avaliar em que medida modelos multimodais podem ampliar a capacidade das ferramentas automatizadas de acessibilidade em situações que exigem análise semântica e contextual.
