Defesa de Tese de Doutorado de André Paulo Dantas de Araujo, 14/08/26, 9h30, por videoconferência

Path Planning Optimization with Obstacle Avoidance for Autonomous Sailboats Using Hierarchical Reinforcement Learning with Potential Fields  

  

Resumo:

 

O desenvolvimento de veículos marinhos autônomos exige a simulação rigorosa de seus processos de aprendizagem e controle antes da implantação no mundo real. Esta tese aborda o desafio crítico do planejamento de rotas e desvio de obstáculos para veleiros autônomos. Algoritmos de navegação tradicionais, como A* e Otimização por Colônia de Formigas (ACO), operam sob um paradigma rígido de “planejar-para-executar”, dependendo fortemente de mapas de obstáculos completos e a priori. Esta estrita dependência de mapas os torna estruturalmente vulneráveis em ambientes de águas abertas, onde obstáculos não mapeados e dinâmicos são onipresentes. Para superar essa limitação, esta pesquisa propõe a arquitetura de Controle por Reforço Hierárquico (HR-C). O método emprega uma estrutura de dois níveis: a orientação global de rota combina o algoritmo de busca A* com Campos Potenciais Artificiais (APF), enquanto o controle reativo local é gerenciado por uma política aprendida através da Otimização de Políticas Proximais (PPO). Fundamentalmente, o HR-C opera sem qualquer mapa prévio de obstáculos, dependendo exclusivamente de um espaço de observação de 12 dimensões alimentado por dados LiDAR em tempo real, contabilizando explicitamente as correntes oceânicas e o vento aparente. A abordagem é avaliada comparativamente contra métodos clássicos dependentes de mapa (A*+PID e ACO+PID) no ambiente de simulação de alta fidelidade Yara/eSailor. A avaliação abrange cinco cenários complementares: (A) navegação padrão com mapa conhecido, (B) análise de estresse de atuadores utilizando apenas as velas, (C) teste empírico de falsificação com obstáculo desconhecido, (D) ambiente multiagente dinâmico com seis embarcações SDF físicas como obstáculos em tempo real, e (E) uma corrida competitiva com seis agentes avaliando estratégias explícitas de acionamento de vela. Os resultados demonstram que, enquanto os métodos clássicos falham estruturalmente quando suas premissas de mapa são violadas, o HR-C navega com segurança por ameaças não mapeadas e dinâmicas. Além do HR-C baseline, esta tese investiga o desacoplamento do atuador de vela da política PPO. Dois módulos explícitos de controle de vela — um sistema fuzzy Mamdani e um regressor Polinomial ajustado ao diagrama polar do veleiro — são introduzidos e avaliados em uma corrida competitiva com seis agentes. O HR-C Polinomial alcança o melhor desempenho geral: chegada em 57 passos, distância final de 4,2 m, maior velocidade de avanço (1,33 m/s) e redução de 72% no deslocamento total do leme em relação ao PPO puro (1.106° vs. 4.003°), com zero colisões. Todos os métodos clássicos falham na corrida com obstáculos dinâmicos (A*+PID: 48 colisões, ACO+PID: 15 colisões). Esta tese prova qua integração do planejamento estratégico com o aprendizado por reforço guiado por sensores é uma necessidade estrutural para a verdadeira autonomia marítima, e que o acionamento explícito da vela amplifica simultaneamente a velocidade e a longevidade do hardware.

 

Abstract:

 

The development of autonomous marine vehicles requires rigorous simulation of their learning and control processes prior to real-world deployment. This thesis addresses the critical challenge of path planning and obstacle avoidance for autonomous sailboats. Traditional navigation algorithms, such as A* and Ant Colony Optimization (ACO), operate under a rigid “plan-then-execute” paradigm, heavily relying on complete, a priori obstacle maps. This strict map dependency renders them structurally vulnerable in open-water environments where uncharted and dynamic obstacles are ubiquitous. To over-come this limitation, this research proposes the Hierarchical Reinforcement Control (HR-C) framework. The method employs a two-level architecture: global path guidance combines the A* search algorithm with Artificial Potential Fields (APF), while local reactive control is managed by a policy learned through Proximal Policy Optimization (PPO). Critically, HR-C operates without any prior obstacle map, relying exclusively on a 12-dimensional observation space driven by real-time 2D LiDAR data, explicitly accounting for ocean currents and apparent wind. The approach is comparatively evaluated against classical map-dependent baselines (A*+PID and ACO+PID) in the high-fidelity Yara/eSailor simulation environment. The evaluation covers five complementary scenarios: (A) standard navigation with a known map, (B) a sail-only actuator stress analysis, (C) an empirical falsification test using a controlled unknown obstacle, (D) a dynamic multi-agent environment with six SDF-physical vessel bots as real-time obstacles, and (E) a six-agent competitive race benchmark evaluating explicit sail actuation strategies. Results across all five scenarios demonstrate that while classical methods fail structurally or behave erratically when their map assumptions are violated, HR-C safely navigates uncharted and dynamic threats autonomously. Beyond the baseline HR-C, this thesis further investigates the decoupling of the sail actuator from the PPO policy. Two explicit sail modules — a Mamdani Fuzzy inference system and a Polynomial regressor fitted to the vessel’s polar diagram — are introduced and benchmarked in a novel six-agent competitive race. The Polynomial HR-C achieves the best overall performance: mission completion in 57 steps, a final distance of 4.2 m, the highest surge speed (1.33 m/s), and a 72% reduction in total rudder displacement compared to the pure end-to-end PPO baseline (1,106° vs. 4,003°), with zero collisions. All classical baselines fail in the dynamic-obstacle race (A*+PID: 48 collisions, ACO+PID: 15 collisions). This thesis proves that integrating strategic planning with sensor-driven reinforcement learning is a structural necessity for true maritime autonomy, and that explicit sail actuation further amplifies both speed and hardware longevity.

 

Banca  examinadora:

 

Prof. Esteban Walter Gonzalez Clua, UFF – Presidente

Profa. Flavia Cristina Bernardini, UFF

Prof. Raphael Pereira de Oliveira Guerra, UFF

Prof. Luiz Marcos Garcia Gonçalves, UFRN   

Prof. Cosimo Distante, CNR     

Prof. Luis Martí Orosa, Inria Chile

Related Posts

Leave a Reply