
Uma Abordagem para Escalonamento de Workflows Científicos em Ambientes de Nuvem Híbridos VM–Serverless
Resumo:
Aplicações de Ciência e Engenharia Computacional (Computational Science and Engineering – CSE) têm sua lógica de execução frequentemente representada por workflows científicos, cuja execução em larga escala demanda infraestruturas elásticas na nuvem. Nesse contexto, a computação serverless consolidou-se como um paradigma complementar às Máquinas Virtuais (VMs). As funções serverless provisionam recursos sob demanda, mas impõem restrições de tempo de execução, memória e ambiente que as tornam adequadas sobretudo a ativações de curta duração e baixo consumo de recursos; as VMs, por sua vez, permanecem preferíveis para ativações intensivas em computação. Consequentemente, escalonar workflows em nuvens que combinam os dois modelos configura um problema de escalonamento heterogêneo ainda pouco explorado na literatura: além da ordem de execução, o escalonador precisa decidir qual ambiente é mais adequado a cada ativação, considerando que cada um apresenta características de desempenho, modelos de precificação e restrições operacionais distintos. Esta tese apresenta três contribuições complementares para esse problema: (i) Denethor, um sistema de captura de proveniência para workflows executados em ambientes serverless, que reconstrói o fluxo de dados das ativações executadas como funções e fornece dados empíricos de tempo de execução e custo; (ii) FLEXE+IP, um modelo de programação inteira que formula o problema de escalonamento de forma exata; e (iii) FLEXE+, uma heurística baseada na metaheurística Greedy Randomized Adaptive Search Procedure (GRASP), combinada a uma busca local por Variable Neighborhood Descent (VND), que decide conjuntamente o ambiente de execução — VM ou função serverless — e a ordem de execução das ativações, explorando o compromisso entre o tempo total de execução (makespan) e o custo financeiro. Experimentos com workflows sintéticos e com um workflow real de larga escala de bioinformática mostram que a FLEXE+ reduz o makespan ou o custo financeiro, conforme o objetivo priorizado, e obtém soluções próximas às ótimas encontradas pelo FLEXE+IP nas instâncias em que o modelo exato é tratável.
Computational Science and Engineering (CSE) applications frequently have their execution logic represented as scientific workflows, whose large-scale execution demands elastic cloud infrastructures. In this context, serverless computing has established itself as a paradigm complementary to Virtual Machines (VMs). Serverless functions provision resources on demand, but impose execution time, memory, and environment constraints that make them suitable mainly for short-running activations with low resource consumption; VMs, in turn, remain preferable for compute-intensive activations. Consequently, scheduling workflows on clouds that combine both models constitutes a heterogeneous scheduling problem still underexplored in the literature: besides the execution order, the scheduler must decide which environment is the most suitable for each activation, considering that each one has distinct performance characteristics, pricing models, and operational constraints. This thesis presents three complementary contributions to this problem: (i) Denethor, a provenance capture system for workflows executed in serverless environments, which reconstructs the dataflow of the activations executed as functions and provides empirical data on execution time and cost; (ii) FLEXE+IP, an integer programming model that formulates the scheduling problem exactly; and (iii) FLEXE+, a heuristic based on the Greedy Randomized Adaptive Search Procedure (GRASP) metaheuristic, combined with a Variable Neighborhood Descent (VND) local search, which jointly decides the execution environment — VM or serverless function — and the execution order of the activations, exploring the trade-off between the total execution time (makespan) and the financial cost. Experiments with synthetic workflows and with a real large-scale bioinformatics workflow show that FLEXE+ reduces either the makespan or the financial cost, depending on the prioritized objective, and obtains solutions close to the optimal ones found by FLEXE+IP on the instances for which the exact model is tractable.
Banca examinadora:
Prof. Daniel Cardoso Moraes de Oliveira, UFF – Presidente
Profa. Isabel Cristina Mello Rosseti, UFF
Profa. Simone de Lima Martins, UFF
Prof. Yuri Abitbol de Menezes Frota, UFF
Profa. Marta Lima de Queirós Mattoso, UFRJ
Prof. Luan Teylo Gouveia Lima, INRIA
Prof. Rafaelli de Carvalho Coutinho, Cefet/RJ
Prof. Ubiratam Carvalho de Paula Junior, UFRRJ