Pular para conteúdo

Ai2 revela agendador de GPUs que prioriza pesquisa de alto impacto sem perder ocupação

Lucas Montarroios
Lucas Montarroios

10 de outubro de 2026

A equipe de infraestrutura de IA do Allen Institute for AI detalhou como construiu um agendador de clusters de GPU que dá prioridade a pesquisas de alto impacto e mantém a ocupação...

Carregando áudio…
Ai2 revela agendador de GPUs que prioriza pesquisa de alto impacto sem perder ocupação

A equipe de infraestrutura de IA do Allen Institute for AI (Ai2) detalhou como construiu o agendador que comanda seus clusters de GPU: em vez de reservar máquinas para os projetos considerados mais importantes, o sistema trata prioridade como um atributo dinâmico dos jobs — trabalhos estratégicos assumem recursos na hora, e o que foi interrompido volta para a fila. O relato está no blog oficial do instituto.

O que o Ai2 mudou no agendador de GPUs?

O ponto de partida é um cluster compartilhado por vários times de pesquisa, cada um com prazos e ambições diferentes. A escolha do Ai2 foi manter um único pool de GPUs e resolver a disputa por prioridade. Na prática, cada job carrega uma classe de prioridade; quando um trabalho de prioridade alta entra na fila e não há capacidade livre, o agendador interrompe jobs de prioridade menor, devolve esses trabalhos à fila e entrega os recursos ao recém-chegado.

Como treinos distribuídos já precisam conviver com falhas de hardware, o instituto reaproveita essa mesma disciplina — checkpoints periódicos e reexecução — para tornar a preempção barata. O ganho aparece nos dois lados: quem tem prioridade não espera horas por uma janela livre, e a capacidade que ficaria reservada e ociosa continua produzindo resultados.

Por que não criar partições dedicadas no agendador de GPUs?

O caminho tradicional é fatiar o cluster: um bloco para pesquisa de ponta, outro para experimentos exploratórios, um terceiro para ajuste fino. Funciona para garantir acesso, mas cobra caro, porque cada partição carrega a própria ociosidade — se o bloco nobre fica vazio durante a madrugada, essas GPUs não ajudam ninguém.

Ao trocar a reserva por prioridade, o Ai2 transforma capacidade ociosa em trabalho útil: a fila de baixa prioridade usa tudo o que não está sendo usado e é despejada apenas quando alguém mais importante precisa. O custo é de engenharia, não de hardware: preempção confiável, uma política de prioridades que não seja capturada por um único time e jobs capazes de recomeçar sem perder dias de treino.

O que o agendador de GPUs exige de quem treina modelos distribuídos

Prioridade com preempção só funciona se o job souber morrer e renascer. Na prática, isso significa checkpoints frequentes o bastante para limitar o retrabalho, reinício rápido do pipeline, consistência entre os vários nós de um treino distribuído e telemetria para medir quanto tempo útil foi perdido em cada interrupção.

O recado vale para qualquer equipe que roda treinos longos: resiliência deixa de ser um detalhe de robustez e passa a ser um requisito de agendamento. Um job que leva horas para reiniciar inviabiliza a estratégia, por melhor que seja o escalonador.

Por que o agendador de GPUs importa para quem desenvolve no Brasil?

Compute continua sendo o gargalo local: laboratórios universitários, grupos de pesquisa e startups dividem clusters pequenos e caros, ou alugam GPU por hora em nuvem. Qualquer prática que aumente a ocupação de um pool compartilhado reduz o custo por experimento — mesmo sem comprar uma única placa nova.

A discussão dialoga diretamente com iniciativas de infraestrutura aberta para a academia, como a NSF OMAI: Ai2 coloca no ar infraestrutura de IA totalmente aberta para a academia. Para CTOs que pagam por hora de GPU, a lição é a mesma: priorização e preempção tendem a sair mais baratas do que manter capacidade dedicada parada esperando o próximo projeto importante.

O que o agendador de GPUs do Ai2 ainda não resolve

É um relato de engenharia, não um benchmark comparativo contra outros agendadores — os resultados dependem do perfil de carga do próprio instituto e não vêm acompanhados de séries históricas padronizadas. Também não há receita pronta para o problema político de definir quem é "alto impacto", nem discussão detalhada sobre portabilidade para outros orquestradores ou ambientes multicloud com GPUs heterogêneas. Quem quiser replicar vai precisar calibrar prioridades e políticas de checkpoint na própria realidade.

Perguntas Frequentes sobre o agendador de GPUs

O que é o agendador de impacto do Ai2?

É o sistema que distribui as GPUs dos clusters do instituto usando classes de prioridade e preempção: jobs mais importantes podem interromper jobs de prioridade menor, que voltam à fila e são retomados depois.

Por que não simplesmente comprar mais GPUs?

Porque o problema não é só volume, mas alocação. Um pool único com prioridade evita a ociosidade típica das partições dedicadas e faz a mesma capacidade render mais experimentos por período.

Uma empresa com poucas GPUs pode aplicar a ideia?

Sim, em escala menor: basta um agendador com prioridades, jobs com checkpoint frequente e reinício rápido. O ganho é proporcional à disputa interna por recursos.

Compartilhar:
Lucas Montarroios

Escrito por

Lucas Montarroios

Sou Lucas Montarroios e dediquei os últimos 15 anos à linha de frente de operações de telecom e data centers. Minha carreira sempre foi pautada por um foco implacável: transformar tecnologia e cenários críticos em oportunidades reais de negócio. No novidades.ia.br, trago essa visão executiva para o universo da IA. Especialista em produtos, mercado e ferramentas práticas de IA. Minha missão aqui é filtrar o ruído do mercado, analisando benchmarks, estratégias de grandes empresas e ferramentas práticas.

Artigos relacionados