Ir para o conteúdo principal
Voltar aos artigos

GPU ocupada não é GPU bem distribuída: a mudança de fila da Ai2

A Ai2 trocou prioridades infladas por orçamento de tempo de GPU. A ocupação permaneceu em 98%, com melhorias no acesso e na distribuição.

·3 min de leitura·5 visualizações

A Ai2 descreveu uma mudança no agendamento de treinamento distribuído: em vez de disputar máquinas por prioridades cada vez mais altas, equipes passaram a receber orçamento de tempo de GPU.[19] Na avaliação de 30 dias, a ocupação ficou em 98% antes e depois, e as equipes receberam 98% das horas devidas, limitando o cálculo ao que realmente demandavam.[19] A melhora reportada foi na distribuição e no acesso, não na criação de hardware adicional.

O que muda para quem desenvolve

O ambiente tinha demanda de duas a três vezes a capacidade e incentivos para manter tarefas vazias reservando recursos; as tarefas acabaram usando prioridade HIGH.[19] Minha leitura: quando tudo é urgente, o campo de prioridade deixa de explicar qual trabalho deve vir primeiro. Recomendo tornar a alocação uma decisão explícita, em vez de deixar a disputa acontecer por tickets e reservas informais.

O novo modelo considera o uso em relação ao orçamento numa janela móvel, de sete dias por padrão.[19] Tempo alocado é debitado e recebe proteção durante uma janela mínima; capacidade sobrando pode ser usada sem débito, mas permanece interrompível por demanda alocada.[19] Essa distinção permite aproveitar folgas sem transformar empréstimo em propriedade permanente.

Cada tarefa declara o tempo mínimo para progresso útil e se pode ser retomada, com proteção limitada a oito horas.[19] Para uma equipe menor, a questão aplicável é quais trabalhos realmente conseguem ser interrompidos e restaurados. Não adote preempção apenas porque o agendador oferece o botão.

Como aplicar

Antes de comprar mais capacidade, registre disponibilidade do hardware, tempo ocupado, trabalho realizado e aproveitamento dentro das tarefas. Mantenha também uma medida de espera por classe de job. Esses indicadores respondem a problemas diferentes.

Proponha uma simulação com a fila do seu ambiente, separando tarefas curtas, longas e interativas. Defina orçamento por projeto, proteção mínima e política para capacidade emprestada. Compare espera, interrupções e distribuição, sem atribuir um resultado que ainda não foi medido.

Em seguida, teste restauração de uma tarefa real num ambiente controlado. Registre o ponto salvo, o estado recuperado e o trabalho perdido. O critério de aceitação da política deve incluir progresso útil depois da interrupção, não só a liberação rápida da GPU.

Na implantação, mostre aos usuários consumo e motivo da posição na fila. Recomendo explicar o que é protegido e o que é emprestado antes de mudar o significado das prioridades.

Cuidados e limites

O p90 de espera de depuração caiu de duas horas para 30 segundos na operação real, com a ressalva de que a amostra anterior era menor e mais variável.[19] O cenário simulado que caiu de seis horas para cinco minutos usou dados construídos, não um histórico representativo dessas tarefas.[19] Não misture os dois resultados.

Sessões interativas passaram a poder perder estado volátil após a janela protegida, e a Ai2 ainda investiga fragmentação causada por tarefas menores temporariamente protegidas.[19] Esses custos precisam entrar no desenho.

A conclusão prática não é que um orçamento resolve qualquer fila. É que distribuição, ocupação e utilização devem ser medidas separadamente. Uma GPU sempre ocupada pode continuar atendendo mal o trabalho que a organização decidiu priorizar.

Fonte

[19] Fonte: Hugging Face Blog, publicação da Ai2

Continue lendo