A CoreWeave, empresa de nuvem, anunciou em 16 de setembro de 2026 que colocou de pé, na CoreWeave Cloud, um sistema com vários racks NVIDIA Vera Rubin NVL72: um cluster único, com centenas de GPUs Rubin, pensado pra IA de agentes. Segundo a empresa, ela sobe vários racks como um sistema só, com controle automatizado do ciclo de vida dos racks, validação do sistema e escalonamento da rede.

PublicidadeModo Vitta: Foco e EquilíbrioPara mentes que não param: alinhe tarefas, rotina, hábitos, foco e metas num só app.Ver no Google Play →

Chen Goldberg, executive vice president de produto e engenharia da CoreWeave, disse que a empresa foi a primeira provedora de nuvem de IA a validar e colocar de pé um Vera Rubin NVL72, e a demonstrar que a arquitetura em escala de rack é capaz de operar como um serviço de nuvem confiável e de alto desempenho. Pra clientes que constroem IA de agentes, Goldberg acrescentou, isso significa mais escala, iteração mais rápida e mais produtividade.

Os racks e a rede

Cada rack Vera Rubin NVL72 junta 72 GPUs Rubin e 36 CPUs Vera. Pra unir os racks, com centenas de aceleradores no total, num cluster só, a CoreWeave usa a rede Ethernet Spectrum-X, da NVIDIA. No desenho descrito no anúncio, cada GPU Rubin tem duas SuperNICs ConnectX-9, o que dá 1,6 Tb/s de conectividade de escala horizontal por GPU.

Segundo a empresa, rodar treinamento e inferência em centenas de GPUs importa pra cargas de trabalho de agentes em várias etapas, que são sensíveis à latência de acesso a dados: atrasos podem se acumular a cada chamada repetida de modelo e a cada uso de ferramenta.

O que muda no armazenamento

No mesmo anúncio, a CoreWeave apresentou duas novidades no CoreWeave AI Object Storage. A primeira é a aceleração de escrita entre regiões. Pela descrição da empresa, os checkpoints são gravados localmente, na própria região e com a latência local, enquanto os dados migram em segundo plano pra uma segunda região remota. Como a aplicação enxerga um bucket só, não há mudança de código, e as permissões e as regras de retenção funcionam igual, seja qual for a região de onde veio a escrita. A CoreWeave diz que o recurso minimiza a pausa no treinamento e elimina a necessidade de copiar ou mover dados à mão entre regiões.

A segunda é a Archive, uma camada de custo menor. De acordo com o anúncio, ela não tem taxa pra recuperar dados, pra apagá-los antes da hora nem pra ler a partir dela. A CoreWeave descreve a camada como feita pra dados que as equipes, do contrário, apagariam: o checkpoint de uma rodada que quase deu certo, um conjunto de dados necessário pra reproduzir um resultado ou uma versão de modelo sobre a qual alguém pode perguntar daqui a seis meses. É o famoso "vai que eu preciso", versão nuvem.

Cécile Robert-Michon, director of internal infrastructure da Cohere, disse que os dados da empresa se espalham por várias regiões e que o cronograma de treino não pode ser ditado por atrasos de recuperação entre elas. Com o armazenamento da CoreWeave e as leituras em cache local, completou, "nada espera pela rede".

O que a NVIDIA diz sobre o sistema

A NVIDIA afirma, na página do Vera Rubin NVL72, que o sistema treina modelos mixture-of-experts com um quarto do número de GPUs, em comparação com o GB200 NVL72, e entrega inferência a um décimo do custo por milhão de tokens pra IA de agentes muito interativa e de raciocínio profundo, com até 10 vezes mais tokens por megawatt. As notas da própria página avisam que os números de inferência estão sujeitos a mudança e que a comparação de treinamento é desempenho projetado.