NVIDIA Vera Rubin: O fim dos custos altos na era da IA?

NVIDIA Vera Rubin Chega para Turbinar a IA: Prepare-se para o Futuro Gigantesco!

Olá, pessoal! Aqui é o Lucas Tech, e hoje a gente vai mergulhar de cabeça em algo que promete virar o mundo da Inteligência Artificial de ponta-cabeça. A NVIDIA acabou de soltar uma bomba tecnológica: a plataforma Vera Rubin está entre nós, e o que ela traz é simplesmente… gigascale! Sabe o que isso significa? Que o futuro da IA, daquele jeito que a gente só via em filmes, está chegando mais rápido do que imaginávamos, com uma capacidade de processamento que vai além da nossa compreensão. Fica comigo que eu te explico tudo!

O Que É Essa Tal de Vera Rubin?

Imagine um supercomputador de IA que não é apenas um monte de peças juntas, mas sim um sistema completamente integrado, pensado do zero para entregar o máximo de performance com a maior eficiência. Essa é a Vera Rubin NVL72 da NVIDIA! Ela já está a todo vapor em parceiros gigantes como CoreWeave, Google Cloud, Microsoft Azure e Oracle Cloud Infrastructure. Estamos falando da maior e mais robusta cadeia de suprimentos de hardware em escala de rack já montada, pronta para atender à demanda insana por IA que estamos vendo.

A plataforma Vera Rubin foi construída para entregar o maior desempenho por watt e o menor custo por "token" (pensa em token como uma unidade de informação que a IA processa). Pra ter uma ideia, a CoreWeave fez um teste com o modelo DeepSeek-R1 e o resultado foi impressionante: 10 vezes mais capacidade de processamento por megawatt do que a geração anterior (Grace Blackwell NVL72)! Isso é crucial, porque para as "fábricas de IA" de hoje, cada megawatt conta muito!

A Magia por Trás: Co-design Extremo

"Co-design extremo"? Parece complexo, mas vou te explicar de um jeito simples: ao invés de juntar peças que foram projetadas separadamente, a NVIDIA projetou tudo junto, desde o chip até a infraestrutura do rack, como um sistema único. Isso inclui sete chips e cinco bandejas de rack, como o Vera Rubin NVL72, o Vera CPU, Groq 3 LPX, Spectrum-6 SPX e Vera BlueField-4 STX. É como montar um time de futebol onde cada jogador foi treinado especificamente para se encaixar perfeitamente com os outros.

No centro de tudo, temos a NVIDIA Vera CPU. Essa CPU redefine o que um processador para uma fábrica de IA pode fazer. Ela foi pensada para a "era dos agentes" (que são IAs autônomas que realizam tarefas complexas). Com seu núcleo "Olympus" personalizado, ela entrega 2 vezes mais desempenho single-threaded, 3 vezes mais largura de banda entre os núcleos e 40% menos latência de memória que as arquiteturas concorrentes. É a CPU mais eficiente para aqueles trabalhos de IA que exigem muito raciocínio e planejamento.

Conectividade de Outro Nível para Fábricas de IA

Para que a IA funcione em escala gigantesca, a comunicação entre todos esses componentes precisa ser impecável. É aí que a rede entra em cena:

  • NVLink (6ª geração): Essa tecnologia da NVIDIA, usada para "escalar para cima" (ou seja, dentro de um mesmo rack ou sistema), entrega mais de 2 vezes a capacidade de processamento em tarefas complexas, 3 vezes menos latência e 10 vezes mais taxa de pacotes do que o Ethernet comum.
  • Spectrum-X Ethernet: Para "escalar para fora" (entre diferentes racks e clusters), temos essa combinação de switches Spectrum-6 de 102.4T e SuperNICs ConnectX-9 de 1.6T. Isso permite 1.6 vezes mais largura de banda RDMA do que o Ethernet padrão. Empresas como CoreWeave, Microsoft, SpaceXAI e Tesla já estão usando o Spectrum-6 para turbinar suas fábricas de IA.
  • NVIDIA Photonics: Essa tecnologia inovadora, com óticas co-empacotadas (a primeira do tipo em fabricação em volume), reduz o consumo de energia em 5 vezes e aumenta a durabilidade em 10 vezes em relação aos transceptores tradicionais. CoreWeave, Lambda e OCI são alguns dos primeiros a adotá-la.
  • Spectrum-XGS Ethernet: Estende a performance entre diferentes locais, com 1.9 vezes mais capacidade de processamento multi-site. Afinal, IA em escala gigantesca não é um problema de um único prédio!
  • NVLink Fusion: Abre a plataforma da NVIDIA para outros chips (XPUs de terceiros), dando aos parceiros um caminho mais rápido para integrar suas soluções com o ecossistema NVLink.

Sustentabilidade e Eficiência Sem Precedentes

Além de toda essa potência, a NVIDIA pensou na praticidade e no meio ambiente. As três gerações de co-design em escala de rack resultaram em um sistema Vera Rubin NVL72 sem cabos, ventoinhas ou mangueiras na bandeja de computação. Sabe o que isso significa? O tempo de montagem da bandeja de computação caiu de horas para apenas um minuto! Isso é um ganho gigantesco para quem precisa escalar rápido.

E tem mais! O design com resfriamento líquido permite que a entrada de temperatura seja de até 45 graus Celsius, o que possibilita o uso de "dry-coolers" (resfriadores a seco) sem a necessidade de chillers. Para as novas fábricas de IA, esse sistema de resfriamento a seco em temperaturas mais altas, combinado com o sistema de resfriamento líquido de circuito fechado, economiza milhões de galões de água por megawatt anualmente. Performance monstra e amiga do planeta!


Vera Rubin na Europa: IA Soberana e Aberta

A Vera Rubin está entregando uma performance de última geração para a infraestrutura de IA da Europa! Ela é a base de uma parceria recém-expandida entre a Microsoft e a Mistral, trazendo IA de ponta para a região. Isso combina modelos europeus abertos com ambientes de nuvem e controlados pelo cliente, permitindo que governos e indústrias regulamentadas adotem a IA em seus próprios termos.

Essa parceria inclui um novo acordo multibilionário focado na expansão da infraestrutura de IA na Europa. A Mistral está adicionando sua capacidade de GPU, utilizando milhares das mais recentes GPUs NVIDIA Vera Rubin para aumentar a disponibilidade de computação de IA para clientes e fornecer uma plataforma compartilhada para treinamento, inferência e implantação em larga escala.

A Europa quer a IA mais capaz do mundo, funcionando sob suas próprias leis, perto de casa e totalmente sob seu controle. E a barra está cada vez mais alta: sistemas "agentic" (como a gente falou lá em cima) podem consumir até 15 vezes mais tokens do que as aplicações de IA tradicionais, tornando a infraestrutura eficiente uma prioridade estratégica. A Vera Rubin fornece essa base de computação para o ecossistema de modelos abertos da Europa, combinando computação acelerada, rede e software para que modelos e agentes funcionem de forma eficiente, do treinamento à produção.

Comparada com o NVIDIA GB200 NVL72, a Vera Rubin NVL72 entrega até 10 vezes mais tokens por megawatt e um décimo do custo por milhão de tokens. Isso significa mais inteligência dentro do mesmo consumo de energia!


CoreWeave e o Salto de Performance Monstruoso

A CoreWeave, abraçando o co-design extremo da NVIDIA, está conseguindo um salto de performance de uma ordem de magnitude com a Vera Rubin NVL72. Depois de meses de trabalho conjunto, a CoreWeave se tornou a primeira nuvem de IA a validar a Vera Rubin NVL72 – e já está compartilhando os primeiros números de desempenho medidos em hardware real!

Como eu disse antes, a CoreWeave rodou um benchmark DeepSeek-R1 na Vera Rubin NVL72 e viu uma melhoria de 10 vezes em tokens por segundo por megawatt em comparação com a Grace Blackwell NVL72. Essa métrica é o que determina se uma infraestrutura de IA pode escalar de forma lucrativa. Mais tokens por megawatt significa mais inteligência com o mesmo orçamento de energia, ou a mesma carga de trabalho com significativamente menos energia. Laboratórios de IA e empresas como a Jane Street usarão a plataforma Vera Rubin para escalar suas fábricas de IA na nuvem CoreWeave.

Para o modelo DeepSeek R1, que usa arquitetura MoE (Mixture of Experts), a comunicação "all-to-all" entre GPUs é essencial. O tecido NVLink 6 da Vera Rubin NVL72, com 260 TB/s, remove esse gargalo, fazendo com que o rack se comporte como um único acelerador unificado. A CoreWeave está entre as primeiras a implantar o NVIDIA Spectrum-X Ethernet SN6600-LD como a rede para a Vera Rubin NVL72, que conta com resfriamento líquido e oferece o dobro de capacidade em relação aos switches da geração anterior resfriados a ar!


Google Cloud A5X: Superaprendizes em Ação!

A NVIDIA Vera Rubin NVL72 também está impulsionando a primeira instância A5X do Google Cloud, que já está funcionando para a startup londrina Ineffable Intelligence. A Ineffable Intelligence desenvolve uma nova geração de sistemas "superlearner" inteligentes que aprendem continuamente por experiência para descobrir avanços em todas as áreas.

Os agentes da Ineffable aprendem diretamente da interação com seus ambientes, em vez de depender de conjuntos de dados estáticos. Eles estão desenvolvendo sistemas "superlearner" por meio de aprendizado por reforço, gerando experiência em ambientes massivamente paralelos simulados continuamente e traduzindo rapidamente essa experiência em atualizações de políticas e avaliações. Esses ciclos de aprendizado extremamente apertados exigem muito da computação, largura de banda da memória e interconexão, necessitando de uma infraestrutura que possa operar em enorme escala com latência extremamente baixa.

A NVIDIA Vera Rubin NVL72 foi projetada para esse tipo de treinamento "agentic", oferecendo latência previsível, alta utilização e significativamente mais inteligência por dólar do que os sistemas da geração anterior, tornando-a uma escolha natural para aprendizado por reforço em larga escala. As instâncias Google Cloud A5X, são instâncias bare-metal construídas em sistemas NVIDIA Vera Rubin NVL72, entregando até 10 vezes menor custo de inferência por token e 10 vezes maior throughput de tokens por megawatt do que a geração anterior!

A A5X usa as SuperNICs NVIDIA ConnectX-9 combinadas com a rede Google Virgo de última geração, permitindo clusters que podem escalar para dezenas de milhares de GPUs NVIDIA Rubin em um único local e até quase um milhão de GPUs em configurações multi-site. É um stack unificado e otimizado para IA, perfeito para treinar e servir modelos de IA de ponta, abertos, agentic e físicos, otimizando performance, custo e sustentabilidade.


DeepInfra e o Cérebro da IA: A CPU Vera

Por fim, a NVIDIA Vera CPU está dobrando a velocidade de orquestração para a nuvem de IA da DeepInfra! Resultados de benchmark da DeepInfra mostram que a NVIDIA Vera CPU é mais de duas vezes mais rápida e pode suportar mais agentes de IA simultâneos em comparação com outras CPUs.

A DeepInfra, uma plataforma de nuvem que faz parte do ecossistema de IA aberta da NVIDIA, testou a Vera CPU em sua infraestrutura de agentes de IA em produção. Eles processam quase cinco trilhões de tokens por semana, com cerca de 30% sendo gerados por sistemas "agentic".

Os benchmarks demonstram suporte para até 1.6 vezes mais agentes de IA simultâneos com a mesma qualidade de serviço e até 2.2 vezes mais velocidade de orquestração do que CPUs alternativas, ao mesmo tempo em que melhora a utilização da infraestrutura e a eficiência de custos. Isso prova que a NVIDIA Vera CPU entrega a eficiência de custo, a baixa latência e a capacidade de processamento que a IA agentic em produção exige! À medida que os agentes de IA assumem raciocínios mais complexos, planejamento, uso de ferramentas e movimentação de dados, o desempenho da CPU se torna cada vez mais importante para orquestrar o trabalho em cada chamada de modelo.


Minha Visão

Gente, a NVIDIA Vera Rubin não é só mais uma atualização de hardware; ela é um divisor de águas. O que estamos vendo aqui é o resultado de uma engenharia de ponta que integra tudo para alcançar um nível de performance e eficiência que era inimaginável há pouco tempo. O foco em "gigascale", a capacidade de entregar 10x mais tokens por megawatt, e a preocupação com a sustentabilidade através de um resfriamento super eficiente, tudo isso aponta para um futuro onde a IA será não só mais poderosa, mas também mais acessível e responsável.

A era dos "agentes de IA" está batendo na porta, e a Vera Rubin é a chave para destravar todo o potencial desses sistemas que aprendem e se adaptam. Seja para IA soberana na Europa, superaprendizes do Google Cloud ou a orquestração de milhões de agentes na DeepInfra, o impacto será sentido em todos os cantos. É emocionante ver como a tecnologia está evoluindo para resolver desafios cada vez maiores e nos levar a um futuro onde a inteligência artificial pode realmente nos ajudar a fazer descobertas incríveis e transformar o nosso mundo para melhor.

E você, o que achou dessa novidade da NVIDIA? Como você imagina que a Vera Rubin vai impactar as grandes inovações de IA que veremos nos próximos anos? Deixa sua opinião nos comentários!

Referência: Matéria Original

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *

Rolar para cima
Tutorial Elevenlabs