NVIDIA Vera Rubin NVL72: Domínio inédito na IA.

NVIDIA Vera Rubin Quebra Recordes na IA: Prepare-se para o Futuro da Inteligência Artificial!

Olá, pessoal! Aqui é o Lucas Tech e, olha, se você achava que a Inteligência Artificial já estava rápida, prepare-se, porque a NVIDIA acabou de puxar o freio de mão da inovação e está acelerando de novo! Hoje saíram os resultados do MLPerf Inference v6.1 e a galera da NVIDIA veio com tudo, mostrando avanços que prometem mudar completamente como as empresas usam e desenvolvem IA. Vamos descomplicar essa notícia e entender por que a gente deve ficar de olho!

Os 3 Pilares da IA de Alto Nível (e por que são importantes)

Pra quem trabalha com IA, ou até pra quem só usa, tem três coisas que fazem a diferença na hora de ver a mágica acontecer: o desempenho do sistema, a capacidade de escalar a infraestrutura de forma eficiente e a otimização contínua do software. Pensa assim: quanto mais rápido o sistema, mais ‘fichas’ (tokens) a IA gera, o que pode significar mais grana ou mais funcionalidades. Escalar de forma eficiente significa que, se você adiciona mais hardware, o desempenho cresce junto, sem desperdício. E otimização contínua? É tirar o máximo da sua máquina sem precisar trocar tudo.

O segredo por trás de tudo isso é ter uma plataforma "fungível", ou seja, a mesma estrutura serve para tudo: treinar um modelo, rodar uma inferência, fazer recomendações, analisar vídeos, tudo com alta utilização. Sem isso, a coisa desanda!

E é exatamente para otimizar todos esses pilares que a plataforma da NVIDIA foi projetada. Os resultados do MLPerf Inference v6.1, que foram divulgados hoje, só confirmam isso. Preparados para os destaques?

Vera Rubin NVL72: A Nova Estrela da Performance em IA

A grande novidade é o debut do sistema NVIDIA Vera Rubin NVL72! Em sua primeira aparição no MLPerf Inference v6.1, ele já chegou metendo o pé na porta, mostrando resultados impressionantes em benchmarks super exigentes como DeepSeek-R1 e Qwen3-VL. Em testes com Qwen3-VL, usando o vLLM e o framework de inferência open source NVIDIA Dynamo, o Vera Rubin NVL72 entregou um throughput (capacidade de processamento) até 3,7 vezes maior que o GB300 NVL72. Já no DeepSeek-R1, com a biblioteca NVIDIA TensorRT-LLM, o ganho foi de até 2,5 vezes!

Isso significa que cada rack Vera Rubin NVL72 pode processar muito mais, atender mais usuários e, claro, gerar mais receita, enquanto o custo por ‘token’ (pedacinho de informação processada) diminui. É a prova de que a NVIDIA não para de inovar, e a performance só vai melhorar com mais otimizações de software.

Essa performance absurda não é por acaso. Ela vem de um codesign completo, onde hardware e software trabalham juntos. Os Tensor Cores aprimorados do Vera Rubin e o Transformer Engine aceleram todas as fases da inferência, e a precisão NVFP4 reduz o consumo de memória, o que aumenta ainda mais o throughput com perda mínima de qualidade. Além disso, o Vera Rubin aproveitou muito bem o ‘serviço desagregado’ e o paralelismo para as camadas de mixture-of-experts que rodam modelos como DeepSeek-R1. Tudo isso conectado pela sexta geração do NVIDIA NVLink e NVLink Switch, que garante altíssima velocidade e baixa latência.

E tem mais! Com a ascensão dos agentes de IA (aqueles que planejam e agem em múltiplas etapas), a forma de medir a performance da inferência está mudando. Em benchmarks feitos para capturar essa mudança, como o SemiAnalysis AgentX, o Vera Rubin NVL72 entregou um desempenho 30 vezes superior ao GB300 NVL72 em testes de prévia. O futuro MLPerf Endpoints trará medições padronizadas para cargas de trabalho de IA com agentes, indo além do que os benchmarks de throughput tradicionais capturam. É a IA ganhando ainda mais "cérebro" e autonomia!

GB300 NVL72: Escalabilidade Sem Perder o Fôlego

A eficiência de escalonamento – ou seja, o quão bem GPUs adicionais se traduzem em ganhos de throughput – é um indicador chave da produtividade da infraestrutura de IA. E a NVIDIA manda muito bem nisso! Eles conseguem isso com interconexões de alta largura de banda e baixa latência dentro de cada rack, redes de alta velocidade entre os racks e uma orquestração inteligente das requisições entre os nós.

A submissão do DeepSeek-R1 (DSR1) da NVIDIA mostrou o GB300 NVL72 escalando de um único rack (72 GPUs) para quatro racks (288 GPUs) e alcançando uma eficiência de escalonamento de 99% no cenário offline. Isso significa que a capacidade de processamento cresceu quase que proporcionalmente ao hardware adicionado. É essencial, porque mais GPUs não significam automaticamente mais poder de fogo. Se o dobro de GPUs entregasse apenas um pequeno percentual de melhoria, o custo da infraestrutura seria inviável. A arquitetura, a interconexão e o software precisam escalar juntos, e o GB300 NVL72 faz isso com maestria!

O GB300 NVL72 também arrasou em testes de eficiência em escala de rack no benchmark WAN 2.2, de texto para vídeo, gerando 0,65 vídeos de 720p por segundo, com apenas 5,7 segundos por vídeo. Isso é 9 vezes mais throughput e 7,5 vezes menos latência que um único nó. É a velocidade da luz pra gerar vídeos!

O Software que Faz a Mágica Acontecer: Otimização Contínua!

A plataforma NVIDIA está em constante desenvolvimento de software, entregando melhorias de performance e recursos o tempo todo. Na versão v6.1, o desempenho do GB300 NVL72 no Qwen3-VL melhorou até 1,6 vezes em relação aos resultados da v6.0. Esses ganhos vieram de uma precisão menor do cache KV, fusão adicional de kernels, kernels aprimorados e o serviço desagregado com vLLM e NVIDIA Dynamo.

E o mais legal? As otimizações não param! Mesmo depois do prazo de submissão do v6.1, a NVIDIA continuou aprimorando, e os resultados pós-submissão (ainda não verificados pelo MLCommons) em modelos como GPT-OSS-120B e DLRMv3 mostram ganhos de performance ainda maiores. É a prova de que não basta ter o melhor hardware, é preciso ter o software que saiba usar cada gotinha de poder dele, e a NVIDIA está sempre um passo à frente!

A IA da NVIDIA Chega a Todos os Lugares, do Celular ao Supercomputador!

Além desses gigantes da performance, a NVIDIA também mostrou que a inferência de IA está em todos os lugares. Foram apresentados resultados com o Jetson AGX Thor, um dispositivo compacto para a "borda" (edge computing), usando o NVIDIA TensorRT Edge-LLM no novo benchmark Edge-Agentic com Qwen3.6-27B.

E o ecossistema de parceiros da NVIDIA participou em peso, com 19 empresas – oito delas usando sistemas Blackwell NVL72 multi-nós – demonstrando uma performance excelente. Estamos falando de nomes como ASUS, Azure, Cisco, CoreWeave, Crusoe, Dell Technologies, Fujitsu, Giga Computing, HPE, Inventec, Lambda, MiTAC Computing, Nebius, Oracle Cloud Infrastructure, Quanta Cloud Technology, Red Hat, ScitiX, Supermicro e Wiwynn.

Do pequeno dispositivo de borda (tipo um mini-computador) até as maiores "fábricas de IA", a NVIDIA continua impulsionando a performance em toda a sua pilha de tecnologia. Eles têm uma cadência anual de novas arquiteturas de plataforma, software em constante aprimoramento e um ecossistema construído para entregar tudo isso em grande escala. É a IA chegando a todos os cantos e com a máxima eficiência!


Minha Visão

Cara, lendo esses resultados do MLPerf, me bate uma empolgação gigante! A NVIDIA não está apenas lançando hardware novo; ela está desenhando todo um ecossistema onde cada peça — do chip ao software, da escalabilidade à otimização — trabalha em perfeita sintonia. Isso significa que a IA não só vai ficar mais rápida e barata para as empresas, mas também mais acessível e capaz de resolver problemas que hoje parecem ficção científica. Pensa em assistentes de IA que realmente te entendem, carros autônomos mais seguros, diagnósticos médicos superprecisos e experiências imersivas em games e metaversos. Essa é a base tecnológica que vai impulsionar a próxima onda de inovação em IA, tornando-a uma ferramenta ainda mais poderosa e presente no nosso dia a dia. É a NVIDIA pavimentando a estrada para um futuro onde a inteligência artificial é não só avançada, mas também eficiente e sustentável em larga escala. É o futuro batendo na porta, e a gente está aqui pra abrir!


E aí, pessoal, o que vocês acham desses avanços? Como vocês imaginam que essa nova onda de performance em IA vai mudar o nosso dia a dia ou o mercado de tecnologia nos próximos anos? Deixem seus comentários aqui embaixo, quero muito saber a opinião de vocês!

Referência: Matéria Original

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *

Rolar para cima
Tutorial Elevenlabs