Yandex Sona: Uma única IA para todas as recomendações?

Yandex Sona: Um Modelo de IA Que Zera a Complexidade das Recomendações! O Futuro da Música Está Aqui?

Olá, pessoal! Aqui é o Lucas Tech e, olha, o que eu vou te contar hoje é um game-changer! Sabe aqueles momentos em que seu app de música acerta em cheio na sua próxima playlist? Ou quando ele te surpreende com uma música que você nem sabia que amava? Pois é, por trás de toda essa magia tem uma engenharia bem complexa. Mas a Yandex, aquela gigante da tecnologia russa, acaba de apresentar uma solução que pode simplificar tudo isso. Preparem-se para conhecer o Sona, um modelo de IA generativa que promete virar o jogo das recomendações!

O Problema que o Sona Resolve

Até agora, a maioria dos sistemas de recomendação funciona como uma cascata. Imagina uma linha de produção: primeiro, vários "geradores de candidatos" sugerem um monte de coisas. Depois, um "pré-ranqueador" filtra essas sugestões. E por fim, um "ranqueador pesado" pega as poucas que sobraram e decide qual é a melhor, usando centenas de características que foram "engenheiradas" manualmente.

O problema dessa abordagem é que cada etapa trabalha meio que "por conta própria", otimizando seus próprios objetivos. O "ranqueador" final só vê o que as etapas anteriores deixaram passar. É como se a informação se perdesse no caminho!

O Sona chega com uma proposta revolucionária: ele une a geração de candidatos e o ranqueamento num sistema só, substituindo todas aquelas etapas. A Yandex testou o modelo por sete dias em seus próprios smart speakers e, pasmem, ele substituiu mais de 15 geradores de candidatos, a etapa de pré-ranqueamento e a etapa de ranqueamento com um único transformer em produção! E o mais legal? Ele não usa nenhuma daquelas "features engenheiradas à mão"!

Nos smart speakers da Yandex, a música pode começar a tocar sem que o usuário escolha um artista, gênero ou humor. É um cenário de pura recomendação, e o Sona foi feito sob medida para isso.

Como a Arquitetura do Sona Funciona

Vamos dar uma olhada por baixo do capô para entender como essa máquina de recomendações funciona.

1. O Tokenizador Semântico

Pensa numa forma de dar um "RG digital" para cada música. É isso que o tokenizador semântico faz! Cada faixa vira uma sequência de 3 códigos discretos. Um modelo de linguagem grande (LLM) multimodal "congelado" (que não é treinado na hora) analisa o espectrograma dos primeiros 90 segundos da música, além do título, artistas e tags.

Depois, um transformer de 4 camadas ajusta essas características ao comportamento de audição dos usuários. O resultado é quantizado em 3 "livros de código" com 32.000 entradas cada. Isso melhorou bastante a precisão, superando sistemas anteriores!

2. Codificador com Compressão de Histórico

O Sona consegue prestar atenção em até 8.192 eventos passados do usuário (tipo, quais músicas ele ouviu). É muita coisa! Para não ficar pesado e lento, o codificador é inteligente: os 2.048 eventos mais recentes recebem uma atenção superdetalhada com 7 camadas de autoatenção. Já os eventos mais antigos passam por um processo mais rápido. O resultado? Quase a mesma qualidade, mas com quase metade do custo de processamento!

3. Decodificador e Módulo de Ranqueamento

O decodificador é como o "cérebro criativo" do Sona. Ele gera os códigos semânticos para as músicas que podem ser recomendadas. Ele usa uma busca por feixe (beam search) restrita, e um "trie de catálogo" garante que ele não gere combinações de códigos sem sentido. Cada combinação de códigos se expande para todas as músicas que compartilham aqueles códigos.

Aí entra o Módulo de Ranqueamento, que tem quatro camadas de "cross-attention". Ele pega as músicas geradas pelo decodificador e as avalia usando a mesma memória que o codificador usou para entender o usuário. Genial, né?

Treinamento: Um Professor que Nunca se "Forma"

Aqui vem uma sacada genial: o Módulo de Ranqueamento aprende com um "Professor Ranqueador" que já vem pronto e congelado. Esse professor é um transformer grandão, com 0.6 bilhão de parâmetros, e também não usa features engenheiradas à mão. Ele foi treinado com um ano inteiro de dados de engajamento dos usuários em duas etapas.

O mais curioso é que esse "professor" não vai para produção. Ele só serve para ensinar o Sona! É como se o professor desse a aula e o aluno (Sona) aprendesse, mas na hora da prova, o professor não está lá para ajudar – só o aluno!

O treinamento do Sona é contínuo, quase em tempo real. Os eventos são agregados em sessões, alimentam um treinador com GPU e os novos pesos do modelo chegam ao servidor a cada 10 minutos. Isso garante que o Sona esteja sempre atualizado com o que está acontecendo!

Resultados: Teste A/B no Mundo Real

A prova de fogo veio com um experimento de 7 dias em 15% dos usuários da Yandex. E os resultados foram impressionantes (e estatisticamente significativos!):

  • Usuários Ativos (a métrica mais importante para eles): +4,53%
  • Tempo Total de Audição: +6,30%
  • Curtidas: +11,42%
  • Comandos "Repetir Música": +17,99%
  • Usuários Super Engajados: +7,37%

E o mais impressionante: esse aumento é 2,35 vezes maior do que o ganho que o sistema anterior (Argus) entregou em usuários ativos na mesma plataforma! É muita coisa, galera!

Sona vs. OneRec vs. HSTU: Um Duelo de Gigantes

O Sona não é o primeiro sistema de recomendação generativo "ponta a ponta" a ir para produção. Já temos o OneRec da Kuaishou e os HSTU Generative Recommenders da Meta. Mas o que o Sona combina de forma única é:

  • Substituição completa da cascata: Um único modelo que faz tudo.
  • Zero features engenheiradas à mão: Ele aprende tudo sozinho.
  • Ranqueador destilado: O "professor" ensina, mas não vai para a linha de frente.
  • Validado online: Tudo isso com resultados reais e comprovados em testes A/B!

Dá uma olhada nessa tabela comparativa que montei (baseado nas fontes originais):

CaracterísticaSona (Yandex)OneRec (Kuaishou)HSTU GR (Meta)
DomínioStreaming de MúsicaVídeos curtosGrande plataforma de internet, várias superfícies
Substitui a cascata com 1 modeloSim, em teste A/BSim, cerca de 25% do QPS totalNão, arquitetura nova para modelos de recomendação
Inputs do UsuárioApenas campos de eventos registrados, sem features manuais"Engenharia de features em multi-escala" (uid, idade, gênero)Sequências de ações do usuário
Saída do ItemIDs Semânticos de 3 níveisIDs Semânticos de 3 níveisIDs de Item
Sinal de RanqueamentoProduzido de "Professor Ranqueador" congelado (0.6B)RL com modelo de recompensa P-ScoreModelo de ranqueamento HSTU
Aprendizado por Reforço (RL)Não, totalmente supervisionadoSim (ECPO)Não reportado
Escala ReportadaHistórico de 8.192 eventos, professor de 0.6B10x FLOPs do modelo de ranqueamento anterior1.5 trilhão de parâmetros
Ganho Online Reportado+4,53% Usuários Ativos, +6,30% tempo de audição, +11,42% curtidas+0,54% e +1,24% Tempo de Permanência no App+12,4% em testes A/B online
Código ou Pesos PúblicosNãoNão no relatórioSim, no GitHub

Lembrando que os ganhos online vêm de plataformas e métricas diferentes, então não são diretamente comparáveis, ok?

Conclusões Essenciais

Pra resumir tudo, galera, aqui estão os pontos chave do Yandex Sona:

  • Ele substituiu mais de 15 geradores, o pré-ranqueamento e o ranqueamento com apenas um modelo em produção.
  • Não usa nenhuma feature "engenheirada à mão": só eventos registrados e IDs Semânticos aprendidos.
  • Um "professor" de 0.6 bilhão de parâmetros treina o ranqueador, mas não vai para o servidor final.
  • No teste A/B, gerou um aumento de +4,53% em Usuários Ativos, sendo 2,35 vezes o ganho anterior do Argus.
  • Não é liberado publicamente (sem código ou pesos), e ainda não está em 100% do tráfego. Ou seja, por enquanto, é uma joia da Yandex!

Perguntas e Respostas Rápidas

O que é o Yandex Sona?
O Sona é um modelo de IA generativa que combina a geração de candidatos e o ranqueamento dentro de um único sistema. A Yandex testou ele em um experimento de produção de sete dias em seus smart speakers, onde ele substituiu a pipeline de recomendação multi-etapas existente para o grupo de teste.

Como o Sona é diferente do OneRec?
O OneRec utiliza caminhos de features de usuário engenheiradas e Aprendizado por Reforço (RL) com um modelo de recompensa. Já o Sona usa apenas campos de eventos registrados e "destila" o ranqueamento de um "professor" congelado.

Para todos os detalhes, vale a pena conferir o Artigo original!

Minha Visão

Cara, essa notícia do Sona me deixa muito animado! Vimos um movimento claro na indústria de IA para simplificar sistemas complexos, e o Sona é um exemplo perfeito. Sair de uma cascata de 15+ modelos e etapas para um único modelo que faz tudo, e ainda sem precisar de nenhuma feature manual, é um salto gigante. Isso não só economiza tempo e recursos de engenharia, mas também cria um sistema mais coerente e inteligente, já que ele entende o usuário e o item de uma forma unificada.

Para nós, usuários finais, isso significa recomendações de música ainda mais fluidas, precisas e surpreendentes, especialmente em dispositivos como smart speakers, onde a interação é mais orgânica. Isso mostra que a inteligência artificial está amadurecendo a ponto de não só fazer as coisas melhor, mas de fazer de um jeito mais inteligente.

E aí, o que vocês acharam dessa inovação da Yandex? Será que o Sona vai inspirar uma nova onda de sistemas de recomendação por aí? Me contem nos comentários! Tamo junto!

Referência: Matéria Original

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *

Rolar para cima
Tutorial Elevenlabs