Yandex Sona: Um Modelo de IA Que Zera a Complexidade das Recomendações! O Futuro da Música Está Aqui?
Olá, pessoal! Aqui é o Lucas Tech e, olha, o que eu vou te contar hoje é um game-changer! Sabe aqueles momentos em que seu app de música acerta em cheio na sua próxima playlist? Ou quando ele te surpreende com uma música que você nem sabia que amava? Pois é, por trás de toda essa magia tem uma engenharia bem complexa. Mas a Yandex, aquela gigante da tecnologia russa, acaba de apresentar uma solução que pode simplificar tudo isso. Preparem-se para conhecer o Sona, um modelo de IA generativa que promete virar o jogo das recomendações!
O Problema que o Sona Resolve
Até agora, a maioria dos sistemas de recomendação funciona como uma cascata. Imagina uma linha de produção: primeiro, vários "geradores de candidatos" sugerem um monte de coisas. Depois, um "pré-ranqueador" filtra essas sugestões. E por fim, um "ranqueador pesado" pega as poucas que sobraram e decide qual é a melhor, usando centenas de características que foram "engenheiradas" manualmente.
O problema dessa abordagem é que cada etapa trabalha meio que "por conta própria", otimizando seus próprios objetivos. O "ranqueador" final só vê o que as etapas anteriores deixaram passar. É como se a informação se perdesse no caminho!
O Sona chega com uma proposta revolucionária: ele une a geração de candidatos e o ranqueamento num sistema só, substituindo todas aquelas etapas. A Yandex testou o modelo por sete dias em seus próprios smart speakers e, pasmem, ele substituiu mais de 15 geradores de candidatos, a etapa de pré-ranqueamento e a etapa de ranqueamento com um único transformer em produção! E o mais legal? Ele não usa nenhuma daquelas "features engenheiradas à mão"!
Nos smart speakers da Yandex, a música pode começar a tocar sem que o usuário escolha um artista, gênero ou humor. É um cenário de pura recomendação, e o Sona foi feito sob medida para isso.
Como a Arquitetura do Sona Funciona
Vamos dar uma olhada por baixo do capô para entender como essa máquina de recomendações funciona.
1. O Tokenizador Semântico
Pensa numa forma de dar um "RG digital" para cada música. É isso que o tokenizador semântico faz! Cada faixa vira uma sequência de 3 códigos discretos. Um modelo de linguagem grande (LLM) multimodal "congelado" (que não é treinado na hora) analisa o espectrograma dos primeiros 90 segundos da música, além do título, artistas e tags.
Depois, um transformer de 4 camadas ajusta essas características ao comportamento de audição dos usuários. O resultado é quantizado em 3 "livros de código" com 32.000 entradas cada. Isso melhorou bastante a precisão, superando sistemas anteriores!
2. Codificador com Compressão de Histórico
O Sona consegue prestar atenção em até 8.192 eventos passados do usuário (tipo, quais músicas ele ouviu). É muita coisa! Para não ficar pesado e lento, o codificador é inteligente: os 2.048 eventos mais recentes recebem uma atenção superdetalhada com 7 camadas de autoatenção. Já os eventos mais antigos passam por um processo mais rápido. O resultado? Quase a mesma qualidade, mas com quase metade do custo de processamento!
3. Decodificador e Módulo de Ranqueamento
O decodificador é como o "cérebro criativo" do Sona. Ele gera os códigos semânticos para as músicas que podem ser recomendadas. Ele usa uma busca por feixe (beam search) restrita, e um "trie de catálogo" garante que ele não gere combinações de códigos sem sentido. Cada combinação de códigos se expande para todas as músicas que compartilham aqueles códigos.
Aí entra o Módulo de Ranqueamento, que tem quatro camadas de "cross-attention". Ele pega as músicas geradas pelo decodificador e as avalia usando a mesma memória que o codificador usou para entender o usuário. Genial, né?
Treinamento: Um Professor que Nunca se "Forma"
Aqui vem uma sacada genial: o Módulo de Ranqueamento aprende com um "Professor Ranqueador" que já vem pronto e congelado. Esse professor é um transformer grandão, com 0.6 bilhão de parâmetros, e também não usa features engenheiradas à mão. Ele foi treinado com um ano inteiro de dados de engajamento dos usuários em duas etapas.
O mais curioso é que esse "professor" não vai para produção. Ele só serve para ensinar o Sona! É como se o professor desse a aula e o aluno (Sona) aprendesse, mas na hora da prova, o professor não está lá para ajudar – só o aluno!
O treinamento do Sona é contínuo, quase em tempo real. Os eventos são agregados em sessões, alimentam um treinador com GPU e os novos pesos do modelo chegam ao servidor a cada 10 minutos. Isso garante que o Sona esteja sempre atualizado com o que está acontecendo!
Resultados: Teste A/B no Mundo Real
A prova de fogo veio com um experimento de 7 dias em 15% dos usuários da Yandex. E os resultados foram impressionantes (e estatisticamente significativos!):
- Usuários Ativos (a métrica mais importante para eles): +4,53%
- Tempo Total de Audição: +6,30%
- Curtidas: +11,42%
- Comandos "Repetir Música": +17,99%
- Usuários Super Engajados: +7,37%
E o mais impressionante: esse aumento é 2,35 vezes maior do que o ganho que o sistema anterior (Argus) entregou em usuários ativos na mesma plataforma! É muita coisa, galera!
Sona vs. OneRec vs. HSTU: Um Duelo de Gigantes
O Sona não é o primeiro sistema de recomendação generativo "ponta a ponta" a ir para produção. Já temos o OneRec da Kuaishou e os HSTU Generative Recommenders da Meta. Mas o que o Sona combina de forma única é:
- Substituição completa da cascata: Um único modelo que faz tudo.
- Zero features engenheiradas à mão: Ele aprende tudo sozinho.
- Ranqueador destilado: O "professor" ensina, mas não vai para a linha de frente.
- Validado online: Tudo isso com resultados reais e comprovados em testes A/B!
Dá uma olhada nessa tabela comparativa que montei (baseado nas fontes originais):
| Característica | Sona (Yandex) | OneRec (Kuaishou) | HSTU GR (Meta) |
|---|---|---|---|
| Domínio | Streaming de Música | Vídeos curtos | Grande plataforma de internet, várias superfícies |
| Substitui a cascata com 1 modelo | Sim, em teste A/B | Sim, cerca de 25% do QPS total | Não, arquitetura nova para modelos de recomendação |
| Inputs do Usuário | Apenas campos de eventos registrados, sem features manuais | "Engenharia de features em multi-escala" (uid, idade, gênero) | Sequências de ações do usuário |
| Saída do Item | IDs Semânticos de 3 níveis | IDs Semânticos de 3 níveis | IDs de Item |
| Sinal de Ranqueamento | Produzido de "Professor Ranqueador" congelado (0.6B) | RL com modelo de recompensa P-Score | Modelo de ranqueamento HSTU |
| Aprendizado por Reforço (RL) | Não, totalmente supervisionado | Sim (ECPO) | Não reportado |
| Escala Reportada | Histórico de 8.192 eventos, professor de 0.6B | 10x FLOPs do modelo de ranqueamento anterior | 1.5 trilhão de parâmetros |
| Ganho Online Reportado | +4,53% Usuários Ativos, +6,30% tempo de audição, +11,42% curtidas | +0,54% e +1,24% Tempo de Permanência no App | +12,4% em testes A/B online |
| Código ou Pesos Públicos | Não | Não no relatório | Sim, no GitHub |
Lembrando que os ganhos online vêm de plataformas e métricas diferentes, então não são diretamente comparáveis, ok?
Conclusões Essenciais
Pra resumir tudo, galera, aqui estão os pontos chave do Yandex Sona:
- Ele substituiu mais de 15 geradores, o pré-ranqueamento e o ranqueamento com apenas um modelo em produção.
- Não usa nenhuma feature "engenheirada à mão": só eventos registrados e IDs Semânticos aprendidos.
- Um "professor" de 0.6 bilhão de parâmetros treina o ranqueador, mas não vai para o servidor final.
- No teste A/B, gerou um aumento de +4,53% em Usuários Ativos, sendo 2,35 vezes o ganho anterior do Argus.
- Não é liberado publicamente (sem código ou pesos), e ainda não está em 100% do tráfego. Ou seja, por enquanto, é uma joia da Yandex!
Perguntas e Respostas Rápidas
O que é o Yandex Sona?
O Sona é um modelo de IA generativa que combina a geração de candidatos e o ranqueamento dentro de um único sistema. A Yandex testou ele em um experimento de produção de sete dias em seus smart speakers, onde ele substituiu a pipeline de recomendação multi-etapas existente para o grupo de teste.
Como o Sona é diferente do OneRec?
O OneRec utiliza caminhos de features de usuário engenheiradas e Aprendizado por Reforço (RL) com um modelo de recompensa. Já o Sona usa apenas campos de eventos registrados e "destila" o ranqueamento de um "professor" congelado.
Para todos os detalhes, vale a pena conferir o Artigo original!
Minha Visão
Cara, essa notícia do Sona me deixa muito animado! Vimos um movimento claro na indústria de IA para simplificar sistemas complexos, e o Sona é um exemplo perfeito. Sair de uma cascata de 15+ modelos e etapas para um único modelo que faz tudo, e ainda sem precisar de nenhuma feature manual, é um salto gigante. Isso não só economiza tempo e recursos de engenharia, mas também cria um sistema mais coerente e inteligente, já que ele entende o usuário e o item de uma forma unificada.
Para nós, usuários finais, isso significa recomendações de música ainda mais fluidas, precisas e surpreendentes, especialmente em dispositivos como smart speakers, onde a interação é mais orgânica. Isso mostra que a inteligência artificial está amadurecendo a ponto de não só fazer as coisas melhor, mas de fazer de um jeito mais inteligente.
E aí, o que vocês acharam dessa inovação da Yandex? Será que o Sona vai inspirar uma nova onda de sistemas de recomendação por aí? Me contem nos comentários! Tamo junto!
Referência: Matéria Original
Posts relacionados:
Construindo um aplicativo usando GitHub Spark com uma única frase como prompt de IA
O Veo 3 da Google agora gera um vídeo de 8 segundos a partir de uma única imagem – veja como experimentar
Sim, é possível fazer sua AirTag durar 10 anos com uma única bateria, mas o método não é agradável.

SILENT THOUGHT The user wants me to rewrite a title in Portuguese for Google Discover. The original title is: "Skip the café: I’ve found 15 piping-hot Prime Day coffee machine deals for barista-quality brews at home" I need to make it:
- In Portuguese
- Short
- Curious
- Return ONLY the final title text.
Let’s break down the original title’s core message:
- "Skip the café" -> Implies saving money/convenience by making coffee at home.
- "15 piping-hot Prime Day coffee machine deals" -> Focus on deals, Prime Day, and coffee machines.
- "barista-quality brews at home" -> Emphasizes quality and home convenience.
Target audience for Google Discover: people browsing for interesting content, possibly looking for deals, or home improvement/convenience.
Ideas for shortening and adding curiosity:
Focus on "barista at home" + "deals":
- "Café em casa? Achamos 15 ofertas Prime Day imperdíveis!" (A bit generic)
- "Seu café barista em casa! 15 máquinas com super desconto Prime Day." (Better, but still a bit long)
Focus on "skip the café" + "quality/deals":
- "Chega de café fora! 15 máquinas Prime Day para um café de barista em casa." (Getting closer)
- "Pule o café! 15 ofertas Prime Day para o café perfeito em casa." (Good, "Pule o café!" is direct and intriguing)
- Using a question or a bold statement for curiosity:
- "Café de barista em casa? Veja 15 ofertas Prime Day!" (Question + deals)
- "Seu café perfeito sem sair de casa: 15 ofertas Prime Day!" (Benefit-driven)
- "Barista em casa, por que não? 15 máquinas em oferta Prime Day." (Playful question)
Let’s refine "Pule o café! 15 ofertas Prime Day para o café perfeito em casa."
- "Pule o café!" – Short, direct, curious.
- "15 ofertas Prime Day" – Essential info.
- "para o café perfeito em casa." – Benefit, "perfeito" implies barista-quality.
How short is "Pule o café! 15 ofertas Prime Day para o café perfeito em casa."? 20 words. Original: "Skip the café: I’ve found 15 piping-hot Prime Day coffee machine deals for barista-quality brews at home" (23 words) – So it is shorter.
Let’s try to make it even more concise and impactful for Discover.
Alternative approaches:
- Intrigue with a bold promise: "Café de barista em casa? Sim! 15 máquinas em oferta Prime Day." (A bit too much "Sim!")
- Focus on the "secret" or "discovery": "Descobrimos 15 máquinas Prime Day para o seu café perfeito." (Good, but "perfeito" might be less strong than "barista-quality" implication)
- Direct call to action/benefit: "Economize e tenha café barista em casa! 15 ofertas Prime Day." (A bit long)
Let’s re-evaluate "Pule o café! 15 ofertas Prime Day para o café perfeito em casa."
- "Pule o café!" is intriguing.
- "15 ofertas Prime Day" is clear.
- "para o café perfeito em casa" is the benefit. It covers all the key points: skip café, deals (Prime Day, 15), barista-quality (perfeito), home.
Can I make "perfeito" imply "barista-quality" more strongly or directly? "Café de barista em casa?" – This is good for curiosity. "15 máquinas com oferta Prime Day para o seu café barista em casa." (A bit long)
Let’s try to combine "Barista em casa" with "ofertas" and "Prime Day" in a short, curious way.
Option 1: Question + Benefit + Deal "Quer café de barista em casa? 15 máquinas Prime Day em oferta!"
- "Quer café de barista em casa?" (Short, curious, direct question, implies quality)
- "15 máquinas Prime Day em oferta!" (Deals, specific count, event) This is 12 words. Very short.
Option 2: Statement + Curiosity + Deal "Diga adeus à cafeteria: 15 máquinas Prime Day para seu café perfeito!"
- "Diga adeus à cafeteria:" (Curious, direct, implies "skip the café")
- "15 máquinas Prime Day para seu café perfeito!" (Deals, quality, home) This is 14 words. Also good. "Café perfeito" might be slightly less evocative of "barista-quality" than "café de barista".
Let’s compare Option 1 and Option 2. Option 1: "Quer café de barista em casa? 15 máquinas Prime Day em oferta!"
- "Café de barista" directly addresses the quality.
- The question format is good for Discover.
- "Em oferta" is concise for "deals".
Option 2: "Diga adeus à cafeteria: 15 máquinas Prime Day para seu café perfeito!"
- "Diga adeus à cafeteria" is very good for "skip the café".
- "Café perfeito" is good but slightly less specific than "café de barista".
I think "Quer café de barista em casa?" is more directly curious and speaks to the core "barista-quality" aspect. It’s also shorter.
Let’s re-read the prompt: "curto e curioso". "Quer café de barista em casa?" – Curious, short. "15 máquinas Prime Day em oferta!" – Short, highlights the deals.
This seems to hit all the requirements.
- Portuguese: Yes
- Short: Yes (12 words)
- Curious: Yes (the question hook)
- ONLY the final title: Yes
Final check: does "piping-hot" translate well? Not literally. The idea is "hot deals" or "great deals". "Em oferta!" covers this well, implying good prices. "Barista-quality brews at home" -> "café de barista em casa". Perfect. "Skip the café" -> "Quer café de barista em casa?" implies you don’t need to go out.
I’m confident with this one.Quer café de barista em casa? 15 máquinas Prime Day em oferta!