NeoMME: H Company reinventa a IA multimodal abrindo mão do que parecia essencial.

Diga Adeus às Gambiarras! NeoMME Revoluciona a Busca Visual com IA Pura e Potente!

Olá, pessoal! Aqui é o Lucas Tech, e hoje a gente vai mergulhar em uma novidade que promete dar uma chacoalhada no mundo da Inteligência Artificial. Sabe aqueles sistemas de busca visual de documentos que vemos por aí? A maioria deles são, digamos, umas "gambiarras" ou "heranças" de modelos maiores. Eles pegam um modelo de IA generativo, que foi feito para criar coisas, e o adaptam para apenas "ler" e "entender" imagens e textos. O resultado? Muita complexidade desnecessária, desperdício de recursos e modelos inchados.

Mas segurem-se nas cadeiras, porque a H Company (sim, aquela mesma, que está sempre trazendo inovações quentes!) acaba de lançar o NeoMME. E o que ele faz? Ele simplesmente joga fora toda essa "tralha" extra e entrega um modelo bidirecional puro e otimizado, feito para brilhar na busca visual desde o primeiro dia. Preparados para entender como essa máquina simples e poderosa funciona? Então, bora lá!

Chega de "Frankenstein" na IA: A Simplicidade do NeoMME

Pensem bem: muitos dos modelos atuais para busca visual, como o ColPali e seus "irmãos", são tipo um "Frankenstein". Eles pegam um modelo de linguagem e visão generativo (que tem uma "torre de visão" para as imagens e um "decoder" para gerar texto, mesmo que ele nunca seja usado para isso!) e o forçam a ser um encoder, que só precisa entender e criar representações. Isso é como levar uma orquestra inteira para tocar um solo de flauta! É muito poder de processamento e um monte de parâmetros sendo desperdiçados.

O NeoMME, tanto na sua versão de 260 milhões quanto na de 800 milhões de parâmetros, vem pra quebrar essa lógica. Ele é um encoder bidirecional feito do zero, sem essas partes extras. Ele processa tanto o texto (em vários idiomas!) quanto as imagens brutas (aquelas "fatias" de 32×32 pixels) usando as mesmas camadas de um único Transformer. Isso é eficiência e elegância pura!

E a melhor parte? Ele já chega "pronto pra batalha". A H Company disponibilizou os checkpoints (os modelos treinados) sob licença Apache 2.0, com suporte desde o dia zero no Hugging Face Transformers. Ah, e a versão de 260M consegue indexar umas impressionantes 51.3 páginas por segundo em uma única NVIDIA L40S, e processa uma consulta em apenas 78.3 ms num servidor com só CPU. É velocidade e acessibilidade!

Uma Torre, Duas Modalidades: O Coração do NeoMME

Que bruxaria é essa de uma torre só? No NeoMME, tanto o texto quanto as imagens são tratados com muito carinho e inteligência. O texto entra com um embedding fatorado estilo ALBERT (uma forma esperta de representar palavras), que é então projetado para a largura do modelo.

As imagens, por sua vez, são "fatiadas" em pequenos patches de 32×32 pixels (sem sobreposição, tá?). Cada um desses patches é processado por uma MLP de 2 camadas, treinada do zero. Sem módulos complicados de fusão de patches, sem "torres" de visão pré-treinadas como o SigLIP2. Simplicidade é a palavra-chave aqui!

E ele não é bobo não! Os modelos suportam uma janela de contexto gigante, com 16.384 tokens – é o suficiente para processar duas imagens 4K UHD completas depois de serem "fatiadas". A maioria das camadas usa atenção deslizante simétrica, mas algumas camadas-chave e a camada final usam atenção global para ter uma visão mais ampla. Ele ainda conta com tecnologias de ponta como atenção agrupada por consulta, normalização de consulta-chave, atenção "gated" e MLPs com função de ativação Squared-ReLU. Tudo pensado para ser super eficiente!

Como o NeoMME Aprendeu essa Mágica?

A mágica do pré-treinamento do NeoMME se chama "difusão mascarada discreta" sobre o texto, que pode ser condicionada por patches de imagem visíveis. Basicamente, é como um jogo de "adivinhação" bem esperto: ele aprende a prever partes de texto que foram "escondidas" ou "mascaradas".

Quando ele está aprendendo com segmentos que têm só texto, a taxa de "corrupção" (o quanto do texto é escondido) varia de 0 a 100%. Mas em segmentos multimodais (com texto e imagem), a taxa de "corrupção" é sempre de 30% a 100%. Isso é crucial! Força o modelo a realmente usar a imagem para entender o que está faltando no texto, tirando qualquer "atalho" de adivinhar só pelo contexto textual.

E os resultados provam que a estratégia funciona! Um teste mostrou que, mesmo com 90% do texto "mascarado", a presença das imagens visíveis aumentou a precisão na recuperação das palavras em mais de 38 pontos percentuais para o modelo de 260M, e 40.5 pontos para o de 800M. Ele realmente está prestando atenção nas imagens! Cada rodada de pré-treinamento processou mais de 500 bilhões de tokens, mostrando o tamanho do esforço!

Resultados que Deixam a Concorrência de Queixo Caído!

Na busca visual de documentos, o NeoMME-Retriever adiciona duas "cabeças" treinadas em conjunto: uma para representações densas e outra para interação tardia. Assim, ele consegue o melhor dos dois mundos em uma única passagem.

No benchmark ViDoRe v3, o modelo de 260M alcançou um impressionante 0.523 nDCG@10. Sabe o que é mais legal? Esse resultado fica a apenas 0.002 ponto do ColQwen2.5-v0.2, que tem 3.75 BILHÕES de parâmetros! Sim, o NeoMME é 14.4 vezes menor e quase tão bom. É o Davi contra Golias da IA! Ele também supera todos os outros modelos abaixo de 800M testados. A versão de 800M chega a 0.556 nDCG@10, bem perto do Vultron Retriever Flash, que é de tamanho similar.

Porém, nem tudo são flores, né? Na busca apenas por texto, ele ainda está um pouco atrás de modelos dedicados. Os desenvolvedores acreditam que isso é por conta da escala de dados de treinamento para essa tarefa específica. Mas é um ponto para futuras melhorias!

Armazenamento e Velocidade: IA Econômica e Veloz!

Vamos falar de economia e performance, porque ninguém quer gastar uma fortuna em infraestrutura, certo? Índices de interação tardia (onde cada token/patch gera um vetor) podem ser bem grandes. Uma página 2048×2048, por exemplo, pode gerar mais de 4.000 vetores, o que dá uns 1.5 MB por documento no formato "bruto" (float32).

Mas a galera da H Company é esperta e usou duas técnicas que são pura magia: pooling hierárquico de tokens e quantização assimétrica. Com isso, eles conseguiram reduzir o tamanho do índice de incríveis 1.5 MB para meros 6 kB por página! Isso é uma redução de mais de 250 vezes, mantendo quase 95% da qualidade original. Imaginem a economia de armazenamento!

E a velocidade? Fenomenal! Em uma única NVIDIA L40S, o NeoMME-260M consegue indexar 51.3 páginas por segundo (em páginas 2048×2048), quase o dobro da velocidade do ColModernVBERT. Menor, mais leve, mais rápido – é o pacote completo para quem busca eficiência máxima!

Explicador Interativo

Ah, e se você é como eu e adora ver as coisas funcionando na prática, a H Company preparou um explicador interativo irado! Ele te permite visualizar como o NeoMME funciona, desde a arquitetura da "torre única" até o processo de pré-treinamento e a compressão dos índices. Vale a pena conferir para ter uma ideia mais clara de toda essa engenharia por trás!

Pontos-Chave para não Esquecer!

  • Simplicidade é poder: Um único Transformer bidirecional que cuida tanto do texto quanto das imagens brutas, sem precisar de torres de visão ou decoders separados. Menos é mais!
  • Desempenho de gente grande: O NeoMME-Retriever-260M alcança 0.523 nDCG@10 no ViDoRe v3, superando todos os outros modelos avaliados abaixo de 800M. Isso é muita performance em um pacote pequeno!
  • Eficiência de recursos: Ele iguala a performance de modelos de 3.75 bilhões de parâmetros (como o ColQwen2.5) no ViDoRe v3, sendo 14.4 vezes menor. Imagina a economia de custo e energia!
  • Compressão Mágica: Com token pooling e quantização, o índice de cada página é cortado de 1.5 MB para 6 kB. É uma otimização brutal para armazenamento.
  • Onde pode melhorar: A busca apenas por texto e a transferência para imagens naturais ainda são pontos que podem ser aprimorados. Mas para busca visual multimodal, ele já é um campeão!

Você pode conferir o Artigo Completo (Paper), a Coleção de Modelos e o Demo. E claro, se curtiu, segue a gente no Twitter, entra no nosso SubReddit de ML com mais de 150k membros e assina a nossa Newsletter! Ah, e agora estamos no Telegram também!

Minha Visão

Galera, essa notícia do NeoMME é um divisor de águas! Por que? Porque ela mostra que podemos ter modelos de IA extremamente potentes e eficazes sem a necessidade de arquiteturas complexas e cheias de "pedaços" que não são otimizados para a tarefa. É a busca por eficiência e elegância no design de IA, algo que como entusiasta me deixa super empolgado! Para nós, desenvolvedores, isso significa mais acessibilidade, menos custos de infraestrutura e a possibilidade de criar aplicações de busca visual muito mais rápidas e escaláveis, democratizando o acesso a tecnologias de ponta.

Pensem no impacto disso em áreas como organização de documentos empresariais, busca de imagens em bancos de dados gigantes, ou até mesmo no desenvolvimento de assistentes visuais mais inteligentes. O NeoMME é um passo gigante para tornar a IA multimodal mais enxuta, barata e disponível para todos. É um lembrete de que inovar nem sempre é adicionar mais, mas sim otimizar e simplificar, buscando a essência da inteligência!

E vocês, o que acham dessa "limpeza" na arquitetura dos modelos de busca visual? Acreditam que a simplificação é o caminho para um futuro da IA mais eficiente e acessível para todos? Deixem seus comentários!

Referência: Matéria Original

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *

Rolar para cima
Tutorial Elevenlabs