Diga Adeus às Gambiarras! NeoMME Revoluciona a Busca Visual com IA Pura e Potente!
Olá, pessoal! Aqui é o Lucas Tech, e hoje a gente vai mergulhar em uma novidade que promete dar uma chacoalhada no mundo da Inteligência Artificial. Sabe aqueles sistemas de busca visual de documentos que vemos por aí? A maioria deles são, digamos, umas "gambiarras" ou "heranças" de modelos maiores. Eles pegam um modelo de IA generativo, que foi feito para criar coisas, e o adaptam para apenas "ler" e "entender" imagens e textos. O resultado? Muita complexidade desnecessária, desperdício de recursos e modelos inchados.
Mas segurem-se nas cadeiras, porque a H Company (sim, aquela mesma, que está sempre trazendo inovações quentes!) acaba de lançar o NeoMME. E o que ele faz? Ele simplesmente joga fora toda essa "tralha" extra e entrega um modelo bidirecional puro e otimizado, feito para brilhar na busca visual desde o primeiro dia. Preparados para entender como essa máquina simples e poderosa funciona? Então, bora lá!
Chega de "Frankenstein" na IA: A Simplicidade do NeoMME
Pensem bem: muitos dos modelos atuais para busca visual, como o ColPali e seus "irmãos", são tipo um "Frankenstein". Eles pegam um modelo de linguagem e visão generativo (que tem uma "torre de visão" para as imagens e um "decoder" para gerar texto, mesmo que ele nunca seja usado para isso!) e o forçam a ser um encoder, que só precisa entender e criar representações. Isso é como levar uma orquestra inteira para tocar um solo de flauta! É muito poder de processamento e um monte de parâmetros sendo desperdiçados.
O NeoMME, tanto na sua versão de 260 milhões quanto na de 800 milhões de parâmetros, vem pra quebrar essa lógica. Ele é um encoder bidirecional feito do zero, sem essas partes extras. Ele processa tanto o texto (em vários idiomas!) quanto as imagens brutas (aquelas "fatias" de 32×32 pixels) usando as mesmas camadas de um único Transformer. Isso é eficiência e elegância pura!
E a melhor parte? Ele já chega "pronto pra batalha". A H Company disponibilizou os checkpoints (os modelos treinados) sob licença Apache 2.0, com suporte desde o dia zero no Hugging Face Transformers. Ah, e a versão de 260M consegue indexar umas impressionantes 51.3 páginas por segundo em uma única NVIDIA L40S, e processa uma consulta em apenas 78.3 ms num servidor com só CPU. É velocidade e acessibilidade!
Uma Torre, Duas Modalidades: O Coração do NeoMME
Que bruxaria é essa de uma torre só? No NeoMME, tanto o texto quanto as imagens são tratados com muito carinho e inteligência. O texto entra com um embedding fatorado estilo ALBERT (uma forma esperta de representar palavras), que é então projetado para a largura do modelo.
As imagens, por sua vez, são "fatiadas" em pequenos patches de 32×32 pixels (sem sobreposição, tá?). Cada um desses patches é processado por uma MLP de 2 camadas, treinada do zero. Sem módulos complicados de fusão de patches, sem "torres" de visão pré-treinadas como o SigLIP2. Simplicidade é a palavra-chave aqui!
E ele não é bobo não! Os modelos suportam uma janela de contexto gigante, com 16.384 tokens – é o suficiente para processar duas imagens 4K UHD completas depois de serem "fatiadas". A maioria das camadas usa atenção deslizante simétrica, mas algumas camadas-chave e a camada final usam atenção global para ter uma visão mais ampla. Ele ainda conta com tecnologias de ponta como atenção agrupada por consulta, normalização de consulta-chave, atenção "gated" e MLPs com função de ativação Squared-ReLU. Tudo pensado para ser super eficiente!
Como o NeoMME Aprendeu essa Mágica?
A mágica do pré-treinamento do NeoMME se chama "difusão mascarada discreta" sobre o texto, que pode ser condicionada por patches de imagem visíveis. Basicamente, é como um jogo de "adivinhação" bem esperto: ele aprende a prever partes de texto que foram "escondidas" ou "mascaradas".
Quando ele está aprendendo com segmentos que têm só texto, a taxa de "corrupção" (o quanto do texto é escondido) varia de 0 a 100%. Mas em segmentos multimodais (com texto e imagem), a taxa de "corrupção" é sempre de 30% a 100%. Isso é crucial! Força o modelo a realmente usar a imagem para entender o que está faltando no texto, tirando qualquer "atalho" de adivinhar só pelo contexto textual.
E os resultados provam que a estratégia funciona! Um teste mostrou que, mesmo com 90% do texto "mascarado", a presença das imagens visíveis aumentou a precisão na recuperação das palavras em mais de 38 pontos percentuais para o modelo de 260M, e 40.5 pontos para o de 800M. Ele realmente está prestando atenção nas imagens! Cada rodada de pré-treinamento processou mais de 500 bilhões de tokens, mostrando o tamanho do esforço!
Resultados que Deixam a Concorrência de Queixo Caído!
Na busca visual de documentos, o NeoMME-Retriever adiciona duas "cabeças" treinadas em conjunto: uma para representações densas e outra para interação tardia. Assim, ele consegue o melhor dos dois mundos em uma única passagem.
No benchmark ViDoRe v3, o modelo de 260M alcançou um impressionante 0.523 nDCG@10. Sabe o que é mais legal? Esse resultado fica a apenas 0.002 ponto do ColQwen2.5-v0.2, que tem 3.75 BILHÕES de parâmetros! Sim, o NeoMME é 14.4 vezes menor e quase tão bom. É o Davi contra Golias da IA! Ele também supera todos os outros modelos abaixo de 800M testados. A versão de 800M chega a 0.556 nDCG@10, bem perto do Vultron Retriever Flash, que é de tamanho similar.
Porém, nem tudo são flores, né? Na busca apenas por texto, ele ainda está um pouco atrás de modelos dedicados. Os desenvolvedores acreditam que isso é por conta da escala de dados de treinamento para essa tarefa específica. Mas é um ponto para futuras melhorias!
Armazenamento e Velocidade: IA Econômica e Veloz!
Vamos falar de economia e performance, porque ninguém quer gastar uma fortuna em infraestrutura, certo? Índices de interação tardia (onde cada token/patch gera um vetor) podem ser bem grandes. Uma página 2048×2048, por exemplo, pode gerar mais de 4.000 vetores, o que dá uns 1.5 MB por documento no formato "bruto" (float32).
Mas a galera da H Company é esperta e usou duas técnicas que são pura magia: pooling hierárquico de tokens e quantização assimétrica. Com isso, eles conseguiram reduzir o tamanho do índice de incríveis 1.5 MB para meros 6 kB por página! Isso é uma redução de mais de 250 vezes, mantendo quase 95% da qualidade original. Imaginem a economia de armazenamento!
E a velocidade? Fenomenal! Em uma única NVIDIA L40S, o NeoMME-260M consegue indexar 51.3 páginas por segundo (em páginas 2048×2048), quase o dobro da velocidade do ColModernVBERT. Menor, mais leve, mais rápido – é o pacote completo para quem busca eficiência máxima!
Explicador Interativo
Ah, e se você é como eu e adora ver as coisas funcionando na prática, a H Company preparou um explicador interativo irado! Ele te permite visualizar como o NeoMME funciona, desde a arquitetura da "torre única" até o processo de pré-treinamento e a compressão dos índices. Vale a pena conferir para ter uma ideia mais clara de toda essa engenharia por trás!
Pontos-Chave para não Esquecer!
- Simplicidade é poder: Um único Transformer bidirecional que cuida tanto do texto quanto das imagens brutas, sem precisar de torres de visão ou decoders separados. Menos é mais!
- Desempenho de gente grande: O NeoMME-Retriever-260M alcança 0.523 nDCG@10 no ViDoRe v3, superando todos os outros modelos avaliados abaixo de 800M. Isso é muita performance em um pacote pequeno!
- Eficiência de recursos: Ele iguala a performance de modelos de 3.75 bilhões de parâmetros (como o ColQwen2.5) no ViDoRe v3, sendo 14.4 vezes menor. Imagina a economia de custo e energia!
- Compressão Mágica: Com token pooling e quantização, o índice de cada página é cortado de 1.5 MB para 6 kB. É uma otimização brutal para armazenamento.
- Onde pode melhorar: A busca apenas por texto e a transferência para imagens naturais ainda são pontos que podem ser aprimorados. Mas para busca visual multimodal, ele já é um campeão!
Você pode conferir o Artigo Completo (Paper), a Coleção de Modelos e o Demo. E claro, se curtiu, segue a gente no Twitter, entra no nosso SubReddit de ML com mais de 150k membros e assina a nossa Newsletter! Ah, e agora estamos no Telegram também!
Minha Visão
Galera, essa notícia do NeoMME é um divisor de águas! Por que? Porque ela mostra que podemos ter modelos de IA extremamente potentes e eficazes sem a necessidade de arquiteturas complexas e cheias de "pedaços" que não são otimizados para a tarefa. É a busca por eficiência e elegância no design de IA, algo que como entusiasta me deixa super empolgado! Para nós, desenvolvedores, isso significa mais acessibilidade, menos custos de infraestrutura e a possibilidade de criar aplicações de busca visual muito mais rápidas e escaláveis, democratizando o acesso a tecnologias de ponta.
Pensem no impacto disso em áreas como organização de documentos empresariais, busca de imagens em bancos de dados gigantes, ou até mesmo no desenvolvimento de assistentes visuais mais inteligentes. O NeoMME é um passo gigante para tornar a IA multimodal mais enxuta, barata e disponível para todos. É um lembrete de que inovar nem sempre é adicionar mais, mas sim otimizar e simplificar, buscando a essência da inteligência!
E vocês, o que acham dessa "limpeza" na arquitetura dos modelos de busca visual? Acreditam que a simplificação é o caminho para um futuro da IA mais eficiente e acessível para todos? Deixem seus comentários!
Referência: Matéria Original
Posts relacionados:

THINK: The user wants a Portuguese title for Google Discover. It needs to be:
- Short: Concise, easy to read quickly.
- Curious: Intriguing, makes people want to click.
- About the original topic: "For Robotaxis, Safety Must Be Built In, Not Bolted On". This means safety (segurança) for robotaxis (robotáxis) must be intrinsic, not an afterthought. The core idea is "integrated safety".
Let’s brainstorm some ideas in Portuguese, keeping the core message and the "short & curious" requirement in mind.
Original nuance: "Built In, Not Bolted On" implies a fundamental, integrated design vs. an add-on.
Keywords:
- Robotáxis / Carros autônomos
- Segurança
- Essencial / Desde o início / Integrada / Fundamento
- Problema / Risco (implied if not built-in)
Drafts & Refinements:
- Direct translation attempt (too long): Para robotáxis, a segurança deve ser construída, não adicionada. (Still long, not curious enough)
- Focus on the "built-in" aspect:
- Segurança dos robotáxis: comece certo. (Okay, but a bit plain)
- Robotáxis: segurança não é opcional. (A bit generic, "built-in" is more specific than "not optional")
- O segredo da segurança em robotáxis. (Curious, but loses the "built-in" vs "bolted on" contrast)
- Segurança autônoma: o que é essencial? (Good, "essencial" captures "built-in")
- Segurança dos robotáxis: o detalhe que ninguém vê. (Too vague, "detalhe" is not strong enough for safety)
- Robotáxis: A segurança invisível. (Intriguing, but "invisível" could imply hidden flaws, not good)
- A verdade sobre a segurança dos robotáxis. (A bit sensationalist, common clickbait)
- Segurança para robotáxis: o que realmente importa? (Okay, but a question is less assertive)
- Robotáxis seguros: comece pelo design. (Good, "design" implies built-in)
- Segurança em robotáxis: é desde o início! (Direct, emphasizes the start)
Let’s try to make it more impactful and concise:
- "Built In" can be translated as "intrínseco," "integrado," "desde o projeto," "na essência."
- "Not Bolted On" implies "não um acessório," "não depois."
Consider a phrase that implies the consequence of not building it in. Or the importance of doing it right from the start.
- Robotáxis: A segurança começa no projeto. (This is good. "No projeto" implies "built-in" and "from the start." It’s short, direct, and implies a critical aspect often overlooked or added later.)
- Robotáxis: Segurança intrínseca? (A bit too technical with "intrínseca" for Discover, and the question mark makes it less direct)
- A segurança dos robotáxis: o que é essencial. (Good, "essencial" covers "built-in")
- Robotáxis: Segurança, ou nada. (Too dramatic, less informative)
- O erro fatal na segurança dos robotáxis. (Sensational, but loses the original nuance of how safety should be implemented)
Let’s revisit "Robotáxis: A segurança começa no projeto."
- Short? Yes.
- Curious? Yes, it implies there’s a specific way safety must start, which might not be obvious to everyone. It contrasts with an "afterthought" approach.
- Relevant? Yes, directly addresses the topic.
Another option focusing on the "essential" aspect:
- Robotáxis: Segurança é parte do DNA. (More metaphorical, good for curious, short) – "DNA" implies built-in.
- Robotáxis: Segurança, só se for de berço. (Colloquial, "de berço" means "from birth" – inherent. Could work.)
"A segurança começa no projeto" is very clear and directly addresses the core "built-in" concept. "Segurança é parte do DNA" is more evocative and curious.
Let’s compare:
- Robotáxis: A segurança começa no projeto. (Clear, direct, less metaphorical, easy to understand.)
- Robotáxis: Segurança é parte do DNA. (More intriguing, uses a metaphor, might resonate well.)
The original title has a slightly technical feel with "built in, not bolted on". "Começa no projeto" is a direct and professional way to say "built in from the start". "Parte do DNA" is also good, but "projeto" is more literal for engineering/design context.
For Discover, curiosity is key. "DNA" is a strong metaphor for something inherent.
Let’s try one more combination that captures the "integrated" idea concisely. "Built In" = "Integrada" / "Essencial" "Not Bolted On" = "Não um acessório"
- Robotáxis: Segurança, só se for integrada. (This is very direct and captures the essence well.)
- Short? Yes.
- Curious? Yes, it implies there are other ways safety is added, but only one is acceptable.
- Relevant? Yes.
This feels very strong. "Só se for integrada" creates that contrast with something that isn’t integrated, implying it’s the only valid approach. It directly reflects "Built In, Not Bolted On."
Final check: "APENAS o texto do título final, sem introduções ou listas".
The chosen option: "Robotáxis: Segurança, só se for integrada."Robotáxis: Segurança, só se for integrada.

THINKING PROCESS:
Analyze the original title: "Firebird Launches CIS Region’s Largest AI Factory in Armenia"
- Core message: Firebird (company/entity) is launching a huge AI factory in Armenia, specifically for the CIS region.
- Keywords: Firebird, AI Factory, Armenia, CIS Region, Largest.
- Tone: Factual, corporate.
Understand the target platform: Google Discover
- Characteristics:
- Curiosity-driven.
- Short, catchy.
- Intriguing, often with a "hook."
- Focuses on what’s new, interesting, or impactful.
- Aims to make the user click for more information.
- Often uses questions, strong verbs, or unexpected twists.
- Less formal than a press release.
- Characteristics:
Translate key terms (mentally/quickly):
- Firebird -> Firebird (keep as is, likely a brand name)
- Launches -> Lança, Inaugura
- CIS Region’s Largest -> A maior da região da CEI, A maior da CEI
- AI Factory -> Fábrica de IA, Centro de IA, Polo de IA
- in Armenia -> na Armênia
Brainstorm initial ideas, keeping Google Discover in mind:
- Direct translation (too bland): Firebird Lança a Maior Fábrica de IA da CEI na Armênia. (No curiosity)
- Focus on "largest": A Maior Fábrica de IA da CEI Abre na Armênia! (Better, but still a bit dry)
- Focus on "AI": Armênia Recebe Gigante da IA: A Maior Fábrica da CEI. (Getting closer, adds "gigante")
- Curiosity question: A Armênia É o Novo Polo da IA? Veja a Maior Fábrica da CEI. (Good, but "Veja" might be too informal or like a command)
- Intrigue with impact: Armênia Vira Centro Neural da IA com Nova Super Fábrica. (Stronger verbs, implies significance)
- Direct question + wow factor: Maior Fábrica de IA da CEI É Inaugurada na Armênia. O que isso significa? (A bit long)
- Emphasize scale and location: Armênia Atinge Novo Patamar: Abriga a Maior Fábrica de IA da CEI. (Good, "novo patamar")
- Short, punchy, and intriguing:
- Armênia Surpreende: Lar da Maior Fábrica de IA da CEI.
- O Gigante da IA Nasce na Armênia: A Maior Fábrica da CEI.
- Armênia no Centro das Atenções: Lança a Maior Fábrica de IA da Região.
- IA GIGANTE: Armênia Inaugura a Maior Fábrica da CEI.
Refine and select the best option based on "curto e curioso":
"IA GIGANTE: Armênia Inaugura a Maior Fábrica da CEI."
- "IA GIGANTE" is short, immediately grabs attention, and highlights the scale of AI.
- "Armênia Inaugura" is clear and factual.
- "a Maior Fábrica da CEI" reinforces the unique selling proposition.
- It’s concise and impactful.
Let’s try another angle focusing on Armenia’s unexpected role:
- "Armênia: Novo Berço da IA com a Maior Fábrica da CEI?"
- "Novo Berço da IA" is very curious and suggestive.
- The question mark adds intrigue.
- "com a Maior Fábrica da CEI" explains why.
- This feels very Discover-esque.
- "Armênia: Novo Berço da IA com a Maior Fábrica da CEI?"
Comparing "IA GIGANTE" vs "Armênia: Novo Berço da IA…"
- "IA GIGANTE" is more direct and "newsy."
- "Armênia: Novo Berço da IA…" is more intriguing and invites a click to understand how Armenia becomes a "berço" (cradle) for such a thing. The question mark is a strong Discover hook.
- Let’s try one more emphasizing the surprise factor.
- "Surpresa: A Maior Fábrica de IA da CEI Nasce na Armênia!"
- "Surpresa" is a great hook.
- "Nasce" is more evocative than "inaugura."
- It’s short and exciting.
- "Surpresa: A Maior Fábrica de IA da CEI Nasce na Armênia!"
Final decision: The option "Surpresa: A Maior Fábrica de IA da CEI Nasce na Armênia!" hits all the points:
- Curioso: "Surpresa" immediately makes you wonder why it’s a surprise and what it is. "Nasce" adds a sense of something new and significant emerging.
- Curto: It’s concise.
- Impacto: Highlights "Maior Fábrica de IA."
- Localização: Clearly states "na Armênia."
This is stronger than the question mark option, as it delivers a mini-revelation upfront. "IA GIGANTE: Armênia Inaugura a Maior Fábrica da CEI" is also good, but "Surpresa" has a stronger emotional hook.
Let’s go with the one that leads with "Surpresa." It’s direct, unexpected, and curiosity-provoking.
One final check: "Firebird" is not in my chosen title. Is that okay for Discover? Often, Discover titles omit company names unless the company itself is the story (e.g., "Apple Lança…"). Here, the story is the factory and its scale/location, not Firebird specifically. So, omitting the company name is fine for a broad, curious Discover audience.
Surpresa: A Maior Fábrica de IA da CEI Nasce na Armênia!
IA reinventa “Turma da Mônica” e empresa se manifesta: “Valorizamos a arte”
Alibaba OpenSandbox: O poder dos Agentes IA na sua mão.