Ember-1: A IA que usa 40% menos tokens. Como é possível?

Adeus, IA "Falastrona"! Conheça o Ember-1 e Economize uma Nota nas Suas Aplicações!

Olá, pessoal! Aqui é o Lucas Tech, seu parceiro nas últimas novidades do mundo da tecnologia, e hoje eu tô super empolgado para compartilhar uma notícia que pode mudar a forma como pensamos sobre a eficiência e o custo da Inteligência Artificial. Sabe aquela busca incessante por IAs mais inteligentes, mais rápidas E mais baratas? Pois é, a Fireworks AI acaba de dar um passo GIGANTE nessa direção com o lançamento do Ember-1. Prepare-se para conhecer um modelo que promete entregar a mesma qualidade de gigantes, mas "pensando" muito menos e, consequentemente, gastando muito menos! Bora desvendar essa novidade?

O Problema dos Modelos "Pensadores Demais"

Vocês já pararam para pensar que, assim como a gente, os modelos de IA também "pensam" internamente antes de nos dar uma resposta? O problema é que, muitas vezes, eles pensam demais. A equipe da Fireworks relata que modelos de raciocínio como o Kimi K3 (uma referência de peso no mercado) podem gastar mais de 90% dos tokens gerados apenas em raciocínio interno! É como pagar por toda a "conversa interna" que a IA tem consigo mesma, sabe?

Imagina o custo disso em aplicações mais complexas, especialmente aquelas que envolvem várias etapas ou interações, onde a IA precisa lembrar do que conversou antes (as famosas "turnos" em agentes autônomos). Cada nova interação, ela relê todo o raciocínio anterior, e o contexto só cresce. Isso significa que o que foi "pensado" lá no começo é relido e cobrado de novo em cada chamada seguinte. Uma conta que cresce rapidinho, né?

A galera queria o poder de codificação e raciocínio do K3, mas a um custo menor. E tentar diminuir o "esforço de raciocínio" do K3 na hora de usar simplesmente sacrificava a qualidade da resposta. Ou seja, a solução não era pedir para a IA pensar menos, mas sim pedir para ela pensar de forma mais eficiente.

Ember-1: A Solução Inteligente da Fireworks AI

E é aí que entra o Ember-1! Ele é um modelo especializado, construído pela Fireworks Research, que foi treinado a partir de uma versão de código aberto do Kimi K3 (o Moonshot AI’s Kimi K3). A grande sacada do Ember-1 é que ele aprendeu a produzir traços de raciocínio mais curtos – ou seja, ele chega na mesma conclusão, mas com menos "palavreado" interno – mantendo a mesma precisão e qualidade da tarefa.

Isso é bem diferente de simplesmente "pedir para a IA pensar menos" na hora da inferência, que acaba comprometendo o resultado. O Ember-1 é mais esperto: ele foi ensinado a cortar o raciocínio redundante e os "loops" improdutivos, mas mantendo aquela parte do "pensamento" que é útil, tipo quando a IA se auto-corrige ou reflete sobre um feedback. Segundo a Fireworks, ele entrega a qualidade do Kimi K3 com cerca de 40% menos tokens! Fantástico, não é?

Como a Mágica Aconteceu (Sem Mágica, é Claro!)

Para criar o Ember-1, a equipe da Fireworks Research não economizou esforços. Eles montaram um conjunto de dados de treinamento super abrangente, que incluiu matemática, codificação, seguir instruções, conversação, busca, uso de ferramentas e engenharia de software. Ou seja, um cardápio completo para uma IA inteligente!

O modelo aprendeu através de interações multi-etapa, onde ele agia nas tarefas e recebia feedback sobre os resultados. Isso permitiu que o Ember-1 identificasse e recompensasse as reflexões úteis (aquelas que realmente corrigiam erros) e eliminasse o que era desnecessário. Foram mais de 50 experimentos de treinamento e mais de 200 avaliações! A equipe também desenvolveu novos algoritmos de treinamento, que, por enquanto, eles estão guardando a sete chaves. Todo o treinamento foi feito na plataforma Serverless Training da própria Fireworks, e eles garantem que usaram apenas dados próprios, sem nenhum dado de clientes.

Resultados que Falam por Si: Menos Custos, Mesma Qualidade

Vamos aos números, que é o que importa! A Fireworks comparou o Ember-1 com o Kimi K3 em diferentes níveis de esforço de raciocínio (baixo, médio e máximo). E o Ember-1 brilhou!

Em benchmarks como o Terminal Bench 2.1 e DeepSWE 1.1, o Ember-1 superou o K3 Max em precisão, enquanto em outros como SWE-bench Verified e SWE-Interact, ele ficou só um pouquinho atrás. O mais impressionante é que, em sete benchmarks e em tráfego de produção de dois clientes, o raciocínio do K3 foi encurtado em 35 a 50% sem sacrificar a precisão! No Bedside Bench da Doximity, que são casos clínicos validados por médicos, o Ember-1 estabeleceu um novo patamar de custo-benefício.

E as provas não pararam por aí! A Fireworks fez testes A/B ao vivo com dois clientes em cargas de trabalho de codificação reais. Os resultados? Ambos viram uma redução de cerca de 35% no número de tokens por tarefa, mantendo a qualidade. Um exemplo: os tokens de saída caíram de 49.300 para 29.900 por tarefa. Os tokens de raciocínio caíram 71.3% e o total de tokens 39%! E o mais legal: a pontuação da tarefa ficou praticamente a mesma (0.753 para Ember-1 vs. 0.751 para K3). E o melhor de tudo: um cliente já está usando o Ember-1 em produção!

Importante: o custo por token do Ember-1 é o mesmo do Kimi K3 na Fireworks. A economia vem inteiramente de gerar menos tokens! Ou seja, você não está pagando menos por token, você está pagando por menos tokens gerados, o que se traduz em uma economia substancial por tarefa. Num dos exemplos, o custo de saída por tarefa caiu de aproximadamente $0.74 para $0.45! É dinheiro no bolso!

Mas Posso Usar no Meu Projeto?

Sim! Mas por enquanto, o Ember-1 está disponível apenas através da API serverless da Fireworks como uma "Research Preview". Isso significa que é para testes e exploração, e você não pode hospedá-lo por conta própria. A Fireworks ainda não divulgou os pesos do modelo, o código de treinamento ou os algoritmos exatos usados, então a opção de "self-hosting" não é uma realidade por agora.


Minha Visão

Galera, isso é um divisor de águas! O lançamento do Ember-1 da Fireworks AI é uma prova clara de que o futuro da inteligência artificial não está apenas em modelos cada vez maiores e mais "potentes" (que muitas vezes vêm com contas altíssimas), mas sim em modelos mais inteligentes e eficientes. É sobre otimizar o processo cognitivo da IA, fazendo com que ela "pense" de forma mais assertiva, cortando o desperdício.

Para nós, desenvolvedores e entusiastas de tecnologia, isso significa que podemos sonhar com aplicações de IA mais robustas, escaláveis e, principalmente, muito mais acessíveis financeiramente. É o passo que precisávamos para tirar a IA do reino dos "superprojetos caros" e trazê-la para o dia a dia de startups, pequenos negócios e até projetos pessoais. A economia de custos é real e o impacto na democratização da IA é imenso. Estou super animado para ver o que vem por aí!


E você, o que achou dessa novidade? Acredita que modelos como o Ember-1 são o futuro para tornar a IA mais sustentável e acessível para todos? Deixa seu comentário aqui embaixo, vou adorar saber a sua opinião!

Referência: Matéria Original

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *

Rolar para cima
Tutorial Elevenlabs