Microsoft Lança IA de Testes: Bate o Copilot com 92.1%!

Olá, pessoal! Aqui é o Lucas Tech e, sério, a Microsoft acabou de lançar algo que pode mudar tudo para nós, desenvolvedores! Esqueça a parte chata de escrever e validar testes de unidade, porque um novo agente de IA chegou para revolucionar essa tarefa. Prepare-se para conhecer o code-testing-generator, uma ferramenta open source que não só escreve seus testes, mas prova que eles funcionam!

🤯 Microsoft Libera Agente AI que Escreve e VALIDA Testes de Unidade! Sua Rotina Dev Nunca Mais Será a Mesma!

Olá, pessoal! Aqui é o Lucas Tech e, sério, a Microsoft acabou de lançar algo que pode mudar tudo para nós, desenvolvedores! Sabe aquela tarefa chata de escrever testes de unidade? Aquela que a gente procrastina ou faz rapidinho sem muita inspiração? Pois é, a gigante de Redmond acaba de liberar um agente de IA superinteligente que não só cria esses testes para você, mas vai além: ele verifica se eles realmente funcionam! Prepare-se para conhecer o code-testing-generator, e o melhor? É open source!

O Fim da Dor de Cabeça: Conheça o code-testing-generator

A Microsoft abriu o código do code-testing-generator, um agente poliglota (ou seja, fala várias linguagens de programação!) que tem uma missão clara: escrever testes de unidade e, em seguida, provar que eles realmente cumprem o que prometem. Ele faz parte do plugin dotnet-test e está lá no repositório dotnet/skills, sob a licença MIT. Ou seja, a comunidade pode usar e contribuir!

Ele foi criado para preencher uma lacuna que os assistentes de código geralmente deixam. Se você já usou um assistente, sabe que um comando como "gerar testes de unidade" pode ser meio vago. Qual framework usar? Onde salvar o arquivo? Que asserções fazer? O code-testing-generator resolve isso de forma inteligente!

Mas O Que o Torna Tão Especial?

A grande sacada desse agente é que ele não simplesmente joga um monte de código na tela. Antes de escrever qualquer coisa, ele "lê" seu repositório. Sim, ele faz uma pesquisa para entender o contexto do seu projeto, os frameworks que você já usa, as convenções de código existentes e até onde seus testes costumam ficar.

Depois dessa "leitura", ele planeja, escreve, executa e verifica os testes que produz. É tipo ter um dev sênior superinteligente que conhece seu projeto a fundo. E os resultados? Em um benchmark interno da Microsoft com 152 tarefas, ele completou 140 tarefas, enquanto o GitHub Copilot (com o mesmo modelo e prompts) completou 120. Isso significa que ele teve 63% menos falhas!

Por Dentro do Mago: Como Ele Trabalha?

O segredo está na sua pipeline RPI (Research-Plan-Implement, ou Pesquisar-Planejar-Implementar), que funciona em várias etapas:

  • Pesquisa (Research): Ele age como um verdadeiro detetive! Procura o código que precisa de testes, detecta a linguagem e o framework de testes, lê os testes existentes para pegar as convenções e encontra os comandos reais de build e teste. Isso evita o problema comum de testes que compilam localmente, mas nunca rodam na CI.
  • Planejamento (Plan): Não é só sair codificando! Ele mapeia cada comportamento para um arquivo de teste e prioriza: começa com códigos mais simples e depois avança para aqueles com mais dependências.
  • Implementação (Implement): A magia acontece aqui! Ele escreve os testes, os executa e corrige as asserções que falham em relação ao código-fonte. Importante: ele nunca modifica o código de produção! E ele é esperto, evita testes que chamam URLs externas, alocam portas ou dependem de tempo (o que geralmente gera testes flaky).

E a cereja do bolo: a verificação!

Antes de reportar que terminou, o agente executa cinco verificações para garantir a qualidade:

  1. Checagem de Pseudo-Mutação: Ele simula pequenas mudanças no código para ver se seus testes deveriam falhar. É uma forma leve de mutation testing. Se um teste passa mesmo com o código "quebrado", ele é fraco!
  2. Checagem de Asserções: Ele procura asserções fracas ou ausentes.
  3. Mapeamento de Cenários: Garante que cada cenário solicitado no prompt tem um teste correspondente.
  4. Build Completo: Ele compila o workspace inteiro e executa a suíte de testes completa.
  5. Descoberta dos Testes: Confirma que o comando de teste do repositório consegue encontrar os novos testes.

Resultados que Você Precisa Ver pra Acreditar!

Chega de papo, vamos aos números! Nos 152 desafios de um benchmark interno da Microsoft, o code-testing-generator completou 140 tarefas (92.1%), enquanto o GitHub Copilot padrão completou 120 (78.9%). Isso significa 63% menos falhas!

  • Prompts Vagos: Em 89 prompts mais "soltos", o agente resolveu 79 (88.8%) contra 59 (66.3%) do Copilot. As falhas caíram de 30 para 10!
  • Prompts Detalhados: Em 63 prompts específicos, ambos tiraram a mesma nota (61 tarefas, 96.8%).
  • Testes para Diffs: O agente passou em todas as 15 tarefas de testes focados em mudanças específicas de código (diffs), enquanto o Copilot padrão não passou em nenhuma!

O mais legal é que ele gerou menos testes (2.3% a menos – 6.963 contra 7.129), mantendo a cobertura de código praticamente idêntica (72.4% contra 72.2%). E ainda foi ligeiramente mais rápido, com um tempo médio de 359 segundos por tarefa, contra 380 do Copilot.

Em tarefas .NET, o Claude Opus 4.8 com o agente resolveu 43 de 45, enquanto no Copilot padrão foram 35 de 45. Com GPT-5.5, a diferença foi de 41/45 vs 36/45.

Pra Quem Serve?

A melhor parte? Ele roda localmente! Como é uma definição de agente com suas "skills", e não um serviço hospedado, seu código permanece seguro na sua máquina.

Pra quem é isso, Lucas?

  • Qualquer um! Desde desenvolvedores solo até grandes empresas.
  • Startups e equipes de médio porte são as que mais ganham, já que o agente faz toda a pesquisa do repositório que uma equipe pequena muitas vezes não tem tempo de fazer.
  • Empresas grandes podem até customizar as diretrizes de linguagem para se adequar aos seus frameworks internos.
  • Setores regulados (pense em finanças, saúde, seguros, setor público) ou equipes que precisam lidar com um monte de testes legados, pois ele ajuda a padronizar e a garantir a qualidade.
  • Aplicações: Preencher módulos sem testes, gerar testes para um pull request, aumentar a cobertura antes de um release ou padronizar convenções em monorepos com várias linguagens.

Quais Linguagens Ele Conhece?

Ele é um verdadeiro poliglota do código! O agente já vem com diretrizes para .NET, Python, TypeScript, JavaScript, Java, Go, Ruby, Rust, Swift, Kotlin, PowerShell e C++. Mas, como já dissemos, o mais legal é que ele aprende as convenções do seu projeto antes de começar a codificar!


Minha Visão

Gente, eu tô MUITO empolgado com isso! Essa ferramenta não é só um atalho para escrever testes; é um salto gigante na qualidade do nosso software e na produtividade dos desenvolvedores. Imagine menos tempo gasto em tarefas repetitivas e mais tempo focado em inovar e resolver problemas complexos. É sobre confiança no nosso código, sabendo que a IA está nos ajudando a construir uma base sólida. Pra mim, isso é um vislumbre de um futuro onde a IA cuida do "chato" e nos liberta para sermos mais criativos. É um game-changer!

E Você, o Que Acha?

Curioso pra testar essa maravilha? Você acha que um agente como o code-testing-generator vai revolucionar o jeito que escrevemos software? Conta pra mim nos comentários!

Referência: Matéria Original

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *

Rolar para cima
Tutorial Elevenlabs