Supabase Lança Evals: Sua IA de código é boa de verdade?

REVOLUÇÃO DEV! Supabase Open Sourceia Ferramenta que Avalia SEU Agente de IA na Prática!

Olá, pessoal! Aqui é o Lucas Tech, e hoje a gente vai mergulhar de cabeça numa notícia que acabou de sair do forno e já está fazendo um burburinho no universo da programação e inteligência artificial! O Supabase, que vocês já conhecem e amam, acabou de lançar o Supabase Evals em código aberto. Mas o que diabos é isso, e por que você, desenvolvedor ou entusiasta de IA, deveria se importar? Basicamente, é uma ferramenta sensacional que testa o quão bem os agentes de IA conseguem construir coisas usando o Supabase. Tipo, é o ENEM para a sua IA codificadora! Bora entender como funciona essa parada que promete deixar nossos agentes muito mais espertos!

Supabase Evals: O Que É e Por Que É Tão Importante?

Imagina só: você tem um agente de IA que escreve código e interage com o Supabase. Como você sabe se ele está realmente fazendo um bom trabalho? É aí que o Supabase Evals entra em campo! Ele é, ao mesmo tempo, um benchmark (um padrão de referência para medir performance) e um framework (uma estrutura para desenvolver e testar) que foi criado para fazer exatamente isso.

Ele coloca agentes de código populares, como o Claude Code, Codex e OpenCode, para ralar em tarefas super reais. Estamos falando de coisas como construir um schema de banco de dados, depurar uma Edge Function que deu pau, ou até consertar uma política de RLS (Segurança em Nível de Linha) que quebrou. Depois, ele dá uma nota para o resultado. O Evals não só alimenta o placar público em supabase.com/evals como também é usado internamente para uma suite de regressão monitorada diariamente. É performance real, meu amigo!

Como Colocar Essa Ferramenta Mágica Pra Rodar?

A boa notícia é que você não precisa esperar! O supabase/evals já está público sob a licença Apache-2.0 e pode ser rodado localmente com pnpm.

Pra quem é essa ferramenta?

  • Indústrias: É um prato cheio para quem trabalha com ferramentas de desenvolvimento, infraestrutura de nuvem, plataformas de dados e, especialmente, backends regulados (tipo fintech ou saúde). Nesses últimos, um agente de IA escrevendo uma política de RLS errada pode virar um incidente de segurança grave!
  • Aplicações: Você pode usar pra fazer testes de regressão em documentos e edições de "skills" (habilidades) dos agentes, para dar o "ok" final em lançamentos de SDKs, e para comparar diferentes agentes de IA cara a cara.

Alguma restrição?

Sim, como tudo na vida, tem uns pré-requisitos: você vai precisar de um daemon do Docker rodando, suas chaves de API dos provedores e as portas 54321–54329 livres na sua máquina. Coisa de dev, né?

Por Trás das Cenas: A Engenharia do Supabase Evals

Pra garantir que os testes fossem completos e justos, o Supabase definiu três dimensões principais:

  • Produtos: Database, Auth, Storage, Edge Functions, Realtime, Cron, Queues, Vectors, Data API.
  • Tópicos: RLS, Segurança, Migrações, SQL, SDK, Observabilidade, Self-hosting, Testes, Schema Declarativo.
  • Estágios: Construir (Build), Implementar (Deploy), Investigar (Investigate), Resolver (Resolve).

Eles pegaram o menor conjunto de cenários possível que tocasse cada uma dessas dimensões, baseando tudo em problemas reais: tickets de suporte, relatórios de bugs e issues do GitHub. Demais, né?

Os cenários são divididos em duas suites:

  • Benchmark: Esses cobrem uma ampla gama de casos e são os que vão para o placar público.
  • Regressão: Esses são focados em modos de falha conhecidos, são atualizados diariamente e não afetam os placares públicos.

Cada cenário roda em um ambiente real. O framework inicia um stack do Supabase (como se estivesse hospedado) e um projeto local CLI em containers. Assim, os agentes chamam o servidor MCP e o CLI de verdade, sem mocks! A pontuação combina checagens determinísticas com um "LLM-como-juiz", e os agentes ainda ganham uma tentativa extra antes da nota final.

A estrutura de cada avaliação é bem organizada: um diretório com PROMPT.md (a tarefa), EVAL.ts (o avaliador) e, opcionalmente, remote/ (estado inicial do projeto hospedado) e local/ (ambiente de trabalho do agente). Se tiver um local/, ou se você declarar interface: cli, ele já liga um sandbox Docker para o agente trabalhar.

O Que o Supabase Aprendeu com o Evals?

Os resultados foram super interessantes e trouxeram insights valiosos:

  • Agentes Top Mandando Bem: Modelos como Opus 5 e Kimi K3 alcançaram 100% no estágio "Build" sem precisar de nenhuma skill extra. Isso mostra o nível de inteligência que esses caras já têm!
  • O Poder das "Skills": Para modelos um pouco menores, as "skills" (habilidades ou conhecimentos pré-definidos) fizeram uma diferença enorme. Por exemplo, o Sonnet 5 saltou de 78% para 100%, o GPT-5.6 Sol de 89% para 100%, e o GPT-5.4 mini de 78% para 89%. É a prova de que um bom "treino" faz diferença!
  • Pontos Fracos Revelados: Três áreas principais mostraram onde os agentes ainda precisam melhorar:
    • Eles preferem escrever migrações manualmente em vez de usar schemas declarativos. Isso levou a uma atualização no guia de "skills" para corrigir esse comportamento.
    • Verificam a autenticação de forma manual, em vez de usar o @supabase/server, o que fez o Supabase criar um guia para ajudar a escolher o pacote certo.
    • O uso da documentação varia muito: o Codex / GPT-5.6 lê cerca de 8 páginas de docs por cenário, enquanto o Claude Code lê apenas 2, e só checa os docs em menos de 40% dos cenários, mesmo com as skills carregadas. Parece que alguns agentes são mais "estudiosos" que outros!

Pra Fechar: Os Principais Insights pra Você!

Pra resumir o que rolou de mais importante:

  • O Supabase abriu o código do supabase/evals sob a licença Apache-2.0, então a ferramenta é sua para usar e explorar.
  • Os cenários de teste rodam em stacks Supabase reais, containerizados, garantindo resultados precisos e sem simulações.
  • A pontuação é super inteligente, misturando checagens determinísticas com um "LLM-como-juiz", e ainda dá uma segunda chance para a IA.
  • As "skills" são menos críticas para os modelos de IA mais avançados, mas são um game-changer para os menores, ajudando-os a performar muito melhor.

Minha Visão

Pensa comigo, galera: ter uma ferramenta como o Supabase Evals em código aberto é um divisor de águas! Não é só sobre saber se a IA do momento é boa, mas exatamente onde ela falha e como podemos torná-la melhor. Isso é crucial para o futuro do desenvolvimento, especialmente em áreas onde um erro na segurança (tipo um RLS mal configurado) pode ser desastroso.

É o Supabase nos mostrando que estão levando a sério a responsabilidade de integrar IA no desenvolvimento, e dando à comunidade as ferramentas para fazer o mesmo. É um passo gigante em direção a um desenvolvimento mais seguro, eficiente e inteligente com IA. Tô super empolgado pra ver o que a comunidade vai construir e descobrir com isso! Você pode conferir os detalhes técnicos e o repositório no GitHub para se aprofundar ainda mais!

E você, o que achou dessa novidade do Supabase? Já pensou em usar o Evals pra testar seus próprios agentes de IA ou até mesmo melhorar o seu workflow? Me conta nos comentários!

Referência: Matéria Original

Deixe um comentário

O seu endereço de e-mail não será publicado. Campos obrigatórios são marcados com *

Rolar para cima
Tutorial Elevenlabs