Google ACERTA EM CHEIO! 🚀 Gemini 3.5 Transcribe Chegou Para REVOLUCIONAR a Conversão de Voz em Texto!
Olá, pessoal! Aqui é o Lucas Tech, e preparem-se porque a Google acabou de jogar uma bomba no mundo da inteligência artificial que vai mudar a forma como interagimos com a voz! Se você curte tecnologia, acessibilidade ou simplesmente quer ver o futuro acontecendo agora, cola comigo que eu vou explicar tudo sobre o novo Gemini 3.5 Transcribe! É um modelo de transcrição de fala para texto que promete ser um divisor de águas, tanto para interfaces de voz em tempo real quanto para áudios gravados. Vem comigo desvendar essa novidade!
O Poder do Gemini 3.5 Transcribe: Dois Mundos, Duas APIs!
A grande sacada aqui é que a Google não lançou um, mas dois "endpoints" para o Gemini 3.5 Transcribe! Pensem em como duas portas diferentes para acessar funcionalidades super específicas, mas complementares.
Temos o gemini-3.5-transcribe que é para arquivos de áudio já gravados. Ele funciona através da Interactions API. Sabe aquela reunião longa que você gravou e precisa da transcrição? É com ele!
E a estrela do show para o real-time é o gemini-3.5-transcribe-live, que lida com streaming bidirecional em tempo real pela Live API. Pensa em assistentes de voz, legendas ao vivo ou ditado instantâneo!
A Google divulgou números impressionantes: a taxa média de erro de palavra (WER) é de 4,0% para streaming e 2,6% para não-streaming, medido pela Artificial Analysis. E o tempo para a transcrição final melhorou 70% em comparação com o modelo anterior, o Chirp 3! Ah, e ele detecta automaticamente mais de 85 idiomas, incluindo a famosa "code-switching" (quando a gente troca de idioma no meio da frase). É tipo mágica! ✨
Dá Pra Usar no Seu Projeto? A Resposta é SIM, mas só via API!
Muita gente pergunta: "Lucas, posso baixar e rodar na minha máquina?". Infelizmente, por enquanto, a resposta é não. Ele é um serviço gerenciado pela Google, totalmente via API, sem pesos abertos para rodar localmente. Mas isso não é um problema, muito pelo contrário!
Para Quem é essa Novidade?
- Qualquer Empresa: Desde um desenvolvedor solo com a camada gratuita da Gemini API (via Google AI Studio) até grandes corporações. Equipes de médio porte podem migrar para a camada paga para limites maiores, e as empresas regulamentadas podem usar o Gemini Enterprise Agent Platform com throughput provisionado e controles de conformidade. Tudo está em "public preview", então fiquem de olho.
- Indústrias que Vão Voar: Call centers, plataformas de experiência do cliente (CX), documentação clínica, legendagem de mídia, serviços jurídicos e de seguros, ferramentas de reunião e tudo que envolve ferramentas de desenvolvimento controladas por voz.
- Aplicações que Vão Brilhar: Agentes de voz em tempo real (como a IA que te atende no telefone!), legendagem ao vivo (eventos, transmissões!), análises pós-chamada, transcrição de reuniões com atribuição de orador (quem disse o quê!), ditado e interfaces controladas por voz. O céu é o limite!
Dois Pontos de Acesso, Funcionalidades Diferentes: A Chave do Sucesso!
Aqui é onde a gente precisa prestar atenção, porque as duas APIs não são iguais e têm funcionalidades diferentes, limites e até preços distintos.
A Live API: Velocidade e Real-time! ⚡
O gemini-3.5-transcribe-live é o mestre da transcrição contínua em sub-segundos. Ele te dá transcrições parciais (que eles chamam de interim_input_transcription) enquanto alguém ainda está falando, e depois a transcrição final (input_transcription) quando a pessoa termina a frase. O áudio entra cru, no formato PCM de 16 bits a 16kHz mono, em pedacinhos de 100ms. Ele suporta detecção de atividade de voz (VAD) automática, híbrida e manual, e ainda usa "ephemeral tokens" para que aplicativos móveis e web possam transmitir sem precisar de uma chave de API fixa. Demais, né?
Mas atenção: As sessões ao vivo são limitadas a 10 minutos de streaming contínuo. Não tem diarização de locutor (saber quem falou o quê) e nem timestamps por palavra. É focada na velocidade e na agilidade.
A Interactions API: Detalhe e Inteligência Pós-Produção! 🧠
Já o gemini-3.5-transcribe (para áudios pré-gravados) cobre o que o streaming não pode. Ele oferece diarização de locutor (até 8 pessoas!), timestamps por palavra (saber exatamente a hora de cada palavra) e vocabulário personalizado (com até 1.000 termos, mas a Google recomenda usar menos de 100 para melhores resultados).
Os arquivos de áudio padrão podem ter até uma hora. Mas, se você habilitar a diarização ou os timestamps por palavra, esse limite cai para 30 minutos. A atribuição de mais de 2 oradores ainda está em fase experimental.
Modo "Verbatim" vs. Modo "Smart": A Decisão de Design Real!
Ambos os endpoints oferecem dois modos de transcrição, e essa é uma decisão importante para planejar seus projetos:
verbatim(Padrão): Transcreve TUDO, literalmente. Inclui hesitações ("um…", "ãh"), repetições e falsos começos de frase. É como ter um registro exato do que foi dito.smart: Esse modo é a inteligência em ação! Ele remove as "disfluências" (essas hesitações e repetições), corrige automaticamente as autocorreções faladas e aplica formatação estruturada.
Um exemplo da própria Google:
- Se alguém disser: "Um, so for the meeting, I think we should, uh, invite Alice and, wait no, Bob and Carol."
- O modo Verbatim vai transcrever exatamente isso.
- Já o modo Smart vai retornar: "For the meeting, I think we should invite Bob and Carol." Muito mais limpo e legível, né?
O pulo do gato: O modo smart não pode ser combinado com timestamps de palavras ou diarização. Ou seja, você precisa escolher: uma transcrição super legível e resumida (Smart) ou uma transcrição precisa e auditável com detalhes de quem falou e quando (Verbatim + timestamps/diarização). Isso é crucial para o seu planejamento!
Performance de Ponta e Suporte a Mais de 85 Idiomas!
Como já mencionei, o Gemini 3.5 Transcribe é um monstro em performance. Com WERs de 4.0% para streaming e 2.6% para não-streaming, ele está entre os melhores do mercado. A melhoria de 70% no tempo de transcrição final em relação ao modelo anterior (Chirp 3) é algo que realmente faz a diferença em aplicações onde cada segundo conta.
E a cereja do bolo é o suporte a mais de 85 idiomas, com detecção automática e a capacidade de lidar com a troca de código no meio da frase, sem precisar de configuração manual. Isso é um game-changer para empresas globais ou para quem lida com diversos idiomas!
Onde Você Já Pode Ver o Gemini 3.5 Transcribe em Ação?
Essa tecnologia não é só teoria! A Live API já está integrada em plataformas como LiveKit, Pipecat, Agora, Fishjam, Vercel e Vision Agents.
No lado do consumidor, o modelo já está impulsionando o Rambler no Android, o aplicativo Gemini no macOS e o Google Antigravity. E a boa notícia é que o Chrome está "chegando em breve" com essa tecnologia! Imaginem as possibilidades para legendas em vídeos do navegador ou interações por voz! 🤯
Resumindo: Pontos Chave para Ficar Ligado!
Pra não esquecer os detalhes mais importantes, aqui vai um resumo rápido para você:
- Duas APIs, não uma: A Live API foca em baixa latência para streaming (mas sem diarização ou timestamps), enquanto a Interactions API é para arquivos gravados, com diarização e timestamps (mas não em tempo real).
- Desempenho de peso: WER de 4.0% para streaming e 2.6% para não-streaming.
- Escolha Inteligente: O modo "Smart" oferece transcrições limpas e formatadas, mas não pode ser combinado com timestamps ou diarização. Você precisa decidir o que é mais importante para sua aplicação.
- Custo acessível (Estimativa): Cerca de US$0,005/min para transcrição em lote e US$0,009/min para transcrição ao vivo (custo blended).
- Limites importantes: Sessões ao vivo de 10 minutos, arquivos de até 1 hora (30 minutos com diarização/timestamps ativados).
Minha Visão
Olha, pessoal, como um entusiasta de tecnologia que vive e respira inovação, o lançamento do Gemini 3.5 Transcribe é simplesmente sensacional! A Google está não apenas aprimorando a capacidade de transformar voz em texto, mas também pensando nas diferentes necessidades dos desenvolvedores e usuários. A separação em duas APIs e a opção entre os modos "Verbatim" e "Smart" mostra uma maturidade incrível na forma como eles abordam problemas complexos.
Para mim, o maior impacto será na acessibilidade e na democratização da inteligência artificial. Pensem em legendas automáticas super precisas para pessoas com deficiência auditiva, ou em como isso pode transformar o atendimento ao cliente, tornando as interações mais eficientes e humanas. E para nós, desenvolvedores, as ferramentas estão ficando cada vez mais poderosas e fáceis de integrar, abrindo um leque enorme de possibilidades para criar as próximas grandes inovações! É a IA se tornando cada vez mais parte do nosso dia a dia de um jeito prático e super útil.
E aí, qual funcionalidade do Gemini 3.5 Transcribe mais chamou a sua atenção e como você imagina que ela poderia ser usada no seu dia a dia ou em algum projeto? Me conta nos comentários! 👇
Referência: Matéria Original
Posts relacionados:

THINK: The user wants me to rewrite a long, technical English title into a short, curious Portuguese title suitable for Google Discover. I need to focus on the "autonomous machine learning research loop" and "hyperparameter discovery" aspects, making it sound intriguing without being overly complex. I must only return the final title.
Analyze the original title:
- "How to Build an Autonomous Machine Learning Research Loop in Google Colab Using Andrej Karpathy’s AutoResearch Framework for Hyperparameter Discovery and Experiment Tracking"
- Core idea 1: Autonomous ML Research Loop
- Core idea 2: Hyperparameter Discovery / Experiment Tracking
- Tool: Google Colab
- Framework: Andrej Karpathy’s AutoResearch Framework (this is too specific/long for Discover)
Identify key concepts for curiosity:
- "Autonomous" -> automatizado, sozinho, sem você
- "Research Loop" -> pesquisa, descoberta, otimização
- "Machine Learning" -> IA, aprendizado de máquina
- "Hyperparameter Discovery" -> melhores resultados, segredos, IA que se aprimora
- "Google Colab" -> fácil, acessível
Brainstorm short, curious Portuguese phrases:
- "Sua IA faz pesquisa sozinha?" (Too informal/simplistic)
- "Colab: sua IA descobre os segredos sozinha."
- "Máquina que aprende sozinha: o loop de pesquisa."
- "Automação ML: deixe a IA otimizar tudo."
- "Descoberta de hiperparâmetros: a IA faz por você."
- "Colab: IA autônoma em pesquisa."
- "Sua IA pesquisa e se aprimora sozinha."
- "Colab: Sua IA pesquisa e se aprimora SOZINHA?"
Refine for Discover style (short, curious, engaging):
- Needs to hint at the "loop" and "discovery" without being explicit about the technical terms.
- "Autonomous" is strong. "Máquina que aprende sozinha" is good.
- "Colab" is a recognizable platform.
- Focus on the benefit: better results, faster discovery, less manual work.
Draft options and evaluate:
- Option 1: "Sua IA pesquisa e se aprimora sozinha no Colab?" (Good, curious, short, uses "sozinha" for autonomous and "aprimora" for hyperparameter discovery/experiment tracking implicitly).
- Option 2: "Colab: Deixe sua IA descobrir os melhores parâmetros." (A bit less about the "loop" and "research," more specific to parameters).
- Option 3: "Máquina que aprende sozinha: o segredo no Colab." (Intriguing, but "segredo" might be too vague).
- Option 4: "Crie uma IA que pesquisa sozinha no Google Colab." (Good, but "crie" might imply building the AI, not just the loop).
- Option 5: "Colab: Sua IA já otimiza os próprios resultados?" (Good, focuses on optimization and "próprios" implies autonomous).
Select the best fit: Option 1 or 5 are strong. Option 1 "Sua IA pesquisa e se aprimora sozinha no Colab?" directly addresses the "research loop" (pesquisa) and "hyperparameter discovery/experiment tracking" (aprimora), while keeping it curious and short. "Sozinha" captures "autonomous." It’s also a question, which is good for Discover engagement.
Let’s try to make it even more punchy, maybe less of a question. "Colab: Sua IA Otimiza Sozinha?" (Too short, loses "research") "Colab: A IA Que Pesquisa e Se Aprimora SOZINHA" (Strong, emphasizes "sozinha") "Descubra: Sua IA Pesquisa E Otimiza Sozinha?" (Adds "Descubra" for curiosity) "Colab: Sua IA já se aprimora sozinha?" (Good, concise, highlights the autonomous self-improvement)
Let’s go with a direct, intriguing question that hints at the core functionality. The "loop" implies continuous research and improvement.
"Sua IA Pesquisa e Otimiza SOZINHA no Colab?" This captures:
- "Pesquisa" (Research loop)
- "Otimiza" (Hyperparameter discovery, experiment tracking, improvement)
- "SOZINHA" (Autonomous)
- "Colab" (Platform)
- It’s a question, making it curious.
- It’s short.
I think "Sua IA Pesquisa e Otimiza SOZINHA no Colab?" is a very good fit. It’s direct, curious, and covers the main points succinctly.
Let’s try one more: "Colab: Sua IA Já Otimiza os Próprios Experimentos?" This is also good, "otimiza os próprios experimentos" maps well to the hyperparameter discovery and experiment tracking loop. "Próprios" implies autonomous.
I will go with something that highlights the "alone/autonomous" aspect clearly, and the "improvement" or "research" part.
"Colab: Sua IA pesquisa e se aprimora SOZINHA?" – This uses "pesquisa" (research) and "aprimora" (improves/optimizes) and "sozinha" (autonomous) and "Colab". It’s a question, short, and curious. This feels like a strong contender.Colab: Sua IA pesquisa e se aprimora SOZINHA?

THINK: The user wants me to rewrite a title in Portuguese for Google Discover. The original title is "Securing the Infrastructure of Intelligence". The requirements are:
- In Portuguese.
- For Google Discover.
- Short.
- Curious.
- Return ONLY the final title text.
Let’s break down the original title: "Securing the Infrastructure of Intelligence"
- "Intelligence" here likely refers to AI, artificial intelligence, or general data/information processing. It’s not human intelligence in the typical sense, more like computational intelligence.
- "Infrastructure" refers to the underlying systems, hardware, networks, etc., that support this intelligence.
- "Securing" refers to protecting it from threats.
So, the core concept is protecting AI/data infrastructure.
Now, let’s brainstorm Portuguese equivalents and ideas for Discover:
Keywords:
- Inteligência (AI, computational)
- Infraestrutura (base, sistemas, rede)
- Segurança (proteção, defender, cibersegurança)
Discover Style:
- Intrigue, ask a question, hint at a problem/solution, create a sense of urgency or importance.
- Short, impactful.
- Often uses words like "Você sabia?", "O que acontece se…", "Segredo revelado", "Como proteger…".
Drafts:
- Direct translation attempt (too long, not curious): "Protegendo a Infraestrutura da Inteligência"
- Focus on AI: "Segurança da IA: Você está protegido?" (Good, but "Você está protegido?" might sound like the user needs protection, not the infrastructure).
- Focus on "intelligence" as a broad concept: "A Inteligência está segura?" (Too ambiguous, what intelligence? Human? AI? Government?)
- Combine AI and Security, add curiosity:
- "IA Segura: O Fim da Ameaça?" (A bit dramatic, but curious)
- "Sua IA em Risco? Descubra como protegê-la." (Too long, "Sua IA" implies personal, not general infrastructure)
- "Proteger a IA: O Desafio Escondido." (Good, "Desafio Escondido" adds curiosity)
- "IA e Segurança: O elo perdido?" (A bit abstract)
- "A Base da IA: Como protegê-la de ataques." (A bit too direct, less curious)
- "Segurança da IA: O que ninguém te conta." (Good, curious, implies secret info)
- "IA em Risco? Cuidado com a infraestrutura." (A bit dry)
- "Defenda a IA: Onde o futuro começa." (Poetic, but maybe less direct about the threat)
- "A Infraestrutura da IA: O Calcanhar de Aquiles?" (Good, uses a known metaphor for vulnerability)
- "IA: E se a base falhar?" (Short, curious, implies risk)
- "Segurança da IA: A chave para o futuro." (Positive, but less about threat/curiosity, more about importance)
Let’s refine some of the stronger ones, keeping it short and curious.
- "IA: E se a base falhar?" (Short, direct question, creates fear of failure for the foundation of AI)
- "O Segredo da IA Segura?" (Short, curious, implies there’s a secret solution)
- "Sua IA Está Segura? Reveja a Base." (A bit long, "Sua IA" again implies personal)
- "Proteja a IA: Onde Começa o Caos?" (Dramatic, curious, focuses on the negative consequence if not protected)
- "Segurança da IA: O Grito Silencioso." (Poetic, but might be too abstract for Discover)
- "Infraestrutura da IA: O Perigo Oculto." (Good, direct, curious, highlights a hidden threat)
Comparing:
- "IA: E se a base falhar?" – Very short, very curious, focuses on the critical infrastructure ("base") and the potential failure. This aligns well.
- "O Segredo da IA Segura?" – Good, but maybe a bit too much "secret" and less "infrastructure" focus.
- "Infraestrutura da IA: O Perigo Oculto." – Also very strong. Direct, curious, hits "infrastructure" and "danger".
Let’s go with one that evokes a direct, critical question about the foundation of AI, which is what "infrastructure" is. "IA: E se a base falhar?" is concise, impactful, asks a direct question, and highlights the core problem (the foundation/infrastructure failing). "Infraestrutura da IA: O Perigo Oculto" is also excellent. The original "Securing the Infrastructure of Intelligence" heavily implies a risk that needs protection. "O Perigo Oculto" captures this well. "IA: E se a base falhar?" directly translates to "AI: What if the base fails?". "Base" is a good proxy for "infrastructure" in a short, impactful way.
Let’s try one more pass for maximum curiosity and conciseness, directly hinting at the infrastructure’s vulnerability.
- "IA: Sua base é segura?" (Short, direct, uses "base" for infrastructure)
- "O Calcanhar de Aquiles da IA." (Very curious, short, common idiom for vulnerability)
- "A Infra da IA em risco?" (Uses "Infra" for short)
"O Calcanhar de Aquiles da IA." is extremely strong for Google Discover.
- In Portuguese: Yes.
- For Google Discover: Yes, uses a well-known idiom, creates intrigue.
- Short: Very short.
- Curious: Absolutely, makes you wonder what the "Achilles’ heel" is and why it’s related to AI. It perfectly conveys the idea of a critical vulnerability within the "infrastructure of intelligence."
This title implies:
- AI exists.
- It has a critical weakness (Achilles’ heel).
- This weakness needs to be addressed/secured.
- It’s short, impactful, and memorable.
Let’s consider "Sua base de IA está em perigo?" as another option, but "O Calcanhar de Aquiles da IA" is more evocative and less direct, which is often better for curiosity.
Final choice: "O Calcanhar de Aquiles da IA." It’s concise, uses a powerful metaphor for vulnerability (directly relating to "securing infrastructure"), and instantly grabs attention.O Calcanhar de Aquiles da IA.

THINKING PROCESS:
Analyze the original title: "I just played Crimson Desert on PS5 Pro — here’s how this massive RPG looks and runs on console"
- Core subject: Crimson Desert
- Platform: PS5 Pro (and "console" in general)
- Main aspects discussed: Looks (graphics), runs (performance)
- Implied tone: Personal experience, informative review/first impression.
- Keywords: Crimson Desert, PS5 Pro, RPG, looks, runs, console.
Understand the target platform: Google Discover.
- Characteristics: Visual-driven, snackable content, engaging, curiosity-inducing, often uses questions, bold claims, or intriguing statements. Personalization is key.
- Goal: Make people click now.
Understand the requirements:
- Language: Portuguese (BR, implied).
- Length: Short.
- Tone: Curious.
- Output: ONLY the final title text.
Brainstorm Portuguese equivalents for key concepts:
- "I just played" -> Joguei, Acabei de jogar, Minha experiência com
- "Crimson Desert" -> Crimson Desert (keep original)
- "PS5 Pro" -> PS5 Pro (keep original)
- "massive RPG" -> RPG massivo, RPG gigante, mundo aberto gigante
- "looks and runs" -> Gráficos e desempenho, Como roda, Como está, O que esperar
- "on console" -> No console, No PS5 Pro
Focus on "short and curious" for Google Discover:
Curiosity triggers:
- Questions (e.g., "Impressionado?", "Como será?", "Vale a pena?")
- Intriguing statements (e.g., "Você não vai acreditar!", "Chocante!", "Surpreendente!")
- Direct address ("Você precisa ver")
- Highlighting the impressiveness or challenge of the game/platform.
- Using strong adjectives (massivo, gigante, surpreendente, incrível).
- Shortness: Avoid long clauses, get straight to the point.
Drafting – Iteration 1 (Mental or scratchpad):
- "Joguei Crimson Desert no PS5 Pro: veja como roda!" (Too plain)
- "Crimson Desert no PS5 Pro: gráficos e desempenho surpreendem?" (Better, but maybe more active)
- "Como Crimson Desert roda no PS5 Pro? É gigante!" (A bit clunky)
- "O RPG massivo Crimson Desert no PS5 Pro: veja como ele se saiu!" (A bit long)
Focus on the "massive RPG" aspect combined with "PS5 Pro":
- The challenge for an "RPG massivo" to run well on a console is the implicit hook. The PS5 Pro is the specific new tech.
Drafting – Iteration 2 (Closer to final):
- "Crimson Desert no PS5 Pro: o RPG massivo surpreende no console?" (Good, but "surpreende" might be too weak, or implies it might not surprise).
- "Crimson Desert no PS5 Pro: É assim que o RPG massivo roda!" (A bit bland).
- "Joguei Crimson Desert no PS5 Pro: o RPG massivo impressiona!" (Good, but "joguei" might make it sound too personal, not for a broader audience seeking a quick info bite). Discover often uses more declarative or question-based styles.
Refine for "curious" and "short":
What makes people curious about a huge game on a powerful console?
- Does it push the limits?
- Is it smooth?
- Are the graphics mind-blowing?
Combine game, platform, and key performance aspects.
- Option 1 (Question-based): "Crimson Desert no PS5 Pro: O RPG massivo impressiona?" (Good, short, curious. "Impressiona" covers both looks and runs implicitly).
- Option 2 (Statement-based with intrigue): "Crimson Desert no PS5 Pro: O RPG gigante em ação!" (A bit less specific on performance).
- Option 3 (Focus on the how): "Crimson Desert no PS5 Pro: Veja como o RPG massivo se saiu!" (A bit long, "se saiu" is okay but not super punchy).
Final selection strategy:
- Choose the one that best combines "Crimson Desert," "PS5 Pro," "massive RPG," and the core idea of "looks and runs" in a curious and short way.
- The question format is excellent for Discover.
"Impressiona" in Portuguese is a strong verb that covers both visual appeal and performance satisfaction.
- Consider: "Crimson Desert no PS5 Pro: como o RPG massivo roda?" (Good, direct, but maybe a bit too much "como roda" which is expected.)
- Consider: "Crimson Desert no PS5 Pro: gráficos e desempenho no RPG gigante!" (A bit descriptive, less curious).
Consider: "Crimson Desert no PS5 Pro: O RPG massivo te surpreende?" (Very good, direct to the reader).
- Let’s try one more: "Crimson Desert no PS5 Pro: O RPG massivo te convence?" (A bit strong on "convence" – implies skepticism).
"Crimson Desert no PS5 Pro: Vale a pena?" (Too generic).
Let’s go back to focusing on the impact of the game running on the Pro. "Impressiona" is good because it covers both visual fidelity and smooth performance, and it directly asks if the combination delivers.
- "Crimson Desert no PS5 Pro: o RPG massivo impressiona?"
- Short: Yes.
- Curious: Yes, it asks a direct question that makes the reader wonder about the answer.
- Covers key elements: Game title, platform, genre, and the core "how it performs" implied by "impressiona."
- Final check: Is it only the title text? Yes.
The chosen title is concise, uses the game and console names, highlights its genre ("RPG massivo") as a key challenge/feature, and asks a direct question ("impressiona?") to pique curiosity about its performance and visuals.
"Crimson Desert no PS5 Pro: O RPG massivo impressiona?"Crimson Desert no PS5 Pro: O RPG massivo impressiona?
Gemini Embedding 2: A IA que Vê, Ouve e Lê Tudo!