Ir para o conteúdo principal
Voltar aos artigos

EmbeddingGemma 2: avalie a recuperação antes de acrescentar multimodalidade ao RAG

O modelo local combina modalidades e vetores redimensionáveis. A decisão útil é medir recuperação, memória e qualidade no próprio acervo.

·3 min de leitura·2 visualizações

O Google anunciou o EmbeddingGemma 2, modelo de embeddings que representa texto, código, imagens, vídeo e áudio em um espaço vetorial compartilhado.[7] A configuração multimodal tem 740 milhões de parâmetros e licença Apache 2.0.[7] Seu papel é busca e recuperação, não gerar respostas por conta própria.[7] Essa distinção deveria orientar qualquer protótipo de RAG que use o lançamento.

O que muda para quem desenvolve

A arquitetura é modular: a parte textual utiliza aproximadamente 270 milhões de parâmetros, com codificadores opcionais de visão e áudio.[7] Isso sugere uma abordagem de adoção incremental. Se o problema é pesquisar documentação escrita, comece por texto e justifique cada modalidade adicional pelo que ela resolve.

A técnica Matryoshka permite reduzir vetores de 768 dimensões para 512, 256 ou 128.[7] A notícia apresenta essa flexibilidade como uma troca entre tamanho do índice e qualidade de recuperação.[7] Em vez de escolher a maior dimensão por reflexo, compare o efeito nas consultas importantes para o produto.

O Google relata cerca de 191 MB de RAM ativa para os pesos textuais quantizados e 567 MB para o conjunto multimodal em um Pixel 11 Pro.[7] Esses números pertencem ao cenário medido, não demonstram consumo equivalente no servidor, no navegador ou no notebook escolhido para outro projeto.

A janela é de 8 mil tokens, e o resultado divulgado no MTEB Code passa de 68,76 para 78,68.[7] São informações do fornecedor. Minha recomendação é tratá-las como motivo para avaliar, não como aprovação antecipada de um acervo em português.

Como aplicar

Monte um experimento de recuperação antes de conectar um gerador de respostas:

  1. Separe uma amostra de documentos, código e perguntas reais sem dados que você não esteja autorizado a processar.
  2. Marque manualmente quais trechos respondem a cada pergunta. Inclua consultas sem resposta no acervo.
  3. Mantenha a mesma segmentação e compare os vetores nas dimensões escolhidas.
  4. Registre se os trechos relevantes aparecem entre os primeiros resultados, além de latência, memória e tamanho do índice.
  5. Só depois avalie a resposta gerada com os trechos recuperados.

Esse desenho ajuda a distinguir falha de busca de falha de geração. Também permite observar se reduzir o vetor economiza recursos sem retirar documentos necessários das primeiras posições. Nenhum resultado desse experimento é pressuposto aqui.

Se áudio ou imagens forem importantes, acrescente um conjunto próprio para essas modalidades e mantenha a avaliação textual como referência. Não altere segmentação, modelo e dimensão ao mesmo tempo se precisar explicar a origem do ganho.

Cuidados e limites

O anúncio enfatiza execução no dispositivo, privacidade e funcionamento offline.[7] Ainda assim, verifique o comportamento do runtime e das integrações escolhidas. A arquitetura de um produto privado deve incluir controle de acesso ao documento e rastreabilidade das fontes.

Um espaço vetorial compartilhado é uma capacidade de recuperação, não uma política de autorização. Preserve essa separação: um trecho relevante pode continuar sendo um trecho que o usuário não tem permissão para receber.

Fonte

[7] Fonte: Google DeepMind Blog, com redirecionamento para o anúncio do Google. Data/hora no feed: 06/10/2026 às 16:57:04.

Continue lendo