EmbeddingGemma 2: avalie a recuperação antes de acrescentar multimodalidade ao RAG
O modelo local combina modalidades e vetores redimensionáveis. A decisão útil é medir recuperação, memória e qualidade no próprio acervo.
O Google anunciou o EmbeddingGemma 2, modelo de embeddings que representa texto, código, imagens, vídeo e áudio em um espaço vetorial compartilhado.[7] A configuração multimodal tem 740 milhões de parâmetros e licença Apache 2.0.[7] Seu papel é busca e recuperação, não gerar respostas por conta própria.[7] Essa distinção deveria orientar qualquer protótipo de RAG que use o lançamento.
O que muda para quem desenvolve
A arquitetura é modular: a parte textual utiliza aproximadamente 270 milhões de parâmetros, com codificadores opcionais de visão e áudio.[7] Isso sugere uma abordagem de adoção incremental. Se o problema é pesquisar documentação escrita, comece por texto e justifique cada modalidade adicional pelo que ela resolve.
A técnica Matryoshka permite reduzir vetores de 768 dimensões para 512, 256 ou 128.[7] A notícia apresenta essa flexibilidade como uma troca entre tamanho do índice e qualidade de recuperação.[7] Em vez de escolher a maior dimensão por reflexo, compare o efeito nas consultas importantes para o produto.
O Google relata cerca de 191 MB de RAM ativa para os pesos textuais quantizados e 567 MB para o conjunto multimodal em um Pixel 11 Pro.[7] Esses números pertencem ao cenário medido, não demonstram consumo equivalente no servidor, no navegador ou no notebook escolhido para outro projeto.
A janela é de 8 mil tokens, e o resultado divulgado no MTEB Code passa de 68,76 para 78,68.[7] São informações do fornecedor. Minha recomendação é tratá-las como motivo para avaliar, não como aprovação antecipada de um acervo em português.
Como aplicar
Monte um experimento de recuperação antes de conectar um gerador de respostas:
- Separe uma amostra de documentos, código e perguntas reais sem dados que você não esteja autorizado a processar.
- Marque manualmente quais trechos respondem a cada pergunta. Inclua consultas sem resposta no acervo.
- Mantenha a mesma segmentação e compare os vetores nas dimensões escolhidas.
- Registre se os trechos relevantes aparecem entre os primeiros resultados, além de latência, memória e tamanho do índice.
- Só depois avalie a resposta gerada com os trechos recuperados.
Esse desenho ajuda a distinguir falha de busca de falha de geração. Também permite observar se reduzir o vetor economiza recursos sem retirar documentos necessários das primeiras posições. Nenhum resultado desse experimento é pressuposto aqui.
Se áudio ou imagens forem importantes, acrescente um conjunto próprio para essas modalidades e mantenha a avaliação textual como referência. Não altere segmentação, modelo e dimensão ao mesmo tempo se precisar explicar a origem do ganho.
Cuidados e limites
O anúncio enfatiza execução no dispositivo, privacidade e funcionamento offline.[7] Ainda assim, verifique o comportamento do runtime e das integrações escolhidas. A arquitetura de um produto privado deve incluir controle de acesso ao documento e rastreabilidade das fontes.
Um espaço vetorial compartilhado é uma capacidade de recuperação, não uma política de autorização. Preserve essa separação: um trecho relevante pode continuar sendo um trecho que o usuário não tem permissão para receber.