O Google DeepMind apresenta o SynthID Bio, que insere marca-d'água em proteínas de IA sem comprometer a função biológica.

O estudo foi publicado nesta quarta-feira (30 de setembro de 2026) na revista Nature, com apresentação técnica simultânea no blog oficial do Google DeepMind e no blog institucional do Google. A ferramenta estende para a biologia sintética a família de rastreamento SynthID — já aplicada em imagens, áudio, texto e vídeo gerados por redes neurais —, tecendo uma assinatura estatística imperceptível na escolha de aminoácidos e nas coordenadas 3D de modelos generativos, verificável mediante chave privada por laboratórios e fabricantes de sequências de DNA.

Entrada envidraçada de edifício comercial moderno com letreiro luminoso branco Google sobre portas giratórias de vidro. À esquerda, um pedestre de casaco escuro, cachecol azul claro e calça jeans fala ao celular. À direita, um ciclista de costas com jaqueta vermelha, capacete verde-limão e mochila preta segura uma bicicleta prateada. Acima da entrada, a fachada envidraçada reflete um prédio com janelas quadradas e traz acabamento lateral em painéis verticais de madeira clara

Gciriani / Wikimedia Commons (CC BY-SA 4.0). Fachada da sede do Google e da subsidiária DeepMind no número 6 da Pancras Square, em Londres, registrada em 21 de dezembro de 2017. O registro mostra a entrada do complexo predial. Não representa as estruturas moleculares sintetizadas nem os dados laboratoriais do artigo.

Overrated

achar que uma marca-d'água digital em proteínas é inviolável contra qualquer tentativa de remoção intencional

Underrated

conseguir alterar as coordenadas atômicas e a sequência genética mantendo a afinidade de ligação idêntica em testes de laboratório úmido

A transição da assinatura para a biologia sintética

O projeto foi iniciado pelo vice-presidente de pesquisa do DeepMind, Pushmeet Kohli, com liderança técnica de David Stutz e Alexander I. Cowen-Rivers. A motivação central descrita pelos autores é preencher uma lacuna crítica nas esteiras de biossegurança contra o risco biológico de agentes e modelos generativos de fronteira.

Provedores comerciais de síntese genética tradicionalmente comparam os pedidos recebidos contra bancos de dados de patógenos, toxinas conhecidas e sequências perigosas catalogadas. No entanto, sistemas contemporâneos de inteligência artificial conseguem desenhar proteínas de novo (do zero) com estruturas e sequências de aminoácidos sem precedentes evolutivos na natureza. Essas sequências não constam nos bancos de dados tradicionais de ameaças, mas podem realizar funções biológicas potentes dentro de organismos vivos, exigindo análises manuais extensas ou passando despercebidas pelas checagens automáticas.

O SynthID Bio divide sua atuação em duas frentes complementares de marcação:

  1. Geração de sequências (ProteinMPNN e AlphaProteo): no momento em que o modelo decide qual aminoácido posicionar ao longo da cadeia, o algoritmo orienta sutilmente as probabilidades com base em uma chave criptográfica pseudoaleatória. Ele só insere variações estatísticas quando a substituição do aminoácido não degrada a estrutura nem a estabilidade funcional da molécula projetada.
  2. Predição de estruturas 3D (AlphaFold 3): a equipe ajustou finamente (fine-tuning) uma fração da rede de difusão do AlphaFold 3, incorporando a marcação diretamente nos pesos matemáticos do modelo. Como resultado, qualquer coordenada atômica espacial estimada pelo sistema carrega um desvio padronizado e detectável por quem dispõe da chave de conferência, mesmo sob rotações e pequenos ruídos digitais.
RecursoDetalhe técnico oficial
EscopoSequências de aminoácidos e coordenadas 3D de proteínas
Modelos validadosAlphaFold 3, ProteinMPNN e AlphaProteo
Validação biológicaTestes in vitro em laboratório úmido com a Adaptyv Bio
Alvos laboratoriaisVEGF-A, proteína spike do SARS-CoV-2 (RBD) e PD-L1
Medições de afinidadeConstante de dissociação (KD) equivalente às versões sem marca
DisponibilidadeCódigo-fonte, dados in vitro e pesos abertos para pesquisadores

Resultados em bancada e testes in vitro

Para demonstrar que a assinatura não inutiliza as propriedades medicinais ou funcionais das moléculas sintetizadas, o DeepMind validou o sistema em testes de bancada de laboratório úmido conduzidos em parceria com a Adaptyv Bio.

Os experimentos focaram em proteínas ligantes (binders), desenhadas para se acoplar com alta especificidade a três alvos biológicos de relevância terapêutica e viral:

  • VEGF-A: fator de crescimento endotelial vascular ligado à formação de vasos sanguíneos.
  • RBD da proteína spike do SARS-CoV-2: domínio de ligação ao receptor celular usado na infecção do coronavírus.
  • PD-L1: proteína de checkpoint imunológico associada à regulação de respostas imunes e tratamentos oncológicos.

Nos três cenários de teste, as versões sintetizadas com a marca-d'água do SynthID Bio mantiveram taxa de acerto (hit rate), diversidade de sequência e afinidade de ligação — avaliada pela constante de dissociação de equilíbrio (KD) — em patamares indistinguíveis dos desenhos originais não marcados. Trata-se da primeira demonstração com validação laboratorial de ligantes proteicos biologicamente funcionais portando marcas d'água computacionais integradas.

Limites, adulteração e modelo de defesa em camadas

Apesar dos resultados laboratoriais, tanto o artigo na Nature quanto especialistas independentes de biossegurança enfatizam os limites práticos da tecnologia. A marcação depende do uso de uma chave de detecção privada, concebida para ser compartilhada com empresas parceiras de síntese de DNA e curadores de repositórios públicos (como Protein Data Bank, GenBank e UniProt) para evitar que dados computacionais não rotulados poluam bancos de referência científica.

A principal restrição reside na possibilidade de remoção (tampering): um agente mal-intencionado com acesso ao código ou à estrutura de uma proteína marcada pode reprocessar o desenho através de uma segunda ferramenta generativa desprovida de marcação, encontrando uma sequência sinônima que preserve a geometria sem reter o padrão estatístico original.

Por essa razão, especialistas em políticas biológicas — como Sarah Carter (Science Policy Consulting) e Tessa Alexanian (ex-IBBIS) — destacam que a marcação deve operar como uma camada complementar dentro de uma defesa escalonada no estilo queijo suíço, ao lado de verificação cadastral de clientes (know-your-customer), triagem de função preditiva e governança na infraestrutura de síntese de DNA.

Em extensão preliminar em conjunto com a Universidade de Stanford e o Arc Institute, o DeepMind também testou a integração do SynthID Bio no modelo genômico Evo 2 para marcar o DNA de bacteriófagos projetados artificialmente, confirmando funcionalidade viável em culturas bacterianas.

Fontes