Google DeepMind ha introdotto SynthID Bio, una nuova famiglia di metodi di watermarking che incorporano una firma rilevabile e impercettibile direttamente nelle proteine ​​progettate dall'intelligenza artificiale. Annunciato il 30 settembre, il sistema estende la tecnologia di filigrana SynthID dell'azienda – già utilizzata per etichettare testo, immagini, audio e video generati dall'intelligenza artificiale – alla biologia sintetica, dove la posta in gioco include la biosicurezza e l'integrità dei database scientifici pubblici.

A differenza della filigrana digitale, una filigrana biologica deve sopravvivere a un test molto più severo: deve rimanere rilevabile non solo nell’output di un modello software, ma nella stessa proteina fisica sintetizzata. Secondo DeepMind, SynthID Bio supera questo limite. Negli esperimenti di laboratorio, i progetti di proteine ​​filigranate hanno mantenuto la loro funzione biologica pur rimanendo verificabili, producendo ciò che l'azienda descrive come i primi leganti proteici filigranati e biologicamente funzionali. Il lavoro è dettagliato in un articolo di Nature intitolato “Filigrana che preserva la funzione delle proteine ​​generate dall’intelligenza artificiale”. Per maggiori informazioni su questa storia, consulta la nostra ultimi sviluppi nell'IA.

Perché applicare la filigrana alla biologia?

L’intelligenza artificiale generativa è diventata un vero e proprio strumento di ricerca biologica. DeepMind punta al proprio portafoglio: AlphaFold per la previsione delle strutture proteiche, AlphaProteo e ProteinMPNN per la progettazione di proteine ​​completamente nuove e, più recentemente, sistemi di intelligenza artificiale utilizzati per sviluppare nuovi batteriofagi, virus che infettano i batteri. Gli stessi strumenti, tuttavia, creano nuovi rischi.

Secondo l’annuncio, le nuove sequenze progettate dall’intelligenza artificiale possono aggirare il tradizionale screening della sintesi del DNA, perché gli addetti allo screening non possono più presumere che una sequenza sconosciuta appartenga a qualche organismo naturale sconosciuto. Separatamente, le strutture 3D sintetiche etichettate erroneamente rischiano di inquinare i database pubblici e fuorviare la ricerca a valle. Entrambi i problemi condividono una causa fondamentale: nessuno attualmente può dimostrare da dove provenga un determinato progetto biologico.

Due approcci alla filigrana, un unico obiettivo

SynthID Bio adatta la sua tecnica al tipo di dati. Per le sequenze proteiche, guida in modo sottile la scelta degli amminoacidi man mano che la sequenza viene generata, incorporando un segnale statistico che gli strumenti di rilevamento possono rilevare. Per le strutture 3D previste, apporta piccoli aggiustamenti alle coordinate atomiche che portano una firma rilevabile.

La prova più forte proviene dalla validazione del wet-lab. Lavorando con una versione SynthID Bio-enabled di ProteinMPNN insieme al metodo di progettazione del legante AlphaProteo di DeepMind, i ricercatori hanno filigranato progetti mirati a tre proteine: VEGF-A, il dominio di legame del recettore della proteina spike SARS-CoV-2 e PD-L1. I disegni con filigrana corrispondevano alle loro controparti senza filigrana in termini di tasso di successo, affinità di legame misurata come KD e diversità di sequenza naturale. In altre parole, la filigrana non ha compromesso la capacità delle molecole di svolgere il proprio lavoro.

Per il ripiegamento delle proteine, DeepMind ha intrapreso una strada diversa: il team ha messo a punto parte della rete di diffusione di AlphaFold 3 in modo che la capacità di watermarking sia integrata direttamente nei pesi del modello. Ciò significa che ogni struttura prevista porta una firma rilevabile indipendentemente da chi esegue il modello, mentre l’azienda riferisce che l’approccio preserva l’accuratezza della previsione di AlphaFold 3, offre una rilevabilità quasi perfetta e resiste al rumore digitale o a piccoli cambiamenti di coordinate.

Un nuovo livello nella difesa del "formaggio svizzero" della biosicurezza

DeepMind inquadra SynthID Bio come uno strato in un modello di biosicurezza a più livelli: l'approccio del "formaggio svizzero", in cui molteplici misure di sicurezza indipendenti coprono ciascuna i punti ciechi degli altri. Lo screening della sintesi del DNA è in prima linea: trasformare il progetto di una proteina digitale in una molecola fisica richiede di ordinare il DNA dai fornitori di sintesi, che esaminano le richieste confrontandole con database di minacce note. La verifica di un ordine sconosciuto oggi può richiedere una revisione manuale esaustiva che blocca la ricerca legittima. Una filigrana incorporata fornisce ai fornitori un segnale automatico che un ordine ha avuto origine da un modello affidabile con garanzie integrate.

Esperti indipendenti citati da DeepMind hanno fatto eco a questa inquadratura. "SynthID Bio è un pezzo importante del puzzle per tracciare la provenienza dei progetti biologici", ha affermato Sarah Carter, esperta di politiche di biosicurezza e direttrice di Science Policy Consulting, aggiungendo che le filigrane consentono agli sviluppatori di guidare la sicurezza e ai fornitori di sintesi di semplificare lo screening. James Diggans, vicepresidente della politica e della biosicurezza presso Twist Bioscience, che ha fornito un primo feedback sul documento, ha definito la filigrana "una nuova promettente aggiunta agli strumenti di biosicurezza" che potrebbe concentrare l'esame sulle sequenze che meritano una revisione più attenta.

Lo stesso segnale di provenienza potrebbe proteggere archivi scientifici aperti come Protein Data Bank, UniProt e GenBank, che accettano contributi pubblici. Man mano che la biologia generata dall’intelligenza artificiale si accumula, SynthID Bio potrebbe contrassegnare o verificare le voci sintetiche prima che contaminino la documentazione su cui fanno affidamento altri ricercatori e le decisioni sulla biosicurezza.

Limiti e cosa verrà dopo

DeepMind è sincero nel dire che il sistema non è a prova di manomissione. Rendere la filigrana resistente alla rimozione deliberata di avversari è considerata una sfida aperta e la società suggerisce di abbinare SynthID Bio con standard di metadati di provenienza simili a C2PA, lo schema di credenziali di contenuto utilizzato per i media digitali, o con archivi centrali di dati biologici generati dall’intelligenza artificiale.

Il campo di applicazione si sta espandendo anche oltre le proteine. Nel lavoro in corso con il laboratorio Hie della Stanford University e l’Arc Institute, DeepMind ha integrato SynthID Bio in Evo 2, un modello genomico avanzato, e lo ha utilizzato per filigranare il genoma di un batteriofago progettato da Evo 2. I primi test di laboratorio su colture batteriche hanno confermato che i fagi filigranati rimangono funzionali e l'azienda afferma che è in arrivo un manoscritto tecnico.

Per un campo in cui l'intelligenza artificiale sta iniziando a scrivere un codice biologico che non è mai esistito in natura, potendo rispondere "chi l'ha fatto e con quale modello?" sta tranquillamente diventando infrastruttura. SynthID Bio è un passo iniziale e deliberatamente cauto in quella direzione, un passo che i suoi creatori insistono sia un complemento, non un sostituto, del resto dello stack di biosicurezza. Per ulteriori informazioni su come si sta evolvendo la ricerca sull'intelligenza artificiale, segui gli ultimi sviluppi dell'intelligenza artificiale mentre i laboratori continuano a spingere i modelli generativi più in profondità nelle scienze naturali.

Stai al passo con l'intelligenza artificiale

Segui la storia completa e molto altro sulla nostra home page: Leggi altre notizie sull'AI →