
Google ha scandagliato il web alla ricerca di trappole per gli agenti IA: gli attacchi sono già realtà e crescono rapidamente
L’idea degli agenti di intelligenza artificiale capaci di navigare sul web, gestire email, compilare moduli o effettuare operazioni autonome viene spesso presentata come una delle trasformazioni tecnologiche più importanti degli ultimi anni. L’obiettivo dichiarato è semplice: delegare alle macchine una parte crescente delle attività quotidiane e professionali.
Parallelamente, però, si è sviluppata un’altra discussione, molto meno visibile ma sempre più rilevante: quella sulla sicurezza dei sistemi basati su IA generativa. Per molto tempo alcuni ricercatori hanno lanciato segnali di allarme su un rischio chiamato iniezione indiretta di prompt, considerato da molti un problema teorico confinato a studi accademici e simulazioni di laboratorio.
Le ultime analisi condotte da Google, però, sembrano raccontare uno scenario differente. Quello che fino a poco tempo fa appariva come un rischio potenziale sta iniziando a manifestarsi in ambienti reali e su larga scala.
Che cos’è l’iniezione indiretta di prompt nell’intelligenza artificiale?
L’iniezione indiretta di prompt è una tecnica che consente di nascondere istruzioni invisibili o difficilmente rilevabili all’interno di pagine web, documenti o contenuti digitali.
Il meccanismo è relativamente semplice: un utente chiede al proprio assistente IA di analizzare una pagina o un documento. Nel contenuto, però, sono presenti istruzioni inserite da terzi che l’utente non vede direttamente. L’agente IA potrebbe interpretarle come comandi validi e iniziare ad eseguire azioni non richieste.
In altre parole, l’utente pensa di aver impartito un ordine al sistema, mentre il modello potrebbe seguire istruzioni nascoste introdotte da un soggetto esterno.
Per anni questo scenario è stato trattato come un rischio futuro. Oggi sembra molto meno ipotetico.
Cosa ha scoperto Google durante la scansione del web?
Il team di Threat Intelligence Group di Google, insieme ai ricercatori di DeepMind, ha deciso di verificare se queste tecniche fossero realmente presenti nella rete pubblica.
Per farlo ha utilizzato Common Crawl, uno dei più grandi archivi pubblici del web, che raccoglie periodicamente miliardi di pagine internet in lingua inglese.
L’obiettivo era diretto: capire se qualcuno stesse già utilizzando in modo concreto questi sistemi.
I ricercatori hanno identificato diverse categorie di contenuti:
- messaggi ironici o innocui;
- istruzioni per influenzare riassunti generati dall’IA;
- tentativi di ottimizzazione SEO mirati agli assistenti;
- contenuti progettati per dissuadere o bloccare gli agenti;
- tentativi di estrazione di dati;
- istruzioni potenzialmente distruttive.
Le ultime due categorie hanno attirato maggiore attenzione.
Nel primo caso, l’obiettivo consiste nel convincere l’assistente a divulgare informazioni dell’utente o dati riservati. Nel secondo, il tentativo riguarda l’esecuzione di comandi che potrebbero alterare o cancellare informazioni sul dispositivo utilizzato.
Perché il dato del 32% potrebbe essere importante?
Tra novembre 2025 e febbraio 2026 Google ha ripetuto la stessa analisi su versioni successive dell’archivio web.
Il risultato più significativo riguarda la crescita delle categorie considerate malevole: gli esempi identificati sono aumentati del 32% in appena tre mesi.
Da solo, un periodo di tre mesi non è sufficiente per definire una tendenza storica consolidata. Tuttavia, il dato assume particolare rilevanza se osservato dal punto di vista economico e tecnologico.
Negli ultimi mesi gli strumenti basati su intelligenza artificiale sono diventati molto più potenti, diffusi e integrati nelle attività quotidiane. Di conseguenza, rappresentano obiettivi più interessanti per chi cerca nuove modalità di attacco.
Contemporaneamente, anche gli attori malevoli hanno iniziato a utilizzare sistemi automatici basati sull’IA per creare e testare nuove tecniche.
Il risultato è un abbassamento del costo operativo degli attacchi.
Ciò che in passato richiedeva tempo, competenze avanzate e risorse economiche importanti oggi potrebbe essere replicato molto più rapidamente.
Come stanno cambiando gli agenti IA nel lavoro quotidiano?
Nel corso del 2025 e del 2026 numerose aziende tecnologiche hanno accelerato lo sviluppo degli agenti IA.
Strumenti progettati per:
- leggere email;
- navigare autonomamente sul web;
- organizzare appuntamenti;
- compilare moduli;
- effettuare acquisti;
- supportare attività professionali.
L’idea è ridurre il carico operativo dell’utente delegando operazioni ripetitive a sistemi intelligenti.
Questo modello, però, presuppone un elemento fondamentale: che l’ambiente in cui opera l’agente sia sufficientemente sicuro.
Se il sistema acquisisce informazioni da pagine web compromesse o contenuti manipolati, il rischio non riguarda più soltanto il software ma l’intera catena delle attività svolte dall’assistente.
Un elemento interessante emerso dall’analisi riguarda i limiti stessi del materiale studiato.
L’archivio Common Crawl esclude gran parte dei contenuti che richiedono autenticazione, quindi:
- piattaforme social;
- aree riservate;
- reti professionali;
- ambienti privati.
Ciò significa che servizi utilizzati quotidianamente da milioni di persone restano in gran parte fuori dalle scansioni pubbliche.
Se gli agenti di IA inizieranno a operare sempre più frequentemente all’interno di questi ecosistemi, la superficie di esposizione potrebbe aumentare ulteriormente.
Gli esperti ritengono che quanto osservato oggi possa rappresentare soltanto una porzione visibile di un fenomeno più ampio.
Perché oggi l’IA viene usata anche dagli attaccanti?
L’aspetto forse più significativo non è la presenza degli attacchi, ma il modo in cui vengono creati.
Gli stessi strumenti di intelligenza artificiale generativa che promettono produttività e automazione possono essere sfruttati anche per automatizzare attività offensive.
Un sistema IA può:
- generare nuove varianti di attacco;
- testarle contro differenti modelli;
- modificarle automaticamente;
- distribuirle su numerosi siti.
Di conseguenza, il costo marginale di ogni nuovo tentativo si riduce drasticamente.
La difesa, invece, richiede ancora investimenti importanti: analisi umane, monitoraggio costante, team di sicurezza, test e aggiornamenti continui.
Questa dinamica non rappresenta una novità nella storia della tecnologia.
Fenomeni simili sono già stati osservati con lo spam, con il ransomware, con le campagne di phishing e con i deepfake vocali. Le innovazioni tendono spesso a offrire vantaggi immediati anche a chi intende sfruttarle in modo improprio.
Quali conseguenze potrebbero avere gli utenti comuni?
Lo scenario più concreto riguarda gli utenti che utilizzeranno assistenti sempre più autonomi in contesti professionali o personali.
Un dirigente potrebbe lasciare attivo un agente per gestire comunicazioni aziendali. Un giornalista potrebbe utilizzarlo per raccogliere informazioni. Un professionista amministrativo potrebbe delegare attività ripetitive.
In questi casi l’assistente potrebbe diventare una superficie d’attacco silenziosa: legge un contenuto, interpreta istruzioni nascoste e compie azioni mai autorizzate dall’utente.
Oggi molte delle situazioni osservate appaiono ancora limitate o sperimentali. Tuttavia, l’evoluzione tecnologica mostra spesso una traiettoria abbastanza prevedibile: quando una tecnica diventa economica, accessibile e facilmente replicabile, la sua diffusione tende ad accelerare rapidamente.
L’espansione degli agenti intelligenti probabilmente continuerà senza rallentamenti. La vera sfida nei prossimi anni potrebbe non essere soltanto aumentare le capacità dell’IA, ma costruire sistemi capaci di distinguere con maggiore precisione ciò che l’utente desidera realmente da ciò che qualcun altro prova a farle eseguire.