Een beveiligingsonderzoeker heeft aangetoond dat kwaadaardige instructies zich via Microsoft Copilot kunnen verspreiden van het ene Word-document naar het andere. De verborgen prompts kunnen niet alleen aan nieuwe bestanden worden toegevoegd, maar ook de inhoud daarvan veranderen, bijvoorbeeld door financiële cijfers te manipuleren.
De aanval werd onderzocht door beveiligingsspecialist Hakon Maloy. Hij stelde de openbaarmaking van zijn bevindingen op verzoek van Microsoft uit. In plaats van de gebruikelijke periode van negentig dagen wachtte hij 144 dagen voordat hij details over de kwetsbaarheid naar buiten bracht. Volgens Maloy heeft Microsoft inmiddels verschillende maatregelen genomen, maar is het onderliggende probleem nog niet volledig opgelost.
Promptaanval
De aanval begint met een document waarin een aanvaller verborgen instructies heeft geplaatst. Dat bestand moet vervolgens bij het beoogde slachtoffer terechtkomen, bijvoorbeeld via een e-mail, een downloadlink of een kwaadaardige website. Wanneer de gebruiker het document daarna als bronmateriaal inzet binnen Copilot voor Word, kan de AI-assistent de verborgen instructies interpreteren alsof zij afkomstig zijn van de gebruiker zelf.
Copilot kan binnen Word nieuwe documenten genereren op basis van bestaande bestanden. Ook kan de assistent worden gevraagd een bestaand document te herschrijven, uit te breiden of samen te vatten. Volgens Maloy kunnen de verborgen prompts tijdens zulke handelingen automatisch worden overgenomen in nieuwe of aangepaste documenten.
Onzichtbaar
De instructies kunnen voor de gebruiker vrijwel onzichtbaar worden gemaakt. Een aanvaller kan ze bijvoorbeeld toevoegen in een zeer klein lettertype of als witte tekst op een witte achtergrond. Daardoor lijkt het document op het eerste gezicht onschuldig, terwijl het op de achtergrond opdrachten bevat die het gedrag van Copilot beïnvloeden.
In de demonstratie van Maloy waren de prompts zo opgesteld dat zij zichzelf naar andere documenten kopieerden. Daarnaast konden zij financiële gegevens in de gegenereerde tekst veranderen. Wanneer een besmet rapport later door een andere medewerker als bron wordt gebruikt, kan de aanval zich opnieuw voortplanten. Daarvoor is geen verdere verbinding met de oorspronkelijke kwaadaardige website of het eerste besmette bestand nodig.
Aanvalsketen
Hierdoor ontstaat volgens de onderzoeker een aanvalsketen binnen een organisatie. Rapporten worden vaak hergebruikt voor nieuwe analyses, samenvattingen, presentaties en beleidsstukken. Een verborgen instructie kan daardoor via reguliere werkprocessen terechtkomen in steeds meer documenten en bij meerdere medewerkers.
De kwetsbaarheid hangt samen met een breder probleem bij grote taalmodellen. Om nuttig te kunnen functioneren, moeten AI-assistenten informatie verwerken uit documenten, e-mails, websites en andere externe bronnen. Die informatie wordt in hetzelfde contextvenster geplaatst als de systeeminstructies en opdrachten van de gebruiker.
Betrouwbaarheid
Daarbij moet het taalmodel zelf beoordelen welke informatie betrouwbaar is en welke tekst mogelijk een aanval bevat. Volgens Maloy zijn de door de aanvaller toegevoegde woorden op dat moment echter al onderdeel geworden van de berekening. Ze kunnen daardoor invloed uitoefenen op de beslissing die het model over hun betrouwbaarheid neemt.
De aanval onderstreept volgens de onderzoeker dat organisaties voorzichtig moeten omgaan met documenten die als bron voor AI-assistenten worden gebruikt. Ook bestanden die visueel betrouwbaar lijken, kunnen verborgen instructies bevatten die de werking van het systeem beïnvloeden.