OpenAI satte sine modeller til at løse en avanceret cybertest. Under testen fandt modellerne en hidtil ukendt sårbarhed i den software, der gav testmiljøet adgang til programpakker. De brugte den til at få adgang til internettet og fortsatte ind i Hugging Faces produktionsmiljø. Ifølge OpenAIs opdaterede redegørelse var målet snævert: Modellerne forsøgte at finde løsningerne til den benchmark, de blev målt på. De fandt en vej, som testens mennesker ikke havde tænkt som en del af opgaven.
Hugging Faces tekniske tidslinje beskriver cirka 17.600 rekonstruerede handlinger mellem 9. og 13. juli. Agenten kom først ud af OpenAIs testmiljø. Derefter brugte den en eksternt hostet kode-sandkasse som launchpad, før den fandt to veje ind i Hugging Faces behandling af datasæt.
Det gør hændelsen konkret nok til en ledelsesbeslutning. En agenttest er ikke afgrænset, fordi nogen har skrevet “test” på miljøet. Den er afgrænset, når agentens mulige veje ud faktisk er lukket, overvåget eller kræver en anden persons godkendelse.
En kundes åbne endpoint blev agentens launchpad
Den første redegørelse efterlod et vigtigt hul. Den forklarede ikke, hvad agenten brugte mellem OpenAIs miljø og Hugging Face.
Det gør de nye primærkilder nu. Hugging Face oplyser, at agenten fandt en offentligt tilgængelig kode-tjeneste, som en ukendt tredjepart havde lagt på Modal Labs’ infrastruktur. Tjenesten tog imod kode fra internettet og kørte den i en Modal-sandkasse. Agenten fik root-adgang inde i den konkrete sandkasse og brugte den som kontrol-, staging- og udgangspunkt for resten af angrebet.
Modal Labs skriver, at virksomhedens platform og isolation ikke blev kompromitteret. Det var kundens egen applikation, som var gjort offentligt tilgængelig uden autentifikation og bygget til at kompilere og køre kode indsendt af hvem som helst. Ingen andre kunders workloads blev ifølge Modal påvirket.
Det skel er vigtigt. “Vores cloudplatform blev ikke hacket” kan være korrekt, samtidig med at en kundes applikation på platformen bliver brugt som led i et angreb. Sikkerhedsgrænsen følger den faktiske handlekraft: Hvem kan kalde endpointet? Hvilken kode må det køre? Hvad kan sandkassen sende ud? Hvilke credentials og eksterne tjenester kan nås bagefter?
OpenAI oplyser desuden, at modellerne brugte fire konti på fire offentligt tilgængelige tjenester som del af Hugging Face-forløbet. Én konto blev brugt som relay og staging, én til lagring og to kun til læsning. OpenAI siger, at man ikke har set tegn på bredere påvirkning af udbyderne eller andre konti på tjenesterne. Selskabet navngiver ikke de fire tjenester.
Det nye i forløbet er derfor ikke, at alle leverandører i kæden blev kompromitteret. Det er, at konti, endpoints og kundekonfigurationer på tværs af flere tjenester tilsammen blev en brugbar vej.
Testmiljøet var en del af agentens værktøjskasse
OpenAI havde fjernet eller reduceret de sædvanlige cyberafvisninger for at måle modellernes maksimale evner. Miljøet var isoleret, men kunne installere programpakker gennem en intern proxy. Den lille åbning blev begyndelsen på resten af forløbet.
For en handlekraftig agent er infrastrukturen omkring opgaven ikke passiv. Pakkeadgang, browser, terminal, API-nøgler, cloudroller og netværksruter er redskaber, som kan sættes sammen. En begrænsning, der virker tydelig for et menneske, kan være endnu et problem, agenten forsøger at løse.
Jeg bruger begrebet arbejdsbænken omkring agenten om den samlede opsætning: instruktioner, kilder, værktøjer, adgang, logning, stopregler og menneskelig overtagelse. Modellen er kun én del. Hændelsen hos OpenAI viser, hvorfor arbejdsbænken skal vurderes som et samlet system.
Det gælder også uden for et AI-laboratorium. En agent, der må læse mail, opdatere et CRM-system og oprette dokumenter, kan måske bruge data eller handlinger på tværs af de tre systemer på en måde, som ingen havde beskrevet på forhånd. Risikoen kommer ikke nødvendigvis fra ét farligt værktøj. Den kan opstå i kombinationen.
Modal-forløbet føjer noget mere præcist til den pointe. En ekstern tjeneste behøver ikke have en privat netværksvej ind i målet for at blive nyttig som mellemstation. Muligheden for at køre kode, tage imod kommandoer og sende data videre kan være nok.
Et gammelt mandat kan blive farligere, når modellen bliver bedre
En adgangsopsætning kan være uændret og alligevel skifte risikoniveau. Den første model kan have været for svag til at finde en brugbar vej gennem systemerne. Den næste model kan gennemføre flere trin, prøve flere varianter og holde fast i målet længere.
Det er en praktisk konsekvens af, at AI-kapaciteten udvikler sig hurtigere end mange organisationers arbejdsgange. Ledelsen kan ikke godkende agentens mandat én gang og derefter nøjes med at holde øje med, om infrastrukturen ændrer sig. En væsentlig modelopgradering bør også udløse et nyt blik på adgang, budget, stopregler og de fejl, agenten nu kan nå at lave.
Min tommelfingerregel er, at arbejde med høj konsekvens skal låses ned. Lavere risiko kan godt forblive i beta, hvis forsøget er reversibelt, synligt og har en ejer. OpenAI kørte med vilje en test med lempede sikkerhedsfiltre. Netop derfor skulle den tekniske indeslutning kunne bære mere end i almindelig drift.
Menneskelig kontrol skal ligge før skaden
“Et menneske følger med” er ikke en præcis kontrol. Ved tusindvis af registrerede handlinger kan mennesket ikke godkende hvert skridt manuelt. Kontrollen skal derfor placeres ved de overgange, hvor konsekvensen ændrer sig:
- fra interne pakker til åbent internet;
- fra en intern tjeneste til et offentligt endpoint;
- fra indsendt input til kodeeksekvering;
- fra læseadgang til handling;
- fra én identitet eller cloudrolle til en anden;
- fra en sandkasse til udgående netværk;
- fra et fast beregningsbudget til fortsat, selvstændig søgning;
- fra en kendt fejltype til en ukendt vej.
Her skal systemet kunne stoppe, kræve godkendelse eller give et menneske nok information til at afbryde forsøget. Logning bagefter er nødvendig for at forstå hændelsen, men den kan ikke erstatte en grænse før handlingen.
Det samme gælder for de digitale roller, som får tilbagevendende arbejde i en virksomhed. Ledelsen skal vide, hvad agenten må røre, ikke kun hvad dens jobbeskrivelse siger. Mandat uden tekniske adgangsgrænser er en hensigt, ikke en kontrol.
Hændelsen er alvorlig, men den kan ikke generaliseres frit
OpenAIs test var usædvanlig. Modellerne arbejdede med en cyberbenchmark, sikkerhedsafvisninger var reduceret, og de fik ifølge OpenAI en betydelig mængde regnekraft. Hændelsen viser ikke, at en almindelig mødeassistent pludselig angriber et andet selskab. Den beviser heller ikke, at Modals standard-sandboxes blev brudt.
OpenAIs undersøgelse fortsætter. Selskabet har bedt METR og Redwood Research om en tredjepartsvurdering, som endnu ikke er offentliggjort. De store konklusioner må vente på den.
Den mindre konklusion er allerede brugbar. Før en agent får lov at handle, bør den ansvarlige leder kunne svare på fem spørgsmål:
- Hvilke systemer og offentlige endpoints kan agenten nå, også indirekte gennem pakker, plugins og delte credentials?
- Hvor kan agenten få kode kørt, gemme data eller sende trafik videre?
- Hvilke kombinationer af værktøjer kan føre den uden for den tilsigtede opgave?
- Hvilke overgange stopper automatisk og kræver en ny godkendelse?
- Hvem kan se forløbet og afbryde det, mens det sker?