Agentisk AI: gränserna sätts i systemet, inte i prompten
När en AI-agent ska köra utan att någon tittar på varje steg är agentisk AI inte längre en teknisk fråga. En instruktion i prompten styr vad agenten oftast gör. En spärr i systemet avgör vad den kan göra.

Nyckelpunkter
- I en tävling med 1,8 miljoner angreppsförsök bröts reglerna upprepade gånger hos samtliga 22 språkmodeller som agenterna byggde på. Instruktionen styr vad agenten oftast gör, inte vad den kan göra.
- Singapores ramverk för agentisk AI rekommenderar deterministiska gränser: styr åtkomsten så att agenten inte kan anropa ett verktyg, i stället för att be den låta bli.
- I Anthropics klassning av API-anrop hade som mest 87 procent av anropen vid minimal komplexitet någon mänsklig inblandning, mot som mest 67 procent vid hög komplexitet, där klassningen enligt Anthropic är mindre säker.
- Erfarna användare av Claude Code körde över 40 procent av sessionerna utan manuellt godkännande men avbröt agenten oftare. Singapores ramverk föreslår att mäta hur ofta människor avvisar eller ändrar agentens handlingar.
När en AI-agent ska få sköta ärenden utan att någon tittar på varje steg flyttas en fråga från utvecklarna till ledningen: vad får den göra på egen hand, och vem svarar när den gör något den inte borde? För agentisk AI är svaret sällan tekniskt. Det är ett antal beslut som någon behöver ha fattat innan agenten släpps på, och det första gäller var gränserna ska sitta. En regel i agentens instruktioner är en önskan. En spärr i systemet är ett beslut.
Räcker det att skriva in i agentens instruktioner vad den inte får göra?
Nej, inte för det som inte får hända. En instruktion i prompten styr vad agenten oftast gör. Den avgör inte vad agenten kan göra, och skillnaden syns först när någon försöker.
Det största offentliga försöket när det genomfördes var en tävling. Säkerhetsbolaget Gray Swan och brittiska AI Security Institute lät under mars och april 2025 deltagare angripa 22 AI-agenter byggda på dåtidens ledande språkmodeller, i 44 realistiska scenarier där varje agent hade fått uttryckliga regler för vad den fick göra. Studien, presenterad i spåret för dataset och riktmärken vid NeurIPS 2025, redovisar 1,8 miljoner angreppsförsök och över 60 000 lyckade regelbrott: obehörig åtkomst till data, otillåtna finansiella åtgärder och brott mot regelefterlevnad. Varje modell i tävlingen drabbades av upprepade lyckade angrepp på samtliga beteenden som prövades. När forskarna sedan samlade de bästa angreppen i ett riktmärke och körde det mot 19 modeller bröt nästan alla agenter mot reglerna för de flesta beteenden inom 10 till 100 försök. Motståndskraften hade svagt samband med modellens storlek eller förmåga.
Två förbehåll hör till talen. Det var angripare som försökte medvetet, inte vanliga användare, och modellerna är äldre än dagens. Men angriparen behöver inte sitta vid tangentbordet. Angrepp där instruktionen låg gömd i data som agenten läste, alltså ett mejl, en webbsida eller ett dokument, lyckades oftare än direkta angrepp. En agent som läser inkommande post läser också det någon har skrivit i den.
En regel i prompten säger vad agenten borde göra. En spärr i systemet avgör vad den kan göra.
Singapores myndighet för informations- och mediefrågor, IMDA, gav i januari 2026 ut ett ramverk för styrning av agentisk AI och i maj samma år en uppdaterad version 1.5. Ramverket är skrivet som rekommendationer och landar i samma hållning: föredra deterministiska gränser framför icke-deterministiska. I stället för att instruera agenten att låta bli ett verktyg ska åtkomsten styras så att agenten inte kan anropa verktyget alls. Där en gräns inte kan göras deterministisk ska den kompletteras med övervakning eller mänsklig granskning.
Vilka beslut om agentisk AI ska ledningen fatta, och vilka kan överlåtas?
Ledningen beslutar vad agenten får användas till, vilka data och system den får nå och var den måste fråga en människa. Hur gränserna byggs kan överlåtas. Att de finns kan det inte.
IMDA:s ramverk utgår från att den organisation som tar en agent i bruk, och de människor som övervakar den, förblir ansvariga för vad agenten gör. Kommer agenten, modellen eller verktygen från en extern part ska organisationen enligt ramverket reglera fördelningen av skyldigheter i avtalet, och där det finns luckor pröva om användningen fortfarande ryms inom den egna risktoleransen. Ramverket ger också ett exempel på hur uppgifterna kan fördelas inom organisationen: beslutsfattarna i ledningen kan sätta målen för hur agenter används och bestämma vilka användningsfall som är tillåtna, inklusive gränserna för agentens dataåtkomst, medan produktteamen svarar för utformning, test och uppföljning.
I praktiken handlar det om fem beslut, och vart och ett behöver ha en namngiven ägare innan agenten får köra utan tillsyn:
- Vad agenten får göra utan att fråga. Läsa, sammanställa och föreslå är något annat än att skicka, betala eller radera.
- Vad som kräver en människa. Godkännandet ska ligga där en handling når verkligheten och inte går att ta tillbaka.
- Vad agenten aldrig får göra. Det beslutet ska verkställas genom att åtkomsten saknas, inte genom en mening i instruktionen.
- Vad den får kosta. Ett tak för förbrukning per ärende och per dygn är ett budgetbeslut och inte en teknisk inställning.
- Vem som stänger av den. Någon behöver ha både befogenheten och möjligheten att ta agenten ur bruk samma dag.
Till det kommer frågan om vem som kör om utvärderingen när modellen under agenten byts ut, vilket är ämnet för Vem bestämmer när er AI-agent måste byggas om.
Hur självständigt kör agenter i produktion i dag?
Mer begränsat än rubrikerna antyder. De som bygger agenterna uppger att de flesta körs med kort koppel, och Anthropics loggar tyder på att den mänskliga inblandningen är lägre när uppgifterna är mer komplexa. De två undersökningarna bygger på olika metod och mäter olika saker.
Forskare vid Berkeley, Stanford, UIUC, IBM Research och banken Intesa Sanpaolo frågade dem som bygger agenterna. Studien Measuring Agents in Production, publicerad vid ICML 2026, bygger på 20 fördjupade fallstudier och en enkät mellan juli och oktober 2025 som omfattar 86 system i produktion eller pilot. Av de 60 system där frågan besvarades uppgav 68 procent att agenten kan köra högst tio steg innan användaren måste ge input, och 47 procent färre än fem. Intervjuerna visar att begränsningen är avsiktlig: teamen håller nere agenternas självständighet för att få stabilitet. Enkäten spreds bland annat via Berkeleys egna evenemang och kurser och via forskarnas yrkesnätverk, och författarna skriver själva att svaren sannolikt lutar åt de egna nätverken. Fallstudieteamen finns till största delen i Nord- och Sydamerika.
Anthropic mätte i stället vad som faktiskt händer i loggarna. I en analys publicerad i februari 2026 lät företaget sin egen modell klassa knappt en miljon slumpvis utvalda verktygsanrop från det öppna programmeringsgränssnittet, gjorda under två veckor i januari och februari 2026. Som mest 80 procent kom från agenter som såg ut att ha minst ett skydd, till exempel begränsade behörigheter eller krav på godkännande, och 0,8 procent av anropen såg ut att inte gå att ta tillbaka. Någon form av mänsklig inblandning fanns i som mest 87 procent av anropen på uppgifter med minimal komplexitet och i som mest 67 procent på uppgifter med hög komplexitet. Anthropic skriver att inblandningen sannolikt överskattas och att talen ska läsas som en övre gräns. Anthropics egen kontroll visar dessutom att anrop som klassats som att en människa var inblandad stämde i 46 procent av fallen i kontrollurvalet, som enligt Anthropic gör talet något skevt eftersom det innehöll många automatiska förlopp från träning med förstärkningsinlärning. Klassningen av komplexitet är också osäkrare för de svåra uppgifterna. Urvalet domineras av programmering och gäller en enda modelleverantörs kunder.
Verktygsanrop via Anthropics API, 19 januari till 1 februari 2026, klassade av Claude. Talen är en övre gräns. Klassningen av komplexitet är enligt Anthropic mindre tillförlitlig vid hög komplexitet.
Källa: Anthropic, Measuring AI agent autonomy in practice, 18 februari 2026
Anthropic ger två möjliga förklaringar. Godkännande steg för steg blir opraktiskt när stegen blir många, och komplexa uppgifter kan oftare komma från erfarna användare, något Anthropic inte kan mäta direkt i trafiken. Håller mönstret betyder det för den som äger agenten att godkännande steg för steg inte följer med när uppgifterna blir större. Tillsynen måste då ta en annan form, och den formen behöver någon ha bestämt. Hur ofta agenten lyckas med samma ärende gång efter gång är en annan fråga, och den behandlas i När är en AI-agent redo för skarpt läge.
Blir det säkrare av att en människa godkänner varje steg?
Inte nödvändigtvis, och det är den starkaste invändningen mot att lägga kontrollen hos en människa i loopen. Ett godkännande skyddar bara så länge den som godkänner faktiskt prövar.
I Anthropics data från kodagenten Claude Code körde nya användare med fullt automatiskt godkännande i ungefär 20 procent av sessionerna. Efter 750 sessioner hade andelen stigit till över 40 procent. Samtidigt avbröt de erfarna oftare: användare med ett tiotal sessioner bakom sig avbröt agenten i 5 procent av turerna, mer erfarna i omkring 9 procent. Anthropic tolkar det som att tillsynen byter form från att godkänna varje steg till att bevaka och ingripa. I sina rekommendationer till beslutsfattare avråder företaget från krav på att varje handling ska godkännas, eftersom sådana krav enligt Anthropic skapar friktion utan att nödvändigtvis ge säkerhet. Rådet kommer från en leverantör av agenter. Populationen är användare av ett utvecklarverktyg, där resultatet går att testa, och mönstret kan se annorlunda ut i ekonomi eller ärendehandläggning.
IMDA beskriver samma risk från andra hållet. Ramverket varnar för automationsbias, alltså tendensen att lita för mycket på ett automatiserat system, särskilt ett som har fungerat förut, och för larmtrötthet. Som mått föreslås hur ofta människor avvisar eller ändrar agentens handlingar, där en låg andel kan tyda på att godkännandet har blivit en stämpel, och hur lång tid granskningen tar.
Ett godkännande som aldrig säger nej är en fördröjning och inte en kontroll.
Invändningen gäller också åt andra hållet. Anthropic noterar att agenterna i praktiken får mindre frihet än de klarar av. Det tyder på att gränser som sitter för tätt också har ett pris. Slutsatsen är därför inte fler godkännanden utan färre och bättre placerade: ett godkännande där handlingen inte går att ta tillbaka, en spärr där handlingen aldrig får ske, och en mätning av om godkännandena fortfarande säger nej ibland.
Hur vet ni om er agent är redo att köra utan tillsyn?
Det avgörs av en uppställning och inte av agentens förmåga. Ta en agent och lista varje åtgärd den kan utföra i era system. Skriv bredvid varje åtgärd tre saker: vem som har beslutat att den får göra det, om åtgärden går att ta tillbaka, och vem som märker det först om den görs fel i natt.
Svaren delar upp organisationerna. Den som bara har åtgärder som går att ta tillbaka, och där någon märker ett fel nästa morgon, kan låta agenten köra med loggning och stickprov. Den som hittar en åtgärd som inte går att ta tillbaka men saknar ett namn i första kolumnen har inget tekniskt problem att lösa. Där saknas ett beslut, och det ska fattas innan agenten får köra vidare. Den som inte kan fylla i den tredje kolumnen alls har en agent som ingen bevakar, oavsett vad instruktionerna säger.
Samma uppställning är grunden för hur automation och AI-agenter byggs hos Ampliro: godkännandepunkter där handlingar når verkligheten, och klarhet i vad systemet får avgöra ensamt, beslutat innan bygget börjar.
Vanliga frågor
Den organisation som tar agenten i bruk, och de människor som övervakar den. Så formulerar Singapores myndighet IMDA saken i sitt ramverk för agentisk AI från 2026, som lägger ansvaret på människor och organisationer och inte på agenten. När agenten, modellen eller verktygen kommer från en extern part behöver fördelningen av skyldigheter stå i avtalet, och där avtalet har luckor är det organisationen som får pröva om användningen ryms inom den egna risktoleransen.
Inte för det som inte får hända. I en tävling som Gray Swan och brittiska AI Security Institute genomförde 2025 drabbades samtliga 22 språkmodeller som agenterna byggde på av upprepade lyckade angrepp mot sina uttryckliga regler, och i ett efterföljande riktmärke bröt nästan alla agenter mot reglerna för de flesta beteenden inom 10 till 100 försök. Det som aldrig får ske ska därför verkställas genom att agenten saknar åtkomst, inte genom en mening i prompten.
Att en människa godkänner, ändrar eller kan stoppa agentens handlingar vid bestämda punkter. Det avgörande är var punkterna ligger. Ett godkännande gör mest nytta där handlingen når verkligheten och inte går att ta tillbaka, till exempel när något skickas, betalas eller raderas. Att godkänna varje steg skalar dåligt och riskerar att bli en stämpel.
Fem beslut behöver en namngiven ägare innan agenten kör utan tillsyn: vad den får göra utan att fråga, vad som kräver en människa, vad den aldrig får göra, vad den får kosta och vem som stänger av den. Hur gränserna byggs kan överlåtas till dem som bygger agenten. Att gränserna finns, och var de går, är ett ledningsbeslut.
Genom att mäta dem. IMDA:s ramverk föreslår två mått: hur ofta människor avvisar eller ändrar agentens handlingar, där en låg andel kan betyda att godkännandet har blivit en stämpel, och hur lång tid granskningen tar, där kortare tid kan tyda på automationsbias eller trötthet. Ett godkännande som aldrig säger nej ger ingen kontroll.
Åtgärder som inte går att ta tillbaka och åtgärder som ingen märker. I Anthropics klassning av knappt en miljon verktygsanrop från januari och februari 2026 såg 0,8 procent ut att inte gå att ta tillbaka. Urvalet domineras av programmering, och Anthropic skriver att kontrollen av klassningen ger begränsat underlag för att bedöma hur väl den skiljer mellan de allvarligare graderna av oåterkallelighet. En lista över agentens åtgärder, med beslutsfattare, ångerbarhet och vem som märker ett fel, visar var risken sitter i den egna organisationen.
Landar det här på ert bord bör vi prata.
Ampliro Insights
Ny analys, ungefär varje vecka.
Vi skriver när reglerna ändras och när något visar sig fungera i praktiken. En text i taget, inga serier, och du kan gå ur från vilket nummer som helst.
Vi sparar din adress för att skicka Ampliro Insights, och inget annat. Mer i integritetspolicyn.