Agentstyring · myndighet · stoppvilkår
Når skal en AI-agent stoppe?
En pålitelig agent kjennes ikke bare på hva den kan gjøre. Den kjennes på hvor presist den oppdager at forutsetningen er brutt, handlingen er for farlig eller mennesket må ta over.
Når virkeligheten ikke lenger stemmer med planen
En agent kan ha lest riktig instruks og likevel stå i en annen situasjon enn den som ble godkjent. En fil kan være endret av noen andre. En tjeneste kan peke mot produksjon i stedet for test. En pris, mottaker eller tillatelse kan ha endret seg mens agenten arbeidet. Da skal den ikke bruke gårsdagens observasjon som bevis for dagens handling.
Gode stoppvilkår ligger derfor så nær handlingen som mulig. Agenten kontrollerer mål, identitet, tilstand og forventet omfang umiddelbart før endringen. Hvis kontrollen ikke passer, stopper den uten å «prøve litt».
Syv grunner til å stoppe
- Målet eller mottakeren kan ikke identifiseres entydig.
- Tilgjengelig myndighet er bredere eller annerledes enn oppgaven krever.
- En beskyttet førtilstand eller test mangler.
- Resultatet vil påvirke mennesker, penger eller eksterne systemer på en ny måte.
- Kilder motsier hverandre eller viktig informasjon er utdatert.
- Tilbakeføring er ikke lenger trygg eller mulig.
- Agenten oppdager at oppgaven har vokst utenfor avtalt omfang.
Agenten skal ikke lage sin egen tillatelse
Hvis en handling krever ny tilgang, skal ikke agenten hente legitimasjon fra et annet prosjekt, kopiere hemmeligheter eller utvide rollen sin. Den skal heller ikke gjøre samme endring gjennom en alternativ kanal mens en godkjenning fortsatt kan bli utført senere. Én handling trenger én tydelig eier.
Lavrisikoarbeid kan fortsette innenfor eksisterende rammer: analysere offentlige data, validere filer, bygge en test eller forberede et forslag. Men en manglende myndighet er en reell grense, ikke et teknisk hinder som bør omgås.
Stoppvilkår må kunne testes
En formulering som «vær forsiktig» kan ikke verifiseres. Et testbart vilkår kan være: avbryt hvis innholdshashen ikke matcher førtilstanden; ikke send dersom mottakeren ikke er eksplisitt angitt; ikke publiser hvis artikkelen mangler sannhetsgrense; ikke oppdater dersom siste sikkerhetskopi ikke kan leses.
Testen må også omfatte den vanskelige veien. Vi bør bevisst endre en forutsetning, fjerne en nødvendig fil eller presentere motstridende data og kontrollere at agenten faktisk stanser. Det er ofte mer verdifullt enn enda en vellykket demonstrasjon.
Kontroll gir mer nyttig autonomi
Når grensene er tydelige, kan agenten ofte gjøre mer på egen hånd innenfor dem. Den kan fortsette gjennom kjente, reversible trinn, samle bevis og levere et ferdig resultat. Mennesket slipper å svare på rutinespørsmål, men blir involvert når valget faktisk kan endre utfallet eller ansvaret.
Det er denne formen for autonomi IntentForce bygger mot: ikke et system som aldri stopper, men et system som kan arbeide lenge fordi det vet når det ikke skal gå videre.