- Početna
- Vodiči
- AI agenti vodič
- Guardrails, policy i risk scoring
Oriphiel AI agenti vodič
Guardrails, policy i risk scoring
Kako agent prije akcije provjerava pravila: zabranjene radnje, reputacijski rizik, pravna osjetljivost, osobni podaci i eskalacija.
Odgovor ukratko
Guardrails su kombinacija validacije, policy pravila, modelskih provjera i ljudske eskalacije. U OpenClaw-u guardrail može zaustaviti email koji nema opt-out tekst, lead s nepoznatim izvorom, slanje prema suppression listi, nacrt s neodobrenom cijenom ili alat koji traži podatke izvan scopea.
Ključne odluke
- Guardrails trebaju biti tehničke kontrole, ne samo stil u promptu.
- Neki guardrails su deterministički, a neki mogu biti modelska procjena s ljudskom potvrdom.
- Risk score treba utjecati na razinu autonomije.
- Policy odluke treba logirati i objasniti.
Provedba korak po korak
Cilj ove lekcije je spriječiti pogrešne ili neprimjerene agent akcije. Korake treba provoditi redom i svaki potvrditi prije širenja opsega.
Preporučeni redoslijed
- Popisati zabranjene i approval-required akcije.
- Implementirati determinističke provjere za suppression, dozvole, prazna obavezna polja i batch limit.
- Dodati modelski reviewer samo za semantički rizik poput tona ili nejasnog prigovora.
- Mapirati risk score na proceed, approve, revise ili block.
Praktičan primjer
Praktičan primjer za vlasnike rizika i developere: tim prvo provodi korak „Popisati zabranjene i approval-required akcije.”, zatim provjerava „Potvrđena je ključna odluka: Guardrails trebaju biti tehničke kontrole, ne samo stil u promptu.”. Odluka o nastavku ne donosi se prema dojmu, nego prema pokazatelju „Blokirane akcije po pravilu.”.
Kontrolna lista prije nastavka
Ova provjera odvaja završenu implementaciju od postavke koja samo izgleda dovršeno.
Provjerite
- Potvrđena je ključna odluka: Guardrails trebaju biti tehničke kontrole, ne samo stil u promptu.
- Testiran je prvi korak provedbe: Popisati zabranjene i approval-required akcije.
- Dogovoreno je početno mjerenje: Blokirane akcije po pravilu.
Najčešće pogreške i rizici
Rizike treba provjeriti prije povećanja prometa, automatizacije ili ovlasti sustava.
Na što treba paziti
- Modelski guardrail propusti pravilo koje je trebalo biti backend provjera.
- Policy se mijenja bez verzije i testova.
- Risk score postoji, ali ne mijenja izvršenje.
- Blokirani slučajevi se ne pregledavaju pa tim ne zna je li pravilo prestrogo.
Mjerenje rezultata
Učinak se procjenjuje kroz mali skup metrika koje su povezane s ciljem lekcije i stvarnim poslovnim ishodom.
Metrike koje imaju smisla
- Blokirane akcije po pravilu.
- Approval rate po risk scoreu.
- False positive policy blokade.
- False negative incidenti.
- Vrijeme rješavanja blokiranih runova.
Česta pitanja
Koji je prvi korak za temu „Guardrails, policy i risk scoring”?
Popisati zabranjene i approval-required akcije. Prije nastavka potvrdite odluku: Guardrails trebaju biti tehničke kontrole, ne samo stil u promptu.
Kako provjeriti da je provedba uspješna?
Potvrđena je ključna odluka: Guardrails trebaju biti tehničke kontrole, ne samo stil u promptu. Nakon toga pratite metriku: Blokirane akcije po pravilu..
Koju pogrešku treba prvo spriječiti?
Modelski guardrail propusti pravilo koje je trebalo biti backend provjera. Problem ispravite prije automatizacije ili povećanja budžeta.
Službeni i stručni izvori
Sučelja, pravila i preporuke mogu se mijenjati. Prije produkcijske izmjene provjerite aktualnu dokumentaciju.
Primijenite lekciju na stvarni projekt
Pošaljite postojeću konfiguraciju, cilj i problem koji želite riješiti. Dobit ćete prijedlog sljedećeg tehničkog ili operativnog koraka.