Skoči na glavni sadržaj
Natrag na AI agenti vodič

Oriphiel AI agenti vodič

Guardrails, policy i risk scoring

Kako agent prije akcije provjerava pravila: zabranjene radnje, reputacijski rizik, pravna osjetljivost, osobni podaci i eskalacija.

Oriphiel stručni tim Ažurirano 21. 7. 2026. 4 min čitanja

Odgovor ukratko

Guardrails su kombinacija validacije, policy pravila, modelskih provjera i ljudske eskalacije. U OpenClaw-u guardrail može zaustaviti email koji nema opt-out tekst, lead s nepoznatim izvorom, slanje prema suppression listi, nacrt s neodobrenom cijenom ili alat koji traži podatke izvan scopea.

Ključne odluke

  • Guardrails trebaju biti tehničke kontrole, ne samo stil u promptu.
  • Neki guardrails su deterministički, a neki mogu biti modelska procjena s ljudskom potvrdom.
  • Risk score treba utjecati na razinu autonomije.
  • Policy odluke treba logirati i objasniti.

Provedba korak po korak

Cilj ove lekcije je spriječiti pogrešne ili neprimjerene agent akcije. Korake treba provoditi redom i svaki potvrditi prije širenja opsega.

Preporučeni redoslijed

  • Popisati zabranjene i approval-required akcije.
  • Implementirati determinističke provjere za suppression, dozvole, prazna obavezna polja i batch limit.
  • Dodati modelski reviewer samo za semantički rizik poput tona ili nejasnog prigovora.
  • Mapirati risk score na proceed, approve, revise ili block.

Praktičan primjer

Praktičan primjer za vlasnike rizika i developere: tim prvo provodi korak „Popisati zabranjene i approval-required akcije.”, zatim provjerava „Potvrđena je ključna odluka: Guardrails trebaju biti tehničke kontrole, ne samo stil u promptu.”. Odluka o nastavku ne donosi se prema dojmu, nego prema pokazatelju „Blokirane akcije po pravilu.”.

Kontrolna lista prije nastavka

Ova provjera odvaja završenu implementaciju od postavke koja samo izgleda dovršeno.

Provjerite

  • Potvrđena je ključna odluka: Guardrails trebaju biti tehničke kontrole, ne samo stil u promptu.
  • Testiran je prvi korak provedbe: Popisati zabranjene i approval-required akcije.
  • Dogovoreno je početno mjerenje: Blokirane akcije po pravilu.

Najčešće pogreške i rizici

Rizike treba provjeriti prije povećanja prometa, automatizacije ili ovlasti sustava.

Na što treba paziti

  • Modelski guardrail propusti pravilo koje je trebalo biti backend provjera.
  • Policy se mijenja bez verzije i testova.
  • Risk score postoji, ali ne mijenja izvršenje.
  • Blokirani slučajevi se ne pregledavaju pa tim ne zna je li pravilo prestrogo.

Mjerenje rezultata

Učinak se procjenjuje kroz mali skup metrika koje su povezane s ciljem lekcije i stvarnim poslovnim ishodom.

Metrike koje imaju smisla

  • Blokirane akcije po pravilu.
  • Approval rate po risk scoreu.
  • False positive policy blokade.
  • False negative incidenti.
  • Vrijeme rješavanja blokiranih runova.

Česta pitanja

Koji je prvi korak za temu „Guardrails, policy i risk scoring”?

Popisati zabranjene i approval-required akcije. Prije nastavka potvrdite odluku: Guardrails trebaju biti tehničke kontrole, ne samo stil u promptu.

Kako provjeriti da je provedba uspješna?

Potvrđena je ključna odluka: Guardrails trebaju biti tehničke kontrole, ne samo stil u promptu. Nakon toga pratite metriku: Blokirane akcije po pravilu..

Koju pogrešku treba prvo spriječiti?

Modelski guardrail propusti pravilo koje je trebalo biti backend provjera. Problem ispravite prije automatizacije ili povećanja budžeta.

Službeni i stručni izvori

Sučelja, pravila i preporuke mogu se mijenjati. Prije produkcijske izmjene provjerite aktualnu dokumentaciju.

Primijenite lekciju na stvarni projekt

Pošaljite postojeću konfiguraciju, cilj i problem koji želite riješiti. Dobit ćete prijedlog sljedećeg tehničkog ili operativnog koraka.