Skoči na glavni sadržaj
Natrag na AI agenti vodič

Oriphiel AI agenti vodič

Permissions, sandbox i human-in-the-loop

Kako ograničiti AI agenta kroz dozvole, sandbox, approval korake, read/write scope i sigurnosne prekidače.

Oriphiel stručni tim Ažurirano 21. 7. 2026. 4 min čitanja

Odgovor ukratko

Siguran agent nije onaj kojem vjerujemo jer ima dobar prompt, nego onaj koji tehnički ne može napraviti nedopuštenu radnju. Permissions određuju koje alate smije koristiti, sandbox ograničava izvršno okruženje, human-in-the-loop zaustavlja rizične korake, a kill switch omogućuje brzo gašenje.

Ključne odluke

  • Prompt nije sigurnosna kontrola.
  • Read i write scope moraju biti tehnički odvojeni.
  • Sandbox treba ograničiti datoteke, mrežu, procese i tajne gdje je primjenjivo.
  • Ljudsko odobrenje treba biti uvjet u backend stateu, ne samo komentar u UI-ju.

Provedba korak po korak

Cilj ove lekcije je spriječiti nekontrolirane agent akcije. Korake treba provoditi redom i svaki potvrditi prije širenja opsega.

Preporučeni redoslijed

  • Napraviti permission matricu po agentu, alatu i tipu podatka.
  • Dodati approval_required za slanje, brisanje, suppression promjene i masovne akcije.
  • Koristiti sandbox za kod, browsing ili file operacije gdje postoje.
  • Uvesti globalni i per-agent kill switch.

Praktičan primjer

Praktičan primjer za administratore, developere i vlasnike rizika: tim prvo provodi korak „Napraviti permission matricu po agentu, alatu i tipu podatka.”, zatim provjerava „Potvrđena je ključna odluka: Prompt nije sigurnosna kontrola.”. Odluka o nastavku ne donosi se prema dojmu, nego prema pokazatelju „Odbijene akcije zbog permissiona.”.

Kontrolna lista prije nastavka

Ova provjera odvaja završenu implementaciju od postavke koja samo izgleda dovršeno.

Provjerite

  • Potvrđena je ključna odluka: Prompt nije sigurnosna kontrola.
  • Testiran je prvi korak provedbe: Napraviti permission matricu po agentu, alatu i tipu podatka.
  • Dogovoreno je početno mjerenje: Odbijene akcije zbog permissiona.

Najčešće pogreške i rizici

Rizike treba provjeriti prije povećanja prometa, automatizacije ili ovlasti sustava.

Na što treba paziti

  • Agent dobije admin API ključ jer je najlakše za razvoj.
  • Approval se prikazuje korisniku, ali backend ga ne zahtijeva.
  • Sandbox ima pristup produkcijskim credentialima.
  • Kill switch ne zaustavlja već queued jobove.

Mjerenje rezultata

Učinak se procjenjuje kroz mali skup metrika koje su povezane s ciljem lekcije i stvarnim poslovnim ishodom.

Metrike koje imaju smisla

  • Odbijene akcije zbog permissiona.
  • Approval latency.
  • Sandbox escape pokušaji ili policy blokade.
  • Kill switch testovi.
  • Akcije po read/write scopeu.

Česta pitanja

Koji je prvi korak za temu „Permissions, sandbox i human-in-the-loop”?

Napraviti permission matricu po agentu, alatu i tipu podatka. Prije nastavka potvrdite odluku: Prompt nije sigurnosna kontrola.

Kako provjeriti da je provedba uspješna?

Potvrđena je ključna odluka: Prompt nije sigurnosna kontrola. Nakon toga pratite metriku: Odbijene akcije zbog permissiona..

Koju pogrešku treba prvo spriječiti?

Agent dobije admin API ključ jer je najlakše za razvoj. Problem ispravite prije automatizacije ili povećanja budžeta.

Službeni i stručni izvori

Sučelja, pravila i preporuke mogu se mijenjati. Prije produkcijske izmjene provjerite aktualnu dokumentaciju.

Primijenite lekciju na stvarni projekt

Pošaljite postojeću konfiguraciju, cilj i problem koji želite riješiti. Dobit ćete prijedlog sljedećeg tehničkog ili operativnog koraka.