- Početna
- Vodiči
- AI agenti vodič
- SLO i alerting za AI agente
Oriphiel AI agenti vodič
SLO i alerting za AI agente
Kako definirati pouzdanost kroz task success, critical error, latency, schema pass, tool success i human escalation umjesto samog uptimea.
Odgovor ukratko
Agent može biti tehnički dostupan, ali poslovno neupotrebljiv; SLO mora uključiti kvalitetu i sigurnosne invarijante na reprezentativnom uzorku.
Ključne odluke
- Koji je korisnički ishod
- Koja greška je kritična
- Koji p95 latency cilj vrijedi
- Tko reagira na quality drift
Provedba korak po korak
Cilj ove lekcije je Kako definirati pouzdanost kroz task success, critical error, latency, schema pass, tool success i human escalation umjesto samog uptimea. Korake treba provoditi redom i svaki potvrditi prije širenja opsega.
Preporučeni redoslijed
- Definirati SLIs po workflowu
- Uvesti online tehničke i sampled quality metrike
- Postaviti burn-rate alarme
- Povezati alarm s runbookom i kill switchom
Praktičan primjer
Agent ima 99 posto schema pass cilj, p95 ispod zadanog praga i zaseban alarm za bilo kakav pokušaj slanja prema suppression kontaktu.
Kontrolna lista prije nastavka
Ova provjera odvaja završenu implementaciju od postavke koja samo izgleda dovršeno.
Provjerite
- Schema i tool greške su odvojene
- PII nije metric label
- Alarm sadrži trace ID
- Kritični invariant ima nultu ili vrlo malu toleranciju
Najčešće pogreške i rizici
Rizike treba provjeriti prije povećanja prometa, automatizacije ili ovlasti sustava.
Na što treba paziti
- Samo API 200 se mjeri
- Prosjek skriva spore runove
- Svaki grader fail šalje alarm
- Nema baselinea po model verziji
Mjerenje rezultata
Učinak se procjenjuje kroz mali skup metrika koje su povezane s ciljem lekcije i stvarnim poslovnim ishodom.
Metrike koje imaju smisla
- Task success SLO
- p95 latency
- Critical invariant failures
- Error-budget burn
Česta pitanja
Koji je prvi korak za temu „SLO i alerting za AI agente”?
Definirati SLIs po workflowu Prije nastavka potvrdite odluku: Koji je korisnički ishod
Kako provjeriti da je provedba uspješna?
Schema i tool greške su odvojene Nakon toga pratite metriku: Task success SLO.
Koju pogrešku treba prvo spriječiti?
Samo API 200 se mjeri Problem ispravite prije automatizacije ili povećanja budžeta.
Službeni i stručni izvori
Sučelja, pravila i preporuke mogu se mijenjati. Prije produkcijske izmjene provjerite aktualnu dokumentaciju.
Primijenite lekciju na stvarni projekt
Pošaljite postojeću konfiguraciju, cilj i problem koji želite riješiti. Dobit ćete prijedlog sljedećeg tehničkog ili operativnog koraka.