Skoči na glavni sadržaj
Natrag na AI agenti vodič

Oriphiel AI agenti vodič

Retrieval eval dataset

Kako izgraditi skup pitanja, relevantnih dokumenata, hard negative primjera i no-answer slučajeva za objektivno mjerenje RAG dohvaćanja.

Oriphiel stručni tim Ažurirano 22. 7. 2026. 3 min čitanja

Odgovor ukratko

Bez retrieval evala tim ne zna je li pogrešan odgovor nastao zbog lošeg dohvaćanja, zastarjelog izvora ili modelskog zaključivanja.

Ključne odluke

  • Koji upiti predstavljaju produkciju
  • Koji dokument je relevantan
  • Koji su zbunjujući negativni primjeri
  • Kada ispravan rezultat ne postoji

Provedba korak po korak

Cilj ove lekcije je Kako izgraditi skup pitanja, relevantnih dokumenata, hard negative primjera i no-answer slučajeva za objektivno mjerenje RAG dohvaćanja. Korake treba provoditi redom i svaki potvrditi prije širenja opsega.

Preporučeni redoslijed

  • Anonimizirati stvarne upite
  • Ručno označiti relevantne chunkove
  • Dodati parafraze i hard negatives
  • Verzionirati dataset uz corpus snapshot

Praktičan primjer

Skup sadrži pitanje o opt-outu, točan policy chunk, sličan ali zastarjeli predložak kao hard negative i slučaj za koji interna dokumentacija nema odgovor.

Kontrolna lista prije nastavka

Ova provjera odvaja završenu implementaciju od postavke koja samo izgleda dovršeno.

Provjerite

  • Test pokriva različite jezike i kratke upite
  • No-answer slučajevi postoje
  • Labeleri imaju jasne upute
  • Corpus verzija je poznata

Najčešće pogreške i rizici

Rizike treba provjeriti prije povećanja prometa, automatizacije ili ovlasti sustava.

Na što treba paziti

  • Dataset sadrži samo idealne upite
  • Relevantnost označava jedan autor bez provjere
  • Promjena chunkinga ne pokreće eval
  • Mjeri se samo finalni tekst

Mjerenje rezultata

Učinak se procjenjuje kroz mali skup metrika koje su povezane s ciljem lekcije i stvarnim poslovnim ishodom.

Metrike koje imaju smisla

  • Recall@k
  • Precision@k
  • MRR
  • No-answer accuracy

Česta pitanja

Koji je prvi korak za temu „Retrieval eval dataset”?

Anonimizirati stvarne upite Prije nastavka potvrdite odluku: Koji upiti predstavljaju produkciju

Kako provjeriti da je provedba uspješna?

Test pokriva različite jezike i kratke upite Nakon toga pratite metriku: Recall@k.

Koju pogrešku treba prvo spriječiti?

Dataset sadrži samo idealne upite Problem ispravite prije automatizacije ili povećanja budžeta.

Službeni i stručni izvori

Sučelja, pravila i preporuke mogu se mijenjati. Prije produkcijske izmjene provjerite aktualnu dokumentaciju.

Primijenite lekciju na stvarni projekt

Pošaljite postojeću konfiguraciju, cilj i problem koji želite riješiti. Dobit ćete prijedlog sljedećeg tehničkog ili operativnog koraka.