Ako evaluovať výstupy LLM
Bez merania nevieš, či je nový prompt lepší. Praktické prístupy k evaluácii.
„Zdá sa mi to lepšie” nie je metrika. Ak ladíš prompty alebo meníš model, potrebuješ opakovateľný spôsob, ako porovnávať kvalitu.
Tri úrovne evaluácie
- Zlaté odpovede. Sada vstupov s očakávaným výstupom. Rýchle, ale krehké.
- LLM ako sudca. Iný model hodnotí odpoveď podľa kritérií. Škáluje dobre.
- Ľudské hodnotenie. Najpresnejšie, najdrahšie — nechaj na finálnu kontrolu.
Minimálny setup
Stačí tabuľka: vstup, očakávanie, výstup A, výstup B, hodnotenie. Aj 20-30 príkladov ti povie viac než pocit.