Գնահատումներ ԱԲ գործակալների համար
Գնահատումները (evals) համակարգված թեստեր են, որոնք չափում են, թե որքան լավ է ԱԲ գործակալը կատարում առաջադրանքը՝ թեստային փաթեթ ոչ դետերմինիստական համակարգերի համար, որն օգտագործվում է ռեգրեսիաներ որսալու և փոփոխությունները համեմատելու համար։
Քանի որ գործակալները ոչ դետերմինիստական են, չեք կարող փոփոխությունը գնահատել մեկ անգամ փորձելով։ Գնահատումները գործակալը գործարկում են ֆիքսված առաջադրանքների հավաքածուի վրա՝ սահմանված հաջողության չափանիշներով, և գնահատում արդյունքները՝ ավտոմատ, մեկ այլ մոդելի կողմից՝ որպես դատավոր, կամ մարդկանց կողմից։ Լավ գնահատումների հավաքածուն «ավելի լավ է զգացվում»-ը վերածում է թվի, որը կարող եք հետևել, որպեսզի կարողանաք ասել՝ նոր հուշումը, մոդելը կամ գործիքն իսկապես բարելավե՞լ է ինչ-որ բան, թե՞ լուռ խախտել։
Հիմնական կետերը
- Կրկնվող առաջադրանքների հավաքածու՝ հաջողության չափանիշներով, գնահատված գործակալի որակը չափելու համար։
- Կարևոր է, քանի որ գործակալները ոչ դետերմինիստական են. մեկ գործարկումը ոչինչ չի ապացուցում։
- Գնահատումը կարող է լինել ավտոմատ, մոդելի կողմից դատված (LLM-as-judge) կամ մարդկային։
- Դրանք սուբյեկտիվ «թվում է ավելի լավ»-ը վերածում են հետևվող չափանիշի և որսում ռեգրեսիաներն օգտատերերից առաջ։
Սովորիր՝ կառուցելով
Way of the Agent-ը սովորեցնում է ԱԲ գործակալների ինժեներիան մակարդակ առ մակարդակ՝ այսպիսի հասկացություններ, ապա գործնական փորձ, XP և ԱԲ Տարեգրություններ։
Սկսիր անվճար →