Evaluation

Գնահատումներ ԱԲ գործակալների համար

Գնահատումները (evals) համակարգված թեստեր են, որոնք չափում են, թե որքան լավ է ԱԲ գործակալը կատարում առաջադրանքը՝ թեստային փաթեթ ոչ դետերմինիստական համակարգերի համար, որն օգտագործվում է ռեգրեսիաներ որսալու և փոփոխությունները համեմատելու համար։

Քանի որ գործակալները ոչ դետերմինիստական են, չեք կարող փոփոխությունը գնահատել մեկ անգամ փորձելով։ Գնահատումները գործակալը գործարկում են ֆիքսված առաջադրանքների հավաքածուի վրա՝ սահմանված հաջողության չափանիշներով, և գնահատում արդյունքները՝ ավտոմատ, մեկ այլ մոդելի կողմից՝ որպես դատավոր, կամ մարդկանց կողմից։ Լավ գնահատումների հավաքածուն «ավելի լավ է զգացվում»-ը վերածում է թվի, որը կարող եք հետևել, որպեսզի կարողանաք ասել՝ նոր հուշումը, մոդելը կամ գործիքն իսկապես բարելավե՞լ է ինչ-որ բան, թե՞ լուռ խախտել։

Հիմնական կետերը

  • Կրկնվող առաջադրանքների հավաքածու՝ հաջողության չափանիշներով, գնահատված գործակալի որակը չափելու համար։
  • Կարևոր է, քանի որ գործակալները ոչ դետերմինիստական են. մեկ գործարկումը ոչինչ չի ապացուցում։
  • Գնահատումը կարող է լինել ավտոմատ, մոդելի կողմից դատված (LLM-as-judge) կամ մարդկային։
  • Դրանք սուբյեկտիվ «թվում է ավելի լավ»-ը վերածում են հետևվող չափանիշի և որսում ռեգրեսիաներն օգտատերերից առաջ։

Սովորիր՝ կառուցելով

Way of the Agent-ը սովորեցնում է ԱԲ գործակալների ինժեներիան մակարդակ առ մակարդակ՝ այսպիսի հասկացություններ, ապա գործնական փորձ, XP և ԱԲ Տարեգրություններ։

Սկսիր անվճար →