کتاب A Practical Guide to Reinforcement Learning from Human Feedback اثر Sandip Kulkarni انتشارات آوای مؤلف
0%
(0 نفر) از خریداران، این کالا را پیشنهاد کرده اند
برند :
متفرقهویژگی ها
- زبان نوشتار : انگلیسی
- طراحی صفحات : متن و تصویر
- نوع جلد : شومیز
- نوع کاغذ : تحریر
- گروه سنی : همه سنین
مشخصات محصول
خلاصه کتاب
این کتاب با مبانی یادگیری تقویتی و بهینهسازی سیاست، از جمله الگوریتمهایی مانند بهینهسازی سیاست پروگزیمال (PPO) آغاز میشود و توضیح میدهد که چگونه مدلهای پاداش و یادگیری ترجیحات انسانی به تنظیم دقیق سیستمهای هوش مصنوعی و مدلهای هوش مصنوعی مولد کمک میکنند. شما بینش عملی در مورد چگونگی بهینهسازی مدلها توسط خطوط لوله RLHF برای مطابقت بهتر با ترجیحات انسانی و اهداف دنیای واقعی به دست خواهید آورد.
زبان نوشتار
انگلیسی
طراحی صفحات
متن و تصویر
چاپ صفحه
سیاه و سفید
نویسنده
Sandip Kulkarni
ناشر
آوای مؤلف
موضوع
کامپیوتر
قطع
وزیری
نوع جلد
شومیز
نوع کاغذ
تحریر
تعداد صفحه
402
گروه سنی
همه سنین















