كل المصطلحات

Reinforcement Learning

التدريب

التعلم بالتعزيز

RLالنطق at-taʿallum bi-t-taʿzīzمتوسط

English

Reinforcement learning trains a model by letting it take actions in an environment and rewarding or penalizing the outcomes, rather than showing it labeled examples. Over many trials, the model learns a strategy that maximizes reward, as used in game-playing AI and robotics.

Reinforcement learning trains an agent by reward rather than by example: it acts, receives a score, and adjusts to earn more. It suits problems where the right action is hard to specify but success is easy to recognise, games, control, and increasingly the shaping of language model behaviour. Its persistent difficulty is that the agent optimises the reward it was given, which is not always the outcome anyone wanted.

The policy was refined with reinforcement learning over millions of episodes.

العربية

التعلم بالتعزيز يدرّب النموذج بترك حرية اتخاذ إجراءات في بيئة معينة ومكافأة النتائج الجيدة أو معاقبة السيئة، بدلاً من عرض أمثلة مُصنَّفة عليه. يتعلّم النموذج عبر محاولات متكررة استراتيجية تُعظّم المكافأة، كما يُستخدم في ألعاب الذكاء الاصطناعي والروبوتات.

يدرّب التعلم بالتعزيز وكيلاً بالمكافأة لا بالمثال: فهو يتصرف، ويتلقى درجة، ثم يعدّل ليكسب أكثر. ويناسب المسائل التي يعسر فيها تحديد الفعل الصحيح ويسهل التعرف على النجاح، كالألعاب والتحكم، وبصورةٍ متزايدة تشكيلُ سلوك النماذج اللغوية. وصعوبته الملازمة أن الوكيل يُحسّن المكافأة التي أُعطيت له، وهي ليست دائماً النتيجة التي أرادها أحد.

صُقلت السياسة بالتعلم بالتعزيز عبر ملايين الحلقات.

يُعرف أيضاً بـ

  • RL
  • التعلم التعزيزي
  • الرينفورسمنت ليرننغ
  • RL

يُكتب أيضاً هكذا، ولا نوصي به

  • التعلم المعزز
  • التعلم بالمكافأة

مصطلحات ذات صلة