English
One complete pass through the training dataset. Counting epochs is how training duration is usually described, and running too many is a direct route to overfitting.
Small datasets are typically seen many times over; the very large corpora used for language model pretraining are often seen once or less, because there is more data than compute budget. That inversion is worth knowing: 'more epochs' is a meaningful lever when fine-tuning and largely irrelevant at frontier pretraining scale.
Validation loss started rising after the third epoch.
العربية
مرورٌ كاملٌ واحد على مجموعة بيانات التدريب. وعدّ الحقب هو ما يوصف به زمن التدريب عادةً، والإكثار منها طريقٌ مباشر إلى التخصيص المفرط.
تُرى مجموعات البيانات الصغيرة مراتٍ كثيرة عادةً، أما المدونات الضخمة المستعملة في التدريب المسبق للنماذج اللغوية فتُرى مرةً واحدة أو أقل، لأن البيانات أكثر من ميزانية الحوسبة. وهذا الانقلاب جديرٌ بالمعرفة: فزيادة الحقب رافعةٌ ذات معنى في الضبط الدقيق، وتكاد لا تعني شيئاً على مقياس التدريب المسبق المتقدم.
بدأت خسارة التحقق ترتفع بعد الحقبة الثالثة.
Also known as
- training epoch
- الدورة التدريبية
- الجولة
