English
Splitting documents into passages before embedding them, so retrieval returns a relevant piece rather than a whole file. Where the cuts fall largely determines whether a RAG system works.
A chunk that is too large dilutes its embedding until it matches nothing precisely; too small and it loses the context that made it meaningful. Cutting on structure, headings, paragraphs, sections, beats cutting on a fixed character count, because a passage severed mid-argument retrieves badly. This unglamorous step is the most common cause of a RAG system that 'does not work' for reasons no model change will fix.
Chunking on section headings improved retrieval accuracy sharply.
العربية
تقسيم المستندات إلى مقاطع قبل تضمينها، ليعيد الاسترجاع قطعةً ذات صلة لا ملفاً كاملاً. وموضع القطع هو ما يحدد إلى حدٍّ بعيد أينجح نظام التوليد المعزَّز بالاسترجاع أم لا.
المقطع المفرط الكبر يُميّع تضمينه حتى لا يطابق شيئاً بدقة، والمفرط الصغر يفقد السياق الذي أعطاه معناه. والقطع على البنية، العناوين والفقرات والأقسام، أفضل من القطع على عدد محارف ثابت، لأن المقطع المبتور في وسط حجةٍ يُسترجَع استرجاعاً رديئاً. وهذه الخطوة غير البرّاقة أشيعُ سببٍ لنظام استرجاعٍ «لا يعمل» لأسبابٍ لن يصلحها أي تغييرٍ في النموذج.
حسّنت التجزئة على عناوين الأقسام دقةَ الاسترجاع تحسناً حاداً.
Also known as
- text splitting
- passage segmentation
- التقطيع إلى مقاطع
- تقسيم المستندات
