English
Stored intermediate attention values from earlier tokens, kept so each new token does not force the model to recompute the whole sequence.
Generating text one token at a time would otherwise mean re-running attention over everything already produced, at growing cost per token. The KV cache makes that linear instead of quadratic, and it is why memory, not arithmetic, is usually the limit on how many requests a GPU can serve at once. Long contexts are expensive largely because their caches are large.
The KV cache for a 100k context occupies more memory than the weights.
العربية
قيمُ انتباهٍ وسيطة محفوظة من التوكنات السابقة، تُبقى كي لا يُجبر كلُّ توكنٍ جديد النموذجَ على إعادة حساب السلسلة كاملةً.
لولا ذلك لكان توليد النص توكناً بعد توكن يعني إعادة تشغيل الانتباه على كل ما أُنتج، بكلفةٍ متنامية لكل توكن. وهذه الذاكرة تجعل ذلك خطياً بدل أن يكون تربيعياً، وهي سبب كون الذاكرة، لا الحساب، هي الحد الأعلى عادةً لعدد الطلبات التي تخدمها وحدة المعالجة الرسومية في آنٍ واحد. والسياقات الطويلة مكلفة أساساً لأن ذاكراتها كبيرة.
تشغل ذاكرة المفاتيح والقيم لسياقٍ من مئة ألف توكن حيزاً أكبر من الأوزان.
Also known as
- key-value cache
- attention cache
- مخزن المفاتيح والقيم
