vLLM نسخه 0.26.0 - یادداشت های انتشار
یادداشتهای انتشار vLLM نسخه 0.26.0
برترین ها
این نسخه دارای 411 تعهد از 212 مشارکت کننده (61 جدید) است!
- خانواده مدل جدید Inkling با پشته پشتیبانی کامل: مدلسازی پایه (#48799)، piecewise CUDA graphiss="link-link" href="https://github.com/vllm-project/vllm/pull/48822">#48822)، توجه نسبی Hopper FA4 ( (#48869)، LoRA (#48884)، و کمیتسازی استاندارد ModelOpt NVFP4 (#486)،
fused_topk_bias(کرنل 1.5–2x، #47463) و حذف اضافی تکرار/کپی، <2TP8% E-linkaiss (1. js-issue-link" href="https://github.com/vllm-project/vllm/pull/48137">#48137)، به علاوه کمپرسور دو مرحلهای ROCm برای پر کردن HCA (#47718)، بهینهسازیهای پراکنده رمزگشایی/پیشپر کردن (#48788، #47419) و XPU (#47677). - fp32
lm_headبرای مدلهای تولیدی از طریقhead_dtype(#489، <0> مسیر Loa>#483 گسترش یافته است. class="issue-link js-issue-link" href="https://github.com/vllm-project/vllm/pull/48525">#48525) و یک مسیر سریع ROCmtorch.mm(#48688)، بهبود دقت برای سرهای نسل. - پشتیبانهای توجه انعطافپذیر: اکنون میتوان بخش پشتیبان توجه را بهازای هر گروه حافظه پنهان KV انتخاب کرد (#48012، و پشتیبانی از پشتیبان در حال حاضر قابلیت انقباض دارد (a class="issue-link js-issue-link" href="https://github.com/vllm-project/vllm/pull/48011">#48011) — بهبود پشتیبانی از مدل های هیبریدی.
- خروج KV & فضای ذخیرهسازی ثانویه ردیفی به طور قابلتوجهی به بلوغ رسیده است: بارگیری معیارها (#45958، #47666، #47679،
#46544 ، هویت بار کاری (#47063، #47274، #481DPware,#47987