vLLM نسخه 0.26.0 - یادداشت های انتشار

منبع / نسخه بالادست

یادداشت‌های انتشار vLLM نسخه 0.26.0

برترین ها

این نسخه دارای 411 تعهد از 212 مشارکت کننده (61 جدید) است!

  • خانواده مدل جدید Inkling با پشته پشتیبانی کامل: مدل‌سازی پایه (#48799)، piecewise CUDA graphiss="link-link" href="https://github.com/vllm-project/vllm/pull/48822">#48822)، توجه نسبی Hopper FA4 ( (#48869)، LoRA (#48884)، و کمیت‌سازی استاندارد ModelOpt NVFP4 (#486)، fused_topk_bias (کرنل 1.5–2x، #47463) و حذف اضافی تکرار/کپی، <2TP8% E-linkaiss (1. js-issue-link" href="https://github.com/vllm-project/vllm/pull/48137">#48137)، به علاوه کمپرسور دو مرحله‌ای ROCm برای پر کردن HCA (#47718)، بهینه‌سازی‌های پراکنده رمزگشایی/پیش‌پر کردن (#48788، #47419) و XPU (#47677).
  • fp32 lm_head برای مدل‌های تولیدی از طریق head_dtype (#489، <0> مسیر Loa>#483 گسترش یافته است. class="issue-link js-issue-link" href="https://github.com/vllm-project/vllm/pull/48525">#48525) و یک مسیر سریع ROCm torch.mm (#48688)، بهبود دقت برای سرهای نسل.
  • پشتیبان‌های توجه انعطاف‌پذیر: اکنون می‌توان بخش پشتیبان توجه را به‌ازای هر گروه حافظه پنهان KV انتخاب کرد (#48012، و پشتیبانی از پشتیبان در حال حاضر قابلیت انقباض دارد (a class="issue-link js-issue-link" href="https://github.com/vllm-project/vllm/pull/48011">#48011) — بهبود پشتیبانی از مدل های هیبریدی.
  • خروج KV & فضای ذخیره‌سازی ثانویه ردیفی به طور قابل‌توجهی به بلوغ رسیده است: بارگیری معیارها (#45958، #47666، #47679،#46544، هویت بار کاری (#47063، #47274، #481DPware,#47987
بازگشت به لیست اخبار دانشنامه
enamad