Pembaruan terbaru pada backend vLLM kini memungkinkan implementasi model dari library Transformers berjalan secepat atau bahkan lebih cepat daripada implementasi native vLLM. Ini dicapai melalui integrasi yang lebih dalam, di mana vLLM secara dinamis menerapkan optimasi inferensi seperti fusi layer dan kernel yang dioptimalkan pada runtime. Model author kini dapat memanfaatkan performa ultra-cepat vLLM untuk model Transformers mereka tanpa perlu melakukan porting kode secara manual, yang sebelumnya memerlukan penulisan ulang kode khusus untuk vLLM.
Poin Penting
- Backend vLLM kini mendukung implementasi model Transformers dengan kecepatan inferensi setara atau melampaui implementasi native.
- Integrasi baru menggunakan torch.fx dan AST untuk optimasi runtime model Transformers.
- Optimasi meliputi fusi layer, kernel yang dioptimalkan untuk EP dan TP (MergedColumnParallelLinear, QKVParallelLinear).
- Model author dapat menjalankan model Transformers di vLLM dengan flag
--model-impl transformerstanpa porting kode. - Model yang dioptimalkan tetap dapat digunakan untuk pelatihan, tidak seperti implementasi vLLM khusus.
- Performa diukur pada berbagai arsitektur Qwen3 (4B, 32B, 235B MoE) dan terbukti kompetitif.
Penjelasan Mendalam
Inti dari pembaruan ini adalah penggunaan torch.fx untuk analisis statis pada graph model Transformers. Proses ini mengidentifikasi pola-pola yang dapat dioptimalkan, kemudian menggunakan Abstract Syntax Tree (AST) untuk memanipulasi dan menulis ulang operasi tertentu secara in-place. Hasilnya adalah fusi operasi yang dipetakan ke kernel vLLM yang sangat dioptimalkan, seperti yang digunakan untuk Expert Parallelization (EP) pada model Mixture-of-Experts (MoE), serta MergedColumnParallelLinear dan QKVParallelLinear untuk Tensor Parallelism (TP). Model yang dimanipulasi ini tetap kompatibel dengan torch.compile dan CUDA Graphs, serta dapat digunakan untuk pelatihan karena tetap merupakan implementasi Transformers standar.
Kenapa Ini Penting
Pembaruan ini secara drastis menurunkan hambatan teknis untuk mencapai inferensi LLM berkecepatan tinggi. Praktisi AI di Indonesia kini dapat memanfaatkan performa terbaik vLLM untuk model yang sudah ada di ekosistem Transformers tanpa perlu keahlian mendalam dalam optimasi low-level, mempercepat deployment LLM.
Untuk Siapa
Developer AI, peneliti, dan tim MLOps yang ingin memaksimalkan throughput inferensi LLM mereka, terutama saat menggunakan model dari Hugging Face Transformers.
Contoh Use Case
- Menyajikan model LLM besar (seperti Qwen3-235B MoE) dengan latensi rendah pada skala besar.
- Mengoptimalkan inferensi untuk aplikasi chatbot yang membutuhkan respons cepat.
- Mempercepat proses fine-tuning atau evaluasi model dengan memanfaatkan backend inferensi yang efisien.
- Menjalankan model VLM (Vision-Language Models) yang didukung Transformers di vLLM dengan performa maksimal.
Cara Mulai
- Pastikan Anda telah menginstal atau memperbarui paket vLLM ke versi terbaru:
pip install --upgrade vllm --torch-backend auto. - Saat menjalankan server inferensi vLLM, tambahkan flag
--model-impl transformerske perintahvllm serve. - Konfigurasikan opsi paralelisme (tensor-parallel, data-parallel, expert-parallel) seperti biasa sesuai kebutuhan hardware Anda.
- Uji performa model Anda dengan flag tersebut dan bandingkan hasilnya dengan implementasi native (jika ada).
Peran: Praktisi MLOps
Konteks: Saya ingin mengoptimalkan inferensi LLM menggunakan vLLM dengan model dari Hugging Face Transformers. Saya baru saja mengetahui tentang backend Transformers baru di vLLM yang diklaim secepat implementasi native.
Tugas: Berikan panduan langkah demi langkah yang jelas dan ringkas tentang cara mengaktifkan dan menguji backend Transformers baru di vLLM untuk model 'meta-llama/Llama-2-7b-chat-hf' pada satu GPU NVIDIA A100.
Format Output: Daftar bernomor yang berisi perintah terminal dan konfigurasi yang diperlukan.
Batasan: Gunakan Bahasa Indonesia, berikan perintah yang dapat langsung dijalankan.
Insight Bisnis
Penyedia layanan AI dapat menawarkan deployment LLM yang lebih cepat dan efisien kepada klien mereka, mengurangi biaya infrastruktur dan meningkatkan kepuasan pengguna. Pengembang model dapat lebih mudah mendistribusikan model mereka dengan jaminan performa inferensi yang tinggi.
FAQ
Apakah semua model Transformers didukung oleh backend baru ini?
Sebagian besar model Transformers yang kompatibel dengan optimasi yang diterapkan didukung. Model yang menggunakan linear attention saat ini belum didukung, tetapi direncanakan untuk segera ditambahkan. Model kustom yang tidak mengikuti standar Hub mungkin tidak berfungsi.
Apakah saya masih perlu mem-porting model jika ingin performa terbaik?
Tidak, tujuan utama pembaruan ini adalah agar model Transformers dapat berjalan dengan performa setara implementasi native vLLM tanpa perlu porting manual.
Bisakah saya menggunakan model ini untuk pelatihan?
Ya, karena ini masih merupakan implementasi model Transformers standar, model tersebut dapat digunakan untuk pelatihan, evaluasi, dan RL rollouts, tidak seperti implementasi vLLM khusus.
Bagaimana cara menginstal vLLM dengan backend PyTorch yang dioptimalkan?
Gunakan perintah pip install --upgrade vllm --torch-backend auto untuk memastikan instalasi yang benar.
Sumber: Hugging Face Blog
Diringkas dan disusun otomatis oleh GrowWithAI AI Pulse. Pelajari lebih lanjut lewat kelas AI GrowWithAI atau buka AI Pulse.