Hugging Face kini memungkinkan pengguna menjalankan server LLM privat yang kompatibel dengan OpenAI API menggunakan vLLM di infrastruktur Hugging Face Jobs. Dengan satu perintah hf jobs run, pengguna dapat meng-host model seperti Qwen/Qwen3-4B tanpa perlu provisioning server atau Kubernetes. Layanan ini ditagih per detik penggunaan hardware GPU, menjadikannya solusi cepat untuk pengujian, evaluasi, atau generasi batch. Endpoint yang dihasilkan dapat diakses dari mana saja menggunakan token Hugging Face sebagai otorisasi.
Poin Penting
- Jalankan server LLM privat kompatibel OpenAI API dengan vLLM di Hugging Face Jobs dalam satu perintah.
- Tidak perlu provisioning server atau Kubernetes, bayar hanya per detik penggunaan GPU.
- Cocok untuk pengujian cepat, evaluasi model, dan batch generation.
- Model dapat diakses dari mana saja menggunakan token Hugging Face sebagai otorisasi.
- Mendukung model besar dengan tensor parallelism dan penyesuaian parameter memori GPU.
- Tersedia fitur tambahan seperti SSH ke server, Gradio UI, dan integrasi agen coding.
Penjelasan Mendalam
Fitur ini memanfaatkan hf jobs run yang berfungsi seperti docker run di infrastruktur Hugging Face. Pengguna menentukan image Docker (vllm/vllm-openai:latest), jenis GPU (--flavor a10g-large), dan port yang diekspos (--expose 8000). Perintah ini secara otomatis mengunduh bobot model (misalnya, Qwen/Qwen3-4B) dan menjalankannya menggunakan vllm serve. Port yang diekspos dirutekan melalui proxy publik Hugging Face Jobs, menghasilkan URL yang dapat diakses publik (dengan otentikasi token). Untuk model yang lebih besar seperti Qwen/Qwen3.5-122B-A10B, pengguna dapat menggunakan flavor GPU yang lebih kuat (h200x2) dan mengaktifkan tensor parallelism (--tensor-parallel-size 2) untuk mendistribusikan beban model ke beberapa GPU. Pengaturan seperti --max-model-len dan --max-num-seqs dapat disesuaikan untuk mengelola memori GPU pada model besar.
Kenapa Ini Penting
Update ini mendemokratisasi akses ke infrastruktur LLM yang kuat, memungkinkan praktisi AI di Indonesia untuk bereksperimen dengan model besar tanpa investasi hardware awal yang signifikan. Kemudahan penggunaan dan model bayar per detik sangat cocok untuk proyek-proyek yang membutuhkan fleksibilitas dan efisiensi biaya.
Untuk Siapa
Developer AI, peneliti, dan data scientist yang ingin dengan cepat meng-host dan menguji LLM untuk berbagai keperluan tanpa kerumitan manajemen infrastruktur.
Contoh Use Case
- Mengevaluasi performa model LLM baru untuk tugas klasifikasi teks.
- Melakukan batch generation deskripsi produk menggunakan model LLM.
- Mengembangkan prototipe aplikasi chatbot yang terintegrasi dengan LLM.
- Menguji kemampuan model LLM dalam menjawab pertanyaan spesifik domain.
- Menjalankan eksperimen A/B testing antar beberapa LLM untuk tugas tertentu.
Cara Mulai
- Pastikan memiliki metode pembayaran atau saldo kredit di Hugging Face dan versi
huggingface_hubterbaru (pip install -U "huggingface_hub>=1.20.0"). - Login ke akun Hugging Face lokal Anda menggunakan
hf auth login. - Jalankan perintah
hf jobs run --flavor a10g-large --expose 8000 --timeout 2h vllm/vllm-openai:latest vllm serve Qwen/Qwen3-4B --host 0.0.0.0 --port 8000. - Dapatkan URL endpoint dari output perintah dan gunakan token Hugging Face Anda untuk otentikasi saat melakukan query.
- Untuk menghentikan server, gunakan
hf jobs cancel <job_id>.
Peran: Analis AI
Konteks: Saya baru saja menjalankan server LLM vLLM di Hugging Face Jobs menggunakan model Qwen/Qwen3-4B dan ingin menguji kemampuannya dalam meringkas teks.
Tugas: Buatkan prompt Bahasa Indonesia untuk meminta LLM meringkas artikel berita berikut menjadi tiga poin utama.
Artikel:
"Kementerian Komunikasi dan Informatika (Kominfo) terus mendorong literasi digital di masyarakat. Berdasarkan data terbaru, indeks literasi digital Indonesia pada tahun 2023 mencapai 3.54 dari skala 5. Angka ini menunjukkan peningkatan dibandingkan tahun sebelumnya, namun masih terdapat ruang untuk perbaikan, terutama di area kecakapan digital. Kominfo berencana meluncurkan program pelatihan baru yang difokuskan pada penggunaan teknologi secara aman dan etis di dunia maya. Selain itu, kerjasama dengan platform media sosial juga akan ditingkatkan untuk memerangi hoaks dan disinformasi."
Format Output: Tampilkan hasil ringkasan dalam bentuk daftar bernomor (bullet points).
Batasan: Gunakan Bahasa Indonesia yang lugas dan hindari jargon teknis yang berlebihan. Pastikan ringkasan hanya terdiri dari tiga poin utama.
Insight Bisnis
Fitur ini membuka peluang bagi startup atau tim kecil untuk menawarkan layanan LLM kustom tanpa investasi infrastruktur besar, atau bagi perusahaan untuk melakukan eksperimen LLM secara efisien sebelum komitmen produksi.
FAQ
Berapa biaya menjalankan server vLLM di Hugging Face Jobs?
Biaya dihitung per menit penggunaan hardware GPU. Harga spesifik tergantung pada jenis GPU yang dipilih (flavor), misalnya a10g-large sekitar $1.50/jam.
Bagaimana cara mengakses endpoint yang sudah berjalan?
Endpoint dapat diakses menggunakan URL yang diberikan, dengan menyertakan token Hugging Face Anda sebagai 'Bearer token' dalam header otorisasi.
Apakah saya bisa menjalankan model yang lebih besar dari Qwen/Qwen3-4B?
Ya, Anda bisa menggunakan flavor GPU yang lebih kuat (misalnya, H200) dan mengaktifkan tensor parallelism (--tensor-parallel-size) untuk mendistribusikan model besar ke beberapa GPU.
Kapan sebaiknya menggunakan Hugging Face Jobs dibandingkan Inference Endpoints?
Gunakan Hugging Face Jobs untuk fleksibilitas maksimal, eksperimen, evaluasi cepat, atau batch generation. Gunakan Inference Endpoints untuk layanan yang lebih siap produksi dan terkelola.
Sumber: Hugging Face Blog
Diringkas dan disusun otomatis oleh GrowWithAI AI Pulse. Pelajari lebih lanjut lewat kelas AI GrowWithAI atau buka AI Pulse.