Thinking Machines merilis Inkling, model multimodal open source berskala besar dengan ~1 triliun parameter dan konteks 1M token. Model ini secara native menerima input gambar, teks, dan audio. Arsitekturnya adalah decoder-only Mixture-of-Experts dengan 975B total parameter dan 41B aktif per forward. Inkling menggunakan relative attention, hybrid sliding window/global attention, dan short 1D convolution. Tersedia dalam varian bf16 (membutuhkan 2TB VRAM) dan NVFP4 (600GB VRAM). Dukungan day-0 ada di transformers, SGLang, vLLM, dan llama.cpp, memudahkan eksperimen dan deployment.
Poin Penting
- Inkling adalah model multimodal open source dengan 975B total parameter (41B aktif) dan 1M token konteks.
- Mendukung input gambar, teks, dan audio secara native dengan arsitektur decoder-only Mixture-of-Experts.
- Menggunakan relative attention sebagai pengganti RoPE, hybrid sliding window/global attention (rasio 5:1), dan short 1D convolution.
- Tersedia dalam dua varian presisi: bf16 (2TB VRAM) dan NVFP4 (600GB VRAM), dengan dukungan day-0 di transformers, SGLang, vLLM, dan llama.cpp.
- Memiliki parameter reasoning_effort untuk mengontrol seberapa dalam model melakukan penalaran, dari none hingga max.
- Multimodal tower sederhana tanpa encoder terpisah: hierarchical MLP untuk gambar dan discretized mel spectrogram untuk audio.
Penjelasan Mendalam
Inkling menggunakan arsitektur decoder-only MoE dengan 256 experts, di mana top-6 experts dirutekan plus 2 shared experts yang selalu aktif. Inovasi pada positional encoding: daripada RoPE, Inkling menggunakan relative attention dengan proyeksi keempat yang menghasilkan fitur R per token per head, dimodulasi oleh jarak key-query. Hybrid attention terdiri dari rasio 5:1 sliding window ke global attention, dengan layer terakhir global untuk representasi kaya. Short 1D convolution (SConv) membaca W-1 hidden states sebelumnya untuk membantu pemrosesan lokal. Multimodal tower sederhana: untuk gambar, hierarchical MLP patchifier yang menggabung piksel bertahap; untuk audio, discretized mel spectrogram diklasifikasikan ke bin mel. Tidak ada encoder terpisah seperti model multimodal lain. Parameter reasoning_effort (none, minimal, low, medium, high, xhigh, max) mengontrol kedalaman penalaran.
Kenapa Ini Penting
Bagi praktisi AI Indonesia, Inkling membuka akses ke model multimodal skala besar yang dapat di-fine-tune untuk kebutuhan lokal seperti bahasa daerah atau domain spesifik. Konteks 1M token memungkinkan analisis dokumen panjang, rekaman audio, atau video. Dukungan inference engines populer memudahkan eksperimen tanpa infrastruktur raksasa.
Untuk Siapa
Peneliti AI dan insinyur yang ingin membangun aplikasi multimodal reasoning, serta organisasi yang membutuhkan model open source besar yang dapat diadaptasi untuk domain spesifik (medis, hukum, edukasi).
Contoh Use Case
- Menganalisis interaksi obat dari gambar suplemen dan teks penjelas.
- Transkripsi dan analisis sentimen dari percakapan audio multipartai.
- Sistem tanya jawab multimodal untuk dokumen teknis berisi diagram, tabel, dan narasi.
- Asisten virtual yang memahami instruksi gabungan suara, gambar, dan teks dalam satu konteks.
- Fine-tuning model untuk deteksi penyakit dari citra medis dan rekam medis teks.
Cara Mulai
- Instal transformers versi 5.14.0 atau lebih baru: pip install -U transformers.
- Gunakan pipeline 'any-to-any' dengan model ID 'thinkingmachines/Inkling' atau varian NVFP4 untuk GPU Blackwell.
- Untuk multimodal, gunakan AutoModelForMultimodalLM dan AutoProcessor, lalu apply_chat_template dengan messages berisi tipe 'image', 'audio', dan 'text'.
- Atur parameter reasoning_effort sesuai kedalaman penalaran yang diinginkan (contoh: 'medium' untuk keseimbangan).
- Untuk deployment skala besar, pertimbangkan varian NVFP4 atau gunakan kuantisasi ggml via llama.cpp.
Peran: Ahli farmasi dan AI multimodal
Konteks: Saya menggunakan model Inkling yang baru dirilis oleh Thinking Machines, yang mampu memproses gambar, teks, dan audio secara native. Saya ingin menganalisis interaksi obat dari gambar produk suplemen.
Tugas: Analisis komponen dalam gambar suplemen ini dan identifikasi potensi interaksi antar komponen. Berikan penjelasan mengapa interaksi tersebut berbahaya atau aman.
Format Output: Daftar komponen, potensi interaksi, tingkat risiko (rendah/sedang/tinggi), dan rekomendasi.
Batasan: Gunakan Bahasa Indonesia, maksimal 500 kata, berdasarkan pengetahuan medis yang umum.
Insight Bisnis
Peluang membangun layanan analisis multimodal kustom untuk industri farmasi, edukasi, atau media yang membutuhkan pemahaman lintas modalitas, dengan memanfaatkan model open source yang dapat di-fine-tune untuk domain spesifik.
FAQ
Berapa besar VRAM yang dibutuhkan untuk menjalankan Inkling?
Varian bf16 membutuhkan sekitar 2TB VRAM, varian NVFP4 600GB VRAM. Untuk deployment lokal, disarankan menggunakan kuantisasi ggml atau inference via serverless providers yang tersedia di Hugging Face.
Apakah Inkling mendukung input video?
Secara arsitektur ada dimensi temporal untuk video, namun kinerja out-of-the-box belum dievaluasi. Kemampuan ini diharapkan berguna setelah fine-tuning.
Apa perbedaan utama Inkling dengan model multimodal lain seperti LLaVA atau GPT-4V?
Inkling menggunakan multimodal tower sederhana tanpa encoder terpisah, relative attention, hybrid attention, dan MoE dengan shared experts. Model ini open source dengan parameter ~1T, memberikan alternatif untuk fine-tuning dan eksperimen.
Sumber: Hugging Face Blog
Diringkas dan disusun otomatis oleh GrowWithAI AI Pulse. Pelajari lebih lanjut lewat kelas AI GrowWithAI atau buka AI Pulse.