Technology

DGX Spark Kini Mampu Jalankan DeepSeek V4 Flash 284B dengan Satu Perintah Instalasi

Pengguna DGX Spark dapat menjalankan model DeepSeek V4 Flash 284B dengan kecepatan prefill 1.000 token per detik dan multi-agent serving 59 token per detik hanya dengan satu perintah instalasi.

Oleh Tim Editorial

DGX Spark Kini Mampu Jalankan DeepSeek V4 Flash 284B dengan Satu Perintah Instalasi
winbuzzer.com

Sebuah unggahan di platform X oleh Bleys Goodson (@bleysg) pada awal Agustus 2026 menyebutkan bahwa pemilik atau calon pembeli NVIDIA DGX Spark sebaiknya memperhatikan perkembangan ini. Unggahan tersebut mengklaim bahwa model DeepSeek V4 Flash versi 07 31 dengan 284 miliar parameter kini dapat disajikan pada satu unit DGX Spark dengan kecepatan prefill 1.000 token per detik dan 59 token per detik untuk skenario multi agent serving. Proses instalasi disebut hanya membutuhkan satu perintah. Klaim ini muncul di tengah meningkatnya minat terhadap kemampuan menjalankan model AI besar secara lokal di perangkat desktop. NVIDIA memasarkan DGX Spark sebagai "superkomputer AI di meja Anda" yang dirancang untuk menjalankan agen AI otonom langsung dari desktop pengguna.

Jika klaim tersebut akurat, ini berarti model dengan skala 284 miliar parameter dapat beroperasi penuh tanpa ketergantungan pada infrastruktur cloud. Unggahan @bleysg tidak menyertakan detail teknis lengkap mengenai konfigurasi perangkat keras atau perangkat lunak yang digunakan. Namun, diskusi di forum pengembang NVIDIA memberikan konteks tambahan. Sebuah thread pada 29 Juni 2026 melaporkan bahwa DSpark, build speculative decode dari DeepSeek V4 Flash, memberikan peningkatan kecepatan nyata pada konfigurasi dua DGX Spark dengan tensor parallelism (TP=2). Pada pengujian code generation, kecepatannya mencapai 60 67 token per detik, naik dari sekitar 40 45 token per detik pada decode V4 Flash biasa. Mekanisme speculative decoding bekerja dengan menyusun beberapa token per langkah dan model target memverifikasinya dalam satu pass.

Ketika tingkat penerimaan draft tinggi, seperti pada konten yang dapat diprediksi seperti kode program, peningkatan kecepatannya signifikan. Pada konten campuran atau beragam, kecepatannya turun ke sekitar 40 token per detik. Thread tersebut juga menyebut penggunaan NVFP4 KV cache dengan konfigurasi nvfp4 ds mla. Thread lain di forum yang sama pada 31 Juli 2026 melaporkan pengalaman menjalankan DeepSeek V4 Flash 0731 pada dua DGX Spark. Pengguna tersebut menemukan bahwa diperlukan perubahan konfigurasi kecil untuk mengembalikan tingkat penerimaan speculative decoding. Tanpa perubahan tersebut, model berjalan pada 30 token per detik, tetapi setelah penyesuaian, kecepatannya kembali normal seperti versi preview sebelumnya. Pengguna itu juga mencatat bahwa throughput decode berkurang setengahnya tanpa penurunan kualitas output.

Sementara itu, sebuah posting di X oleh akun keys 🧪 (@u1tra instinct) menyebutkan konfigurasi dua DGX Spark dengan 1 juta konteks dan 2,6 juta token pool pada kecepatan 60 70 token per detik. Angka ini sejalan dengan laporan forum NVIDIA tentang peningkatan kecepatan pada konfigurasi dua perangkat. Di sisi lain, sebuah artikel di flowtivity.ai pada 2 Agustus 2026 membahas DeepSeek V4 Flash 0731 pada dua DGX Spark dengan fokus pada 13 miliar parameter aktif. Artikel itu menyebutkan bahwa model ini memberikan performa agentic tingkat frontier dengan ukuran 10 kali lebih kecil dari Claude Opus. Mereka menjalankannya dengan Hermes Agent untuk beban kerja AI privat di lokasi dengan kecepatan 41 token per detik, serta menyertakan analisis biaya dan implikasi ekonomi dari menjalankan agen AI secara lokal.

Perbedaan angka kecepatan antara berbagai sumber menunjukkan bahwa performa sangat bergantung pada konfigurasi spesifik, jenis konten, dan penyesuaian perangkat lunak. Angka 59 token per detik yang diklaim @bleysg untuk multi agent serving berada di kisaran yang dilaporkan sumber lain, meskipun konfigurasi pastinya tidak dirinci. Kehadiran resep teknis di GitHub, seperti repositori tonyd2wild yang menyediakan panduan menjalankan DeepSeek V4 Flash pada dua node DGX Spark dengan vLLM, TP=2, FP8 KV, dan MTP melalui koneksi RoCE/RDMA, menunjukkan bahwa komunitas pengguna telah mengembangkan solusi untuk mengoptimalkan perangkat ini. Repositori tersebut mencakup image Docker, skrip peluncuran, dan pengaturan RDMA/NCCL. Bagi pengguna yang mempertimbangkan pembelian DGX Spark, klaim tentang kemampuan menjalankan model 284 miliar parameter secara lokal berpotensi mengubah perhitungan biaya.

Alih alih menyewa kapasitas komputasi cloud untuk model skala besar, perangkat desktop dengan harga lebih terjangkau dapat menjadi alternatif. Namun, perlu dicatat bahwa sebagian besar laporan performa terbaik berasal dari konfigurasi dua perangkat, bukan satu. NVIDIA sendiri belum mengeluarkan pernyataan resmi mengenai klaim @bleysg. Informasi yang beredar saat ini berasal dari pengguna dan pengembang komunitas yang melakukan pengujian mandiri. Status verifikasi unggahan @bleysg tercatat sebagai satu sumber dengan semua klaim wajib diatribusikan tanpa penambahan detail. Perkembangan ini muncul di tengah tren yang lebih luas menuju komputasi AI terdistribusi dan privat. Kemampuan menjalankan model besar di perangkat lokal mengurangi kebutuhan transfer data ke cloud, yang relevan untuk organisasi dengan persyaratan privasi ketat.

Artikel flowtivity.ai secara eksplisit membahas perubahan ekonomi dari menjalankan agen AI lokal untuk beban kerja on premise. Bagi pengguna yang ingin mencoba, langkah berikutnya adalah memantau thread @bleysg di X untuk detail instalasi lebih lanjut, serta forum pengembang NVIDIA untuk pembaruan konfigurasi. Komunitas juga terus menyempurnakan resep teknis yang tersedia di GitHub, yang dapat menjadi titik awal bagi pengguna yang ingin mereplikasi hasil yang dilaporkan.

Sumber dan referensi