Temukan minat Anda, bersama

Promo pilihan, ulasan jujur, dan cerita belanja dari mereka yang seminat dengan Anda — setiap hari di Kuybeli.

Temukan minat Anda, bersamaPromo pilihan, ulasan jujur, dan cerita belanja dari mereka yang seminat dengan Anda — setiap hari di Kuybeli.

Model AI Lokal: Qwen Flash dan DeepSeek V4 Menggeser Inference ke Perangkat

Model AI Lokal: Qwen Flash dan DeepSeek V4 Menggeser Inference ke Perangkat
Minat|Eksplorasi Aplikasi AI

Dari Cloud ke Perangkat: Definisi Pergeseran Baru AI

Pergeseran AI di perangkat adalah perubahan arah pengembangan model AI dari bergantung pada server cloud menuju model AI lokal yang berjalan langsung di laptop, desktop, atau workstation pengguna, dengan inference tanpa cloud yang cukup cepat dan hemat memori sehingga satu mesin konsumen bisa memproses teks, gambar, dan video secara offline sambil menjaga privasi data di perangkat sendiri. Dalam konteks ini, Qwen Flash dan DeepSeek V4 adalah contoh penting model efisien yang membuat AI di perangkat bukan lagi eksperimen, melainkan opsi serius untuk kerja harian dan operasi bisnis. Intinya, lokasi komputasi berpindah dari pusat data ke tepi jaringan—ke rumah, kantor kecil, dan studio kreator.

Dua peristiwa teknis menandai titik balik ini. Tim Qwen membuka bobot Qwen3.8-Flash-Next pada 26 Agustus 2026 sebagai pratinjau multimodal untuk arsitektur Qwen4. Di sisi lain, Salvatore Sanfilippo alias antirez memperlihatkan DeepSeek V4 Flash dengan visi berjalan lokal dan cepat di Mac M5 Max pada 1 September 2026, lengkap dengan dukungan Metal, CUDA, dan ROCm yang siap dirilis. Keduanya bukan sekadar rilis fitur; mereka adalah deklarasi bahwa model AI lokal yang canggih sudah cukup matang untuk meninggalkan ketergantungan penuh pada cloud dan memindahkan pusat gravitasi AI ke perangkat pengguna.

Model AI Lokal: Qwen Flash dan DeepSeek V4 Menggeser Inference ke Perangkat

Qwen3.8-Flash-Next: MoE Raksasa yang Dirancang untuk Hemat Komputasi

Qwen3.8-Flash-Next layak dibaca sebagai eksperimen berani: sebuah model mixture-of-experts multimodal dengan bobot terbuka, namun sekaligus pratinjau arsitektur Qwen4 yang belum final. Model ini memproses teks, gambar, dan video menjadi teks, dengan mesin inferensi yang mengekstrak dan mengolah frame video di bawah satu anggaran konteks bersama untuk resolusi, sampel, dan teks. Pendekatan ini jelas berpihak pada AI di perangkat—konteks besar dan multimodalitas dipadatkan melalui arsitektur yang hemat komputasi, bukan sekadar disandarkan pada server raksasa.

Secara angka, Qwen3.8-Flash-Next tampak menggila: 125 miliar parameter di model utama, 51 miliar tambahan di tabel embedding N-gram, dan hanya 6 miliar parameter yang benar-benar diaktifkan per token. "Repositori resmi menawarkan sekitar 360 GB berkas dan konfigurasi di bawah Qwen Community License 1.0". Rasio antara total parameter dan parameter aktif adalah inti efisiensi: deployment memang tetap memuat set lengkap, tetapi inference hanya menggerakkan sebagian kecil. Artinya, model besar dapat berperilaku seperti model jauh lebih kecil ketika berjalan, membuka pintu bagi model AI lokal yang sebelumnya terasa mustahil di mesin individu.

SpecQwen3.8-Flash-NextImplikasi untuk AI Lokal
Parameter total125B + 51B embeddingButuh memori besar, tapi masih dapat dioptimalkan lewat MoE
Parameter aktif per token6BMengurangi komputasi per langkah inferensi
ModalitasTeks, gambar, videoMendukung use case multimodal di perangkat
LisensiQwen Community License 1.0Bobot terbuka namun dengan syarat komersial khusus

DeepSeek V4 Flash dan DS4: Visi Lokal Serius di Tiga Backend

Jika Qwen Flash menunjukkan bagaimana arsitektur MoE bisa menghemat komputasi, maka DeepSeek V4 Flash melalui mesin DS4 menunjukkan betapa jauh konsep model AI lokal sudah berjalan. antirez mendemonstrasikan DeepSeek V4 Flash dengan kemampuan visi yang menganalisis gambar di Mac M5 Max dan mengembalikan deskripsi dalam hitungan detik, seluruh proses berlangsung di chip Apple tanpa koneksi ke cloud. Di sini, model AI lokal bukan slogan pemasaran; ia berarti gambar yang dianalisis benar-benar tidak pernah meninggalkan mesin pengguna. Bagi orang yang bekerja dengan dokumen rahasia atau foto medis, konsekuensinya jelas: privasi bukan sekadar janji, melainkan sifat teknis dari sistem.

DS4, singkatan dari DwarfStar4, adalah mesin inferensi khusus untuk DeepSeek V4 Flash yang dipublikasikan antirez di GitHub pada 6 Mei 2026. Tidak seperti runtime generalis, DS4 sengaja hanya mendukung satu model dengan varian PRO untuk mesin bermemori besar. DeepSeek V4 Flash sendiri adalah model mixture-of-experts dengan 13 miliar parameter aktif dari total 284 miliar, tingkat sparsitas yang ekstrem. Versi Vision-Exp yang dirilis 21 Agustus 2026 menambahkan pemahaman gambar sampai batas 384 token per gambar tanpa menurunkan kemampuan teks. Yang menentukan bukan hanya fitur visi ini, melainkan fakta bahwa DS4 membawa visi DeepSeek V4 Flash ke lokal di tiga backend sekaligus: Metal untuk Mac, CUDA untuk NVIDIA, dan ROCm untuk AMD. Model yang sama dengan kualitas yang sama berjalan di Mac, NVIDIA, dan AMD.

SpecDeepSeek V4 FlashDS4
Total parameter284 miliarButuh mesin kuat, tapi ditopang sparsitas ekstrem
Parameter aktif13 miliar per tokenInference efisien untuk model sebesar itu
Vision-Exp384 token per gambar, encoder 0,9 GiBPerlu memori tambahan namun tetap masuk akal
BackendMetal, CUDA, ROCmInference tanpa cloud seragam di Mac, NVIDIA, AMD

Biaya, Privasi, dan Kekuatan Individu: Kenapa Model Efisien Mengubah Permainan

Model AI lokal seperti Qwen Flash dan DeepSeek V4 Flash menggeser perdebatan klasik tentang AI: apakah lebih masuk akal membayar infrastruktur cloud atau membangun AI di perangkat sendiri. Pengembang yang menghitung anggaran sudah lama membandingkan satu Mac lokal dengan langganan cloud bulanan, dan hitungannya makin sering berpihak pada mesin di rumah sendiri. Selama bertahun-tahun, AI lokal tertinggal satu langkah—cukup untuk eksperimen, belum cukup untuk kerja sungguhan. Rilis DS4 dengan visi dan bobot terbuka Qwen3.8-Flash-Next menggeser batas itu lagi. Satu laptop saja sudah cukup untuk kerja serius.

Dampaknya paling terasa di dua hal: biaya operasi dan privasi. Efisiensi MoE—hanya sebagian kecil parameter aktif per token—mengurangi komputasi dan pada akhirnya mengurangi kebutuhan kapasitas cloud. Inference tanpa cloud berarti tidak ada data sensitif yang dikirim keluar; gambar tetap berada di mesin, dan kebijakan kepatuhan tidak bergantung pada janji pihak ketiga. Untuk individu dan bisnis kecil, ini adalah bentuk edge computing yang memampukan: mereka dapat membangun workflow dengan AI di perangkat yang kuat, murah untuk dijalankan, dan cukup fleksibel untuk disesuaikan dengan kebutuhan sendiri. Ketika bobot terbuka Qwen bisa dimuat dengan Transformers dan DeepSeek V4 Flash dijalankan lewat DS4 di tiga akselerator besar, AI berhenti menjadi hak eksklusif pusat data dan mulai menjadi alat sehari-hari di meja kerja.

Ke Depan: Eksperimen Terbuka, Standar Baru untuk Edge Computing

Meski terasa seperti lompatan besar, baik Qwen3.8-Flash-Next maupun DeepSeek V4 Flash Vision-Exp masih berdiri di fase eksperimental. Repositori Qwen secara eksplisit diklasifikasikan sebagai pratinjau multimodal yang dapat dijalankan, bukan spesifikasi final Qwen4. Bobotnya sengaja diterbitkan lebih awal untuk dievaluasi sebelum keluarga Qwen4 dibangun penuh. Di kubu DeepSeek, Vision-Exp juga diperkenalkan sebagai varian eksperimen, dan masih harus dilihat seberapa kuat visi ini bertahan serta seberapa cepat dukungan stabil hadir.

Namun eksperimen ini sudah cukup untuk menetapkan standar baru bagi edge computing. Qwen menguji arsitektur dengan jendela konteks native 262.144 token yang dapat diperluas sampai satu juta dengan YaRN, sementara antirez menunjukkan bahwa mesin inferensi kecil dengan beberapa ribu baris kode C dapat membawa salah satu model multimodal paling mumpuni ke perangkat pengguna. Jika tren ini berlanjut, masa depan AI tidak lagi ditentukan oleh siapa yang memiliki data center terbesar, melainkan oleh siapa yang mampu merancang model dan mesin inference yang efisien, aman, dan dapat dijalankan di mana saja. Individu dan bisnis kecil berada di posisi yang lebih kuat dari sebelumnya: mereka bisa memilih untuk tetap di cloud, memindahkan sebagian beban ke lokal, atau bahkan membangun seluruh tumpukan AI di perangkat sendiri.

Kuybeli memperoleh komisi saat Anda berbelanja melalui tautan kami, tanpa biaya tambahan untuk Anda.

You May Also Like

Comments
Tulis sesuatu...
Belum ada komentar. Jadilah yang pertama berbagi pendapat!