Kuantisasi ModelPrismML Bonsai 27B menggunakan build Qwen3.6 1-bit dan ternary untuk menghadirkan AI lokal di perangkat yang lebih kecilBagian yang menarik bukanlah mahkota tolok ukur, melainkan apa yang bisa diwujudkan oleh kuantisasi agresif secara praktis di laptop dan ponsel.PrismMLQwen3.6Kuantisasi ModelAI di PerangkatNyx·Jul 16, 2026·5 min readBaca artikel
02Silikon AppleRumor Kemasan Apple A20 Pro Menunjukkan AI Adalah Masalah BandwidthApple A20 ProPengemasan WMCMInFO-PoPLPDDR5XTheo·Jul 14, 2026·5 min readBaca artikel
03Apple siliconPerpindahan A20 Pro Apple yang Dilaporkan dari InFO-PoP Menunjukkan AI Membutuhkan Bandwidth yang Lebih Dingin, Bukan Sekadar KomputasiA20 ProInFO-PoPWMCMTSMCTheo·Jul 7, 2026·5 min readBaca artikel
04Kecerdasan buatan di perangkat Kecerdasan buatan (AI) di perangkat adalah kemampuan menjalankan model AI langsung pada perangkat seperti ponsel pintar, laptop, atau tablet — tanpa mengirimkan data ke server cloud. Bayangkan seperti memiliki asisten cerdas yang tinggal sepenuhnya di dalam perangkatmu, bukan di suatu tempat yang jauh di internet. ## Cara kerjanya Model AI tradisional biasanya berjalan di pusat data besar yang terhubung melalui internet. AI di perangkat mengambil pendekatan berbeda — model tersebut dimuat langsung ke memori perangkatmu dan berjalan menggunakan prosesor lokal. Perangkat modern menyertakan chip khusus yang dirancang untuk tugas AI: - **Unit Pemrosesan Neural (NPU)** — chip yang dioptimalkan khusus untuk komputasi AI - **Unit Pemrosesan Grafis (GPU)** — awalnya dirancang untuk grafis, tetapi sangat efektif untuk perhitungan AI - **Prosesor utama (CPU)** — dapat menjalankan model AI yang lebih kecil meski tidak seefisien chip khusus ## Mengapa hal ini penting **Privasi** — Datamu tetap berada di perangkatmu. Saat kamu menggunakan pengenalan wajah untuk membuka kunci ponsel, foto wajahmu tidak dikirim ke perusahaan mana pun. **Kecepatan** — Menghilangkan perjalanan bolak-balik ke server jauh berarti respons yang lebih cepat. Papan ketik prediktif dan koreksi otomatis terasa instan karena memang diproses secara lokal. **Kemampuan offline** — Fitur seperti terjemahan bahasa atau asisten suara dapat bekerja bahkan tanpa koneksi internet. **Penghematan baterai** — Terkadang memproses data secara lokal lebih hemat energi daripada mengirimkan data bolak-balik melalui jaringan seluler. ## Contoh dalam kehidupan sehari-hari Kamu mungkin sudah menggunakan AI di perangkat lebih sering dari yang kamu sadari: - Membuka kunci ponsel menggunakan wajah atau sidik jari - Saran teks saat mengetik pesan - Filter dan efek kamera real-time - Aplikasi terjemahan yang bekerja secara offline - Perintah "hei asisten" yang dideteksi tanpa koneksi internet - Pemindaian dokumen yang secara otomatis meluruskan dan memperjelas gambar ## Tantangan dan keterbatasan AI di perangkat bukan tanpa hambatan. Model yang lebih besar dan lebih canggih memerlukan lebih banyak memori dan daya komputasi daripada yang tersedia di sebagian besar perangkat. Ini berarti model AI di perangkat sering kali merupakan versi yang lebih kecil dan lebih sederhana dibandingkan rekan berbasis cloud-nya. Pertimbangan utama meliputi: - **Ukuran model** — Model yang lebih besar memberikan hasil yang lebih baik tetapi membutuhkan lebih banyak ruang penyimpanan - **Penggunaan memori** — Menjalankan AI bersamaan dengan aplikasi lain bersaing untuk mendapatkan RAM yang terbatas - **Panas dan baterai** — Komputasi AI yang intensif dapat menguras baterai dan membuat perangkat menjadi panas - **Pembaruan** — Memperbarui model di perangkat lebih rumit daripada memperbarui layanan cloud terpusat ## Tren yang sedang berkembang Produsen chip besar seperti Apple, Qualcomm, dan MediaTek kini menyertakan NPU khusus di hampir setiap prosesor ponsel pintar baru. Kemampuan ini berkembang dengan cepat — model yang membutuhkan server yang kuat hanya beberapa tahun lalu kini dapat berjalan dengan lancar di ponsel standar. Model bahasa besar (LLM) — jenis AI yang mendukung chatbot seperti ChatGPT — kini mulai tersedia dalam versi yang cukup kecil untuk berjalan di perangkat. Ini mewakili pergeseran signifikan dalam cara AI dapat digunakan secara pribadi dan aman.Pixi Menjaga Feed Kamera Anda Tetap Offline dari Cloud. Itu adalah Pilihan Desain yang Layak Diteliti.PixiPesan Augmented RealityAI di PerangkatiMessageRiver·Jun 27, 2026·7 min readBaca artikel
05Inferensi model bahasa pada perangkat ## Apa itu inferensi model bahasa pada perangkat? Inferensi model bahasa pada perangkat adalah proses menjalankan model kecerdasan buatan (AI) langsung di perangkat pengguna—seperti ponsel, laptop, atau tablet—tanpa mengirimkan data ke server jarak jauh. Alih-alih mengunggah teks atau gambar ke cloud untuk diproses, perangkat itu sendiri yang melakukan semua komputasi secara lokal. ## Mengapa ini penting? Ketika kamu mengetik pesan atau mengambil foto, kamu mungkin tidak ingin data tersebut meninggalkan perangkatmu. Inferensi pada perangkat membuat ini menjadi mungkin karena: - **Privasi:** Data tidak pernah meninggalkan perangkatmu - **Kecepatan:** Tidak ada waktu tunggu akibat koneksi jaringan - **Mode offline:** Berfungsi bahkan tanpa koneksi internet - **Hemat biaya:** Tidak diperlukan server cloud yang mahal ## Bagaimana cara kerjanya? Model bahasa biasanya membutuhkan banyak daya komputasi. Agar dapat berjalan di perangkat yang lebih kecil, para insinyur menggunakan beberapa teknik cerdas: ### Kuantisasi Kuantisasi mengurangi presisi angka-angka yang digunakan model. Bayangkan seperti mengubah foto beresolusi tinggi menjadi versi yang lebih kecil dan terkompresi—tampilannya hampir sama, tetapi ukuran filenya jauh lebih kecil. Model yang dikuantisasi menggunakan lebih sedikit memori dan berjalan lebih cepat. ### Pemangkasan Pemangkasan menghilangkan bagian-bagian model yang tidak terlalu berkontribusi pada akurasi. Ini seperti memotong cabang-cabang kecil dari pohon sambil tetap menjaga batang utama dan cabang besarnya utuh. ### Akselerasi perangkat keras Ponsel dan laptop modern memiliki chip khusus—seperti unit pemrosesan grafis (GPU) dan unit pemrosesan neural (NPU)—yang dirancang untuk melakukan perhitungan AI secara efisien. Model pada perangkat memanfaatkan chip-chip ini untuk mendapatkan kinerja yang lebih baik. ```figure: ┌─────────────────────────────────────────────────────────┐ │ │ │ Pendekatan Cloud Pendekatan Pada Perangkat │ │ │ │ [Pengguna] ──► [Internet] ──► [Server] │ │ ▲ │ │ │ └──────────────────────────────┘ │ │ (perjalanan pulang pergi) │ │ │ │ [Pengguna] ──► [Model Lokal pada Perangkat] │ │ ▲ │ │ │ └───────────────────┘ │ │ (tetap di sini) │ │ │ └─────────────────────────────────────────────────────────┘ @title Perbandingan cloud vs. pada perangkat @caption Inferensi cloud mengirimkan data melalui internet ke server jarak jauh, lalu mengembalikan hasilnya. Inferensi pada perangkat memproses semuanya secara lokal, sehingga data tidak pernah meninggalkan perangkatmu. @source Diagram EducationPals ``` ## Contoh nyata Kamu mungkin sudah menggunakan inferensi pada perangkat tanpa menyadarinya: - **Keyboard prediktif** pada ponselmu menyarankan kata berikutnya secara lokal - **Pengenalan wajah** untuk membuka kunci ponsel terjadi sepenuhnya di perangkat - **Perintah asisten suara** seperti "Hei Siri" atau "Oke Google" terdeteksi secara lokal sebelum terhubung ke cloud - **Filter kamera** menerapkan efek AI secara real-time menggunakan chip perangkat ## Keterbatasan Inferensi pada perangkat bukan tanpa tantangan: 1. **Ukuran model:** Model yang lebih besar membutuhkan lebih banyak penyimpanan dan RAM 2. **Konsumsi daya baterai:** Komputasi AI dapat menguras baterai lebih cepat 3. **Kemampuan terbatas:** Model pada perangkat biasanya lebih kecil dan kurang mampu dibandingkan model cloud 4. **Pembaruan model:** Memperbarui model berarti mengunduh file baru ke perangkat ## Tren masa depan Seiring chip ponsel menjadi semakin bertenaga dan teknik kompresi model terus berkembang, inferensi pada perangkat semakin mampu melakukan tugas-tugas yang sebelumnya hanya bisa ditangani oleh server cloud. Banyak perusahaan teknologi besar kini menyematkan kemampuan AI langsung ke dalam perangkat keras perangkat mereka, yang mengisyaratkan masa depan di mana AI yang canggih dan sadar privasi berjalan sepenuhnya di tanganmu.A 70-Billion Parameter LLM yang Berjalan Sepenuhnya di Ponsel Android Menantang Semua Asumsi Kita tentang Edge AILiberaGPTAI pada PerangkatInferensi TepiAI AndroidNyx·Jun 21, 2026·5 min readBaca artikel
06Model Fondasi AppleApple Menjalankan AI Cloud Paling Canggihnya di Server Google. Apple Tidak Masalah dengan Itu.Apple Foundation ModelsApple IntelligenceWWDC26AI On-DeviceNyx·Jun 13, 2026·5 min readBaca artikel
07Apple IntelligenceApple Telah Menjalankan Dua Tingkat Otak AI di iPhone Kamu Sejak 2024, dan Kebanyakan Pelajar ML MelewatkannyaApple IntelligencePrivate Cloud ComputeOn-Device AIFoundation ModelsNyx·Jun 8, 2026·6 min readBaca artikel
08NVIDIA RTX AI PCNVIDIA Baru Saja Menjadikan AI Lokal sebagai Standar di Tingkat Silicon, Bukan Sekadar Solusi Alternatif Perangkat LunakNVIDIA RTX AI PCsGeForce RTX 50 SeriesLocal AI InferenceNVIDIA NIMNyx·Jun 8, 2026·6 min readBaca artikel