- LiteRT-LM menyediakan lapisan orkestrasi berprestasi tinggi yang membolehkan model Gemma 4 berjalan dengan cekap pada perkakasan pinggir seperti Raspberry Pi.
- Penggunaan kuantisasi ketepatan campuran dengan ketara mengurangkan jejak memori, membolehkan LLM kompleks beroperasi dengan RAM serendah 0.8 GB.
- Pecutan perkakasan melalui XNNPACK dan sokongan WebGPU eksperimental, berserta penyepaduan Hailo AI HAT yang akan datang, mengoptimumkan kelajuan inferens.
- Melaksanakan firmware penyembuhan kendiri dengan kemas kini dwi-bank memastikan penggunaan OTA AI kekal stabil dan berdaya tahan dalam pengeluaran.
Pernahkah anda terfikir jika anda boleh menggabungkan kuasa model bahasa yang besar ke dalam papan kecil yang muat di tapak tangan anda? Impian untuk membawa GenAI yang canggih ke tahap yang lebih tinggi akhirnya menjadi kenyataan hasil daripada sinergi antara Raspberry Pi dan perkakasan AI terkini Google. Kita sedang bercakap tentang dunia di mana peranti IoT anda bukan sahaja mengikuti skrip mudah tetapi sebenarnya memahami dan menjana teks seperti manusia tanpa memerlukan ikatan berterusan dengan awan.
Untuk memastikan ini berfungsi dengan lancar memerlukan susunan tertentu: perkakasan Raspberry Pi, kecekapan masa jalan LiteRT dan kecerdasan keluarga Gemma 4. Dengan menggabungkan semua ini, pembangun boleh membina aplikasi peribadi dan berlatensi rendah yang memproses data secara setempat, memastikan maklumat sensitif tidak pernah meninggalkan peranti sambil mengekalkan pengalaman pengguna yang pantas melalui pecutan perkakasan yang dioptimumkan.
Membongkar LiteRT-LM dan Ekosistem Gemma 4

Teras operasi ini ialah LiteRT-LM , yang bertindak sebagai lapisan orkestrasi berprestasi tinggi. Ia bukan sekadar pembungkus; ia direka bentuk untuk pelaksanaan merentas platform , bermakna ia mengendalikan kerja-kerja berat menjalankan Model Bahasa Besar (LLM) merentasi platform Android, iOS, Web dan IoT. Bagi mereka yang mendalami Gemma 4, khususnya varian E2B , kecekapannya amat mengagumkan. Google menggunakan skema kuantisasi ketepatan campuran yang bijak (menggabungkan pemberat 2-bit, 4-bit dan 8-bit), yang membolehkan jejak pemberat model menurun serendah 0.8 GB , menjadikannya sesuai untuk RAM peranti pinggir yang terhad.
LiteRT-LM melangkaui penjanaan teks mudah dengan menyokong multimodaliti , yang membolehkan input penglihatan dan audio. Ia juga memperkenalkan panggilan fungsi , yang merupakan pengubah permainan untuk mencipta aliran kerja agentik . Daripada sekadar berbual, AI sebenarnya boleh mencetuskan alat atau API tertentu untuk melaksanakan tugas dunia sebenar. Tambahan pula, pengenalan penggubal Ramalan Berbilang Token (MTP) telah meningkatkan kelajuan inferens sehingga 3x lebih pantas , sekali gus mengurangkan masa yang dihabiskan pengguna untuk menunggu respons dengan ketara.
Langkah demi Langkah: Menggunakan Gemma 4 pada Raspberry Pi 5

Menyediakan pusat kuasa AI pinggir anda sendiri adalah lebih mudah daripada yang disangka. Pertama, anda perlu menyediakan perkakasan anda. Dengan menggunakan Raspberry Pi Imager , adalah disyorkan untuk memasang versi 64-bit Raspberry Pi OS pada Raspberry Pi 5. Setelah OS anda di-flash dan anda telah mewujudkan sambungan SSH ke papan anda, anda boleh mengesahkan bahawa seni bina anda ialah aarch64 untuk memastikan keserasian dengan binari AI.
Bahagian perisian melibatkan beberapa alat utama. Daripada bergelut dengan pengurus persekitaran yang kompleks, menggunakan uv adalah cara yang sesuai untuk mengendalikan persekitaran AI. Selepas memasang uv, anda boleh menyediakan persekitaran maya Python 3.13 dan memasang pakej litert-cli-nightly . Untuk benar-benar menarik model, anda memerlukan token baca Hugging Face . Dengan itu, arahan mudah seperti litert lm run boleh menarik model gemma-4-E2B-it terus daripada repo komuniti dan memulakan perbualan setempat dalam beberapa saat.
Menolak Had: Pecutan Perkakasan dan MLOp

Walaupun CPU mengendalikan sebahagian besar kerja melalui perwakilan XNNPACK , terdapat sokongan eksperimen untuk pecutan GPU. Pada Raspberry Pi 5, ini dicapai melalui pemacu Vulkan sumber terbuka V3DV . Dengan menetapkan pembolehubah persekitaran V3D_WEBGPU_OVERRIDE=1 , anda boleh memanfaatkan WebGPU. Perlu diingatkan bahawa pada masa ini, CPU sering mengatasi GPU untuk beban kerja khusus ini, tetapi asasnya tersedia untuk keuntungan masa hadapan, terutamanya dengan penyepaduan pemecut Hailo AI yang akan datang melalui AI HAT+.
Selain persediaan awal, penyelenggaraan peranti ini di lapangan adalah perkara yang menjadi sukar. Di sinilah konsep Firmware Penyembuhan Kendiri memainkan peranan. Untuk mengelakkan "gelung but tanpa henti" yang ditakuti semasa kemas kini OTA, pasukan moden menggunakan memori dwi-partition (Bank A dan Bank B ). Peranti ini menguji muatan AI baharu dalam fasa percubaan; jika ia mencetuskan kebocoran memori atau gagal memenuhi tarikh akhir RTOS , pemuat but akan kembali secara automatik ke firmware yang diketahui baik . Ini menghalang perjalanan penyelenggaraan fizikal yang mahal dan memastikan AI pinggir anda kekal berdaya tahan.

Konvergensi kecekapan masa jalan LiteRT dan saiz padat Gemma 4 mengubah Raspberry Pi daripada papan hobi kepada pelayan Edge AI gred profesional . Dengan memanfaatkan alatan seperti LiteRT CLI, kuantisasi ketepatan campuran dan strategi firmware yang berdaya tahan, pembangun kini boleh menggunakan AI multimodal agentik yang beroperasi sepenuhnya di luar talian, membuka jalan untuk generasi baharu sistem terbenam pintar dan berdikari.