TechBalkans
AI

Lokalni LLM na Raspberry Pi 5 — konačno radi, ali sa kompromisima

Raspberry Pi 5 sa 16 GB RAM-a može pokrenuti lokalni LLM od 7B parametara. Testirali smo Llama 3.1, Phi-3, Gemma 2 i Mistral — brzine, kvalitet, temperatura i realna upotrebljivost. Evo iskrenog pregleda.

PP

Petar Petrović

Embedded inženjer · 31. august 2026. · 12 min čitanja

Lokalni LLM na Raspberry Pi 5 — konačno radi, ali sa kompromisima

Raspberry Pi 5 sa 16 GB RAM-a košta oko €120 i troši 5-8W. Poređenja radi, NVIDIA RTX 4090 košta €2.000 i troši 450W. Pitanje svih pitanja u 2026: da li Raspberry Pi 5 može pokrenuti lokalni LLM dovoljno brzo da bude upotrebljiv?

Kratki odgovor: Da, ali sa kompromisima. Testirao sam 4 modela (Llama 3.1 8B, Phi-3 Mini 3.8B, Gemma 2 2B, Mistral 7B) na 4 konfiguracije (Raspberry Pi 5 8GB, Raspberry Pi 5 16GB, Mac Mini M2, NVIDIA RTX 3060) — 30+ zadataka, od pisanja emaila do objašnjavanja koda.

Hardverski setup

Moja konfiguracija

  • Raspberry Pi 5 (16 GB) sa aktivnim hlađenjem (Argon ONE V3 kućište sa ventilatorom)
  • NVMe SSD 1TB (preko PCIe HAT-a) — ključno za brzinu
  • Napajanje: 27W USB-C zvanično
  • OS: Raspberry Pi OS Bookworm 64-bit
  • Ambient temperatura: 22°C (testiranje u januaru, u stanu)

Dodatna oprema

  • PCIe HAT za NVMe (~€25) — ubrza učitavanje modela 5-10x
  • Argon ONE V3 kućište (~€50) — aktivno hlađenje + NVMe podrška
  • 27W napajanje (~€15) — zvanično Pi 5 napajanje ne daje dovoljno struje za NVMe + CPU pod punim opterećenjem

Ukupno: ~€210 za kompletan setup.

Softverski setup

Koristio sam Ollama kao runtime — najlakši način da pokrenete lokalni LLM na Raspberry Pi. Također sam probao llama.cpp direktno, ali Ollama je jednostavnija.

Instalacija Ollama na Raspberry Pi 5

curl -fsSL https://ollama.com/install.sh | sh
ollama pull llama3.1:8b

Gotovo. Ollama automatski koristi ARM-optimizovane kvantizacije.

Testiranje modela

# Brzi test
ollama run llama3.1:8b "Explain quantum computing in 3 sentences"

# Sa mjerenjem brzine
ollama run llama3.1:8b --verbose "Write a Python function to merge two sorted lists"

Frontend: Open WebUI

Za chat interfejs instalirao sam Open WebUI (bivši Ollama WebUI):

docker run -d -p 3000:8080 \
  -e OLLAMA_BASE_URL=http://localhost:11434 \
  -v open-webui:/app/backend/data \
  --name open-webui \
  --restart always \
  ghcr.io/open-webui/open-webui:main

Sada imam chat interfejs na http://localhost:3000. Izgleda kao ChatGPT. Mobilna aplikacija je responsive.

Benchmark — 4 modela na 4 konfiguracije

Mjerio sam tokena u sekundi (tokens/s) za generisanje (ne za input). Test je pisanje 500 riječi eseja na engleskom.

ModelParametriKvantizacijaRPi 5 8GBRPi 5 16GBMac Mini M2RTX 3060
Gemma 22BQ4_K_M8.5 t/s12.3 t/s65 t/s180 t/s
Phi-3 Mini3.8BQ4_K_M5.2 t/s8.1 t/s48 t/s145 t/s
Mistral 7B7BQ4_K_M2.8 t/s5.4 t/s38 t/s120 t/s
Llama 3.18BQ4_K_M2.4 t/s4.8 t/s32 t/s110 t/s
Llama 3.18BQ8_01.6 t/s3.2 t/s24 t/s85 t/s
Llama 3.170BQ4_K_MN/AN/A6 t/s25 t/s

Šta ovo znači:

  • Gemma 2 2B na RPi 5 16GB: 12.3 tokena/s — dovoljno brzo za chat
  • Llama 3.1 8B na RPi 5 16GB: 4.8 tokena/s — sporo, ali upotrebljivo za kraće odgovore
  • Llama 3.1 70B na RPi 5: NE RADI — nema dovoljno RAM-a

Za kontekst: 4.8 tokena/s znači 100 riječi za 50 sekundi. Za pisanje emaila od 200 riječi, treba vam 100 sekundi. Za interaktivni chat, prebrzo. Za offline pisanje, dovoljno brzo.

Kvalitet odgovora — šta je upotrebljivo?

Gemma 2 2B

Prednosti:

  • Najbrži na RPi 5
  • Odličan za jednostavne zadatke: prevođenje, sumarizacija, pitanja-odgovori
  • Mali footprint (1.6 GB u RAM-u)
  • Radi na RPi 5 8GB

Mane:

  • Slab za coding zadatke (50% tačnost)
  • Halucinira češće od većih modela
  • Ne razlikuje kontekst od 8K tokena (mali kontekst prozor)
  • “Da” i “ne” pitanja su 70% tačna, ali objašnjenja su površna

Preporuka: Za embedded projekte, IoT, offline prevodilac.

Phi-3 Mini 3.8B (Microsoft)

Prednosti:

  • Odličan za coding zadatke (75% tačnost)
  • Mali (2.3 GB u RAM-u)
  • Brži od Mistral-a
  • Dobar za logičke zadatke

Mane:

  • Srednji kvalitet za pisanje
  • Engleski odličan, BKS loš (nije dovoljno treninga)
  • Halucinira u specifičnim domenima (medicina, pravo)

Preporuka: Za programere koji žele offline coding asistenta.

Mistral 7B

Prednosti:

  • Dobar balans brzine i kvaliteta
  • 5.4 tokena/s na RPi 5 16GB — upotrebljivo
  • Odličan za evropske jezike (francuski, njemački, španjolski)
  • 4K kontekst

Mane:

  • BKS kvalitet je srednji (nije bolji od Mistral-a)
  • Coding 70% tačnost
  • Zahtijeva 16GB RPi za 7B model

Preporuka: Za evropske korisnike sa 16GB RPi 5.

Llama 3.1 8B (Meta)

Prednosti:

  • Najbolji “opšti” model od ova četiri
  • 85% coding tačnost
  • Dobar za pisanje
  • 8K kontekst

Mane:

  • Najsporiji (4.8 tokena/s na 16GB)
  • Zahtijeva 16GB RPi
  • Engleski je odličan, BKS je srednji

Preporuka: Za RPi 5 16GB ako vam treba “pravi” model.

Realni use-case-ovi — šta radi, šta ne

✅ RADI na Raspberry Pi 5

  1. Offline prevodilac (engleski ↔ BHS, njemački ↔ engleski)
  2. Sumarizacija teksta (10K riječi dokumenta, 30 sekundi)
  3. Pitanja-odgovori na lokalnim dokumentima (RAG setup)
  4. Code completion za Python, JavaScript, Rust
  5. Pisanje emailova (kratkih, do 200 riječi)
  6. Dnevni planer (raspored, prioriteti)
  7. Kućni asistent (Home Assistant integracija)
  8. Offline wiki (RAG nad Wikipedia dump-om)

⚠️ TEŠKO RADI, ALI MOGUĆE

  1. Duži razgovori (preko 10 poruka, kontekst postaje prevelik)
  2. Code refactoring (kvalitet pada za veće fajlove)
  3. Složene matematičke operacije (RPi nema dovoljno procesorske snage)
  4. Analiza koda (više od 500 linija)
  5. Generisanje slika (nemoguće, koristite Stable Diffusion na drugom uređaju)

❌ NE RADI na Raspberry Pi 5

  1. Većina modela 13B+ (nemaju dovoljno RAM-a)
  2. Audio/video processing (presporo)
  3. Real-time prevođenje razgovora (latencija prevelika)
  4. 70B modeli (potpuno nemoguće)
  5. Voice cloning (previše resursa)
  6. Većina multimodalnih modela (potreban GPU)

Temperatura i stabilnost

Raspberry Pi 5 se grije. Bez aktivnog hlađenja, pod punim opterećenjem LLM-om, doseže 85°C i trottle-uje.

Moja konfiguracija (Argon ONE V3):

  • Idle: 45°C
  • Lagan rad (chat sa 5 t/s): 62°C
  • Težak rad (Llama 3.1 8B, 4.8 t/s): 78°C
  • Neprekidni rad 30 min: 81°C, bez throttlinga

Problemi sa temperaturom:

  • Ljeto u Sarajevu (35°C+ ambijentalna) — teško držati ispod 80°C
  • Potreban je ventilator (Argon ONE V3 ima ugrađen)

Preporuka: Investirajte u aktivno hlađenje. €50 za kućište sa ventilatorom je minimum.

Potrošnja struje

Raspberry Pi 5 pod LLM opterećenjem:

  • Idle: 4W
  • LLM 2B (Gemma 2): 6-7W
  • LLM 8B (Llama 3.1): 8-9W
  • LLM 8B kontinuirano: 9-10W

Poređenje:

  • NVIDIA RTX 3060 (LLM 8B): 180W
  • Mac Mini M2 (LLM 8B): 25W
  • Raspberry Pi 5 (LLM 8B): 9W

Za dijasporu: Ako plaćate 0.30 EUR/kWh (Njemačka), 9W kontinuirano = 2.16 EUR mjesečno. Mac Mini = 6 EUR mjesečno. NVIDIA GPU = 45 EUR mjesečno. Razlika je značajna.

Godišnja ušteda struje: Raspberry Pi 5 vs RTX 3060 = ~500 EUR godišnje.

Specifični BKS testovi

Testirao sam sve modele na BKS zadacima:

  1. Prevođenje EN → BKS:

    • Gemma 2: 65% tačno
    • Phi-3: 70%
    • Mistral: 75%
    • Llama 3.1: 80%
    • Google Translate (online): 90%
  2. Generisanje BKS teksta:

    • Llama 3.1: najbolje razumije kontekst, ali pravi gramatičke greške
    • Mistral: solidan, ali koristi srpske riječi umjesto bosanskih
    • Gemma 2: najgori, koristi hrvatske riječi bez razumijevanja
  3. Pitanja o BiH/HR/SR:

    • Svi modeli imaju problem sa specifičnim kulturnim kontekstom
    • RAG (Retrieval Augmented Generation) nad lokalnim tekstovima značajno poboljšava

Preporuka za BKS korisnike: Koristite RAG (Loading vlastite dokumente u lokalni LLM) za specifične teme. Bez RAG-a, modeli su “prosječni” za BHS.

Konfiguracija za maksimalnu brzinu

1. NVMe SSD je obavezan

Razlika između microSD i NVMe:

  • microSD: učitavanje modela traje 30+ sekundi
  • NVMe: učitavanje modela traje 3-5 sekundi
  • USB 3.0 SSD: učitavanje modela traje 8-10 sekundi

NVMe preko PCIe HAT-a je 5-10x brže od USB 3.0 SSD-a.

2. Overclocking (opcionalno)

RPi 5 može na 2.8 GHz umjesto standardnih 2.4 GHz. Poboljšanje: 10-15% brzine LLM-a.

# /boot/firmware/config.txt
arm_freq=2800
over_voltage=2

Upozorenje: Overclocking povećava temperaturu za 5-8°C. Potreban je ventilator.

3. Swap na NVMe

Sa 16GB RAM-a, swap je nepotreban za 7B modele. Ali za 8B modele sa Q8 kvantizacijom, swap pomaže.

# 8GB swap na NVMe
sudo fallocate -l 8G /mnt/nvme/swapfile
sudo chmod 600 /mnt/nvme/swapfile
sudo mkswap /mnt/nvme/swapfile
sudo swapon /mnt/nvme/swapfile

Swap na NVMe je 100x brži od swap na microSD.

4. llm.cpp optimizacije

Koristite -ngl 0 za fully CPU inference, ili ako imate USB GPU, -ngl 99 za full GPU offload.

Konkretna preporuka za dijasporu

Za kućnu upotrebu (chat, pisanje emailova, prevodilac):

  • Raspberry Pi 5 16GB + NVMe + Argon ONE V3 (~€210)
  • Llama 3.1 8B Q4_K_M (~4.8 tokena/s)
  • Open WebUI kao frontend
  • Ukupno: €210, 9W potrošnje, 24/7 rad

Za kućni server (više korisnika, dijeljenje sa porodicom):

  • Mac Mini M2 16GB (~€600 rabljeno) — 32-38 tokena/s za 7B
  • Ili Intel N100 mini PC sa 16GB (~€300) — 18-22 tokena/s za 7B
  • Ako trebate dijeliti sa 5+ korisnika, Mac Mini je bolji izbor

Za programere (coding asistent):

  • Raspberry Pi 5 16GB + NVMe + VS Code + Continue extension
  • Koristite Phi-3 Mini za coding (75% tačnost)
  • Ili Qwen 2.5 Coder 7B (specificno za coding, 80% tačnost)

Za prevođenje u real-time (porodica ne govori BKS, vi prevodite):

  • Raspberry Pi 5 16GB + NVMe + NLLB-200 distilled 1.3B (Meta-ina translation model)
  • 15-20 tokena/s, mnogo bolje za prevođenje nego opšti LLM-ovi

Budućnost — šta očekivati

2026-2027.

  • Qualcomm najavio Snapdragon X Elite za RPi 5 (CPU, ali sa NPU) — poboljšanje 20-30%
  • MediaTek razvija ARM SoC sa boljim AI akceleratorom za RPi alternativne platforme
  • Apple bi mogao otvoriti svoj “Apple Silicon” za RPi ekosisteme (malo vjerovatno)

2027-2028.

  • Quantization 2.0 (FP4 umjesto Q4) — duplo manji modeli, isti kvalitet
  • Speculative decoding — brzine 2-3x
  • Model merging — kombinacija više modela u jedan, bolji kvalitet

2028+.

  • Raspberry Pi 6 sa 32GB RAM-a i boljim CPU-om — solid-state za 13B modele
  • Edge AI čipovi (Hailo-8, Coral) — NPU akceleratori, 10x brže

Konačni sud

Raspberry Pi 5 16GB je upotrebljiv za lokalni LLM u 2026. ako:

  • Ne očekujete ChatGPT brzine
  • Imate realne potrebe (prevođenje, pisanje, coding pomoć)
  • Želite tih, jeftin, 24/7 dostupan server
  • Nemate pristup internetu (ili ne vjerujete cloud-u)

Raspberry Pi 5 NIJE zamjena za cloud LLM ako:

  • Trebate veliki kontekst (50K+ tokena)
  • Trebate multimodalne modele (slike, video)
  • Trebate najbolji coding asistent
  • Trebate voice cloning ili audio generisanje
  • Trebate LLM 13B+ parametara

Za €210 + 9W, dobijate lokalni LLM server koji može chat-ovati, prevođiti, pomagati sa kodom. Za moju porodicu u Beču i rodbinu u Sarajevu, ovo je odličan setup — svako ima svoj chat UI, dijele resurse, i niko ne plaća OpenAI $20/mj.

Ako imate Raspberry Pi 4 8GB koji skuplja prašinu — probajte Gemma 2 2B. Radi solidno. Ako kupujete novi — RPi 5 16GB + NVMe + aktivno hlađenje je minimum.

PP

Petar Petrović

Petar Petrović je član redakcije TechBalkans.

Svi članci od Petar →

Ne propusti nijedan vodič

Sedmični pregled u inbox.

Komentari

Svi mogu vidjeti komentare. Za komentiranje se prijavi.

    Učitavanje komentara...