Godina je 2026. i lokalni LLM-ovi su konačno upotrebljivi za svakodnevni rad. Ali ne rade svi modeli jednako na kućnom hardveru.
Testna platforma
Svi testovi su izvršeni na:
- Desktop: RTX 3090 (24 GB VRAM), 64 GB RAM
- Laptop: Apple M2 Pro (16 GB unified memory)
Modeli koje smo testirali
Llama 3.3 70B (Q4_K_M)
- Veličina: ~42 GB
- Brzina na RTX 3090: ~18 tokena/s
- Kvalitet: Najbliže GPT-4 klasi od svih open-source modela
- Verdict: Ako imate dovoljno VRAM-a, ovo je best-buy
Mistral Small 3 (24B)
- Veličina: ~14 GB
- Brzina: ~45 tokena/s
- Kvalitet: Odličan za coding i instruction-following
- Verdict: Najbolji balans brzine i kvaliteta
Qwen 2.5 Coder 32B
- Veličina: ~19 GB
- Brzina: ~32 tokena/s
- Kvalitet: Specijaliziran za programiranje, bolji od Llama-e za kod
- Verdict: Ako vam je programiranje primarni use-case
Phi-4 14B
- Veličina: ~8.5 GB
- Brzina: ~60 tokena/s
- Kvalitet: Iznenađujuće dobar za reasoning, manje za kreativno pisanje
- Verdict: Savršen za laptop
Kako pokrenuti
Najlakši način je koristiti Ollama:
# Instalacija
curl -fsSL https://ollama.com/install.sh | sh
# Pokreni Mistral Small
ollama run mistral-small
# Ili specifičan model
ollama run llama3.3:70b-instruct-q4_K_M
Za naprednije slučajeve sa custom system prompt-ovima i vlastitim modelima, koristite LM Studio — ima GUI i podržava sve formate (GGUF, MLX, GPTQ).
Praktični savjeti
- Quantization je ključan. Q4_K_M je sweet spot — minimalan gubitak kvaliteta, drastično manja veličina.
- Specijalizirani modeli su bolji od općih. Phi-4 za reasoning, Qwen Coder za kod, Mistral za sve ostalo.
- Context window troši resurse. 8K kontekst je zlatni standard za kućni hardver.
Važno: Lokalni LLM-ovi nikad neće biti 100% zamjena za cloud modele. Ali za 80% svakodnevnih zadataka — pisanje, refaktoriranje koda, research — rade odlično i vaši podaci ostaju kod kuće.
Prijavi se da ostavi komentar.
Registracija je besplatna putem Google računa.