Vai al contenuto principale
David Loor
Chi sonoServiziProgettiBlogContatti
←Torna al Blog

#gemma

1 articoli con il tag gemma.

Trovato 1 articolo
2026-06-08
13 min read

Gemma locale era troppo lento con AIdaemon finché non ho corretto llama.cpp e la dimensione del prompt

Volevo AIdaemon su Gemma locale 4 26B tramite llama.cpp, non Ollama. La generazione avveniva a circa 45 tok/s su un M4 Pro. I turni dell'agente sembravano ancora bloccati perché il prefill su prompt da 14k token richiedeva da 8 a 9 secondi prima che il modello scrivesse una singola parola.

aisoftware-developmentopen-source

Rimani Aggiornato

Ricevi gli ultimi articoli e approfondimenti direttamente nella tua casella di posta.

Niente spam. Puoi annullare in qualsiasi momento.

Archivio
  • Gemma locale era troppo lento con AIdaemon finché non ho corretto llama.cpp e la dimensione del prompt
David Loor

Architetto di Soluzioni AI, Cloud & Web

Chi sonoServiziProgettiBlogLibreria

© 2026 David Loor. Tutti i diritti riservati.

david@davidloor.com