Saltar al contenido principal
David Loor
Acerca deServiciosProyectosBlogContacto
←Volver al Blog

#gemma

1 artículos con la etiqueta gemma.

Encontrado 1 publicación
2026-06-08
13 min read

Gemma local era demasiado lento con AIdaemon hasta que arreglé llama.cpp y el tamaño del prompt

Quería AIdaemon en Gemma 4 26B local a través de llama.cpp, no Ollama. La generación se ejecutaba a ~45 tok/s en un M4 Pro. Los turnos del agente aún se sentían atascados porque el prefill en prompts de 14k tokens tardaba de 8 a 9 segundos antes de que el modelo escribiera una sola palabra.

aisoftware-developmentopen-source

Mantente Actualizado

Recibe las últimas publicaciones e ideas directamente en tu bandeja de entrada.

Sin spam. Puedes cancelar cuando quieras.

Archivo
  • Gemma local era demasiado lento con AIdaemon hasta que arreglé llama.cpp y el tamaño del prompt
David Loor

Arquitecto de Soluciones de IA, Cloud y Web

Acerca deServiciosProyectosBlogEstantería de Libros

© 2026 David Loor. Todos los derechos reservados.

david@davidloor.com