Zum Hauptinhalt springen
David Loor
Über michServicesProjekteBlogKontakt
←Zurück zum Blog

#gemma

1 Artikel mit dem Schlagwort gemma.

Gefunden 1 Beitrag
2026-06-08
13 min read

Lokales Gemma war zu langsam mit AIdaemon, bis ich llama.cpp und die Prompt-Größe optimierte

Ich wollte AIdaemon auf lokalem Gemma 4 26B über llama.cpp, nicht Ollama. Die Generierung lief mit ~45 tok/s auf einem M4 Pro. Agenten-Turns fühlten sich immer noch träge an, da das Prefill bei 14k-Token-Prompts 8 bis 9 Sekunden dauerte, bevor das Modell ein einziges Wort schrieb.

aisoftware-developmentopen-source

Auf dem Laufenden bleiben

Erhalten Sie die neuesten Beiträge und Einblicke direkt in Ihren Posteingang.

Kein Spam. Jederzeit abbestellbar.

Archiv
  • Lokales Gemma war zu langsam mit AIdaemon, bis ich llama.cpp und die Prompt-Größe optimierte
David Loor

AI, Cloud & Web Solutions Architekt

Über michServicesProjekteBlogBücherregal

© 2026 David Loor. Alle Rechte vorbehalten.

david@davidloor.com