Aller au contenu principal

2 articles tagués avec « inference »

Voir tous les tags

La quantization LLM démystifiée : comment faire tourner un 7B sur un ThinkPad

· 7 minutes de lecture
Ingénieur Logiciel & Architecte Cloud

Un modèle 7B en FP32, c'est 28 Go de RAM. Mes ThinkPads en ont 16 à 32. Impossible de charger le modèle — sans parler de faire de l'inférence.

La quantization a résolu ce problème. Pas en sacrifiant la qualité — en changeant la façon dont les poids sont stockés.

LLMs on Bare Metal: Quantization, SLMs, and Replacing phi4-mini with Qwen 2.5 7B

· 9 minutes de lecture
Ingénieur Logiciel & Architecte Cloud

Running LLMs on bare-metal CPU hardware forces you to understand the numbers behind model files. This post documents how we reason about model size, quantization, and inference serving on minicloud — and the concrete change we made: replacing phi4-mini with Qwen 2.5 7B across all three Ollama instances.