Objectifs :
- Comprendre les enjeux du déploiement local d'un LLM : confidentialité des données, souveraineté et maîtrise des coûts
- Dimensionner l'infrastructure nécessaire (CPU, GPU, VRAM) et comprendre l'impact de la quantification
- Installer et configurer les outils d'inférence locale : Ollama, llama.cpp et vLLM
- Sélectionner et évaluer un modèle open-weights adapté à son cas d'usage
- Exposer le modèle via une API et l'intégrer dans une application (chatbot, RAG documentaire)
- Sécuriser, superviser et maintenir le déploiement en production
Objectifs :
- Comprendre les enjeux du déploiement local d'un LLM : confidentialité des données, souveraineté et maîtrise des coûts
- Dimensionner l'infrastructure nécessaire (CPU, GPU, VRAM) et comprendre l'impact de la quantification
- Installer et configurer les outils d'inférence locale : Ollama, llama.cpp et vLLM
- Sélectionner et évaluer un modèle open-weights adapté à son cas d'usage
- Exposer le modèle via une API et l'intégrer dans une application (chatbot, RAG documentaire)
- Sécuriser, superviser et maintenir le déploiement en production