Accueil > Formations > Intelligence artificielle & Data Science > Ingénierie des LLMs & IA Générative > Ollama : déployer et optimiser des LLM en local
Formation Ollama : déployer et optimiser des LLM en local
Maîtrisez le déploiement de modèles d'IA en local pour garantir la confidentialité de vos données tout en optimisant les performances !
Vue d'ensemble
- Connaissances de base en intelligence artificielle et en modèles de langage
- Pratique courante de la ligne de commande (Terminal, PowerShell)
- Bases en Python ou langage équivalent
- Notions de Docker (images, conteneurs)
Objectifs pédagogiques
Programme détaillé
Introduction à l'IA locale et aux modèles open-source
– Avantages de l’IA locale : confidentialité des données, réduction des coûts et maîtrise de la latence face aux solutions cloud
– Panorama des LLM open-source : positionnement et caractéristiques des modèles Llama, Mistral et Gemma
– Exigences matérielles : impact de la RAM, du GPU et de l’architecture sur les performances des modèles
– Architecture d’Ollama : fonctionnement interne, gestion des modèles et cas d’usage en entreprise
– Comparaison des performances et coûts entre un LLM local et une API cloud sur un même jeu de prompts
Installation et configuration d'Ollama
– Installation multi-plateforme : procédures spécifiques pour macOS, Windows et Linux
– Dépendances et accélération GPU : configuration de Docker et des drivers CUDA pour exploiter le matériel disponible
– Bonnes pratiques de configuration : organisation des modèles, gestion de l’espace disque et variables d’environnement
– Diagnostic et dépannage : résolution des problèmes courants d’installation et de compatibilité
– Installation d’Ollama et lancement d’un premier modèle léger
– Diagnostic et résolution de problèmes d’installation simulés
Utilisation et gestion des modèles
– Interface CLI : commandes essentielles pour télécharger, lancer et gérer les modèles
– Interface WebUI : interaction graphique avec les modèles pour le prototypage rapide
– Gestion du cycle de vie : téléchargement, mise à jour et suppression des modèles
– Techniques de prompting : rédaction de prompts efficaces et tests comparatifs entre modèles
– Lancement de plusieurs modèles et comparaison de leurs réponses sur des prompts variés
Personnalisation des modèles avec les Modelfiles
– Modelfiles : syntaxe et structure pour définir des modèles personnalisés
– Paramétrage avancé : ajustement de la température, du contexte et des instructions système
– Adaptation métier : spécialisation d’un modèle pour un domaine ou une tâche spécifique
– Fine-tuning de base : principes et limites de l’ajustement de modèles en local
– Création d’un Modelfile pour spécialiser un LLM sur la génération de code Python
– Personnalisation d’un modèle avec des instructions système adaptées à un contexte métier
Intégration applicative via l'API REST et LangChain
– API REST Ollama : endpoints disponibles, formats de requêtes et gestion des réponses en streaming
– Intégration Python : appels programmatiques à l’API pour intégrer Ollama dans des applications existantes
– LangChain et Ollama : configuration du connecteur, création de chaînes de traitement et gestion de la mémoire
– Création d’agents conversationnels : architecture d’un chatbot exploitant un modèle local
– Développement d’un chatbot simple intégrant l’API Ollama
– Construction d’une chaîne LangChain connectée à un modèle local
Optimisation des performances
– Quantization : réduction de la taille des modèles et impact sur la qualité des réponses
– Batching : traitement par lots pour améliorer le débit dans les scénarios multi-utilisateurs
– Stratégies de caching : mise en cache des résultats pour accélérer les réponses récurrentes
– Monitoring : suivi des métriques de performance (temps de réponse, consommation mémoire, utilisation GPU)
– Application de la quantization sur un modèle large et mesure de l’impact sur les performances et la qualité
– Mise en place d’un monitoring de base pour suivre l’utilisation des ressources
Sécurisation et déploiement en environnement sensible
– Isolation avec Docker : conteneurisation d’Ollama pour limiter la surface d’attaque
– Chiffrement des données : protection des modèles et des échanges en transit et au repos
– Contrôle d’accès : gestion des permissions et restriction de l’utilisation des modèles
– Cas d’usage en secteurs réglementés : déploiement dans des contextes santé, finance ou défense
– Déploiement d’Ollama dans un conteneur Docker sécurisé avec contrôle d’accès
– Développement d’un agent d’analyse de texte confidentiel exploitant un modèle local isolé
Prochaines sessions
Avis des participants
Formation claire, structurée et directement applicable. Le formateur a pris le temps de répondre à toutes nos questions avec des exemples concrets.
Très bon équilibre entre théorie et pratique. Les exercices permettent de comprendre rapidement les concepts et de les mettre en œuvre.
Un formateur expérimenté, pédagogue et disponible. Je repars avec des méthodes et des outils que je peux utiliser immédiatement dans mon travail.
Le contenu était dense, mais très bien expliqué. Le rythme a été adapté au niveau du groupe et chacun a pu progresser.
Des formateurs experts, reconnus par nos apprenants
Chez Sparks Formation, la qualité de nos formations repose sur l'expertise de nos formateurs et la satisfaction de nos apprenants.
Note moyenne attribuée par les participants à nos formateurs
formateurs experts partenaires
Sparks Formation
sujets IT délivrés chaque jour partout en France
Financement
Cette formation est éligible aux financements OPCO et FNE-Formation. Nos équipes vous accompagnent dans le montage de votre dossier.
En savoir plus sur le financement
Choisissez votre formation
