Créer chez soi une IA experte d'un domaine : choisir le matériel et le LLM de base, préparer les données, construire un RAG, fine-tuner en QLoRA, évaluer et déployer avec Ollama.
« Entraîner une IA sur mon sujet » peut désigner trois opérations très différentes. L'une coûte des millions d'euros, les deux autres tiennent sur un PC de joueur. Avant de toucher à une ligne de code, il faut savoir laquelle on vise, parce que le mauvais choix mène à des semaines de travail pour un modèle qui invente toujours les réponses.
Un LLM (Large Language Model) est un réseau de neurones entraîné à prédire le mot suivant. À force de lire des milliers de milliards de mots, il a encodé dans ses poids — des milliards de nombres — une quantité énorme de connaissances et la capacité de suivre des instructions.
Deux étapes produisent les modèles qu'on télécharge :
Pour les mécanismes de base et les usages courants, l'article l'IA pour les développeurs pose le décor.
| Approche | Ce qu'on modifie | Coût | Réaliste chez soi |
|---|---|---|---|
| Pré-entraînement from scratch | tout, à partir de zéro | millions d'€, milliers de GPU | non |
| Fine-tuning (LoRA / QLoRA) | une petite partie des poids | quelques heures de GPU grand public | oui |
| RAG | rien : on donne des documents au modèle à chaque question | quasi nul | oui |
Entraîner un modèle depuis zéro sur « le potager » produirait un modèle incapable d'écrire une phrase correcte : il faut des milliards de mots juste pour apprendre la langue. Oubliez cette option. On part toujours d'un modèle existant.
RAG signifie Retrieval-Augmented Generation. Le principe :
Question de l'utilisateur
│
▼
Recherche des passages pertinents dans VOS documents
│
▼
Prompt = consignes + passages trouvés + question
│
▼
LLM → réponse fondée sur les passages, avec sourcesLe modèle ne « sait » rien de plus. On lui met sous les yeux, à chaque question, les pages utiles de votre documentation. C'est un examen à livre ouvert.
Forces : les connaissances se mettent à jour en ajoutant un fichier, les réponses peuvent citer leurs sources, et les hallucinations chutent fortement quand la recherche trouve le bon passage.
Faiblesses : si la recherche rate le bon passage, la réponse est mauvaise. Le modèle ne change ni de ton ni de façon de raisonner.
Le fine-tuning poursuit l'entraînement sur vos exemples (question → réponse idéale). Les poids changent.
Le fine-tuning est excellent pour :
Il est médiocre pour injecter des faits précis. C'est le point que la plupart des tutoriels passent sous silence. Montrer une fois au modèle que « la tomate se sème en février-mars sous abri » ne garantit pas qu'il le ressortira correctement, ni qu'il n'inventera pas une date pour l'aubergine. Pour qu'un fait soit mémorisé de façon fiable, il faut le présenter de nombreuses fois, sous de nombreuses formulations, avec un risque de dégrader les connaissances générales du modèle.
| Besoin | RAG | Fine-tuning | Les deux |
|---|---|---|---|
| Répondre sur des faits précis (dates, chiffres, règles) | ✓✓ | ✗ | ✓✓ |
| Connaissances qui évoluent | ✓✓ | ✗ | ✓ |
| Citer ses sources | ✓✓ | ✗ | ✓✓ |
| Ton, format, persona | ✗ | ✓✓ | ✓✓ |
| Vocabulaire et raisonnement du domaine | ✓ | ✓✓ | ✓✓ |
| Petit modèle rapide aussi bon qu'un gros | ✗ | ✓✓ | ✓✓ |
| Dire « je ne sais pas » hors du périmètre | ✓ | ✓ | ✓✓ |
Mon avis, après plusieurs essais : pour « une IA qui sait tout ce qu'il faut savoir sur un sujet et répond correctement », commencez par le RAG. Il donne 80 % du résultat en une soirée. Ajoutez ensuite un fine-tuning pour ce que le RAG ne corrige pas : ton, structure des réponses, meilleure exploitation des passages, refus hors sujet. La combinaison des deux est ce qui donne les assistants les plus fiables.
Chapitre 2 Matériel et environnement → la machine est prête
Chapitre 3 Choisir le modèle de base → une référence mesurée
Chapitre 4 Préparer les données → corpus propre + jeu de Q/R
Chapitre 5 Construire le RAG → assistant v1
Chapitre 6 Fine-tuner en QLoRA → modèle spécialisé
Chapitre 7 Évaluer → on sait ce qui marche vraiment
Chapitre 8 Déployer et itérer → modèle servi par OllamaOn va construire un assistant capable de répondre à des questions comme :
Le sujet est volontairement simple et bien documenté. Remplacez-le par le vôtre : la méthode est identique pour la documentation interne d'une entreprise, un règlement sportif ou un domaine technique.
Entraîner en local a un avantage énorme : rien ne sort de votre machine. Si votre domaine touche à des données personnelles ou confidentielles, c'est souvent la seule option acceptable. Les implications juridiques sont traitées dans RGPD et IA.
On n'entraîne pas un LLM chez soi, on le spécialise. Le RAG apporte les connaissances, le fine-tuning apporte le comportement. Garder cette séparation en tête évite l'erreur la plus fréquente : fine-tuner pendant des jours en espérant que le modèle apprenne des faits qu'un simple RAG lui aurait donnés en une heure.