Lexique
Définitions courtes des termes techniques utilisés dans les articles du blog.
A
- Agent
- Système qui utilise un LLM pour décider lui-même des actions à exécuter (appels d'outils, boucle de raisonnement), par opposition à un simple appel LLM qui se contente de répondre.
B
- Boucle agentique
- Cycle observer → décider → agir répété par un agent jusqu'à résolution de la tâche : le LLM observe le contexte, choisit une action, l'exécute, puis réévalue.
C
- Cache KV
- Mémoire des vecteurs clé/valeur déjà calculés par un transformer, conservée pour éviter de refaire les calculs d'attention sur les tokens déjà traités à chaque nouveau token généré.
- Cache sémantique
- Cache qui compare les nouvelles requêtes aux précédentes par similarité d'embedding plutôt que par égalité stricte, pour réutiliser une réponse LLM déjà générée sur une question reformulée.
- Confused deputy
- Un composant disposant de plus de droits que l'utilisateur final, manipulé pour utiliser ces droits au service d'une instruction malveillante plutôt que légitime — problème classique de sécurité appliqué aux serveurs MCP et aux agents LLM.
E
- Embeddings
- Représentations vectorielles d'un texte capturant son sens, permettant de comparer des contenus par similarité plutôt que par correspondance exacte de mots — brique de base de la recherche sémantique et du RAG.
F
- Fallback
- Stratégie consistant à basculer automatiquement vers un modèle ou fournisseur LLM de secours quand le premier choix échoue ou est indisponible, pour garantir la continuité de service.
- Fenêtre glissante
- Stratégie qui ne conserve que les N éléments les plus récents d'un historique (messages, tokens...), en éjectant les plus anciens au fur et à mesure — simple et sans coût, mais perte totale de ce qui sort de la fenêtre.
- Few-shot
- Technique de prompting consistant à fournir quelques exemples d'entrée/sortie dans le prompt pour guider le format ou le style de la réponse du LLM, sans entraînement supplémentaire.
- Finetuning
- Ré-entraînement d'un modèle pré-entraîné sur un jeu de données spécifique pour le spécialiser sur une tâche ou un domaine, par opposition au prompt engineering qui ne modifie pas les poids du modèle.
- Fixture
- Fonction pytest qui prépare un objet ou un état réutilisable entre plusieurs tests, injectée automatiquement en paramètre des fonctions de test qui la déclarent.
G
- Garde-fous
- Vérifications placées autour d'un LLM ou d'un agent (filtrage d'entrée, validation de sortie, limites d'action) pour contenir ses erreurs et empêcher les comportements indésirables.
H
- Hallucination
- Réponse produite par un LLM qui est incorrecte ou inventée mais formulée avec la même assurance qu'une réponse correcte — risque intrinsèque des modèles génératifs à ne jamais négliger en prod.
I
- Idempotence
- Propriété d'une opération qui produit le même résultat qu'elle soit exécutée une ou plusieurs fois avec les mêmes paramètres — cruciale pour rejouer un appel LLM en toute sécurité après un timeout.
- Inférence
- Phase où un modèle déjà entraîné génère une sortie à partir d'une entrée, par opposition à l'entraînement — c'est ce qui se passe à chaque appel à un LLM en production.
- Injection de dépendances
- Pattern qui consiste à passer une dépendance (client API, base de données) en paramètre d'une fonction plutôt que de l'instancier en dur à l'intérieur — ce qui permet de la substituer par une version factice dans les tests.
- Injection de prompt
- Attaque consistant à faire passer des instructions malveillantes pour du contenu légitime (document, email, page web) afin de détourner le comportement d'un LLM qui les traite.
- Injection SQL
- Vulnérabilité où une entrée non fiable modifie la structure d'une requête SQL exécutée par l'application, permettant de lire ou modifier des données hors du périmètre prévu.
J
- JSON Schema
- Format standard décrivant la structure attendue d'un document JSON (types, champs requis) — utilisé pour contraindre et valider la sortie structurée d'un LLM.
L
- LLM
- Large Language Model : modèle de langage entraîné sur d'énormes volumes de texte pour prédire la suite d'une séquence, capable de générer et comprendre du langage naturel.
- LoRA
- Low-Rank Adaptation : technique de finetuning qui n'entraîne que de petites matrices additionnelles insérées dans le modèle, au lieu de tous ses poids — beaucoup moins coûteuse en mémoire et en calcul.
M
- MCP
- Model Context Protocol : protocole standard ouvert permettant à un LLM d'appeler des outils et sources de données externes de façon uniforme, indépendamment du modèle ou du client utilisés.
- MicroVM
- Machine virtuelle légère (ex. Firecracker) offrant l'isolation matérielle d'une VM classique — noyau dédié, pas de partage avec l'hôte — avec un temps de démarrage proche de celui d'un conteneur.
- Multi-modèle
- Architecture qui fait appel à plusieurs LLM différents (fournisseurs ou tailles de modèle) selon la tâche, le coût ou la disponibilité, plutôt que de dépendre d'un seul.
O
- Observabilité
- Capacité à tracer et inspecter après coup le comportement d'un système (appels d'outils, raisonnements intermédiaires, coûts) — indispensable pour déboguer un agent dont le comportement n'est pas entièrement déterministe.
P
- PagedAttention
- Technique de gestion mémoire du cache KV qui le découpe en pages de taille fixe allouées à la demande, par analogie avec la pagination mémoire d'un système d'exploitation.
- Prompt engineering
- Pratique consistant à concevoir et affiner la formulation d'un prompt (instructions, exemples, structure) pour obtenir une sortie fiable d'un LLM, sans modifier le modèle lui-même.
- Prompt versioning
- Pratique consistant à tracer et versionner les prompts en production comme du code (historique, diff, rollback), pour pouvoir mesurer et revenir sur l'effet d'une modification.
Q
- QLoRA
- Variante de LoRA qui quantifie d'abord le modèle de base (ex. en 4 bits) avant d'y appliquer l'adaptation, permettant de finetuner de gros modèles sur du matériel grand public.
- Quantification
- Réduction de la précision numérique des poids d'un modèle (ex. de 16 à 4 bits) pour diminuer son empreinte mémoire et accélérer l'inférence, au prix d'une légère perte de qualité.
R
- RAG
- Retrieval-Augmented Generation : technique consistant à injecter dans le prompt des extraits de documents pertinents (récupérés par recherche) avant de générer la réponse, pour ancrer le LLM sur des données à jour ou privées.
- Rate limiting
- Limitation du nombre de requêtes autorisées sur une période donnée, imposée par les fournisseurs de LLM (et à répercuter côté application) pour éviter la surcharge et maîtriser les coûts.
- Requête préparée
- Requête SQL dont la structure est fixée à l'avance, les valeurs variables étant passées comme paramètres séparés plutôt que concaténées — empêche l'injection SQL par construction.
- Retry
- Nouvelle tentative automatique d'un appel qui a échoué (timeout, erreur réseau, indisponibilité), généralement combinée à un backoff progressif pour ne pas surcharger le service appelé.
S
- Sandboxing
- Exécution du code ou des actions décidées par un agent dans un environnement isolé et restreint, pour limiter les dégâts possibles en cas d'erreur ou de comportement malveillant.
- Sous-agents
- Agents spécialisés invoqués par un agent parent pour une sous-tâche précise, permettant de découper un problème complexe en unités indépendantes et testables.
- Structured output
- Contrainte imposée à un LLM pour que sa sortie respecte un schéma précis (souvent JSON), afin qu'elle soit directement exploitable par du code sans parsing fragile.
T
- Température
- Paramètre contrôlant le caractère aléatoire des sorties d'un LLM : une valeur basse privilégie la réponse la plus probable, une valeur haute favorise la diversité et la créativité.
- Tokens
- Unités de texte (mot, fragment de mot ou caractère) qu'un LLM manipule réellement : les prompts et réponses sont mesurés, tarifés et limités en nombre de tokens, pas en caractères.
- Top-k
- Paramètre de génération qui restreint le choix du prochain token aux k tokens les plus probables, pour contrôler la diversité des réponses indépendamment de la température.
V
- Vector DB
- Base de données optimisée pour stocker des embeddings et retrouver rapidement les plus proches voisins d'un vecteur donné — brique centrale d'un système RAG.
W
- WebMCP
- API navigateur en cours de spécification (document.modelContext) permettant à une page web d'exposer des tools qu'un agent IA embarqué dans le navigateur peut découvrir et appeler directement, sans passer par le DOM.
X
- XSS
- Cross-Site Scripting : faille de sécurité où du contenu non fiable est exécuté comme du code (souvent JavaScript) dans le navigateur d'un utilisateur — risque renouvelé quand une sortie de LLM est affichée sans échappement.
É
- Écriture atomique
- Écriture d'un fichier via un renommage (rename/replace) atomique du système de fichiers plutôt qu'un write direct, pour garantir qu'un crash en cours d'écriture ne laisse jamais un fichier à moitié écrit.