A

Agent
Système qui utilise un LLM pour décider lui-même des actions à exécuter (appels d'outils, boucle de raisonnement), par opposition à un simple appel LLM qui se contente de répondre.

B

Boucle agentique
Cycle observer → décider → agir répété par un agent jusqu'à résolution de la tâche : le LLM observe le contexte, choisit une action, l'exécute, puis réévalue.

C

Cache KV
Mémoire des vecteurs clé/valeur déjà calculés par un transformer, conservée pour éviter de refaire les calculs d'attention sur les tokens déjà traités à chaque nouveau token généré.
Cache sémantique
Cache qui compare les nouvelles requêtes aux précédentes par similarité d'embedding plutôt que par égalité stricte, pour réutiliser une réponse LLM déjà générée sur une question reformulée.
Confused deputy
Un composant disposant de plus de droits que l'utilisateur final, manipulé pour utiliser ces droits au service d'une instruction malveillante plutôt que légitime — problème classique de sécurité appliqué aux serveurs MCP et aux agents LLM.

E

Embeddings
Représentations vectorielles d'un texte capturant son sens, permettant de comparer des contenus par similarité plutôt que par correspondance exacte de mots — brique de base de la recherche sémantique et du RAG.

F

Fallback
Stratégie consistant à basculer automatiquement vers un modèle ou fournisseur LLM de secours quand le premier choix échoue ou est indisponible, pour garantir la continuité de service.
Fenêtre glissante
Stratégie qui ne conserve que les N éléments les plus récents d'un historique (messages, tokens...), en éjectant les plus anciens au fur et à mesure — simple et sans coût, mais perte totale de ce qui sort de la fenêtre.
Few-shot
Technique de prompting consistant à fournir quelques exemples d'entrée/sortie dans le prompt pour guider le format ou le style de la réponse du LLM, sans entraînement supplémentaire.
Finetuning
Ré-entraînement d'un modèle pré-entraîné sur un jeu de données spécifique pour le spécialiser sur une tâche ou un domaine, par opposition au prompt engineering qui ne modifie pas les poids du modèle.
Fixture
Fonction pytest qui prépare un objet ou un état réutilisable entre plusieurs tests, injectée automatiquement en paramètre des fonctions de test qui la déclarent.

G

Garde-fous
Vérifications placées autour d'un LLM ou d'un agent (filtrage d'entrée, validation de sortie, limites d'action) pour contenir ses erreurs et empêcher les comportements indésirables.

H

Hallucination
Réponse produite par un LLM qui est incorrecte ou inventée mais formulée avec la même assurance qu'une réponse correcte — risque intrinsèque des modèles génératifs à ne jamais négliger en prod.

I

Idempotence
Propriété d'une opération qui produit le même résultat qu'elle soit exécutée une ou plusieurs fois avec les mêmes paramètres — cruciale pour rejouer un appel LLM en toute sécurité après un timeout.
Inférence
Phase où un modèle déjà entraîné génère une sortie à partir d'une entrée, par opposition à l'entraînement — c'est ce qui se passe à chaque appel à un LLM en production.
Injection de dépendances
Pattern qui consiste à passer une dépendance (client API, base de données) en paramètre d'une fonction plutôt que de l'instancier en dur à l'intérieur — ce qui permet de la substituer par une version factice dans les tests.
Injection de prompt
Attaque consistant à faire passer des instructions malveillantes pour du contenu légitime (document, email, page web) afin de détourner le comportement d'un LLM qui les traite.
Injection SQL
Vulnérabilité où une entrée non fiable modifie la structure d'une requête SQL exécutée par l'application, permettant de lire ou modifier des données hors du périmètre prévu.

J

JSON Schema
Format standard décrivant la structure attendue d'un document JSON (types, champs requis) — utilisé pour contraindre et valider la sortie structurée d'un LLM.

L

LLM
Large Language Model : modèle de langage entraîné sur d'énormes volumes de texte pour prédire la suite d'une séquence, capable de générer et comprendre du langage naturel.
LoRA
Low-Rank Adaptation : technique de finetuning qui n'entraîne que de petites matrices additionnelles insérées dans le modèle, au lieu de tous ses poids — beaucoup moins coûteuse en mémoire et en calcul.

M

MCP
Model Context Protocol : protocole standard ouvert permettant à un LLM d'appeler des outils et sources de données externes de façon uniforme, indépendamment du modèle ou du client utilisés.
MicroVM
Machine virtuelle légère (ex. Firecracker) offrant l'isolation matérielle d'une VM classique — noyau dédié, pas de partage avec l'hôte — avec un temps de démarrage proche de celui d'un conteneur.
Multi-modèle
Architecture qui fait appel à plusieurs LLM différents (fournisseurs ou tailles de modèle) selon la tâche, le coût ou la disponibilité, plutôt que de dépendre d'un seul.

O

Observabilité
Capacité à tracer et inspecter après coup le comportement d'un système (appels d'outils, raisonnements intermédiaires, coûts) — indispensable pour déboguer un agent dont le comportement n'est pas entièrement déterministe.

P

PagedAttention
Technique de gestion mémoire du cache KV qui le découpe en pages de taille fixe allouées à la demande, par analogie avec la pagination mémoire d'un système d'exploitation.
Prompt engineering
Pratique consistant à concevoir et affiner la formulation d'un prompt (instructions, exemples, structure) pour obtenir une sortie fiable d'un LLM, sans modifier le modèle lui-même.
Prompt versioning
Pratique consistant à tracer et versionner les prompts en production comme du code (historique, diff, rollback), pour pouvoir mesurer et revenir sur l'effet d'une modification.

Q

QLoRA
Variante de LoRA qui quantifie d'abord le modèle de base (ex. en 4 bits) avant d'y appliquer l'adaptation, permettant de finetuner de gros modèles sur du matériel grand public.
Quantification
Réduction de la précision numérique des poids d'un modèle (ex. de 16 à 4 bits) pour diminuer son empreinte mémoire et accélérer l'inférence, au prix d'une légère perte de qualité.

R

RAG
Retrieval-Augmented Generation : technique consistant à injecter dans le prompt des extraits de documents pertinents (récupérés par recherche) avant de générer la réponse, pour ancrer le LLM sur des données à jour ou privées.
Rate limiting
Limitation du nombre de requêtes autorisées sur une période donnée, imposée par les fournisseurs de LLM (et à répercuter côté application) pour éviter la surcharge et maîtriser les coûts.
Requête préparée
Requête SQL dont la structure est fixée à l'avance, les valeurs variables étant passées comme paramètres séparés plutôt que concaténées — empêche l'injection SQL par construction.
Retry
Nouvelle tentative automatique d'un appel qui a échoué (timeout, erreur réseau, indisponibilité), généralement combinée à un backoff progressif pour ne pas surcharger le service appelé.

S

Sandboxing
Exécution du code ou des actions décidées par un agent dans un environnement isolé et restreint, pour limiter les dégâts possibles en cas d'erreur ou de comportement malveillant.
Sous-agents
Agents spécialisés invoqués par un agent parent pour une sous-tâche précise, permettant de découper un problème complexe en unités indépendantes et testables.
Structured output
Contrainte imposée à un LLM pour que sa sortie respecte un schéma précis (souvent JSON), afin qu'elle soit directement exploitable par du code sans parsing fragile.

T

Température
Paramètre contrôlant le caractère aléatoire des sorties d'un LLM : une valeur basse privilégie la réponse la plus probable, une valeur haute favorise la diversité et la créativité.
Tokens
Unités de texte (mot, fragment de mot ou caractère) qu'un LLM manipule réellement : les prompts et réponses sont mesurés, tarifés et limités en nombre de tokens, pas en caractères.
Top-k
Paramètre de génération qui restreint le choix du prochain token aux k tokens les plus probables, pour contrôler la diversité des réponses indépendamment de la température.

V

Vector DB
Base de données optimisée pour stocker des embeddings et retrouver rapidement les plus proches voisins d'un vecteur donné — brique centrale d'un système RAG.

W

WebMCP
API navigateur en cours de spécification (document.modelContext) permettant à une page web d'exposer des tools qu'un agent IA embarqué dans le navigateur peut découvrir et appeler directement, sans passer par le DOM.

X

XSS
Cross-Site Scripting : faille de sécurité où du contenu non fiable est exécuté comme du code (souvent JavaScript) dans le navigateur d'un utilisateur — risque renouvelé quand une sortie de LLM est affichée sans échappement.

É

Écriture atomique
Écriture d'un fichier via un renommage (rename/replace) atomique du système de fichiers plutôt qu'un write direct, pour garantir qu'un crash en cours d'écriture ne laisse jamais un fichier à moitié écrit.