RAG, mémoire et inférence
Comment un LLM se souvient, cherche et calcule — du mécanisme d'inférence au choix RAG vs finetuning.
-
1
Concept
Inférence LLM : la mécanique
Un LLM ne répond pas d'un bloc : il prédit un token, l'ajoute au contexte, recommence. Prefill, decode, cache KV, échantillonnage — le mécanisme qui explique le coût, la latence et les quotas d'une API LLM.
-
2
Concept
Cache KV en production
Au-delà du principe : comment un serveur d'inférence fait tenir des dizaines de caches KV concurrents dans une VRAM commune — PagedAttention, partage de préfixe entre requêtes, éviction et cache quantifié.
-
3
Concept
RAG vs tool use direct
Le RAG naïf et le tool use direct résolvent des problèmes proches mais pas identiques. Comparaison côte à côte et conseils pour choisir selon ton volume de données et tes besoins de fraîcheur.
-
4
Tutoriel
Embeddings sans vector DB
Pinecone ou Qdrant pour 5 000 documents, c'est de l'over-engineering. Stocker les vecteurs en MySQL et faire la similarité cosinus en SQL ou PHP : quand ça suffit, et le code.
-
5
Concept
Cache sémantique pour LLM
Cacher les réponses LLM par similarité d'embedding plutôt que par clé exacte : gros gains de coût, mais des pièges réels. Quand l'utiliser, quand l'éviter.
-
6
Concept
Finetuning vs RAG
Deux façons d'adapter un LLM à ton contexte : injecter du contexte au moment de la requête (RAG), ou modifier ses poids via des adapters LoRA. Le mécanisme diffère, et ça change tout sur quand utiliser lequel.