1. 1
    Concept

    Inférence LLM : la mécanique

    Un LLM ne répond pas d'un bloc : il prédit un token, l'ajoute au contexte, recommence. Prefill, decode, cache KV, échantillonnage — le mécanisme qui explique le coût, la latence et les quotas d'une API LLM.

  2. 2
    Concept

    Cache KV en production

    Au-delà du principe : comment un serveur d'inférence fait tenir des dizaines de caches KV concurrents dans une VRAM commune — PagedAttention, partage de préfixe entre requêtes, éviction et cache quantifié.

  3. 3
    Concept

    RAG vs tool use direct

    Le RAG naïf et le tool use direct résolvent des problèmes proches mais pas identiques. Comparaison côte à côte et conseils pour choisir selon ton volume de données et tes besoins de fraîcheur.

  4. 4
    Tutoriel

    Embeddings sans vector DB

    Pinecone ou Qdrant pour 5 000 documents, c'est de l'over-engineering. Stocker les vecteurs en MySQL et faire la similarité cosinus en SQL ou PHP : quand ça suffit, et le code.

  5. 5
    Concept

    Cache sémantique pour LLM

    Cacher les réponses LLM par similarité d'embedding plutôt que par clé exacte : gros gains de coût, mais des pièges réels. Quand l'utiliser, quand l'éviter.

  6. 6
    Concept

    Finetuning vs RAG

    Deux façons d'adapter un LLM à ton contexte : injecter du contexte au moment de la requête (RAG), ou modifier ses poids via des adapters LoRA. Le mécanisme diffère, et ça change tout sur quand utiliser lequel.