Concept

Quantiser un modèle LLM

Ce que veut dire réduire la précision numérique des poids d'un modèle de 16 à 4 bits, pourquoi ça ne détruit pas la qualité, et le compromis réel entre empreinte mémoire, débit et perplexité.

Concept

Recherche vectorielle : ANN

Pourquoi comparer un vecteur requête à des millions d'embeddings un par un ne passe pas à l'échelle, et comment les index approximatifs IVF et HNSW retrouvent les plus proches voisins en temps sub-linéaire au prix d'un rappel imparfait.

Concept

Température et sampling

Ce qui se passe entre le dernier calcul du modèle et le token affiché : logits, softmax, température, top-k et top-p. Pourquoi une température à zéro n'est pas vraiment déterministe et comment régler ces paramètres selon la tâche.

Concept

Tokenization et BPE

Pourquoi un LLM lit des tokens et pas des mots, comment l'algorithme BPE construit son vocabulaire en fusionnant les paires les plus fréquentes d'un corpus, et ce que ce découpage change pour le coût, la fenêtre de contexte et les langues autres que l'anglais.

Concept

WebMCP : exposer un tool

WebMCP expose des tools JavaScript directement depuis une page web à un agent du navigateur, sans passer par le DOM ni un serveur MCP. Le flux complet, la mécanique de registerTool, et les limites de sécurité à connaître avant de l'utiliser en prod.

Concept

Sandboxer les tool calls

Une fois que le LLM a décidé d'appeler un tool avec certains arguments, tout se joue dans le code qui exécute cette décision. Trois couches concrètes en PHP : dispatch fermé, validation du schéma, isolation par processus.

Concept

Cache KV en production

Au-delà du principe : comment un serveur d'inférence fait tenir des dizaines de caches KV concurrents dans une VRAM commune — PagedAttention, partage de préfixe entre requêtes, éviction et cache quantifié.

Concept

Inférence LLM : la mécanique

Un LLM ne répond pas d'un bloc : il prédit un token, l'ajoute au contexte, recommence. Prefill, decode, cache KV, échantillonnage — le mécanisme qui explique le coût, la latence et les quotas d'une API LLM.

Concept

Finetuning vs RAG

Deux façons d'adapter un LLM à ton contexte : injecter du contexte au moment de la requête (RAG), ou modifier ses poids via des adapters LoRA. Le mécanisme diffère, et ça change tout sur quand utiliser lequel.