Tutoriel

Agent async multi-outils

Exécuter plusieurs tool calls Python en parallèle avec asyncio.gather() : handlers async, gestion des exceptions par coroutine, et pourquoi le client API doit lui aussi devenir async.

Tutoriel

Mémoire multi-tour en Python

Persister l'historique d'une conversation multi-tour et gérer sa croissance : fenêtre glissante, résumé périodique, et l'impact sur le cache de contexte.

Actualité

Sandboxing : place aux microVM

Simon Willison a fait tester à Claude smolvm, une sandbox à base de microVM (libkrun) pour du code non fiable : démarrage à froid en 1,5 s, à chaud en 50 ms. De quoi rebattre l'arbitrage isolation/latence pour les tools qui exécutent du code généré par un LLM.

Tutoriel

Tester un agent IA en Python

Séparer ce qui est testable de ce qui ne l'est pas dans un agent : tools purs en unitaire, boucle multi-tours avec un client factice, jamais d'appel API réel en CI.

Concept

WebMCP : exposer un tool

WebMCP expose des tools JavaScript directement depuis une page web à un agent du navigateur, sans passer par le DOM ni un serveur MCP. Le flux complet, la mécanique de registerTool, et les limites de sécurité à connaître avant de l'utiliser en prod.

Concept

Sandboxer les tool calls

Une fois que le LLM a décidé d'appeler un tool avec certains arguments, tout se joue dans le code qui exécute cette décision. Trois couches concrètes en PHP : dispatch fermé, validation du schéma, isolation par processus.

Tutoriel

Exposer une vraie DB via MCP

Après le serveur minimal et les principes de sécurité, le dernier maillon du parcours MCP : brancher un tool sur une vraie base MySQL sans transformer le LLM en accès SQL arbitraire.

Concept

Cache KV en production

Au-delà du principe : comment un serveur d'inférence fait tenir des dizaines de caches KV concurrents dans une VRAM commune — PagedAttention, partage de préfixe entre requêtes, éviction et cache quantifié.

Concept

Inférence LLM : la mécanique

Un LLM ne répond pas d'un bloc : il prédit un token, l'ajoute au contexte, recommence. Prefill, decode, cache KV, échantillonnage — le mécanisme qui explique le coût, la latence et les quotas d'une API LLM.