Cache sémantique
Cache qui compare les nouvelles requêtes aux précédentes par similarité d'embedding plutôt que par égalité stricte, pour réutiliser une réponse LLM déjà générée sur une question reformulée.
Cache qui compare les nouvelles requêtes aux précédentes par similarité d'embedding plutôt que par égalité stricte, pour réutiliser une réponse LLM déjà générée sur une question reformulée.