ArXiv cs.AI publie un volume de pré-prints impossible à suivre en entier. Je scanne les titres, je ne lis en détail que ce que des voix de confiance (Karpathy, Sebastian Raschka) relaient et expliquent — c'est un filtre imparfait mais nécessaire.
Le filtre qui fonctionne
La méthode la plus fiable que j'ai trouvée : ignorer 95% du volume brut d'ArXiv et attendre que quelqu'un comme Karpathy ou Raschka écrive une explication accessible d'un papier qui compte vraiment. Le signal-to-noise gagné est énorme, au prix d'un léger décalage temporel — acceptable pour un praticien qui n'a pas besoin d'être à la pointe absolue.
Les thèmes qui reviennent ce trimestre
| Thème | Pourquoi ça compte pour un praticien |
|---|---|
| Efficacité d'inférence (quantization, distillation) | Impact direct sur le coût et la latence en prod |
| Techniques d'entraînement (fine-tuning léger, LoRA et dérivés) | Rend le fine-tuning accessible sans budget de lab |
| Évaluation (limites des benchmarks classiques) | Justifie de construire ses propres évals, voir Tester un appel LLM |
| Architectures alternatives au Transformer classique | Intéressant mais encore loin de la prod — à suivre, pas à adopter |
Là où la recherche recoupe des articles déjà publiés ici
Deux exemples concrets où une idée de recherche a fini par devenir une pratique d'ingénierie documentée sur ce blog : les techniques d'embeddings efficaces derrière Embeddings sans vector DB, et les stratégies de cache qui s'appuient sur des travaux de similarité sémantique dans Cache sémantique pour LLM. La recherche met des années à devenir une ligne de code triviale — mais elle y arrive.
FAQ
Faut-il lire les papiers ArXiv en entier pour rester à jour ?
Non, pour un praticien c'est contre-productif. Scanner les titres et suivre des relais fiables (Karpathy, Raschka) donne un meilleur rapport temps/information.
Les nouvelles architectures alternatives au Transformer vont-elles remplacer l'existant bientôt ?
Rien ne l'indique à court terme — elles restent au stade recherche, sans adoption en production significative pour l'instant.
Le fine-tuning léger (LoRA et dérivés) est-il accessible sans budget de lab ?
Oui, c'est justement l'apport principal de ces techniques : rendre l'adaptation d'un modèle possible avec des ressources de calcul modestes.