ArXiv cs.AI publie un volume de pré-prints impossible à suivre en entier. Je scanne les titres, je ne lis en détail que ce que des voix de confiance (Karpathy, Sebastian Raschka) relaient et expliquent — c'est un filtre imparfait mais nécessaire.

Le filtre qui fonctionne

La méthode la plus fiable que j'ai trouvée : ignorer 95% du volume brut d'ArXiv et attendre que quelqu'un comme Karpathy ou Raschka écrive une explication accessible d'un papier qui compte vraiment. Le signal-to-noise gagné est énorme, au prix d'un léger décalage temporel — acceptable pour un praticien qui n'a pas besoin d'être à la pointe absolue.

Les thèmes qui reviennent ce trimestre

ThèmePourquoi ça compte pour un praticien
Efficacité d'inférence (quantization, distillation)Impact direct sur le coût et la latence en prod
Techniques d'entraînement (fine-tuning léger, LoRA et dérivés)Rend le fine-tuning accessible sans budget de lab
Évaluation (limites des benchmarks classiques)Justifie de construire ses propres évals, voir Tester un appel LLM
Architectures alternatives au Transformer classiqueIntéressant mais encore loin de la prod — à suivre, pas à adopter
Ce n'est pas un état de l'art académique, c'est un filtre pratique : qu'est-ce qui va probablement se retrouver dans une API que j'utilise dans les 12 prochains mois.

Là où la recherche recoupe des articles déjà publiés ici

Deux exemples concrets où une idée de recherche a fini par devenir une pratique d'ingénierie documentée sur ce blog : les techniques d'embeddings efficaces derrière Embeddings sans vector DB, et les stratégies de cache qui s'appuient sur des travaux de similarité sémantique dans Cache sémantique pour LLM. La recherche met des années à devenir une ligne de code triviale — mais elle y arrive.

FAQ

Faut-il lire les papiers ArXiv en entier pour rester à jour ?

Non, pour un praticien c'est contre-productif. Scanner les titres et suivre des relais fiables (Karpathy, Raschka) donne un meilleur rapport temps/information.

Les nouvelles architectures alternatives au Transformer vont-elles remplacer l'existant bientôt ?

Rien ne l'indique à court terme — elles restent au stade recherche, sans adoption en production significative pour l'instant.

Le fine-tuning léger (LoRA et dérivés) est-il accessible sans budget de lab ?

Oui, c'est justement l'apport principal de ces techniques : rendre l'adaptation d'un modèle possible avec des ressources de calcul modestes.