Des questions vivantes, à l’échelle du domaine, qui restent véritablement non résolues. Chacune est un endroit où une contribution soignée pourrait encore faire avancer la discipline.
Apprentissage profondStatistique
Pourquoi les réseaux surparamétrés généralisent
Pourquoi les réseaux de neurones comptant bien plus de paramètres que d’exemples d’entraînement généralisent-ils correctement, alors que la théorie classique prédit un surapprentissage sévère ?
Le compromis biais-variance affirme qu’un modèle assez souple pour interpoler ses données d’entraînement devrait souffrir d’une variance désastreuse. Les réseaux modernes ajustent pourtant leur jeu d’entraînement à la perfection tout en généralisant, et l’erreur de test peut même redescendre au-delà du point d’interpolation au lieu de continuer à croître. Les explications invoquent une régularisation implicite de la descente de gradient, la géométrie du paysage de perte, ou la structure des données réelles, mais aucune n’a tranché la question. Tant qu’elle reste ouverte, on ne sait pas prédire quelle taille de modèle un jeu de données peut supporter, et la capacité se choisit empiriquement.
Apprentissage profondIA générative
Une théorie fondamentale des lois d’échelle
Pourquoi la performance d’un modèle s’améliore-t-elle selon une loi de puissance régulière en fonction des paramètres, des données et du calcul, et qu’est-ce qui détermine les exposants ?
La régularité empirique est assez robuste pour orienter des décisions d’entraînement à plusieurs millions, mais elle repose sur un ajustement de courbe et non sur une dérivation. Sans théorie, les exposants ne peuvent être prédits pour une nouvelle architecture ou un nouveau domaine, et rien ne permet de savoir si une tendance se poursuivra ou se rompra. Une dérivation transformerait la décision de planification la plus lourde du domaine, aujourd’hui une extrapolation, en un calcul.
Apprentissage profondIA générative
Interprétabilité mécaniste des grands modèles
Le calcul effectué par un grand réseau entraîné peut-il être rétro-analysé en algorithmes compréhensibles par un humain ?
Un réseau entraîné est un très grand tableau de poids dont on sait qu’il calcule quelque chose d’utile, sans aucune explication du comment. Des progrès réels ont été réalisés sur l’identification de circuits et de caractéristiques interprétables dans de petits modèles, mais une même unité encode fréquemment plusieurs concepts sans rapport, ce qui empêche une lecture directe. Sans interprétabilité, rien ne permet de vérifier qu’un modèle s’appuie sur une structure légitime plutôt que sur une corrélation fallacieuse, ce qui importe dès que les enjeux sont élevés.
Théorie des jeuxMathématiques
Le coût computationnel du calcul des équilibres
Nash a prouvé qu’un équilibre existe toujours, mais quelle est la difficulté d’en trouver un effectivement, et qu’est-ce que cela implique pour l’équilibre comme concept prédictif ?
Existence et calculabilité sont deux propriétés distinctes. On sait désormais que calculer un équilibre de Nash est complet pour la classe de complexité PPAD, ce qui indique fortement qu’aucun algorithme efficace général n’existe. Cela soulève une question sur le concept lui-même : si les joueurs modélisés ne pouvaient pas calculer l’équilibre en pratique, on voit mal pourquoi leur comportement devrait l’atteindre. La tension entre existence, calculabilité et pertinence prédictive demeure non résolue.
Apprentissage par renforcementApprentissage automatique
Apprentissage par renforcement économe en échantillons
Comment un agent peut-il apprendre un comportement efficace à partir d’une quantité réaliste d’expérience, et la transférer lorsque l’environnement change ?
Les agents d’apprentissage par renforcement nécessitent couramment des millions d’interactions pour maîtriser des tâches qu’un humain acquiert en quelques essais, ce qui cantonne largement les succès à la simulation, où l’expérience est bon marché. Deux obstacles se cumulent : des récompenses éparses font que le signal informatif n’atteint que lentement les décisions initiales, et les politiques apprises dans un environnement se dégradent souvent fortement quand la dynamique change. Combler cet écart sépare les méthodes actuelles d’un déploiement fiable dans le monde physique.
Apprentissage profondVision par ordinateur
Robustesse aux perturbations adverses
Pourquoi des modèles précis se laissent-ils tromper par de minuscules perturbations choisies délibérément, et peut-on obtenir la robustesse sans sacrifier la précision ?
Des perturbations bien trop faibles pour être perçues par une personne peuvent inverser complètement une classification confiante, ce qui signifie qu’une précision moyenne élevée n’implique pas que le modèle ait appris ce qu’un humain appellerait le concept. Les défenses ont eu tendance à céder face à des attaques ultérieures plus fortes, et certains résultats suggèrent une tension réelle entre robustesse et précision sur données propres. La question est à la fois pratique, pour tout déploiement sensible à la sécurité, et conceptuelle, puisqu’elle laisse penser que ces modèles généralisent autrement que leur précision ne le suggère.
Apprentissage automatiqueProbabilité
Apprendre la structure causale à partir de l’observation
Les modèles peuvent-ils apprendre une structure causale, et non une simple corrélation, à partir de données rarement issues d’expériences contrôlées ?
Les modèles prédictifs capturent l’association, ce qui suffit tant que le monde reste tel qu’il était à l’entraînement et cesse de suffire dès qu’une intervention a lieu. Répondre à ce qui se produirait si une variable était modifiée exige une structure causale, laquelle n’est généralement pas identifiable à partir de données observationnelles sans hypothèses supplémentaires. Déterminer quelles hypothèses sont à la fois plausibles et suffisantes reste une question ouverte, et c’est ce qui sépare les modèles qui prédisent de ceux qui éclairent une décision.
IA générativeApprentissage profond
Attention efficace sur de longs contextes
Peut-on éviter le coût quadratique de l’auto-attention sans perdre la capacité de relier directement deux positions quelconques ?
L’auto-attention compare chaque position à toutes les autres, si bien que le coût croît comme le carré de la longueur de séquence, ce qui constitue la contrainte majeure sur la taille du contexte. De nombreuses alternatives, motifs d’attention creux, approximations linéaires, modèles récurrents à espace d’états, réduisent le coût asymptotique, mais abandonnent généralement une part de cet accès non restreint entre paires de positions qui fait l’efficacité de l’attention. Savoir si la capacité complète peut être conservée à moindre coût reste ouvert.