Aller au contenu
Kudos AI

Recherche

Où se situe la frontière, et comment on y est arrivé. Un tableau épinglé de problèmes ouverts sur lesquels le domaine travaille activement, suivi des articles fondateurs qui en ont posé les fondements.

Problèmes ouverts aujourd’hui

La frontière

Des questions vivantes, à l’échelle du domaine, qui restent véritablement non résolues. Chacune est un endroit où une contribution soignée pourrait encore faire avancer la discipline.

Apprentissage profondStatistique

Pourquoi les réseaux surparamétrés généralisent

Pourquoi les réseaux de neurones comptant bien plus de paramètres que d’exemples d’entraînement généralisent-ils correctement, alors que la théorie classique prédit un surapprentissage sévère ?

Le compromis biais-variance affirme qu’un modèle assez souple pour interpoler ses données d’entraînement devrait souffrir d’une variance désastreuse. Les réseaux modernes ajustent pourtant leur jeu d’entraînement à la perfection tout en généralisant, et l’erreur de test peut même redescendre au-delà du point d’interpolation au lieu de continuer à croître. Les explications invoquent une régularisation implicite de la descente de gradient, la géométrie du paysage de perte, ou la structure des données réelles, mais aucune n’a tranché la question. Tant qu’elle reste ouverte, on ne sait pas prédire quelle taille de modèle un jeu de données peut supporter, et la capacité se choisit empiriquement.

Apprentissage profondIA générative

Une théorie fondamentale des lois d’échelle

Pourquoi la performance d’un modèle s’améliore-t-elle selon une loi de puissance régulière en fonction des paramètres, des données et du calcul, et qu’est-ce qui détermine les exposants ?

La régularité empirique est assez robuste pour orienter des décisions d’entraînement à plusieurs millions, mais elle repose sur un ajustement de courbe et non sur une dérivation. Sans théorie, les exposants ne peuvent être prédits pour une nouvelle architecture ou un nouveau domaine, et rien ne permet de savoir si une tendance se poursuivra ou se rompra. Une dérivation transformerait la décision de planification la plus lourde du domaine, aujourd’hui une extrapolation, en un calcul.

Apprentissage profondIA générative

Interprétabilité mécaniste des grands modèles

Le calcul effectué par un grand réseau entraîné peut-il être rétro-analysé en algorithmes compréhensibles par un humain ?

Un réseau entraîné est un très grand tableau de poids dont on sait qu’il calcule quelque chose d’utile, sans aucune explication du comment. Des progrès réels ont été réalisés sur l’identification de circuits et de caractéristiques interprétables dans de petits modèles, mais une même unité encode fréquemment plusieurs concepts sans rapport, ce qui empêche une lecture directe. Sans interprétabilité, rien ne permet de vérifier qu’un modèle s’appuie sur une structure légitime plutôt que sur une corrélation fallacieuse, ce qui importe dès que les enjeux sont élevés.

Théorie des jeuxMathématiques

Le coût computationnel du calcul des équilibres

Nash a prouvé qu’un équilibre existe toujours, mais quelle est la difficulté d’en trouver un effectivement, et qu’est-ce que cela implique pour l’équilibre comme concept prédictif ?

Existence et calculabilité sont deux propriétés distinctes. On sait désormais que calculer un équilibre de Nash est complet pour la classe de complexité PPAD, ce qui indique fortement qu’aucun algorithme efficace général n’existe. Cela soulève une question sur le concept lui-même : si les joueurs modélisés ne pouvaient pas calculer l’équilibre en pratique, on voit mal pourquoi leur comportement devrait l’atteindre. La tension entre existence, calculabilité et pertinence prédictive demeure non résolue.

Apprentissage par renforcementApprentissage automatique

Apprentissage par renforcement économe en échantillons

Comment un agent peut-il apprendre un comportement efficace à partir d’une quantité réaliste d’expérience, et la transférer lorsque l’environnement change ?

Les agents d’apprentissage par renforcement nécessitent couramment des millions d’interactions pour maîtriser des tâches qu’un humain acquiert en quelques essais, ce qui cantonne largement les succès à la simulation, où l’expérience est bon marché. Deux obstacles se cumulent : des récompenses éparses font que le signal informatif n’atteint que lentement les décisions initiales, et les politiques apprises dans un environnement se dégradent souvent fortement quand la dynamique change. Combler cet écart sépare les méthodes actuelles d’un déploiement fiable dans le monde physique.

Apprentissage profondVision par ordinateur

Robustesse aux perturbations adverses

Pourquoi des modèles précis se laissent-ils tromper par de minuscules perturbations choisies délibérément, et peut-on obtenir la robustesse sans sacrifier la précision ?

Des perturbations bien trop faibles pour être perçues par une personne peuvent inverser complètement une classification confiante, ce qui signifie qu’une précision moyenne élevée n’implique pas que le modèle ait appris ce qu’un humain appellerait le concept. Les défenses ont eu tendance à céder face à des attaques ultérieures plus fortes, et certains résultats suggèrent une tension réelle entre robustesse et précision sur données propres. La question est à la fois pratique, pour tout déploiement sensible à la sécurité, et conceptuelle, puisqu’elle laisse penser que ces modèles généralisent autrement que leur précision ne le suggère.

Apprentissage automatiqueProbabilité

Apprendre la structure causale à partir de l’observation

Les modèles peuvent-ils apprendre une structure causale, et non une simple corrélation, à partir de données rarement issues d’expériences contrôlées ?

Les modèles prédictifs capturent l’association, ce qui suffit tant que le monde reste tel qu’il était à l’entraînement et cesse de suffire dès qu’une intervention a lieu. Répondre à ce qui se produirait si une variable était modifiée exige une structure causale, laquelle n’est généralement pas identifiable à partir de données observationnelles sans hypothèses supplémentaires. Déterminer quelles hypothèses sont à la fois plausibles et suffisantes reste une question ouverte, et c’est ce qui sépare les modèles qui prédisent de ceux qui éclairent une décision.

IA générativeApprentissage profond

Attention efficace sur de longs contextes

Peut-on éviter le coût quadratique de l’auto-attention sans perdre la capacité de relier directement deux positions quelconques ?

L’auto-attention compare chaque position à toutes les autres, si bien que le coût croît comme le carré de la longueur de séquence, ce qui constitue la contrainte majeure sur la taille du contexte. De nombreuses alternatives, motifs d’attention creux, approximations linéaires, modèles récurrents à espace d’états, réduisent le coût asymptotique, mais abandonnent généralement une part de cet accès non restreint entre paires de positions qui fait l’efficacité de l’attention. Savoir si la capacité complète peut être conservée à moindre coût reste ouvert.

Articles fondateurs

Les fondements

Chaque article est résumé, replacé dans son contexte et relié à des analyses approfondies et à des entrées de référence : pourquoi il a compté, pas seulement ce qu’il disait.

  1. 1936Alan Turing

    On Computable Numbers, with an Application to the Entscheidungsproblem

    Introduit une machine abstraite qui lit et écrit des symboles sur un ruban selon une table finie de règles, et s’en sert pour montrer qu’aucune procédure générale ne peut décider si un programme quelconque s’arrête.

    MathématiquesIntelligence artificielleProgrammation
  2. 1948Claude E. Shannon

    A Mathematical Theory of Communication

    Définit quantitativement l’information, introduit l’entropie comme mesure de l’incertitude d’une source, et démontre des limites à la compression sans perte et à la transmission fiable sur un canal bruité.

    Théorie de l'informationProbabilitéMathématiques
  3. 1950John Nash

    Equilibrium Points in N-Person Games

    Démontre que tout jeu fini, quel que soit le nombre de joueurs, possède au moins un point d’équilibre, pourvu que les joueurs puissent employer des stratégies mixtes.

    Théorie des jeuxMathématiques
  4. 1950Claude E. Shannon

    Programming a Computer for Playing Chess

    Expose comment une machine pourrait jouer aux échecs : représenter les positions, engendrer les coups légaux, explorer l’arbre de jeu par minimax, et évaluer les positions non terminales par une fonction de score heuristique.

    Recherche et planificationThéorie des jeuxIntelligence artificielle
  5. 1950Alan Turing

    Computing Machinery and Intelligence

    Propose de remplacer la question « les machines peuvent-elles penser ? » par un test comportemental, dans lequel un interrogateur tente de distinguer une machine d’un humain par conversation écrite.

    Intelligence artificielle
  6. 1957Frank Rosenblatt

    The Perceptron: A Perceiving and Recognizing Automaton

    Introduit le perceptron, une unité entraînable qui calcule une somme pondérée de ses entrées et s’active si la somme dépasse un seuil, avec une règle d’ajustement des poids à partir d’exemples étiquetés.

    Apprentissage automatiqueApprentissage profondIntelligence artificielle
  7. 1967John C. Harsanyi

    Games with Incomplete Information Played by Bayesian Players

    Montre comment des jeux où les joueurs sont incertains des gains les uns des autres peuvent être transformés en jeux à information complète mais imparfaite, en dotant chaque joueur d’un « type » tiré au sort.

    Théorie des jeuxProbabilité
  8. 1968Peter E. Hart, Nils J. Nilsson, Bertram Raphael

    A Formal Basis for the Heuristic Determination of Minimum Cost Paths

    Introduit l’algorithme A*, qui ordonne la recherche par la somme du coût déjà engagé et d’une estimation heuristique du coût restant, et démontre son optimalité lorsque l’heuristique ne surestime jamais.

    Recherche et planificationIntelligence artificielle
  9. 1984Leo Breiman, Jerome Friedman, Richard A. Olshen, Charles J. Stone

    Classification and Regression Trees

    Établit la méthodologie CART : faire croître un arbre de décision en choisissant récursivement la division qui améliore le plus la pureté des nœuds, puis l’élaguer à l’aide de données mises de côté.

    Apprentissage automatiqueStatistique
  10. 1986David E. Rumelhart, Geoffrey E. Hinton, Ronald J. Williams

    Learning Internal Representations by Error Propagation

    Présente la rétropropagation comme méthode générale d’entraînement des réseaux multicouches, en montrant que les couches cachées peuvent apprendre des représentations internes utiles au lieu de devoir être conçues à la main.

    Apprentissage profondApprentissage automatiqueOptimisation
  11. 1989Christopher J. C. H. Watkins

    Models of Delayed Reinforcement Learning

    Développe le Q-learning, un algorithme qui estime directement la valeur de chaque action dans chaque état à partir de l’expérience, sans exiger de modèle des probabilités de transition de l’environnement.

    Apprentissage par renforcementApprentissage automatique
  12. 1995Corinna Cortes, Vladimir N. Vapnik

    Support-Vector Networks

    Introduit la machine à vecteurs de support à marge souple, qui sépare les classes par la marge la plus large possible tout en autorisant des violations bornées, et utilise des noyaux pour obtenir des frontières non linéaires.

    Apprentissage automatiqueOptimisationMathématiques
  13. 1996Leo Breiman

    Bagging Predictors

    Introduit l’agrégation bootstrap : ajuster un modèle sur de nombreux rééchantillons bootstrap des données d’entraînement et moyenner les prédictions, ce qui réduit la variance sans augmenter le biais.

    Apprentissage automatiqueStatistique
  14. 2015Rico Sennrich, Barry Haddow, Alexandra Birch

    Neural Machine Translation of Rare Words with Subword Units

    Adapte le codage par paires d’octets à la segmentation du texte, en construisant un vocabulaire sous-lexical par fusion répétée de la paire de symboles adjacents la plus fréquente, de sorte que les mots rares se décomposent en fragments connus.

    Traitement du langage naturelApprentissage profond
  15. 2017Ashish Vaswani et al.

    Attention Is All You Need

    Introduit le transformeur, une architecture bâtie entièrement sur des couches d’attention et de propagation avant, sans récurrence, développée à l’origine pour la traduction automatique.

    IA générativeApprentissage profondTraitement du langage naturel
  16. 2018Jacob Devlin et al.

    BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding

    Préentraîne un encodeur transformeur à prédire des tokens masqués en utilisant le contexte des deux côtés, puis affine le même modèle sur des tâches en aval avec une petite tête spécifique.

    Traitement du langage naturelApprentissage profondIA générative
  17. 2020Tom B. Brown et al.

    Language Models are Few-Shot Learners

    Décrit GPT-3 et montre qu’un modèle de langue décodeur seul suffisamment grand peut accomplir de nouvelles tâches à partir d’une poignée d’exemples fournis dans son invite, sans aucune mise à jour de gradient.

    IA générativeTraitement du langage naturelApprentissage profond
  18. 2020Alexey Dosovitskiy et al.

    An Image is Worth 16x16 Words: Transformers for Image Recognition at Scale

    Applique un transformeur standard directement aux images en découpant chaque image en imagettes de taille fixe et en traitant la suite d’imagettes comme des tokens, sans aucune convolution.

    Vision par ordinateurApprentissage profondIA générative