Trois types courants de stratégies d'apprentissage automatique

Bas Rottier

L'apprentissage supervisé, l'apprentissage non supervisé et l'apprentissage par renforcement se situent dans le domaine de l'apprentissage machine. Il s’agit de types de stratégies d'apprentissage d'un algorithme. Bien que ces méthodes aient le même objectif (parvenir à obtenir des enseignements, des modèles et des relations pouvant être utilisés pour la prise de décisions) elles utilisent des approches différentes et s’utilisent dans des applications bien distinctes.

Dans l'apprentissage automatique, une machine (ordinateur) est formée pour voir des relations. Cela peut se faire de diverses manières. Supposons par exemple que vous deviez assembler une table et une chaise que vous avez achetées en ligne. Comment allez-vous faire ? Vous allez bien entendu consulter le mode d'emploi fourni. Vous suivez les instructions et vous montez le tout. Si aucun mode d'emploi n'est disponible, vous devrez trouver comment assembler la table et la chaise. Ce scénario est similaire à l'apprentissage automatique. Avec un ensemble de données disponibles et une problématique concrète, un programmeur pourra choisir comment élaborer un algorithme en utilisant une stratégie d'apprentissage spécifique. Il existe différents types de stratégies pour l'apprentissage machine. Les trois suivantes sont les plus importantes : apprentissage supervisé (supervised learning), apprentissage non supervisé (unsupervised learning) et apprentissage par renforcement (reinforcement learning).

Apprentissage supervisé

Le modèle d'apprentissage supervisé est comparable à la situation d’un élève supervisé par un enseignant pendant un cours de mathématiques. Pendant la résolution d'un problème, l’enseignant donne des exemples. Cette situation est similaire à celle d'un algorithme d'apprentissage supervisé : en fournissant des entrées sous la forme d'un ensemble de données étiquetées, un modèle peut en tirer des enseignements. Un ensemble de données étiqueté signifie que pour chaque ensemble de données, une réponse ou une solution est également disponible. Ceci doit aider le modèle à apprendre et donc faciliter l'obtention d'un résultat.

Par exemple, un ensemble de données étiquetées d'images d'animaux indiquerait au modèle si l'image représente un chien, un chat, etc. Le modèle reçoit ainsi une formation et, à chaque fois qu'une nouvelle image apparaît pour le modèle, il peut comparer cette image avec l'ensemble de données étiquetées pour prédire l'étiquette correcte. De cette façon, la machine apprend à établir des relations entre entrée et sortie. Au fil du temps, elle fera de moins en moins d'erreurs et sera finalement capable de produire le résultat adéquat sur la base de nouvelles entrées.

Pour quels problèmes peut-il être utilisé ?

Les algorithmes contrôlés peuvent appliquer ce qu’ils ont appris dans le passé à de nouvelles données. Cette méthode s’utilise donc souvent dans des applications où les données historiques permettent de prédire les événements futurs.

L'apprentissage supervisé peut être utilisé pour deux grands types de problèmes : les problèmes de classification et les problèmes de régression. Les problèmes de classification exigent que l'algorithme prédise une valeur discrète capable d’identifier les données d'entrée comme appartenant à une classe ou à un groupe particulier. Dans notre exemple de l'ensemble de données des images d'animaux, chaque image a été étiquetée comme étant un chien, un chat, etc. L'algorithme doit ensuite classer les nouvelles images dans une de ces catégories étiquetées.

Les problèmes de régression sont liés aux données continues, par exemple pour prévoir le prix d'un terrain dans une ville, une région précise, un endroit précis, etc. Ici, l'entrée est envoyée à la machine pour prédire le prix en fonction de cas précédents. La machine détermine une fonction qui détermine les relations entre les caractéristiques de l’endroit et le prix.

Apprentissage non supervisé

Dans l'apprentissage supervisé, l'ensemble de données est clairement étiqueté. Une quantité de données est donc disponible pour l’entraînement de l'algorithme. C'est ce qui fait la grande différence entre l'apprentissage supervisé et l'apprentissage non supervisé. Dans ce second cas, aucun ensemble de données complet et clairement étiqueté n’est disponible. L'apprentissage non supervisé est en effet une sorte d'apprentissage auto-organisé qui aide à trouver des modèles inconnus dans des ensembles de données, sans étiquettes ou exemples préexistants. C’est à l'algorithme de découvrir une structure dans l'entrée. Au cours de ce processus, la machine divisera l'entrée en catégories d'éléments possédant des données très similaires.

Utilisation de l'apprentissage non supervisé

Pour les algorithmes d'apprentissage non supervisés, un modèle reçoit un ensemble de données sans instructions. On ne sait pas exactement ce que le modèle doit produire comme résultat. Il se peut qu'il existe une sorte de relation entre les données de l'ensemble de données, que le modèle tente de déterminer en rassemblant les données dans des groupes d'exemples similaires.

Revenons à l'exemple des images d'animaux. Supposons qu'aucun ensemble de données étiquetées ne soit disponible. Comment le modèle peut-il donc déterminer si un animal est un chat, un chien ou un oiseau ? Si le modèle comporte des informations, par exemple si un animal a des plumes, un bec, des ailes, ... c'est un oiseau. De même, s'il a un pelage duveteux, des oreilles pendantes, une queue courbée et peut-être quelques taches, c’est qu’il s’agit d’un chien. Sur la base de ces informations, le modèle peut distinguer correctement les animaux.

L'apprentissage non supervisé est utilisé pour des données qui n'ont pas obtenu d'étiquettes dans le passé. Par exemple, il peut utiliser ces données pour identifier des segments de clientèle présentant des caractéristiques similaires, ce qui peut être utile pour une campagne de marketing. Ces algorithmes sont également utilisés pour recommander des articles.

 

Apprentissage supervisé

Apprentissage non supervisé

Méthode

Les variables d'entrée et de sortie sont fournies.

Seules les données d'entrée sont fournies.

Objectif

La sortie est prédite via l'ensemble de données d'entrée étiqueté.

La sortie est prédite sur la base de modèles dans l'ensemble de données d'entrée.

Différence entre apprentissage supervisé et apprentissage non supervisé
(Source : Intellipaat)

Apprentissage par renforcement

L'apprentissage par renforcement n'est pas basé sur un apprentissage supervisé ni sur un apprentissage non supervisé. Les algorithmes apprennent à réagir d'eux-mêmes à un environnement. C'est une sorte d'apprentissage basé sur l'interaction d'un agent avec l'environnement par le biais d'actions. Ce type de stratégie d'apprentissage prend de l'ampleur. On voit apparaître de multiples algorithmes d'apprentissage qui peuvent être utilisés pour un grand nombre d’applications.

Pour commencer, il y a toujours un statut de début et un statut de fin pour l'agent (un système piloté par IA). Comme dans un labyrinthe, il peut toutefois exister différents chemins pour atteindre ce statut final. Dans ce scénario, l'apprentissage par renforcement permet de trouver une solution à un problème. L'apprentissage par renforcement est souvent utilisé pour la robotique, les jeux et la navigation. À titre d’exemple, citons les aspirateurs autoguidés, les voitures autonomes, la planification d'ascenseurs, etc.

Principe

Prenons l'exemple d'un enfant qui tente de faire ses premiers pas. Quelles instructions va-t-il suivre pour commencer à marcher ?

  1. Observer d’autres enfants qui marchent et essayer de les imiter
  2. Rester immobile
  3. Essayer d'équilibrer le poids du corps, puis décider quel pied avancer en premier pour commencer à marcher

Apprendre à marcher peut sembler difficile et éprouvant pour un enfant, alors que pour un adulte, c'est facile. Il s’y est habitué avec le temps.

Considérons l'enfant comme un agent qui tente de manipuler l'environnement (surface ou sol) en essayant de marcher et de passer d'un état à un autre (faire un pas). L'enfant reçoit une récompense lorsqu'il fait quelques pas (appréciation), mais il ne reçoit pas de récompense ou d'appréciation s'il n’arrive pas à marcher. L'objectif de l'apprentissage par renforcement est de laisser l'agent choisir des actions qui maximisent la récompense attendue sur une période déterminée. L'agent atteindra plus vite l'objectif en suivant une méthode appropriée. Dans ce modèle d'apprentissage, l'algorithme découvre donc par essais (trial and error) quelles actions sont les plus rentables.

En résumé

Par apprentissage supervisé, nous entendons qu'un modèle apprend par la commande d'un ensemble de données étiquetées. Dans l'apprentissage non supervisé, la machine est formée sur la base de données non étiquetées, sans aucune commande. Dans l'apprentissage par renforcement, une machine ou un agent interagit avec son environnement, réalise des actions et apprend par essais.

 

Apprentissage supervisé

Apprentissage non supervisé

Apprentissage par renforcement

Définition

La machine apprend grâce à l'utilisation de données étiquetées.

La machine est formée grâce à des données non étiquetées, sans commande.

L'agent interagit avec son environnement en effectuant des actions et en apprenant en commettant des erreurs et en recevant des récompenses.

Type de problèmes

Régressions et classification

Reconnaissance de modèles et regroupement

Basé sur la récompense

Type de données

Données étiquetées

Données non étiquetées

Pas de données prédéfinies

Formation

Supervision externe

Pas de supervision

Pas de supervision

Approche

Convertit des entrées étiquetées en sorties connues

Comprend les modèles et découvre la sortie

Suit la méthode d’essais (trial and error)

(Source : Intellipaat)

Source

Auteurs

Vous avez une question ?

Envoyez-la à innovation@sirris.be