AI-901 · Concepts et capacités de l'IA

Concepts et capacités de l'IA : 12 questions AI-901 corrigées

« Concepts et capacités de l'IA » est l'un des 2 domaines évalués à l'examen Microsoft AI-901. Voici 12 questions de ce domaine, chacune avec sa bonne réponse et son explication.

12 questions corrigées ici213 sur ce domaine dans la préparation500 pour toute la AI-901

Masque les réponses pour te tester avant de lire les corrigés.
  1. 1. Quelle est la source de biais la plus fréquente dans un modèle d'apprentissage automatique ?

    • Un nombre trop élevé de couches dans le réseau
    • Des données d'entraînement non représentatives
    • Un temps d'entraînement trop court sur le jeu de test
    • Une infrastructure de calcul mal dimensionnée

    Réponse : Des données d'entraînement non représentatives

    Le biais vient surtout des données : si un groupe est sous-représenté ou si l'historique reflète des décisions discriminatoires, le modèle les reproduit. L'architecture ou le matériel n'y changent rien.

  2. 2. Comment vérifier concrètement qu'un modèle de classification traite équitablement les différents groupes de population ?

    • En mesurant la précision globale sur le jeu de test
    • En augmentant la taille totale du jeu d'entraînement
    • En vérifiant le temps de réponse du service déployé
    • En comparant les taux d'erreur groupe par groupe

    Réponse : En comparant les taux d'erreur groupe par groupe

    L'équité s'évalue par groupe et non globalement : une précision globale élevée peut masquer un taux d'erreur bien plus fort sur une minorité, invisible dans une métrique agrégée.

  3. 3. Quel outil open source est conçu pour évaluer et atténuer les problèmes d'équité d'un modèle ?

    • Fairlearn
    • InterpretML
    • ONNX Runtime
    • TensorBoard

    Réponse : Fairlearn

    Fairlearn et non InterpretML : Fairlearn mesure les disparités entre groupes et propose des méthodes d'atténuation, alors qu'InterpretML sert à expliquer les prédictions, ce qui relève de la transparence.

  4. 4. Une équipe découvre que son modèle de détection de fraude signale à tort beaucoup plus d'opérations pour les clients d'une région donnée. Quelle action traite la cause la plus probable ?

    • Augmenter le seuil de décision pour tous les clients
    • Déployer le modèle sur une infrastructure plus puissante
    • Rééquilibrer les données et réévaluer par groupe
    • Chiffrer les transactions avant de les envoyer au modèle

    Réponse : Rééquilibrer les données et réévaluer par groupe

    Le déséquilibre des données est la cause probable : il faut compléter les exemples du groupe concerné puis mesurer l'erreur par groupe. Relever le seuil pour tous masque l'écart au lieu de le corriger.

  5. 5. Pourquoi le simple retrait de l'attribut « genre » d'un jeu de données ne garantit-il pas l'équité du modèle ?

    • Parce que le modèle a besoin de cet attribut pour être précis
    • Parce que d'autres variables corrélées jouent le même rôle
    • Parce que l'attribut reste stocké dans les journaux du service
    • Parce que la suppression d'une colonne fausse l'entraînement

    Réponse : Parce que d'autres variables corrélées jouent le même rôle

    Des variables proxy comme le métier, les loisirs ou le code postal restent corrélées à l'attribut retiré et permettent au modèle de le reconstituer : il faut mesurer les écarts par groupe, pas seulement masquer.

  6. 6. Un modèle est entraîné sur dix ans de décisions d'embauche d'une entreprise qui recrutait surtout des hommes aux postes techniques. Quel risque cela crée-t-il ?

    • Le modèle deviendra instable dès la première mise à jour
    • Le modèle exposera les données personnelles des candidats
    • Le modèle sera plus lent à répondre pour certains profils
    • Le modèle reproduira le déséquilibre historique observé

    Réponse : Le modèle reproduira le déséquilibre historique observé

    C'est un biais historique : le modèle apprend la discrimination passée et la reconduit. Ce n'est pas un problème de confidentialité, qui concernerait l'exposition des données des candidats.

  7. 7. Que signifie « atténuer un biais » dans un projet d'IA ?

    • Réduire les écarts de traitement mesurés entre les groupes
    • Supprimer définitivement toute erreur de prédiction du modèle
    • Empêcher tout accès non autorisé aux jeux de données bruts
    • Réduire le temps d'entraînement pour limiter les coûts

    Réponse : Réduire les écarts de traitement mesurés entre les groupes

    Atténuer un biais, c'est réduire les disparités mesurées entre groupes, pas atteindre zéro erreur : un modèle peut rester imparfait tout en traitant les groupes de façon comparable.

  8. 8. Un système de reconnaissance faciale affiche une précision nettement plus faible sur les personnes à la peau foncée. Quelle mesure d'atténuation est la plus adaptée ?

    • Réduire la résolution des images pour uniformiser l'entrée
    • Ajouter une étape de chiffrement des images stockées
    • Enrichir le jeu d'entraînement avec des visages variés
    • Augmenter le nombre d'époques d'entraînement du modèle

    Réponse : Enrichir le jeu d'entraînement avec des visages variés

    La disparité vient d'une sous-représentation dans les données : il faut diversifier le jeu d'entraînement puis réévaluer par groupe. Chiffrer les images relève de la confidentialité, pas de l'équité.

  9. 9. À quel moment un audit d'équité apporte-t-il le plus de valeur ?

    • Une fois par an, après réception des plaintes des clients
    • Avant la mise en production, puis régulièrement ensuite
    • Seulement si un régulateur en fait explicitement la demande
    • Uniquement lors de la première collecte des données brutes

    Réponse : Avant la mise en production, puis régulièrement ensuite

    L'équité se vérifie avant le déploiement et se surveille ensuite, car les données réelles évoluent. Attendre les plaintes revient à découvrir le problème une fois le préjudice causé.

  10. 10. D'où peut aussi provenir un biais, même lorsque le jeu de données couvre tous les groupes de façon équilibrée ?

    • De la puissance de calcul allouée à l'entraînement
    • Du format de fichier choisi pour stocker les images
    • De la région Azure dans laquelle le modèle est hébergé
    • Des étiquettes posées par les annotateurs humains

    Réponse : Des étiquettes posées par les annotateurs humains

    L'étiquetage humain transporte les préjugés des annotateurs et devient une source de biais malgré un échantillon équilibré. La région d'hébergement relève, elle, de la confidentialité des données.

  11. 11. Une assurance santé constate que son modèle facture davantage les habitants de certains quartiers, alors que l'origine des assurés n'a jamais été collectée. Quelle explication est la plus plausible ?

    • Le code postal joue le rôle de variable proxy
    • Le modèle mémorise les données de chaque assuré
    • Le modèle manque de puissance de calcul en production
    • Les données ont été chiffrées avant l'entraînement

    Réponse : Le code postal joue le rôle de variable proxy

    Une variable géographique peut être fortement corrélée à une caractéristique protégée et produire une discrimination indirecte. Ce n'est pas de la mémorisation, qui relèverait de la confidentialité.

  12. 12. Quelle différence sépare un problème d'équité d'un problème de fiabilité ?

    • L'équité concerne l'entraînement du modèle, la fiabilité concerne le stockage des données
    • L'équité concerne la vitesse du service, la fiabilité concerne son coût réel
    • L'équité vise les écarts entre groupes, la fiabilité vise la constance du système
    • L'équité vise l'accès au service, la fiabilité vise l'explication des décisions

    Réponse : L'équité vise les écarts entre groupes, la fiabilité vise la constance du système

    Équité et non fiabilité : l'équité compare les résultats obtenus entre groupes, la fiabilité vérifie que le système se comporte de façon constante et sûre, y compris dans des situations inattendues.