AI-901 · Concepts et capacités de l'IA
Concepts et capacités de l'IA : 12 questions AI-901 corrigées
« Concepts et capacités de l'IA » est l'un des 2 domaines évalués à l'examen Microsoft AI-901. Voici 12 questions de ce domaine, chacune avec sa bonne réponse et son explication.
1. Quelle est la source de biais la plus fréquente dans un modèle d'apprentissage automatique ?
Réponse : Des données d'entraînement non représentatives
Le biais vient surtout des données : si un groupe est sous-représenté ou si l'historique reflète des décisions discriminatoires, le modèle les reproduit. L'architecture ou le matériel n'y changent rien.
2. Comment vérifier concrètement qu'un modèle de classification traite équitablement les différents groupes de population ?
Réponse : En comparant les taux d'erreur groupe par groupe
L'équité s'évalue par groupe et non globalement : une précision globale élevée peut masquer un taux d'erreur bien plus fort sur une minorité, invisible dans une métrique agrégée.
3. Quel outil open source est conçu pour évaluer et atténuer les problèmes d'équité d'un modèle ?
Réponse : Fairlearn
Fairlearn et non InterpretML : Fairlearn mesure les disparités entre groupes et propose des méthodes d'atténuation, alors qu'InterpretML sert à expliquer les prédictions, ce qui relève de la transparence.
4. Une équipe découvre que son modèle de détection de fraude signale à tort beaucoup plus d'opérations pour les clients d'une région donnée. Quelle action traite la cause la plus probable ?
Réponse : Rééquilibrer les données et réévaluer par groupe
Le déséquilibre des données est la cause probable : il faut compléter les exemples du groupe concerné puis mesurer l'erreur par groupe. Relever le seuil pour tous masque l'écart au lieu de le corriger.
5. Pourquoi le simple retrait de l'attribut « genre » d'un jeu de données ne garantit-il pas l'équité du modèle ?
Réponse : Parce que d'autres variables corrélées jouent le même rôle
Des variables proxy comme le métier, les loisirs ou le code postal restent corrélées à l'attribut retiré et permettent au modèle de le reconstituer : il faut mesurer les écarts par groupe, pas seulement masquer.
6. Un modèle est entraîné sur dix ans de décisions d'embauche d'une entreprise qui recrutait surtout des hommes aux postes techniques. Quel risque cela crée-t-il ?
Réponse : Le modèle reproduira le déséquilibre historique observé
C'est un biais historique : le modèle apprend la discrimination passée et la reconduit. Ce n'est pas un problème de confidentialité, qui concernerait l'exposition des données des candidats.
7. Que signifie « atténuer un biais » dans un projet d'IA ?
Réponse : Réduire les écarts de traitement mesurés entre les groupes
Atténuer un biais, c'est réduire les disparités mesurées entre groupes, pas atteindre zéro erreur : un modèle peut rester imparfait tout en traitant les groupes de façon comparable.
8. Un système de reconnaissance faciale affiche une précision nettement plus faible sur les personnes à la peau foncée. Quelle mesure d'atténuation est la plus adaptée ?
Réponse : Enrichir le jeu d'entraînement avec des visages variés
La disparité vient d'une sous-représentation dans les données : il faut diversifier le jeu d'entraînement puis réévaluer par groupe. Chiffrer les images relève de la confidentialité, pas de l'équité.
9. À quel moment un audit d'équité apporte-t-il le plus de valeur ?
Réponse : Avant la mise en production, puis régulièrement ensuite
L'équité se vérifie avant le déploiement et se surveille ensuite, car les données réelles évoluent. Attendre les plaintes revient à découvrir le problème une fois le préjudice causé.
10. D'où peut aussi provenir un biais, même lorsque le jeu de données couvre tous les groupes de façon équilibrée ?
Réponse : Des étiquettes posées par les annotateurs humains
L'étiquetage humain transporte les préjugés des annotateurs et devient une source de biais malgré un échantillon équilibré. La région d'hébergement relève, elle, de la confidentialité des données.
11. Une assurance santé constate que son modèle facture davantage les habitants de certains quartiers, alors que l'origine des assurés n'a jamais été collectée. Quelle explication est la plus plausible ?
Réponse : Le code postal joue le rôle de variable proxy
Une variable géographique peut être fortement corrélée à une caractéristique protégée et produire une discrimination indirecte. Ce n'est pas de la mémorisation, qui relèverait de la confidentialité.
12. Quelle différence sépare un problème d'équité d'un problème de fiabilité ?
Réponse : L'équité vise les écarts entre groupes, la fiabilité vise la constance du système
Équité et non fiabilité : l'équité compare les résultats obtenus entre groupes, la fiabilité vérifie que le système se comporte de façon constante et sûre, y compris dans des situations inattendues.