Apprentissage par Renforcement pour Micro-Réseaux
Formulation MDP des Micro-Réseaux
De la simulation à l'action : Modéliser un micro-réseau en MDP
Vous savez déjà utiliser Homer Pro pour simuler et dimensionner des micro-réseaux. Cette approche est puissante pour la planification, mais la gestion en temps réel exige une stratégie plus dynamique. Comment un système peut-il prendre la meilleure décision à chaque instant, face à l'incertitude de la demande et de la production renouvelable ?
Nous allons transformer ce problème de gestion en un Processus de Décision Markovien (MDP). Plutôt que de simplement simuler des scénarios, nous allons construire un cadre formel qui permet à un agent (un contrôleur) d'apprendre une politique de décision optimale. L'objectif est de passer d'une analyse statique à une stratégie de contrôle intelligente et adaptative.
Définir le terrain de jeu : États et actions
Un MDP se définit d'abord par ce que l'agent peut observer (l'état) et ce qu'il peut faire (l'action). Pour notre micro-réseau arctique, l'état est un instantané du système. Il doit capturer toutes les informations pertinentes pour prendre une bonne décision.
Face à cet état, le contrôleur doit choisir une action . L'espace d'actions peut être modélisé de manière discrète ou continue.
- Actions discrètes : On définit un ensemble fini de choix. Par exemple, pour la batterie, les actions pourraient être {charger à 5 kW, décharger à 5 kW, ne rien faire}. C'est plus simple à résoudre, mais moins précis.
- Actions continues : L'action est une valeur réelle dans une plage. Par exemple, la puissance de la batterie peut être n'importe quelle valeur entre sa puissance maximale de charge et de décharge. C'est plus réaliste mais computationnellement plus exigeant.
Pour notre cas, une action combine les décisions pour la batterie et le générateur diesel : . est la puissance de charge/décharge et est la décision de démarrer ou d'arrêter le générateur.
L'art de la récompense
Comment l'agent sait-il si une action était bonne ? Grâce à la fonction de récompense, . Cette fonction attribue un score numérique à chaque action prise dans un état donné. Notre objectif est de minimiser les coûts opérationnels, donc nous allons formuler la récompense comme un coût négatif. Une récompense plus élevée (moins négative) est meilleure.
L'équilibre entre ces termes est essentiel. Une pénalité de délestage très élevée forcera le système à garantir la fiabilité à tout prix, même si cela signifie faire tourner le générateur diesel plus souvent. Une pénalité faible pourrait privilégier l'économie de carburant au détriment de la satisfaction de la demande. C'est ici que l'expertise métier et les objectifs du projet (économiques, écologiques, de résilience) entrent en jeu.
Gérer l'imprévisible
Le principal défi d'un micro-réseau est l'incertitude. La demande de charge et la production renouvelable sont des variables stochastiques ; on ne peut pas les prédire avec une certitude absolue. Le MDP intègre cette incertitude via la fonction de transition, . Elle définit la probabilité de passer à un état futur en partant de l'état et en effectuant l'action .
Dans la pratique, on n'a pas toujours besoin de modéliser explicitement cette fonction de transition. Des algorithmes d'apprentissage par renforcement, comme le , peuvent apprendre la politique optimale directement par essais et erreurs, en interagissant avec le système (ou une simulation de celui-ci).
L'agent n'a pas besoin de connaître toutes les probabilités, il a juste besoin de faire l'expérience des résultats pour apprendre ce qui fonctionne.
Enfin, nous devons considérer l'horizon de décision. S'agit-il d'optimiser sur une heure, un jour, une année ? Un horizon infini est souvent utilisé en théorie, mais en pratique, on optimise sur un horizon glissant (par exemple, les prochaines 24 heures).
Le facteur d'escompte, gamma (), est un paramètre entre 0 et 1 qui détermine l'importance des récompenses futures. Un proche de 1 donne une grande importance à l'avenir, encourageant des stratégies à long terme comme stocker de l'énergie pour un pic de demande anticipé. Un proche de 0 rend l'agent "myope", le poussant à maximiser uniquement la récompense immédiate.
Testons maintenant votre compréhension de ces concepts fondamentaux.
Pourquoi transformer la gestion d'un micro-réseau en un Processus de Décision Markovien (MDP) ?
Dans le contexte du micro-réseau décrit, qu'est-ce qui constitue une "action" que l'agent peut prendre ?
Avec ces éléments – états, actions, récompenses et transitions – nous avons transformé un problème complexe de gestion de l'énergie en un MDP structuré, prêt à être résolu par des algorithmes d'apprentissage par renforcement.