Research
【論文紹介】Revisiting Regularized Policy Optimization for Stable and Efficient Reinforcement Learning in Two-Player GamesNew!!

AlphaGo をはじめとするゲームAIは、囲碁や将棋などで人間を上回る強さを実現してきました。ゲームAIの研究で培われた技術は、数学の問題を解いたり、新しいアルゴリズムを発見したりするなど、ゲームの枠を超えた課題にも活用されています。こうしたゲームAIの強さを支える仕組みの一つが、候補となる手の先で起こり得る展開を何度もシミュレーションし、有望な手を探す「先読み探索」です。しかし、この仕組みを用いて学習を行うには大規模な計算資源が必要なため、強いゲームAIを再現したり、新しいゲームに応用したりすることは、限られた研究組織にしかできませんでした。

そこで本研究では、学習中に先読み探索を行わず、AIが自分自身と対戦して得た経験から良い手を直接学ぶゲームAI「KLENT」を提案しました。5種類のボードゲームを用いた実験では、先読み探索を使う既存手法に匹敵する強さに、より少ない計算で到達し、最大4倍の学習効率を達成しました。これにより、より多くの研究者や開発者がゲームAIを試し、新しいゲームやより一般的な意思決定問題に応用できる可能性が広がります。本研究は、機械学習分野のトップカンファレンスであるInternational Conference on Machine Learning(ICML 2026)に採択されました。

Read more