Vývoj obecného herného agenta pre šachovnicové hry
Development of a General Game-Playing Agent for Chessboard Games
Vývoj obecného herního agenta pro šachovnicové hry
bakalářská práce (OBHÁJENO)
Zobrazit/ otevřít
Trvalý odkaz
http://hdl.handle.net/20.500.11956/213627Identifikátory
SIS: 280773
Kolekce
- Kvalifikační práce [12696]
Autor
Vedoucí práce
Oponent práce
Mestek, Jakub
Fakulta / součást
Matematicko-fyzikální fakulta
Obor
Informatika se specializací Umělá inteligence
Katedra / ústav / klinika
Katedra teoretické informatiky a matematické logiky
Datum obhajoby
10. 9. 2026
Nakladatel
Univerzita Karlova, Matematicko-fyzikální fakultaJazyk
Slovenština
Známka
Výborně
Klíčová slova (česky)
herná umelá inteligencia|AlphaZero|Monte Carlo Tree Search|učenie posilňovaním|šachovnicové hryKlíčová slova (anglicky)
game artificial intelligence|AlphaZero|Monte Carlo Tree Search|reinforcement learning|board gamesPráca sa zaoberá návrhom a implementáciou všeobecného systému pre šachovnicové hry Gomoku, Othello a Checkers. V spoločnej infraštruktúre implementuje a porovnáva náhodného hráča, alpha-beta prehľadávanie, Monte Carlo Tree Search a AlphaZero-like PUCT s policy-value sieťou učenou pomocou self-play. Systém spája herné adaptéry, tré- ning, správu checkpointov, reprodukovateľné vyhodnotenie a interaktívnu analýzu partií. Hlavný experiment vyhodnocuje samostatne trénované osemhodinové modely v zápasoch s vymenenými stranami. Všetky tri modely prekonali náhodného hráča. Othello prinieslo najsilnejší pozitívny výsledok proti testovaným MCTS konfiguráciám, zatiaľ čo Gomoku prekonalo zmrazené MCTS konfigurácie, ale prehralo všetky partie proti alpha-beta. Prí- nosom práce je rozšíriteľný a sledovateľný rámec na skúmanie rozdielnych spôsobov her- ného rozhodovania.
This thesis presents the design and implementation of a general system for the board games Gomoku, Othello, and Checkers. Within a shared infrastructure, it implements and compares a random player, alpha-beta search, Monte Carlo Tree Search, and AlphaZero- like PUCT guided by a policy-value network trained through self-play. The system com- bines game adapters, training, checkpoint management, reproducible evaluation, and interactive game analysis. The main experiment evaluates separately trained eight-hour models in matches with swapped sides. All three models outperformed the random player. Othello produced the strongest positive result against the tested MCTS configurations, while Gomoku defeated the frozen MCTS configurations but lost every game against alpha-beta. The contribution is an extensible and traceable framework for studying dif- ferent sources of decision-making signals in games.
