Spiel gegen es
Du bist Schwarz, es ist Blau. Die Balken über dem Brett zeigen sein Denken: Der blasse Balken ist sein Instinkt allein aus dem Netz, der kräftige Balken zeigt, wo seine Suche gelandet ist.
. Bei null spielt es rein nach Instinkt; jede Simulation schaut eine Variante tiefer in die Zukunft.
Beim Lernen zusehen
Starte mit zufälligen Gewichten und lass es gegen sich selbst spielen. Alle 25 Partien wird es gegen drei feste Gegner getestet, mit 200 Simulationen pro Zug. Zufall wählt irgendeine gültige Spalte. Gierig gewinnt, wenn es kann, blockiert deinen Sieg, wenn es muss, und bevorzugt sonst die Mitte. Klassisches MCTS führt dieselbe Baumsuche aus, ebenfalls mit 200 Simulationen, bewertet Stellungen aber, indem es zufällige Partien zu Ende spielt, statt das Netz zu fragen. Zufall und Gierig fallen innert Minuten; klassisches MCTS ist der eigentliche Test. Stelle sein Gehirn oben auf «Dein Trainingslauf», um gegen das bisher Gelernte zu spielen.
Hier erscheinen die Partien gegen sich selbst
So funktioniert es
AlphaZero kombiniert ein neuronales Netz mit Monte-Carlo-Baumsuche und trainiert das Netz auf Partien, die es gegen sich selbst spielt. Diese Seite setzt eine kleine Version der Methode für Vier gewinnt um.
Policy- und Value-Netz
Ein vollständig verbundenes Netz mit zwei verborgenen Schichten erhält das Brett als Eingabe. Es gibt eine Policy aus, eine Wahrscheinlichkeit für jede der sieben Spalten, und einen Value, eine Schätzung des Ausgangs für die Spielerin oder den Spieler am Zug. Die Gewichte werden zufällig initialisiert.
Baumsuche
Die Monte-Carlo-Baumsuche baut einen Baum möglicher Fortsetzungen auf. In jedem Knoten wählt sie den Zug mit dem höchsten PUCT-Wert, der den durchschnittlichen Wert des Zugs (Q) gegen die A-priori-Wahrscheinlichkeit der Policy (P) und seine Besuchszahl (n) abwägt. Neue Stellungen werden mit dem Value-Ausgang bewertet, statt zu Ende gespielt zu werden.
Training durch Self-Play
Jede Partie gegen sich selbst liefert Trainingsbeispiele: die Stellung, die Besuchsverteilung der Suche (π) und das Endergebnis (z). Das Netz wird trainiert, mit seiner Policy π und mit seinem Value z zu treffen, und das aktualisierte Netz spielt die nächsten Partien.