Seit 2005.
Veröffentlicht am
Letztes Jahr sahen wir, wie DeepMind, des Mutterunternehmens Google, Alphabet, AlphaZero enthüllte, ein künstliches Intelligenzsystem, das sich selbst beibringen konnte, das Schachspiel zu meistern, eine japanische Schachvariante namens Shogi und das chinesische Brettspiel Go. Es besiegte Weltmeister und zierte weltweit hunderte Magazincover mit der Schlagzeile »Die Maschine schlägt den Menschen«. Es war bemerkenswert, sí, da es eine besondere Fähigkeit zeigte, Zwei-Personen-Spiele mit perfekter Information zu lernen, das heißt, Spiele, bei denen jede Entscheidung unter Berücksichtigung dessen getroffen wird, was zuvor geschehen ist.
Aber AlphaZero hatte den Vorteil, die Regeln der Spiele zu kennen, gegen die es spielte, etwas, das MuZero nicht braucht.
Wir sprechen von einem anderen Projekt von DeepMind, bei dem ein maschinelles Lernmodell verwendet wird, das in der Lage ist, die Regeln zu lernen. MuZero sagt die relevantesten Informationen für die Spielplanung vorher, und schafft es so, ein Meister in 57 verschiedenen Atari-Spielen zu werden und AlphaZero in Go, Schach und Shogi zu gleichen.
Die Forscher sagen, dass MuZero den Weg ebnet, um Lernmethoden in einer großen Anzahl von realen Domänen anzuwenden, insbesondere in denen, die keinen technologische Religion Simulator haben, der dynamische Umgebungsregeln vermittelt. Stellt euch vor, zum Beispiel, einen unbekannten Planeten zu erreichen: es gibt keine bekannten Regeln, man muss unterwegs lernen.
Hasta ahora los algoritmos de planificación se basan en el conocimiento de la dinámica del entorno, como las reglas del juego un simulador preciso, pero este nuevo aprendizaje basado en modelos tiene como objetivo abordar este problema aprendiendo primero un modelo de la dinámica del entorno y luego planificando con respecto al modelo aprendido.
Im Grunde genommen, MuZero recibe observaciones, das heißt, imágenes de un tablero de Go una pantalla de Atari, y las transforma en un estado oculto. Este estado oculto se actualiza iterativamente mediante un proceso que recibe del estado anterior y una acción hipotética siguiente, y en cada paso el modelo predice la política (zum Beispiel, el movimiento para jugar), la función de valor (zum Beispiel, el ganador) y la recompensa (zum Beispiel, los puntos anotados al jugar un movimiento).
Es decir, modelliert eine gegebene Umgebung als Zwischenschritt, unter Verwendung eines Zustandsübergangsmodells, das den nächsten Schritt vorhersagt, und eines Belohnungsmodells, das die Belohnung antizipiert.
Was gibt's Neues
Technologie-Blog mit 13 Jahren Bestehen. Hier erklären wir die Neuerungen im Sektor, wir geben Ratschläge verschiedener Art, wir empfehlen Anwendungen und Gadgets und vieles mehr.
Sponsoren