yhyu13/AlphaGOZero-python-tensorflow

Congratulation to DeepMind! This is a reengineering implementation (on behalf of many other git repo in /support/) of DeepMind's Oct19th publication: [Mastering the Game of Go without Human Knowledge]. The supervised learning approach is more practical for individuals. (This repository has single purpose of education only)

해결하는 문제

이 프로젝트는 DeepMind의 "인간의 지식 없이 바둑을 마스터하기" 논문에 설명된 AlphaGo Zero 아키텍처의 Python 및 TensorFlow 구현을 제공합니다. 이로 인해 인간의 지식이나 데이터 없이도 AI 에이전트가 바둑을 학습하고 플레이할 수 있습니다.

작동 방식

시스템은 DeepMind의 "인간의 지식 없이 바둑을 마스터하기" 논문에 기술된 아키텍처를 구현합니다. 감독 학습, 강화학습을 위한 자기 대전 파이프라인, 그리고 분산 학습을 지원하여 에이전트의 성능을 향상시킵니다.

대상 사용자

강화학습과 AlphaGo Zero 아키텍처에 관심이 있는 개발자 및 연구자로서, 자신만의 바둑 AI를 훈련해 실험하고 싶은 분들.

주요 기능

  • 자기 대전 파이프라인: 에이전트가 자신의 게임에서 학습할 수 있는 핵심 메커니즘을 구현.
  • GTP 지원: 바둑 텍스트 프로토콜(GTP)을 포함하여, Sabaki와 같은 바둑 소프트웨어의 엔진으로 사용 가능.
  • 분산 학습: 여러 리소스를 활용해 학습 과정을 가속화.
  • 감독 학습: 기존 게임 데이터셋을 사용해 초기 학습 수행 가능.

관련

  • Dispatch
  • 프로젝트
  • 프로젝트
  • Dispatch
  • 프로젝트