アルファ碁
概要
アルファ碁(AlphaGo)は、Google DeepMind(グーグル・ディープマインド)が開発した人工知能囲碁プログラムである。ディープラーニングニューラルネットワークとモンテカルロ木探索(MCTS)を組み合わせることで、従来のコンピュータ囲碁プログラムの限界を超え、2016年に李世乭(イ・セドル、이세돌)九段との対局で勝利し、世界中に人工知能の可能性と衝撃を同時に知らしめた。この対局は単なるゲームの勝敗を超え、人間固有の領域とされてきた直感や創造性にまでAIが踏み込めるというシグナルとして評価されている。
主要内容
開発背景
囲碁は、場合の数が宇宙の原子の数よりも多いとされる代表的な「難問」ゲームである。チェスが1997年にIBMのディープブルーによって攻略された後も、囲碁は20年近くにわたり、人間の最高棋士がコンピュータを圧倒し続ける最後の砦であった。DeepMindはこの問題を正面から突破するため、2014年からアルファ碁プロジェクトを本格化させた。
核心技術
アルファ碁の核心は大きく三つある。
- 方策ネットワーク(Policy Network): 次に打つ着手を予測するニューラルネットワークで、探索空間を飛躍的に縮小する。
- 価値ネットワーク(Value Network): 現在の局面の勝率を評価するニューラルネットワークで、最後までシミュレーションしなくても局面の優劣を判断する。
- モンテカルロ木探索(MCTS): 上記二つのニューラルネットワークを探索過程に組み合わせ、最適な手を見つけ出す。
これに自己対局(Self-play)による強化学習と、プロ棋譜データを活用した教師あり学習が組み合わされた。
主要対局
- 2015年10月: ヨーロッパチャンピオンの樊麾(ファン・フェイ)二段を5戦全勝で破り、その存在を知らしめた。
- 2016年3月: 李世乭九段との五番勝負で4勝1敗で勝利。李世乭の「78手」は、人間がアルファ碁から挙げた唯一の1勝として語り継がれている。
- 2017年5月: 中国の烏鎮(ウーチェン)で柯潔(カ・ケツ)九段を3戦全勝で破り、世界ランキング1位を相手に完全勝利を収めた。
アルファ碁ゼロとその後
2017年、DeepMindは人間の棋譜なしに自己対局のみで学習したアルファ碁ゼロ(AlphaGo Zero)と、囲碁以外の他のゲームにも適用可能な汎用アルゴリズムアルファゼロ(AlphaZero)を発表した。アルファ碁ゼロは従来のアルファ碁を100:0で圧倒し、人間の知識なしでも学習が可能であることを実証した。
最新動向
アルファ碁自体は2017年を最後に引退したが、その技術的遺産は2024~2025年のAI産業全体に深く浸透している。
- アルファフォールド系: 同じDeepMindのアルファフォールド(AlphaFold)はタンパク質構造予測問題を解決し、2024年にノーベル化学賞を受賞する決定的な貢献をした。
- 強化学習の復権: アルファ碁の自己対局方式は、大規模言語モデル(LLM)の推論強化、RLHF(人間のフィードバックによる強化学習)など、現代の生成AI学習手法の原型として再注目されている。
- 韓国のAIエコシステム: 李世乭との対局を契機に、韓国はAI人材育成と政策投資を本格化させ、2024年以降は「AI基本法」の議論と生成AI競争力の強化が主要課題として浮上した。
- 再評価: 2024年に李世乭の「78手」がAI研究において独創的戦略の事例として再分析されるなど、アルファ碁の対局は今なお教育・研究コンテンツとして活用されている。
関連トピック
- [[ディープマインド]]
- [[李世乭]]
- [[強化学習]]
- [[アルファフォールド]]
- [[人工知能]]