再帰的自己改善
概要
再帰的自己改善(Recursive Self-Improvement, RSI)とは、人工知能システムが自身のアーキテクチャ・ソースコード・学習アルゴリズム・評価基準を自ら修正して性能を高め、そうして改善された自身が再び次世代の改善作業を実行する自己参照的フィードバックループを指す。単純な自動化やハイパーパラメータ調整とは異なり、改善の主体と対象が同一のシステムである点が核心であり、汎用人工知能(AGI)以降の急激な能力爆発シナリオと人工知能アラインメント問題を論じる際に最も頻繁に引用される概念である。
主要な内容
概念定義
再帰的自己改善は、三つの条件が同時に満たされるときに成立する。第一に、システムが自身の内部状態と性能を観察・評価できなければならない(自己診断)。第二に、観察結果に基づいて自身のコードや重み、構造を実際に変更できなければならない(自己修正)。第三に、修正された結果が元よりも優れているかを検証し、その改善版を次の改善サイクルの主体として再投入できなければならない(再投入)。これら三言段階が反復されると、改善速度そのものが改善される、いわゆる二階導関数の増大が生じる。
歴史的背景
1965年、数学者I. J. グッドは、最初の超知能機械が人類最後の発明品になるという知能爆発(Intelligence Explosion)構想を提示した。1998年、エリエゼル・ユドコフスキーは自律的に自身を改善するAIを目標とするシードAI(Seed AI)概念を整理し、2003年、ニック・ボストロムは著書『スーパーインテリジェンス』でRSIを超知能到達経路の核心として分析した。2010年代にはニューラルネットワーク構造探索(NAS)とAutoMLが実用的な形の自己改善自動化を実現し、2020年代に入ると大規模言語モデルを用いた自己精錬(Self-Refine、Reflexion)、自己生成データに基づく反復学習(STaR)研究が登場し、概念が再び注目を集めた。
知能爆発仮説と速度論争
RSIが臨界点を超えると、知能が数時間または数分で爆発的に増大するという主張がある。反論としては三つのボトルネックが示される。第一に、改善には計算資源とデータが必要であり、物理的上限が存在する。第二に、自己修正の利益はログスケールで実感されることが多い。第三に、検証コストが生成コストより大きくなる逆転現象が生じる。すなわち、自己改善が必ずしも特異点的暴走につながると断定するのは難しいという立場が実証研究の多数である。
安全性とアラインメント問題
自己改善ループにおける最大の危険は、目標が誤って指定されたとき、その誤りが改善過程でともに増幅される点である。システムが自身の目的関数を自ら修正する権限を持つと、人間の意図とは無関係な方向に最適化され得る。このため、目標保存(goal preservation)、改善過程の解釈可能性確保、修正前の人間承認手続き、隔離されたサンドボックス実験などが安全装置として議論される。
実務的な実装形態
現実に観察されるRSIの穏健な形態としては、自己生成した問題-解答ペアで微調整する反復学習、エージェントが自身のツール使用ログを分析してプロンプトとポリシーを改善する手法、コード生成モデルが自身の出力をテストして修正するループ、進化アルゴリズムに基づくアーキテクチャ探索などがある。
最新動向
2024-2025年には、大規模言語モデルベースのエージェントが自ら評価基準を作成し反復改善する自己報酬(self-rewarding)パイプラインが活発に研究されている。同時に、主要AI研究所と政府機関は自己改善能力の閾値をリスク評価指標とし、一定水準以上の自律的自己修正に安全性テストと報告義務を課す規制議論を進めている。また、自己生成データのみで学習した場合に多様性と品質が低下するモデル崩壊(model collapse)現象が重要な実証的課題として浮上した。研究界の大まかな合意は、現在のシステムは完全な自律RSIには達していないが、特定の狭い領域における再帰的自己改善はすでに商用化段階に入っているというものである。あわせて、自己改善ループの利益を測定する標準ベンチマークと監査(audit)プロトコルを整備しようとする試みが続いている。
関連トピック
- [[人工知能アラインメント]]
- [[汎用人工知能]]
- [[知能爆発]]
- [[AI安全性]]
- [[AutoML]]
- [[モデル崩壊]]