AI 感官與運動配置
AI 透過讀取角色 15 個骨骼特徵點的座標進行輸入,並以雙層感知機神經網絡控制 QWOP 四個按鍵。
獎勵函數的局部最優
僅設定「前進得分」會導致 AI 陷入膝蓋走路的局部最優解,需加入時間懲罰來強迫 AI 站立奔跑。
隨機網絡蒸餾 (RND)
針對「跨欄」造成的獎勵稀疏問題,引入 RND 鼓勵 AI 探索未曾見過的狀態,使其學會主動攻擊障礙物。
課程學習 (Curriculum Learning)
將複雜的跨欄動作拆解為起跳、過桿、收腿三個簡單子任務,逐步訓練 AI 完成高難度動作。
18 年模擬訓練打破紀錄
AI 歷經 150 萬次、相當於人類不吃不喝玩 18 年的訓練量,最終以 43.921 秒刷新世界紀錄。
早期觀眾反應
整理 3 則有效留言信心 低觀眾對 AI 挑戰高難度遊戲的過程感到驚奇與趣味,並對 AI 展現出的極限表現印象深刻。
觀眾表示從 AI 學習遊戲的過程中獲得許多啟發與感觸。
觀眾認為 AI 在遊戲中「往前蹭」的動作非常滑稽有趣。
目前僅整理 3 則有效留言,反應仍可能改變。