强化学习打爆最难的跑步游戏!!

這部在講什麼知識講解

紀錄利用強化學習(Reinforcement Learning)訓練 AI 挑戰極高難度遊戲《QWOP》,並最終打破世界紀錄的過程。

適合誰對人工智慧、機器學習或遊戲開發感興趣的人。
關鍵概念強化學習的基本配置、解決獎勵稀疏的策略、課程學習的應用實務。
最值得看07:15 揭露 AI 如何發現遊戲代碼漏洞並將障礙物踢出畫面。

概念地圖

01:35
03:38
07:15
09:50
12:05

概念與關係意義優先,時間戳用來導航

機制00:55

AI 感官與運動配置

AI 透過讀取角色 15 個骨骼特徵點的座標進行輸入,並以雙層感知機神經網絡控制 QWOP 四個按鍵。
概念01:35

獎勵函數的局部最優

僅設定「前進得分」會導致 AI 陷入膝蓋走路的局部最優解,需加入時間懲罰來強迫 AI 站立奔跑。
策略03:38

隨機網絡蒸餾 (RND)

針對「跨欄」造成的獎勵稀疏問題,引入 RND 鼓勵 AI 探索未曾見過的狀態,使其學會主動攻擊障礙物。
技巧09:32

課程學習 (Curriculum Learning)

將複雜的跨欄動作拆解為起跳、過桿、收腿三個簡單子任務,逐步訓練 AI 完成高難度動作。
結果12:00

18 年模擬訓練打破紀錄

AI 歷經 150 萬次、相當於人類不吃不喝玩 18 年的訓練量,最終以 43.921 秒刷新世界紀錄。

看完可以做什麼

前往 GitHub 下載作者開源的訓練代碼,或在 LYIhub 網站嘗試挑戰 AI 影子模式。
需要留意:AI 發現的「踢飛跨欄」屬於遊戲引擎的渲染 Bug,在真實田徑規則中並不適用,訓練時需透過人工干預引導正確動作。

早期觀眾反應

整理 3 則有效留言信心 低

觀眾對 AI 挑戰高難度遊戲的過程感到驚奇與趣味,並對 AI 展現出的極限表現印象深刻。

補充對 AI 學習過程的感觸1 則提及

觀眾表示從 AI 學習遊戲的過程中獲得許多啟發與感觸。

補充對遊戲表現的娛樂感1 則提及

觀眾認為 AI 在遊戲中「往前蹭」的動作非常滑稽有趣。

目前僅整理 3 則有效留言,反應仍可能改變。

生成於 2026-07-20 檢舉
摘要先揭露後段價值,完整內容仍屬於原創作者。 回 YouTube 看最值得的一段 → 在 YouTube 邊播邊讀 · 加入 Chrome →