强化学习打爆史上最难跑步游戏!

這部在講什麼知識講解

紀錄開發團隊利用強化學習(Reinforcement Learning)訓練 AI 挑戰高難度遊戲《QWOP》,透過課程學習與演算法優化,最終打破人類世界紀錄。

適合誰對人工智慧、機器學習或遊戲物理引擎感興趣的人。
關鍵概念強化學習的基本訓練架構、稀疏獎勵問題的解決方案、AI 如何利用物理引擎漏洞尋找最優解。
最值得看04:22 AI 發現物理引擎漏洞,直接一腳踢飛欄杆的「非人類」解法。

概念地圖

01:13
03:40
05:50
09:30
12:08

概念與關係意義優先,時間戳用來導航

概念01:12

強化學習基礎架構

以 15 個骨骼關鍵點坐標為輸入,雙層感知機神經網路為大腦,輸出的四個按鍵模擬肌肉控制。
機制03:40

隨機網路蒸餾 (RND)

解決「稀疏獎勵」問題,透過獎勵 AI 對未知環境的「好奇心」,引導其在碰壁時嘗試新動作而非躺平。
做法09:30

課程學習 (Curriculum Learning)

將複雜的跨欄動作拆解為起跳、前腳過桿、後腳過桿三個簡單任務,逐步引導 AI 學習複雜技能。
風險10:35

災難性遺忘

AI 在學習新技能(跨欄)時會遺忘舊技能(走路),需透過擴大模型規模(提升 8 倍神經元數量)與更強的算力解決。
數據12:30

AI 與人類的效率對比

AI 需累積相當於 18 年不間斷的訓練時間才打破紀錄,凸顯出人類學習效率在小樣本下的驚人優勢。

看完可以做什麼

前往開發者的 GitHub 專案(LYIHub)查看開源代碼,嘗試自行訓練一個能玩 QWOP 的 AI。
需要留意:- 強化學習的結果高度取決於獎勵函數的設計,若設計不當,AI 容易陷入「局部最優解」(如跪著走)。

觀眾怎麼看

整理 39 則有效留言信心 高

觀眾對 AI 挑戰高難度遊戲《QWOP》的技術與視覺呈現給予高度肯定,同時引發關於 AI 競速意義的討論。

共識影片製作與視覺效果8 則提及

觀眾普遍讚賞影片中 AI 生成的動畫質感、音樂搭配以及幽默的敘事風格,認為製作非常用心。

共識遊戲難度與懷舊感6 則提及

許多觀眾對《QWOP》這款經典高難度遊戲感到懷舊,並認同該遊戲的操作極具挑戰性。

本摘要僅基於提供的 39 則留言樣本,不代表全體觀眾觀點。

生成於 2026-07-20 檢舉
摘要先揭露後段價值,完整內容仍屬於原創作者。 回 YouTube 看最值得的一段 → 在 YouTube 邊播邊讀 · 加入 Chrome →