NVIDIA 機器人學的終局之戰:VLA 時代終結,世界行動模型 WAM 登場

這部在講什麼知識講解

NVIDIA 機器人專家 Jim Fan 闡述如何複製大語言模型的成功路徑到機器人領域,並提出「世界行動模型 (WAM)」與「第一人稱影片預訓練」將成為具身智能的終局解決方案。

適合誰關注 AI 趨勢、具身智能與機器人技術的開發者或科技愛好者。
關鍵概念理解機器人學習從 VLA 轉向 WAM 的核心邏輯、掌握數據規模化的最新路徑、預見 2040 年機器人科技樹的終點。
最值得看7:25 宣告 VLA 時代終結,正式進入 WAM 世界行動模型時代。

概念地圖

3:31
7:25
15:41
17:11

概念與關係意義優先,時間戳用來導航

概念2:55

偉大的平行路徑

機器人學正複製 LLM 的成功模式:先進行世界狀態的預訓練(模擬物理),再透過動作微調對齊現實需求,最後由強化學習完成最後一哩路。
機制4:14

從 VLA 轉向 WAM 模型

傳統 VLA (視覺語言行動) 偏重語言知識而非物理直覺;新一代 WAM (世界行動模型) 透過預測影片像素,讓模型自發湧現重力、浮力與光影等物理規律。
例子6:09

Dream Zero 零樣本學習

一種新型策略模型,能「想像」未來數秒的情境並據此行動,實現對從未見過的任務進行零樣本(Zero-shot)執行。
機制11:17

Eagle Scale 數據革命

利用 2.1 萬小時的人類第一人稱視角影片預訓練,僅需 0.1% 的機器人數據即可學會摺襯衫、操作注射器等靈巧動作。
概念15:41

神經模擬器 DreamDojo

捨棄傳統物理方程式,改用數據驅動的神經模擬器,將運算能力直接轉化為訓練環境與數據,實現大規模並行學習。
概念17:11

機器人科技樹的三大里程碑

未來需解鎖:物理圖靈測試(人機操作無異)、物理 API(自動化熄燈工廠)、物理自動研究(機器人自我迭代)。

看完可以做什麼

關注並研究「第一人稱視角影片 (Egocentric Video)」的標註技術,這是未來具身智能數據飛輪的核心。
需要留意:目前世界模型仍會產生「物理翻車 (Physics Flop)」或幻覺,且模型(如 Dream Zero)在任務穩定性上尚未達到 100% 可靠。

早期觀眾反應

整理 1 則有效留言信心 低

早期觀眾對影片內容給予正面評價,展現出對機器人技術發展的關注。

補充觀眾正面回饋1 則提及

早期觀眾對影片內容表達了高度肯定與正向的反應。

目前僅整理 1 則有效留言,反應仍可能改變。

生成於 2026-07-11 檢舉
摘要先揭露後段價值,完整內容仍屬於原創作者。 回 YouTube 看最值得的一段 → 在 YouTube 邊播邊讀 · 加入 Chrome →