GRPO 訓練法大幅降低成本
取代傳統昂貴的 PPO 演算法,透過群組相對評估取代「人工/模型導師」評分,讓大規模訓練更經濟高效。
AI 出現自發性的思考過程
在純強化學習中,模型學會了「先想再說」,自發產生「等等...讓我重新計算」等字眼來修正邏輯。
擺脫人類範例的純強化學習
證明不需依賴人類寫的教科書或案例,AI 僅憑規則透過自我博弈,就能在競賽數學上從 15% 準確率進化到 80%。
少量引導如同「手電筒」
雖然零樣本可行,但加入極少量高品質範例能防止模型在自然語言對話中出現語言混亂,效率更高。
知識蒸餾賦能小模型
將 R1 強大的思維路徑作為教材,讓僅 70 億參數的小模型在數學表現上超越體積龐大的 GPT-4o 達六倍。
讓下一支影片也替你省時間
把你常看的 YouTube 影片,也變成這樣的重點摘要
安裝摘要王後,打開任何 YouTube 影片就能一鍵整理重點,先看值得看的段落,不必再複製網址。
用摘要王先看重點,把時間留給想看的段落。免費註冊,我們會把 YouTube 電腦版安裝連結和教學寄到你的信箱。
免費註冊,再送 5 小時影片摘要額度・30 天有效
使用 Google 免費開始・每個新帳號限領一次
一個選填問題
剛才這份摘要有幫你節省時間嗎?
如果願意,點一下最接近你的感受就好。
謝謝,你的回答會幫我們把摘要做得更有用。
謝謝你直接告訴我們
是哪一點讓它還不夠有用?可選填。
收到,謝謝你幫我們校正方向。
觀眾怎麼看
整理 40 則有效留言信心 高觀眾高度肯定 DeepSeek 的開源貢獻,並對該頻道深入淺出的知識解析表達強烈支持。
觀眾認為 DeepSeek 的開源模式有助於打破大型科技公司的技術壟斷,促進 AI 技術的普及與公平競爭。
觀眾一致推崇該頻道將複雜的學術論文轉化為易懂內容的能力,並讚賞其客觀、真實的報導態度。
多位觀眾分享在個人電腦上運行 R1 等模型的經驗,認為這能減少對封閉式雲端模型的依賴。
有留言指控 DeepSeek 透過非法手段獲取數據進行訓練,與影片強調的技術突破觀點存在衝突。
留言樣本多為頻道忠實粉絲,可能存在對影片內容的偏好性與正面評價偏差。