Google 擁抱 Apache 2.0 真開源
不同於 Meta Llama 的限制性授權,Gemma 提供完全商用自由,不設收入限制或研究限制。
低硬體門檻達成高性能
31B 版本的 Gemma 在單張 RTX 4090 即可運行,相較於同效能模型(如 Kimi)需數百 GB 顯存與多張 H100 顯卡。
Turboquant 座標轉換壓縮
將資料從笛卡爾座標轉為極座標(半徑與角度),並利用 JL 轉換將高維數據縮減至單位元,極大化記憶體效率。
Per-layer Embeddings 提升效率
每一層神經網路都擁有專屬的「小抄」Token 資訊,取代傳統的一次性嵌入,讓資訊在最需要的時刻才介入。
打破大型模型的規模迷信
透過「有效參數」(Effective Parameters)概念,讓小尺寸模型在智慧表現上對標體積大出數十倍的巨型模型。
觀眾怎麼看
整理 40 則有效留言信心 高觀眾對 Google 發布 Gemma 模型表示高度關注,並針對技術細節與「開源」定義展開熱烈討論。
多數觀眾對模型在消費級硬體上的運行效率與壓縮技術感到驚艷,認為其表現優異。
部分觀眾指出影片中提到的 TurboQuant 技術是用於優化 KV Cache 以擴展上下文,而非直接壓縮模型權重。
觀眾質疑 Google 對「開源」的定義,並擔憂 Google 過往產品常態性下架的紀錄會影響此模型的長期可用性。
使用者分享了本地運行測試的經驗,指出模型在特定指令遵循與格式化輸出上仍有改進空間。
留言樣本包含大量網路迷因與玩笑,技術性討論僅佔部分比例。