小型模型的視覺突破
體積僅為超大型模型(如 DeepSeek)1.6 兆參數的 1%,卻具備在地端筆電運行的多模態能力。
捨棄傳統專用編碼器
傳統 AI 需額外視覺或音訊編碼器進行「翻譯」,新架構則主張移除這些外部神經網路。
圖像與音訊的碎片化處理
將圖片切成小塊(Patches),並將音訊切成 40 毫秒片段,直接映射到模型的內部表示中。
感知與推理的深度融合
強迫系統同時學習成為眼睛、耳朵與大腦,大幅減少數億個冗餘的專門參數。
開源社群的技術擴散
公開此架構細節後,能協助其他如 DeepSeek 等系統更高效地學習「看」世界。
未來開源模型的不確定性
隨能力增強,未來強大模型可能不再免費提供,目前這些開源成果應被視為珍貴的贈禮。
觀眾怎麼看
整理 40 則有效留言信心 高觀眾對 Google DeepMind 的 Gemma 模型展現高度興趣,特別肯定其在小型硬體上的高效表現與創新架構。
多數觀眾認同 Gemma 模型在小型硬體上運行順暢,且具備極佳的效率與實用性。
觀眾認為 Google 專注於底層技術創新與多模態整合,而非僅追求大型模型的基準測試數據。
有觀眾指出此架構並非全新概念,認為這更像是對現有技術的增量改進而非革命性突破。
觀眾詢問關於模型視覺與音訊功能的具體啟用方式,以及對技術細節的進一步釐清。
部分觀眾提到其他開源模型(如 Qwen)在類似任務上表現更佳,對 Google 的領先地位持保留態度。
留言樣本數有限,且部分觀點僅代表特定技術愛好者立場。