投機性解碼 (Speculative Decoding)
LPU 負責快速生成初步候選 Token(猜測),GPU 則負責驗證正確性,這種異質架構可讓產出速度提升至每秒 1000 個 Token,約為現行 API 的 20 倍。
推理與訓練的分工
GPU 適合處理大上下文與訓練階段(Prefill),而 LPU 則針對生成 Token 的解碼階段(Decode)進行加速,NVIDIA 透過系統整合將兩者合併為 LPX 系統。
EUV 與算力的物理掛鉤
每 1GW 的 AI 晶片產出需 3.5 台 EUV 機台產能支持,ASML 的光刻機產出速度與無塵室建置時程,是決定 AI 算力供給天花板的核心限制。
生成式網頁介面 (AIGC UI)
當 Token 生成延遲趨近於零,未來的網頁將不再是模組化設計,而是根據用戶個性完全由 AI 即時生成的專屬版面,這對電商轉化率有巨大潛力。
半導體產能瓶頸轉移
AI 算力發展短線看電力供給,中長線則卡在光刻機設備、HBM 記憶體與台積電先進封裝(CoWoS)的產能。