測試邏輯與模型定位
以網頁開發測上限(訓練集多),以 Android 開發測下限(訓練集少、考驗泛化力);對比模型包含 Kimi K3、GPT-4o 變體與 Claude 3.5 Sonnet。
Android UI 實測結果
GPT 系列(Sol/Terra)完美達成複雜的長按拖拽與滑動選取;Kimi 泛化力不足導致 UI 邏輯錯誤;Claude Fable 則因安全審查機制拒絕執行底層開發任務。
網頁開發表現對比
在開發二手交易網站任務中,Claude 與 Kimi 風格簡約且無 Bug;GPT 界面華麗、具備自動填寫密碼等智能細節,但帶有細微 Bug,雙方各有千秋。
Kimi 的穩定性與極端表現
Kimi 表現極不穩定,在非主流任務中容易給出完全不可用的解法,導致開發者的試錯與時間成本過高。
GPT 的泛化力優勢
GPT 雖不一定提供最優解,但泛化能力強,多數任務均能提供可行方案,是目前最值得信賴的主力開發模型。
讓下一支影片也替你省時間
把你常看的 YouTube 影片,也變成這樣的重點摘要
安裝摘要王後,打開任何 YouTube 影片就能一鍵整理重點,先看值得看的段落,不必再複製網址。
用摘要王先看重點,把時間留給想看的段落。免費註冊,我們會把 YouTube 電腦版安裝連結和教學寄到你的信箱。
免費註冊,再送 5 小時影片摘要額度・30 天有效
使用 Google 免費開始・每個新帳號限領一次
一個選填問題
剛才這份摘要有幫你節省時間嗎?
如果願意,點一下最接近你的感受就好。
謝謝,你的回答會幫我們把摘要做得更有用。
謝謝你直接告訴我們
是哪一點讓它還不夠有用?可選填。
收到,謝謝你幫我們校正方向。
觀眾怎麼看
整理 14 則有效留言信心 中觀眾對 Kimi K3 的開發能力評價兩極,並高度關注模型是否存在「蒸餾」行為。
多位觀眾指出 K3 與 Fable 產出介面高度相似,質疑其是否透過蒸餾技術訓練,並討論蒸餾模型是否必然導致偏科。
部分觀眾認為偏科是模型訓練的必然結果,甚至認為特定領域的強項比通用性更重要;另一派則對此持保留態度。
有使用者回饋 K3 在 UI 前端開發表現優秀,但穩定性不足,目前僅適合作為輔助工具使用。
有觀眾認為評測標準有爭議,例如不應將存在 Bug 的結果視為平手,且認為模型間的強項差異大,單一評測難以定論。
本摘要僅基於 14 則留言,樣本數較少,無法代表全體觀眾觀點。