測試邏輯與模型定位
以網頁開發測上限(訓練集多),以 Android 開發測下限(訓練集少、考驗泛化力);對比模型包含 Kimi K3、GPT-4o 變體與 Claude 3.5 Sonnet。
Android UI 實測結果
GPT 系列(Sol/Terra)完美達成複雜的長按拖拽與滑動選取;Kimi 泛化力不足導致 UI 邏輯錯誤;Claude Fable 則因安全審查機制拒絕執行底層開發任務。
網頁開發表現對比
在開發二手交易網站任務中,Claude 與 Kimi 風格簡約且無 Bug;GPT 界面華麗、具備自動填寫密碼等智能細節,但帶有細微 Bug,雙方各有千秋。
Kimi 的穩定性與極端表現
Kimi 表現極不穩定,在非主流任務中容易給出完全不可用的解法,導致開發者的試錯與時間成本過高。
GPT 的泛化力優勢
GPT 雖不一定提供最優解,但泛化能力強,多數任務均能提供可行方案,是目前最值得信賴的主力開發模型。
早期觀眾反應
整理 1 則有效留言信心 低觀眾對於本次評測內容的早期反應,主要關注於過往相關測試影片的連結資訊。
有觀眾主動分享了上一期關於 Kimi 單獨測試的影片連結,供其他觀眾參考對比。
目前僅整理 1 則有效留言,反應仍可能改變。