Kimi K3遭控蒸餾Claude 月之暗面:性能源自3大自研技術
中國AI模型公司月之暗面推出Kimi K3震驚全球科技界,甚至有人說是另一個「DeepSeek時刻」,不過,也有傳言K3也是蒸餾自美國模型而來,對此,月之暗面業務負責人黃震昕21日澄清K3性能躍升的核心來自底層原創架構創新,並非對現有模型蒸餾復刻。
21世紀經濟報導,黃震昕明確表示:「開源模型、中國大模型不該被貼上低價標籤,我們做出了SOTA級(State-of-the-Art 的縮寫,指當前最優技術或最先進水平)模型,也能匹配合理商業定價。」
此前有傳聞稱Kimi蒸餾自Anthropic的Claude。不過,K3並非來自蒸餾,黃震昕說,K3的底層自研技術有三方面:
其一是Moon Clip,為全新二階優化器,由Kimi首次應用於大模型訓練。當前全球可用訓練數據基本見底,這項技術能讓20T訓練數據跑出40T的訓練效果,同等性能下訓練成本、算力功耗直接減半。
其二是Kimi Linear Tension,自研線性注意力機制,解決傳統線性注意力處理超長任務時性能衰減的痛點。AI可執行任務時長每7個月翻一倍;這套機制讓上下文窗口擴大十倍,訓練成本僅同步擴大十倍。
其三是Attention Residuals(注意力殘差),這是馬斯克曾專門發文稱讚的底層技術,優化模型多層網絡間信息傳遞、復用邏輯,讓2.8兆超大參數模型既能穩定完成訓練,又能讓推理效率同步提升25%。
在商業化層面,黃震昕表示,Kimi現階段暫不提供私有化部署服務,商業模式對標海外成熟頭部AI企業,核心發力打磨模型基礎能力;公司收入結構中API業務佔比最高,暫未對外披露私有化、行業解決方案細分營收佔比。同時明確行業參數規模趨勢:大模型參數規模會持續向上拓展,不會止步於當前2.8兆規模。
對於開源會有減速主義,會降低前沿模型商業回報、降低行業持續研發投入意願,黃震昕稱,Kimi自K2起持續堅持開源路線,這一路線未來也不會改變;核心底層技術、論文均對外公開,對行業保持開放姿態。他也強調,Kimi無法私有化部署,根源是當前K3參數量巨大、部署門檻高,和開源授權策略本身無關。
黃震昕表示,K3性能躍升來自底層原創架構創新,不是對現有模型的蒸餾復刻;公司也強調已做出SOTA級模型,能以合理價格商業化。 Moon Clip可提升訓練效率與降低成本;Kimi Linear Tension強化超長上下文處理能力;Attention Residuals則改善多層訊息傳遞,兼顧大模型穩定訓練與推理效率。 公司暫不提供私有化部署,收入以API業務為主,並維持開源路線不變;黃震昕也指出,無法私有化主要因K3參數量巨大、部署門檻高。精華 FAQ
