如何煉成全球參數最大開源模型
222
訂閱已訂閱已收藏
收藏點擊播報本文,約
7月27日,我國科技企業月之暗面發布Kimi K3的模型權重、技術報告,正式開源Kimi K3,人人都可下載。Kimi K3是月之暗面開發的AI(人工智能)大模型,於7月17日發布,是全球參數最大的開源模型。該模型總參數達到2.8萬億,原生支持視覺理解,具備100萬詞元上下文窗口,主要面向長程編程、知識工作和復雜推理等場景。
在大模型編碼評估系統Frontend Code Arena榜單中,Kimi K3以1679分位居榜首,超過Claude Fable 5、GPT—5.6 Sol等閉源模型,這也是開源模型首次在該榜單上超過閉源模型並登頂。
在大模型研發中,參數規模是關鍵變量。參數就像人腦裡的神經連接,它決定模型“能裝下多少知識”。參數越大,能力的上限越高,也就可以提供更智能的模型表現。2.8萬億參數,意味著模型能把更多的知識和規律裝進“腦子”,懂得更多、想得更深、答得更准。
注意力機制同樣重要。自2017年Transformer架構提出以來,注意力機制就成為全球主流大模型的技術基石之一。注意力機制決定了模型“會不會抓重點”,能不能從海量信息中快速找到關鍵、建立聯系並形成答案。傳統全注意力機制在處理長文本時,計算量隨文本長度接近平方級增長——模型“讀”的內容增加1倍,計算量就增至約4倍,這正是超長文本難落地的關鍵原因。
Kimi K3的突破,不只是參數大、“裝得多”,還在於處理信息的方式更高效。首先,它應用了月之暗面提出的一種創新的線性注意力模塊——KDA混合線性注意力機制,通過混合線性設計,把計算量降到接近線性增長。這意味著在同等算力條件下,模型能“讀”得更長、處理更多信息、完成更復雜任務。
另一方面,模型越大、層數越多,信息傳遞的“路程”就越長,信號容易衰減、失真,訓練也越容易失敗,這是全球大模型開發共同面對的工程難題。月之暗面開發的注意力殘差技術,則改進了信息在不同網絡層之間的傳遞和復用方式,相當於為巨型模型加裝了一套“穩定器”,讓2.8萬億參數能穩定高效地用起來。
在訓練新一代基座大模型的過程中,月之暗面使用了自主研發的底層模型架構,並積累形成了一整套科學的模型訓練方法。如果說KDA混合線性注意力機制回答的是“超長文本怎樣算得更省”,注意力殘差技術回答的就是“超大模型怎樣訓練得更穩”。兩項技術共同表明,我國大模型企業的競爭力,正從擴大參數規模延伸到基礎架構和原創算法層面。
性能強、成本低,使得中國大模型成為全球開發者的重要選擇。
全球人工智能模型聚合平台OpenRouter的數據顯示,7月20日至26日,中國大模型周調用量達33萬億詞元,連續13周穩居全球首位。高盛集團認為,中國開源及開放權重模型的智能水平,正在達到面向全球擴散的關鍵臨界點﹔預計2026年下半年,中國可能出現更多總參數達到2萬億至5萬億的大模型。
在月之暗面創始人兼首席執行官楊植麟看來,從部分性能在全球大模型榜單登頂,到多模態模型能力攀升,再到單個智能體衍生出智能體集群,中國大模型的發展壯大不僅體現在數量上,更體現在質量、應用深度和全球影響力等多方面。
北京中關村學院院長劉鐵岩認為,一批中國開源大模型從“單點亮相”走向“群體突破”,為世界人工智能發展提供了新方案、新路徑,將加快推動人工智能技術向上向善發展。
關注公眾號:人民網財經
分享讓更多人看到
- 評論
- 關注































微信掃一掃


第一時間為您推送權威資訊
報道全球 傳播中國
關注人民網,傳播正能量