撕掉開源模型低價標簽
222
訂閱已訂閱已收藏
收藏點擊播報本文,約
本報記者 楊學聰
7月17日,北京月之暗面科技有限公司發布新一代開源大模型Kimi K3。這款總參數2.8萬億、原生搭載視覺理解、支持百萬詞元超長上下文窗口的模型,一舉拿下Frontend Code Arena編程榜單榜首,實現開源模型首次超越頭部閉源模型登頂。發布短短數日,Kimi K3成為全球人工智能行業焦點。這一模型底層創新邏輯是什麼?記者走進月之暗面深入探尋。
革新底層算法
Kimi K3一經發布,憑借硬核性能迅速引發全球關注:SpaceX首席執行官埃隆·馬斯克在相關評測報道的評論區留言稱“令人印象深刻”,並將Kimi K3列為自家Grok 4.5模型重點追趕目標﹔OpenAI戰略負責人迪恩·鮑爾直言,該模型性能無法依靠簡單蒸餾或類似手段實現,復雜智能體編程場景下,性能對標2026年一季度全球頂尖公開模型。
隨著大量新用戶涌入,平台自7月19日起宣告暫停C端新用戶訂閱,優先保障存量用戶使用體驗。月之暗面Kimi企業業務負責人黃震昕坦言,盡管團隊提前籌備了擴容預案,但市場熱情超乎預期。“我們非常努力地通過模型效能優化和算力供給盡快解決問題,還在努力恢復中。”
一款大模型何以引發如此熱度?用戶反映,Kimi K3很聰明。這份聰明勁兒,不同於眾多靠后天學習打磨補齊能力的模型,其核心優勢在於原生具備超強長程高難度復雜推理能力,可完成高難度芯片設計、一句話生成完整游戲、整合數十份研報產出圖文並茂的行業深度報告等硬核生產力任務。從編程到金融、法律、科研、商業航天等專業賽道,大模型把人們從繁瑣工作中解放出來。
“Kimi K3最本質的能力提升一定是參數量帶來的,我們一直堅持底層架構技術創新,而不只是工程效率的優化。”黃震昕總結,性能質變的根基,源於企業迭代了行業內多項沉寂多年的基礎核心技術,依托萬億級參數規模疊加底層算法革新,實現模型綜合能力跨越式提升。
“我們的目標從來不是做高性價比的雕琢。”黃震昕說。月之暗面英文名“Moonshot”是登月之意,彰顯了企業理念——專注攻克通用人工智能(AGI)領域無人涉足的硬核難題,完成如同登月一般“難而正確”“難而有價值”的技術探索。
破解算力瓶頸
2.8萬億參數背后,是算力約束下的技術創新。
2017年,谷歌研究人員提出Transformer架構,其中的注意力機制成為全球主流大模型的技術基石。參數規模決定模型“能裝下多少知識”,注意力機制則決定模型“會不會抓重點”。Kimi K3的突破,不只是“裝得更多”,更在於處理信息的方式更高效。
在算力約束下實現效率質變,兩大自研核心技術成為月之暗面關鍵抓手。其中,一個是KDA混合線性注意力機制。傳統全注意力機制處理長文本時,文本量翻番,計算成本將提升4倍,極大限制超長內容處理能力。通過注意力機制創新,同等算力條件下,模型能讀取更長文本、完成更復雜任務,適配智能體時代高頻出現的長程工作需求。
另一個是注意力殘差技術。模型越大、層數越多,信息傳遞的“路程”就越長,容易出現信號衰減、失真問題。這項技術改進了信息在不同網絡層之間的傳遞和復用方式,為超大模型裝上運行“穩定器”,讓2.8萬億參數能穩定高效地用起來。
前者讓“超長文本怎樣算得更省”,后者讓“超大模型怎樣訓得更穩”。二者相輔相成,標志月之暗面從單純堆砌參數進階至原創基礎架構、底層算法自主創新層面。
這些技術突破的初衷,旨在破解行業共性難題。大模型領域有一個影響深遠的“大力出奇跡”(Scaling Law)定律。其核心在於,只要不斷加碼算力、擴充數據、提升參數,模型智能水平將穩步提升。但當下,模型算力投入擴大100倍,才能獲得能力增強10倍。在全球算力緊缺、數據見頂的今天,粗放擴張已面臨瓶頸。
“Kimi致力於做最大的模型,一直在尋求將能源轉化成智能的最優解。解決問題的鑰匙,就是底層的技術創新。”黃震昕給出的答案很明確:“我們首先要做到最強的模型﹔其次是盡可能通過底層技術創新、盡可能多的算法創新,在有限的算力資源下做出最強模型﹔最終目標是讓AGI普惠全世界。”
這些企業共識早已付諸實踐:圍繞Token效率革命,自研新型二階優化器,同等15萬億Token訓練預算下,模型智能密度較行業通用方案提升1倍,同樣性能下訓練功耗直接減半,讓有限的數據可以發揮出更高的智能﹔自研Kimi Linear長上下文架構,補齊傳統線性注意力長距離推理性能短板,牢牢抓住衡量高端大模型的核心標尺——長時程復雜任務執行能力。
探尋最優路徑
Kimi K3發布,被高盛研報解讀為中國大模型走向定價權的新節點。此前,中國大模型主要靠性價比進入全球市場﹔未來,中國模型可能憑借前沿能力進入全球開發者的核心工作流。摩根士丹利則關注到,Kimi K3的API價格處於中國頭部模型高位,並認為較高定價對大模型市場格局具有積極意義。
“我們既能做非常前沿的研究,又願意把模型開源出來、把技術開放出來,這在全球來看是其他國家的企業很難做到的。”月之暗面創始人楊植麟說。
創立伊始,月之暗面就貼著“開源”標簽。很多創新技術在模型面世前,已被寫進技術報告,開源給全世界。而大模型是一個高投入的賽道,可持續商業化是技術長期迭代的根基。開源大模型怎樣做好商業化,是企業必須面對的問題。
“從戰略上來講,公司一直堅定於‘模型公司一定要做模型’。模型的強度是企業一切業務的根基。”黃震昕認為,模型能力強到一定程度后,智能體(Agent)包括C端市場就是自然而然的事情。另外,企業也有大量的C端智能體產品,依托海量用戶端智能體真實使用反饋反向迭代優化模型,對齊用戶真實需求與模型能力邊界。
“開源和閉源不是競爭關系,是面向不同客戶群體、適配多元業務需求的並行發展路徑。”黃震昕說,這次Kimi引人矚目,就在於徹底撕掉“開源模型等於低價廉價”的固有標簽。“開源模型不該貼上低價標簽,我們沒有陷入價格戰,反而把模型的能力和商業化價值拉高了一檔。”
面向未來,Kimi也早已做出取舍:放棄娛樂性場景,離開生圖生視頻賽道,聚力打造編程、金融、法律、科學研究等高門檻生產力場景。所有的技術創新都錨定3個核心研發方向:百萬詞元超長上下文,拉長模型“工作記憶”,連貫處理超長復雜任務﹔翻番Token利用效率,提升單位算力下模型智力水平﹔智能體集群技術Agent Swarm,尋找智能體並行協作最優解。三大技術路線協同發力,將持續挖掘算力向智能轉化的最優路徑。
關注公眾號:人民網財經
分享讓更多人看到
- 評論
- 關注































微信掃一掃


第一時間為您推送權威資訊
報道全球 傳播中國
關注人民網,傳播正能量