具身智能,在物理世界中成長(院士講科普·未來產業)
222
訂閱已訂閱已收藏
收藏點擊播報本文,約
![]() |
|
鄭南寧院士(左一)與團隊成員討論星表非結構化建模仿真系統技術細節。 |
![]() |
|
2026中關村論壇年會期間,北京中關村展示中心常設展上,一台配備了靈巧手的機器人在展示穿針引線。 |
習近平總書記指出,人工智能是世界經濟增長的新引擎和新舊動能轉換的加速器,正從“數字世界”走向“物理世界”。
“十五五”規劃綱要把具身智能列為未來產業之一。從實驗室走向生產線、再走向更復雜的行業場景,人工智能正在經歷一場重要轉變,發展為能夠在物理世界中持續交互、學習與進化的智能形態——具身智能。在人工智能重塑人類生產生活范式的今天,如何認識具身智能?具身智能怎樣影響未來?
本期“院士講科普·未來產業”邀請中國工程院院士、西安交通大學人工智能與機器人研究所所長鄭南寧,圍繞熱點問題進行解讀。
——編 者
人工智能的重要發展方向之一,是讓機器不僅能處理信息、推演復雜問題,也能在真實多變的環境中靈活完成各類任務。
從工業生產線上的精細操作,到復雜地形中的自主行走,再到展演環境中的動態運動……近年來,機器人頻繁出現在各種場景中。在這些能力背后,人工智能正在經歷一場重要轉變:從能夠“計算”走向能夠“行動”,並進一步發展為能夠在物理世界中持續交互、學習與進化的智能形態——具身智能。
需要明確的是,具身智能不等於人形機器人,人形只是載體之一。其關鍵在於智能系統能否真正進入真實環境,形成“感知—認知—決策—行動—反饋”的閉環,並在這一閉環中不斷調整自身行為,並通過學習改善內部模型和策略。因此,評價具身智能的標准,不在於形態是否“像人”,而在於是否能真正解決現實世界中的問題。
具身智能是什麼?
像嬰兒一樣認識世界
理解具身智能,一個最直觀的方式,是回到嬰兒認識世界的過程。
嬰兒不會先學習概念或語言,而是通過不斷觸摸、抓取、跌倒和重新嘗試來建立對世界的理解。嬰兒的認知並不脫離身體,而是在身體與環境的互動中逐步形成:視覺提供空間結構,觸覺提供物理反饋,運動經驗不斷修正對世界的預測。
智能並不是隻存在於“腦”中的計算過程,而是身體與環境相互作用的產物。因此,身體不只是執行指令的工具,更是認知系統的組成部分,參與感知、理解與行動的整個過程。這種“身體參與認知”的結構性特征,構成了具身智能的內涵。
一個具身智能系統通常由3部分構成:感知系統(視覺、觸覺、力覺等)負責獲取環境信息,決策系統負責形成理解與規劃,執行系統(機械臂、移動平台等物理實體)負責作用於物理世界。三者形成閉環,使系統能夠在行動中學習,而不是僅依賴離線數據訓練。
大語言模型代表的“數據驅動智能”與這一機制相比,有明顯差異。當前的大模型更像“書房中的智能體”,主要擅長語言生成與知識表達,但並不直接作用於物理世界。而真實世界具有高度不確定性,例如光照變化、遮擋干擾、材料差異與環境擾動,都要求系統具備持續適應能力。具身智能並不是對現有模型的簡單擴展,而是推動我們重新審視身體、行動與環境在智能形成中的作用。
具身智能並非今天才出現。我國1986年實施的國家高技術研究發展計劃(863計劃)中,自動化主題就已明確提出研制精密裝配機器人、水下作業機器人、復雜惡劣環境作業機器人,這些機器人都必須面對真實環境並完成閉環操作,它們正是早期具身智能的雛形。
近年來,隨著算法進步、算力提升以及多模態數據的豐富,這一方向才真正具備規模化工程實現條件。
能力如何進化?
從“看懂世界”到“改變世界”
具身智能要讓機器真正“進入世界並在世界中行動”,需要多種能力,可以從4個方面概括:
——世界模型的形成。系統需要在內部構建一個可模擬環境,使其能夠在行動之前預測與推演,從而評估不同決策可能帶來的結果。這種能力使智能系統從被動響應轉向具有前瞻性的主動決策。
——多模態表征能力。現實世界的信息來源具有高度異質性,包括視覺、語言、觸覺與聲音等多種形式。具身智能需要將這些信息整合到統一的語義空間,從而形成整體性理解。
——因果推理能力。當前大模型主要基於統計相關性進行學習,對因果結構的把握仍然有限。因此,模型作出的判斷有時在語言上看似合理,但在物理世界中並不成立。這也是人工智能幻覺的來源之一。具身智能必須進一步建立穩定的“動作—結果”的因果鏈條,才能在復雜環境中可靠運行。
——生成與行動一體化能力。隨著生成式人工智能的發展,逐步出現將視覺、語言與動作統一建模的端到端系統,使機器人能夠根據自然語言指令生成動作策略,並通過控制系統和執行機構付諸行動,再根據環境反饋持續修正。
在這一框架之下,當前系統仍然存在一定局限性:許多模型仍停留在單一信息域的處理階段,難以實現真正意義上的跨模態統一。因此,一個更具前沿性的方向正在形成,即推動“信息—物理—認知”三域融合建模,使智能系統逐步具備更接近人類的整體認知結構,從而形成對世界的深層理解,並支撐其在物理環境中的推理與行動閉環。這一方向也代表了具身智能向更高層次發展的重要路徑,但其實現仍面臨多方面挑戰:一是黑箱問題,模型決策過程的可解釋性不足﹔二是算力與部署矛盾,大模型難以在邊緣設備實時運行﹔三是產業生態尚未成熟,標准體系與接口規范仍處於演進階段。
與此同時,具身智能的發展還依賴兩大基礎條件:一是高質量多模態數據作為“燃料”,二是高逼真仿真環境作為“練兵場”。通過仿真訓練再遷移到真實世界已成為重要技術路徑,但如何縮小仿真與現實的差距,仍亟待解決。
怎樣影響未來?
從“實驗室”走向“應用場”
具身智能的價值,最終必須在現實應用中體現。
在工業制造領域,一個重要趨勢正在形成:智能系統正在從執行工具轉向意圖驅動系統。在這種系統中,工藝參數可以直接進入智能模型,用於分析生產過程中的優化空間﹔系統可以扮演“數字檢驗工程師”的角色,對產品質量進行實時監控,並參與生產調度﹔通過傳感器與數字孿生技術,整個生產過程可以在虛擬空間中同步映射,實現全流程可視化與可追溯。
當前,制造體系正在從單點自動化走向全流程閉環。這種結構性變化,本質上就是具身智能在工業體系中的落地形態。
在醫療與康復領域,智能系統正在成為醫生的重要輔助工具,參與微創手術、康復訓練等。在城市治理與公共安全中,無人機與地面機器人協同執行基礎設施巡檢任務,在橋梁、電網、管道等高風險環境中替代人工作業。在家庭場景中,具身智能逐步進入日常生活,承擔陪護、教育與基礎家政服務功能。在交通領域,自動駕駛系統通過感知環境、構建世界模型、進行路徑規劃並控制車輛運動,是當前最接近規模化應用的具身智能形態之一。
具身智能的本質,並不是讓機器“像人”,而是讓智能真正進入現實世界,在復雜、不確定環境中形成持續學習與適應能力。從數據驅動的大模型,再到面向物理世界的具身智能,人工智能正在經歷從符號世界、數據世界到真實世界的連續演化過程,從“看懂世界”進一步走向“在世界中成長”。
我國在具身智能領域已形成政策引導、技術突破與產業應用協同發展的良好格局,但在基礎理論、原始創新與開源生態方面仍需提升。具身智能作為高度交叉的前沿方向,需要長期投入與持續突破。面向未來,具身智能讓機器既“懂世界”又“能行動”,將深刻改變生產方式與生活方式,成為推動產業變革和社會發展的重要力量。
(作者為中國工程院院士、西安交通大學人工智能與機器人研究所所長,本報記者張丹華採訪整理)
《 人民日報 》( 2026年08月08日 05 版)
關注公眾號:人民網財經
分享讓更多人看到
- 評論
- 關注

































微信掃一掃


第一時間為您推送權威資訊
報道全球 傳播中國
關注人民網,傳播正能量