徐雷:從AI需求出發推進數據資源建設
222
訂閱已訂閱已收藏
收藏點擊播報本文,約
![]() |
| 上海市人工智能戰略咨詢專家委員會榮譽委員、上海交大講席教授、香港中文大學榮譽教授、歐洲科學院院士徐雷。人民網記者 翁奇羽攝 |
人民網自貢6月16日電 (記者焦磊)6月16日,由人民網·人民數據主辦的“2026人民數據大會”在四川省自貢市舉行。會上,上海市人工智能戰略咨詢專家委員會榮譽委員、上海交大講席教授、香港中文大學榮譽教授、歐洲科學院院士徐雷在主旨發言中表示,人工智能的發展與語言、文字和數據表達方式密切相關。推進數據資源建設和應用,應進一步從人工智能需求出發,重視中文數據特征、行業專業數據價值以及數據流通中的安全邊界。
徐雷表示,人類智能與語言文字關系緊密。與西方拼音文字逐步抽象為符號語言、數學語言並延伸至計算機語言不同,中文文字具有形象結構,一個字往往包含符號、內容和意義。這一特點對人工智能的數據表達和模型訓練具有啟發意義。
圍繞數據建設,徐雷表示,當前在處理中文數據時,往往會將文字轉化為編碼、token等形式,若能夠進一步考慮中文文字和中文語義結構特點,將其融入數據組織和模型處理過程,可能有助於提升人工智能訓練和應用效果。數據工作不能隻停留在傳統大數據思路上,還要關注數據能否支撐模型訓練、業務推理和實際任務落地。
“真正有價值的數據,是行業和專業的。”在徐雷看來,真正有價值的數據更多蘊含在行業和專業場景中。通用數據固然重要,但越往行業應用深入,專業數據越成為企業和行業的關鍵資源。
徐雷認為,推動數據要素流通和價值釋放,既要看到行業專業數據對人工智能發展的重要支撐作用,也要認識到相關數據在交易、共享和合作中的邊界。特別是在智能設備、機器人等可能持續採集真實環境數據的場景中,應更加重視數據採集、使用和流轉過程中的風險防范。
徐雷表示,面向人工智能發展新階段,數據建設應更加關注模型需求、場景需求和產業落地需求,在保障安全和權益的基礎上,推動高價值數據更好地服務人工智能創新發展。
關注公眾號:人民網財經
分享讓更多人看到
- 評論
- 關注
































微信掃一掃


第一時間為您推送權威資訊
報道全球 傳播中國
關注人民網,傳播正能量