黃宇凱:推動供需協同 建設高質量數據集
222
訂閱已訂閱已收藏
收藏點擊播報本文,約
![]() |
| 海天瑞聲CTO黃宇凱。人民網記者 翁奇羽攝 |
人民網自貢6月17日電 (記者焦磊)6月16日,由人民網主辦的2026人民數據大會在四川省自貢市舉行。海天瑞聲CTO黃宇凱在主旨發言中表示,高質量數據集是人工智能模型能力提升的重要基礎,推進高質量數據集建設,需要從總體規劃、工程化建設、質量評測和產業生態等方面協同發力。
黃宇凱表示,高質量數據集可直接用於開發和訓練人工智能模型,是能有效提升模型性能的數據集合,具有規模大、質量高、安全牢、觀點正、效果好、應用廣等核心特點,是大模型能力的基礎,也決定了模型能力的上限。
黃宇凱認為,高質量數據集建設應遵循“總體規劃、分步實施,先易后難、先簡后繁”的原則。他表示,數據是人工智能的關鍵基石,也關系企業和組織內部多部門、多系統協同,需要頂層設計和指導。
對於圍繞建設路徑,黃宇凱表示,高質量數據集建設需要從供給側和需求側兩個方向發力。從供給側看,應站在數據產品和數據服務角度,在數據生產、數據處理、數據供給等方面加大投入﹔從需求側看,則應站在人工智能賦能各行業、各場景落地的角度,以應用需求牽引數據建設、釋放數據價值。兩者之間,需要通過數據技術、數據服務和數據生態協同供需兩端,促進人工智能產業高質量發展。
可信數據空間建設與行業高質量數據集建設密切相關。對此,黃宇凱表示,圍繞國家數據局推進的可信數據空間,可以從個人、企業、行業、城市、跨境等不同層面展開,根據不同可信數據空間面向的應用場景,需要數據提供方、使用方、服務方、運營方和監管方等多方共同參與。
黃宇凱介紹,在文旅行業,海天瑞聲也在多個景區推動多模態伴游助手應用,利用景區文本、圖片、視頻等數據,結合具體應用場景打造文旅行業高質量數據集,推動導覽服務從被動響應向主動服務、從通用答案向深度體驗轉變。在數字人領域,圍繞直播帶貨、品牌宣傳、動畫游戲、文化推廣等不同場景,也存在文本、聲音、視頻等多模態定制化數據需求。
據介紹,海天瑞聲成立於2005年,長期專注於人工智能高質量數據集能力建設和產品服務,已累計形成1800多個數據集,服務全球超過1200家客戶。
黃宇凱表示,結合人才資源、數據資源和工程化、規模化智能平台能力,持續構建高質量數據集,將有助於人工智能更好賦能千行百業。
關注公眾號:人民網財經
分享讓更多人看到
- 評論
- 關注
































微信掃一掃


第一時間為您推送權威資訊
報道全球 傳播中國
關注人民網,傳播正能量