人民網
人民網>>經濟·科技

中國科學院“敖倉·科技語料庫”發布

2026年07月17日16:55 | 來源:人民網222
訂閱已訂閱已收藏收藏小字號

點擊播報本文,約

人民網北京7月17日電 (記者趙竹青)320PB科學數據、1.5億篇科技論文、1.2億件發明專利……這些海量高價值知識經過精煉加工,如今匯聚於一座數字時代的“國家糧倉”。7月17日,在2026世界人工智能大會(WAIC)開幕當日,中國科學院“敖倉·科技語料庫”正式發布,標志著我國支撐人工智能高質量發展的新型基礎設施建設邁出關鍵一步。

人工智能賦能科學研究(AI4S)正在引領新一輪科研范式變革,其發展高度依賴於科技語料的有效供給。科技語料是對科學研究活動中產生的多模態科學數據與科技文獻等進行清洗整編、解構重組、關聯融合,提升語義密度與知識含量后形成的高價值智能就緒數據。由於數據模態多、知識密度大、質量要求高、加工治理難等特點,科技語料建設具有較高的門檻與壁壘。

“中國科學院率先行動,主動作為,在人工智能蓬勃發展的今天,牽頭建設敖倉‘科技語料庫’,體現了國家戰略科技力量主力軍服務國家重大戰略需求、引領全球科研范式變革的使命擔當。”中國科學院文獻情報中心主任曲建升表示。

該語料庫由中國科學院文獻情報中心牽頭,聯合國內科學數據、科技文獻領域內近百家優勢單位和覆蓋全學科領域專家共同建設。以數據供給為例,其來源就覆蓋超過320PB的科學數據、1.5億篇科技論文、1.2億件發明專利和500萬本科技圖書的嚴謹知識,覆蓋文本、圖像、圖表、公式、影像、化學式、波、譜、場等多種數據形態。

目前,敖倉構建了“1+7+N”總分庫模式,即1個全學科數據知識融合的國家級總庫、7個專業化深度提煉的領域分庫與N個場景化關聯的應用子庫,通過建設科技語料描述、加工、評價、服務及運維的全流程標准,形成了數學物理、化學化工、天文空間、地球科學、生命科學、前沿技術、產業創新等全學科覆蓋的內容就緒、計算就緒、可信就緒科技語料供給體系。

同時,團隊創造性地提出基礎語料、特征語料、知識語料三階知識精煉模式,大幅提升語義密度和知識密度。曲建升介紹,“敖倉中高知識含量、高語義密度的語料,可以補齊大模型領域知識短板、校准邏輯推理偏差,使其輸出符合科學基本規律與數理邏輯,具備領域專業知識與長程思考能力,提升多模態理解和跨領域交叉能力。”

秉持“場景驅動、邊建邊用”的理念,“敖倉”以賦能科學研究、人工智能應用與產業創新為核心使命,諸多場景服務成效已經顯現。面向科學發現場景,相關語料已多批次供給磐石科學基礎大模型,助力其科學推理能力顯著提升,並向智能化工等多領域學科模型按需供給﹔面向智能應用場景,正啟動對豆包、千問等通用大模型及科大訊飛等領域應用大模型的語料供給,並已開始為螞蟻醫療大模型提供支撐,助力其為醫患提供更為嚴謹規范的科學輸出﹔面向產業創新場景,正針對商業航天、低空經濟、智能制造、生物醫藥等領域開展語料加工服務,下一步將支撐元器件選型、超微病理診斷、高速列車外形設計等百余個行業應用。

“敖倉的建成對筑牢國家人工智能發展數據底座、實現高水平科技自立自強,具備不可替代的基礎性、戰略性價值。”曲建升說。未來,“敖倉”將持續為用戶提供更科學嚴謹、更智慧專業、更靈活適配、更規范可信的語料服務,全面賦能我國人工智能產業與科技創新的高質量發展。

(責編:趙竹青、高雷)
關注公眾號:人民網財經關注公眾號:人民網財經

分享讓更多人看到

推薦閱讀
返回頂部