專家解讀 | 建設高質量科學數據集 推動科學研究范式創(chuàng)新
隨著重大科技基礎設施、科學觀測平臺、數字化實驗系統(tǒng)和行業(yè)科研平臺的不斷發(fā)展,科學數據正成為支撐科研創(chuàng)新的戰(zhàn)略資源。《全國數據資源調查報告(2025年)》(以下簡稱《報告》)顯示,2025年,全國年度數據生產總量達52.26澤字節(jié),同比增長27.28%;數據存儲總量達2.53澤字節(jié),同比增長21.05%。我國已經形成較大的數據資源基礎,但數據資源規(guī)模擴大并不等同于高質量數據供給能力自然形成,關鍵還在于能否把分散、異構、復雜的數據進一步轉化為可治理、可共享、可復用、可驗證的數據資源體系。
一、高質量科學數據集正在成為支撐科研突破的關鍵底座
傳統(tǒng)科研更多依賴理論推演、實驗驗證和經驗判斷。隨著科學儀器、觀測平臺和數字化實驗體系不斷發(fā)展,科研活動產生的數據規(guī)模持續(xù)擴大,數據類型也更加多樣,數據處理難度也不斷提升。《報告》顯示,本年度調查有效樣本數量4.25萬個,調查面向14類調查對象開展數據資源調查工作,有效樣本包括科研機構1259個、國家科學數據中心10個。科研機構和科學數據平臺已經成為全國數據資源體系中的重要組成部分。
與其他數據相比,科學數據往往來源于復雜儀器觀測、實驗過程記錄、遙感探測、生命健康研究和材料分析等場景,具有來源復雜、專業(yè)性強、噪聲水平高、結構類型多樣、驗證門檻高等鮮明特點,更強調專業(yè)語義、實驗條件、觀測背景、質量控制和可復現性。尤其在天文觀測、材料實驗、生命科學等領域,原始數據體量巨大、噪聲復雜、專業(yè)門檻高,只有經過校準、標注、關聯(lián)和質量控制,才能轉化為可用于人工智能和科學分析的高質量科學數據集。
二、我國推進科學數據資源建設具備多重基礎
一是數據資源供給規(guī)模持續(xù)擴大。《報告》顯示,2025年,全國云存儲總量為0.98澤字節(jié),同比增長53.13%,占數據存儲總量的38.74%;結構化數據存儲量為0.56澤字節(jié),同比增長43.59%,占數據存儲總量的22.13%;活躍數據總量為1.67澤字節(jié),同比增長28.46%。數據資源開發(fā)利用程度正在提升,也為科學數據進一步結構化治理、標準化管理和智能化分析提供了基礎條件。
二是重大科研平臺、科學數據基礎設施和應用場景持續(xù)豐富。當前,我國已在國家層面優(yōu)化整合20個國家科學數據中心,圍繞基礎學科、基因組、微生物等方向推進體系建設。重大科技基礎設施已成為高質量科學數據的重要來源。中國科學院重大科技基礎設施共享服務平臺集中了一批FAST 500米口徑球面射電望遠鏡、上海光源等典型設施,覆蓋天文支架、遙感測繪、先進材料等多個前沿方向。隨著科研任務向更高精度、更大范圍、更強實時性和交叉推進,科學數據的規(guī)模、類型和處理復雜度都在同步上升。
三是科學數據應用與轉化能力正在提升。《報告》指出,AI for Science推動科學數據創(chuàng)新涌現,并加速向產業(yè)轉化應用。從行業(yè)數據看,2025年科學研究和技術服務業(yè)領域數據生產量為1.96澤字節(jié),企業(yè)數據流通量為146.42艾字節(jié),同比增長33.15%,數據開發(fā)率為32.88%。從應用方向看,13.43%的科學數據用于人工智能訓練分析,同比增長50.32%,增速領先其他行業(yè);90%的科學數據服務于前沿研究和重大工程項目,10%的科學數據向產業(yè)、民生領域轉化應用。科學數據已經不只是科研過程中的記錄性資源,正在成為支撐前沿研究、重大工程的重要基礎。科學數據資源的開發(fā)利用正從單一主體、單一平臺、單一場景的模式,逐步向多主體協(xié)同、多場景復用轉變。科學數據集建設也應順應這一趨勢,在安全合規(guī)的前提下,推動跨機構、跨學科、跨場景的數據協(xié)同利用。
三、當前科學數據集建設仍面臨幾個突出問題
一是科學領域高質量數據集供給不足。原始科研數據數量較大,但可直接用于科學分析、模型訓練和科研復現的高質量數據集仍然不足。部分原始科研數據不能直接用于模型訓練、結果驗證和跨場景復用,仍需進一步經過校準、清洗、標注、關聯(lián)和質量評測。
二是科學數據集建設的專業(yè)門檻較高。科學數據通常涉及復雜的儀器條件、實驗參數、觀測環(huán)境、時空背景以及學科知識體系,不能簡單套用通用算法或一般數據加工流程,需要在數據清洗、標注、關聯(lián)、評測等環(huán)節(jié)充分納入領域知識和專業(yè)判斷。
三是跨機構共享和復用機制不夠順暢。科學數據分散在不同平臺、機構、項目和團隊之中,在標準規(guī)范、權益邊界、維護責任、成果歸屬和安全合規(guī)等方面仍存在協(xié)調成本。高質量科學數據集建設不是一次性工作,需覆蓋采集、治理、評測、共享、更新和反饋優(yōu)化的長期機制,推動更多科學數據轉化為可復用的科研公共能力。
四、以高質量科學數據體系支撐科學研究范式創(chuàng)新
一是面向科研任務建設。數據集建設要圍繞重大科學問題、重點科研平臺和關鍵應用場景展開,明確服務什么研究任務、支撐什么模型開發(fā)、覆蓋哪些核心變量、如何進行動態(tài)更新,避免脫離實際需求的低水平重復建設。只有面向任務組織數據,數據集才能真正轉化為科研生產力。
二是重視稀有數據建設。“稀有數據”(Rare Data)或“稀有事件”(Rare Events)猶如稀有金屬,應用價值高、存在稀缺性,是應用數學、統(tǒng)計物理和現代機器學習領域極其重要且具有深刻物理和數學內涵的概念。稀有數據通常指在總體數據分布中出現概率極低、樣本量極少,但往往決定系統(tǒng)穩(wěn)定性、安全邊界或核心物理相變的極端數據。建設專門鎖定此類臨界極限狀態(tài)的稀有數據中心,不僅是突破目前“AI for Science”分布外泛化瓶頸的基礎前提,更是關乎國家總體防災減災與復雜大系統(tǒng)治理底線安全的戰(zhàn)略剛需。該中心前置于物理表象、用數學法則在數據真空區(qū)預切出“稀有絕境數據”的能力,對傳統(tǒng)以收集為主的大數據中心顯著不同。在整體架構與長效運行層面,稀有科學數據中心將構建“異構匯聚、先驗生成、極限推演、對抗評測”四位一體的底座體系。硬件上融合高性能科學計算與智算集群,向下通過協(xié)議打通航空暗數據、事故災損報告與工業(yè)疲勞等跨行業(yè)的長尾孤島;向上則依托機理方程構建數字孿生試驗場。
三是標準先行、質量優(yōu)先。要圍繞數據來源、元數據描述、標注規(guī)范、校準流程、完整性、一致性、可追溯性和可復現性,加快建立科學數據集質量評價體系。對重點領域、重點裝置、重點平臺形成的數據集,可探索第三方評測、質量認證和動態(tài)迭代機制,提高數據集的可信度和可用性。
四是人機協(xié)同提升效率。要充分利用大模型、多模態(tài)識別、知識抽取、智能標注等新工具,提升科學數據清洗、關聯(lián)、分類、審核和結構化處理效率;同時,對于專業(yè)性強、解釋要求高、影響科研結論可靠性的關鍵環(huán)節(jié),必須強化科研人員和領域專家參與,形成技術處理與專業(yè)校核相結合的數據治理機制,提高數據治理效率與科學嚴謹性。
五是開放共享與安全合規(guī)并重。報告顯示,科學數據仍以本地化存儲為主,在集中管理、彈性調用、跨機構共享和規(guī)模化利用方面還有提升空間。應進一步完善數據授權使用、收益分配、責任認定、合規(guī)審查和全過程審計機制,推動科研機構、平臺企業(yè)和行業(yè)主體在安全前提下有序開展數據流通和協(xié)同創(chuàng)新,使更多高價值科學數據轉化為可持續(xù)服務科研創(chuàng)新的公共能力。
總的來看,高質量科學數據集建設并非單一的數據整理工作,而是關系科研組織方式、知識發(fā)現路徑和協(xié)同效率的基礎性工程。我國已具備數據資源、重大科研平臺和政策推進基礎,關鍵是提升科學數據的規(guī)范治理、質量評測、共享復用和持續(xù)服務能力。應以重大科研任務為牽引,以建設高質量科學數據集為抓手,推動數據治理、科研應用、模型訓練和反饋優(yōu)化形成良性循環(huán),更好支撐科研范式創(chuàng)新和原創(chuàng)發(fā)現能力提升。

