• 品牌聚焦
  • 品牌服务
  • 返回上一页

    科研需要AI,AI需要什么

    来源:光明日报    作者:崔兴毅    2026-10-10

    由中国科学院文献情报中心发起的语料创新生态联盟(以下简称“联盟”)近日在北京启动,语料标准规范、敖仓·语料社区服务平台及英文期刊Data Express in AI Corpus等成果同步发布。当日,敖仓·科技语料库分别与语料应用关键机构、国家人工智能应用中试基地签署合作协议。

    为什么要干这件事?

    答案不在语料本身,而在科研。

    当前,人工智能正在改变科研范式。从实验归纳、理论推演、计算模拟到数据驱动,再到AI与科学研究的深度融合(AI for Science,以下简称“AI4S”),科研越来越依赖大模型参与科学推理和知识发现。但大模型要“读懂”科学,靠的不是通用互联网数据,而是高质量科技语料。

    而问题,也由此产生。

    AI4S越深,为何越难绕过“语料关”

    科研需要AI,AI需要什么?

    联盟发起人、中国工程院院士孙凝晖开门见山:“智能的本质是数据的百炼成钢。大模型就是对互联网全量数据进行深度加工后的产物。但科技领域的语料不一样,它有科学语义、有物理约束、有误差信息,不是简单汇聚就能用的。”

    “与通用语料相比,科技语料来源更加多样、专业语义更加复杂,对科学准确性、知识密度、模态关联和可追溯性提出了更高要求。”中国科学院科技基础能力局局长卢方军进一步解释。

    现实瓶颈同样突显:高价值科技资源仍较分散,难以直接转化为高质量科技语料。

    “资源汇聚与授权机制有待完善,标准规范、专业加工、质量评价和安全流通能力仍需加强。”卢方军解释,科技语料连接原始科研资源与人工智能模型,是支撑模型训练、科学推理和知识发现的重要基础。

    可见,建设高质量科技语料,已经成为发展科学智能、提升人工智能专业能力的重要基础性工作。

    单一机构为什么难干成?卢方军直言:因为语料供给方、技术研发方和应用需求方之间,缺少紧密的协同机制。这些问题靠一家单位解决不了。

    往深一层看,竞争格局也在变。

    中国科学院文献情报中心党委书记李猛力判断,全球人工智能竞争正由单一技术和模型能力比拼,向模型、算力、数据与应用生态协同发展的综合竞争深化。

    由此可见,加快构建自主可控、开放协同、安全可信的语料创新生态,是夯实人工智能发展基础、支撑高水平科技自立自强的重要举措。

    2026年7月17日,世界人工智能大会上,由中国科学院牵头建设的敖仓·科技语料库正式发布。联盟的启动,正是从“建库”走向“建生态”的延伸——如果语料关不破,模型训练便缺“精粮”,科研任务便缺“接口”,产业落地便缺“可信链路”。

    迫切性,正在于此。

    分散的科技语料,如何形成合力

    建生态,不是简单地把机构名单拉在一起。资源如何汇聚?标准如何统一?利益如何分配?

    关键在“任务牵引”和“机制破题”。

    中国科学院文献情报中心主任曲建升表示,联盟将以任务为牵引,探索“共建、共享、共赢”协同模式。具体来说,就是成员以资源、能力、专业、场景四类投入参与共建。各自的资源、技术和应用需求,汇聚为联盟公共能力。再通过开放共享和能力反哺,共享语料工具、平台服务、共建成果与发展机会。

    据了解,首批50家共建单位覆盖国家实验室、科研院所、国家级科学数据与文献资源机构、地方政府、人工智能企业、数据基础设施企业、出版与知识服务机构、语料运营企业及投资机构。

    生态要协同,标准必须先行。

    目前已发布的五类42项科技语料标准,采用“指导层—体系层—操作层”三级架构,覆盖数据采集、加工处理、质量评价等全生命周期。

    据悉,根据计划,标准将率先依托联盟先行先用,再逐步上升为行业标准。

    标准立起来了,语料如何流动?这就需要一个承载规则的场所。

    一方面,平台负责承载。敖仓·语料社区服务平台将打通正式语料与社区语料双轨供给共享渠道,在统一规范、统一接口下对外服务。

    另一方面,期刊负责链接。联盟启动当天,Data Express in AI Corpus宣布创刊,该刊旨在聚焦人工智能语料理论创新、技术突破、应用成效,探索期刊、学术会议和语料资源平台协同发展的学术交流与资源服务生态。

    标准、平台、期刊三者协同,正是回答“谁供给、谁治理、谁使用、谁受益”。

    语料库建起来,如何真正用起来

    从“建起来”到“用起来”,至少还有几道坎。

    第一道坎,是开放与安全的平衡。科技语料涉及科研数据、知识产权和国家安全,既要开放共享,又要可信可控。

    多位专家坦言,标准规范、专业加工、质量评价和安全流通能力仍需加强。标准中的安全防护、开放协议、服务记账、应用成效评价能否落地,决定生态能否行稳致远。

    第二道坎,是标准与利益的协调。42项标准先行先用,再上升为行业标准,路径清晰。但不同机构、不同平台、不同领域能否愿意用、用得好?

    李猛力对此有清醒判断:协同,意味着利益必须重新分配。授权机制、激励机制和收益分配机制是否可持续,是绕不开的考题。

    第三道坎,是公共能力的反哺。成员以资源、能力、专业、场景投入共建,最终要形成公共能力并反哺成员。

    孙凝晖表示,联盟要推动科技语料资源和加工能力的基础设施化,建设国家高质量科技语料资源的战略保障基地、国家智能就绪语料集成服务的协同枢纽。

    如果只停留在资源汇聚,不能推动模型迭代、科研任务和产业场景验证,生态价值就难以充分释放。

    回答这些问题,仍要回到任务和场景。

    曲建升表示,下一步联盟将重点聚焦五大任务:联合共建高质量科技语料,推进智能就绪科技语料集成服务,深化国家科技语料基础设施协同建设,强化标准、质量与可信治理,开展AI4S模型与应用场景联合验证。

    的确,联盟成立只是开始。真正的考验,是把“生态”从愿景变成机制,从机制变成能力,从能力变成科研一线看得见、用得上的支撑。

    责编:王慧开
    分享到:
    ×

    微信扫一扫分享

    用微信扫二维码 · 分享给好友或朋友圈

    上一篇:数字技术守护耕地红线
    下一篇:没有了
      电子刊

    Copyright© 2012-2026 kjcxpp.com. All rights reserved.  
    京公网安备 11010802047559号
    京ICP备 09034215号-1

    电话:010-68457597  010-68455696