编者按
人工智能的竞争,归根结底是数据的竞争。国家数据局近期发布政策,将高质量数据集建设提上日程。在这场关乎未来的数据竞赛中,丰台区并非旁观者。落户丰台的八月瓜科技,深耕专利数据服务多年,已构建起规模逾26亿条的数据体系,入选北京市行业高质量数据集典型案例。一家丰台企业如何站上人工智能数据基础设施的风口?本报今日聚焦,敬请关注。
当下,人工智能的“燃料”够用吗?国家数据局发布《关于推进行业高质量数据集建设行动的实施方案》(以下简称《实施方案》)指出行业高质量数据集是推动“人工智能+”赋能千行百业、实现产业落地的基础性、关键性资源。值得注意的是,国务院《关于深入实施“人工智能+”行动的意见》将“人工智能+科学技术”列为六大重点行动之首,国家数据局《实施方案》同样将科学研究放在首位。两份政策文件同时释放出一个清晰信号:高质量数据是AI赋能科学研究的关键基础。
被低估的专利数据富矿
赛智产业研究院人工智能研究所所长安赟指出,人工智能正在从通用对话和内容生成向智能体、科学智能、具身智能和世界模型等方向演进,对行业数据的专业性、结构性、场景性和可验证性提出了更高的要求。
在众多数据资源中,专利数据的价值或被低估。据北京八月瓜科技有限公司董事长李长青介绍,“专利兼具技术属性与法律属性,其核心在于‘公开换保护’,要求发明人充分披露技术细节——比如医药领域的化合物结构式与制备方法、新材料领域的组分与合成工艺、高端芯片制造领域的薄膜沉积与光刻技术方案等——以换取法定期限内的独占权。”据世界知识产权组织2025年12月发布的年度《世界知识产权指标》报告,2024年全球专利申请量为372.5万件,覆盖了绝大多数技术创新信息。
“AI可信语料核心在于来源、质量、应用三重可信,知识产权数据正是天然优质语料,堪称科技创新‘浓缩铀’,是训练专业领域大模型的优质‘燃料’。”北京八月瓜科技有限公司联席CEO、合伙人孙鹏说。
然而,这座“富矿”的开采并不容易。中国信息通信研究院副院长魏亮曾指出,不同单位数据集格式、标注规范相互割裂,难以共享复用。
高质量数据集建设的系统工程
如何把海量专利数据变成真正可用的AI“燃料”?八月瓜科技的实践提供了观察样本。这家国家级专精特新“小巨人”企业,依托国家知识产权局全量专利数据,构建起汇集专利、诉讼、商标、文献、工商等多类数据、总规模逾26亿的数据体系。
据孙鹏介绍,公司采取垂直领域聚焦策略,重点布局新材料、生物医药、化学化工三大行业,每个细分领域均配备专业团队深度处理。数据来源覆盖全球178个国家和地区的超2亿专利数据,标注过程采用“机器+专家”两级模式,确保上下文理解准确,避免因误标导致模型训练失效。
据测算,单篇专利从原始文件到高质量标注数据集的全流程处理成本投入巨大,涵盖数据清洗、去重、无效与失效专利筛除、多维度标引、结构化处理及知识图谱构建等环节,非一般企业所能承受。正是这种高投入构筑了专业壁垒。
目前,八月瓜已形成“多语言专利文本平行语料库”和“外观专利图文库”两项数据集成果,入选北京市行业高质量数据集典型案例。据企业介绍,其已累计服务超10000家科技企业。
数据价值的落地验证
高质量数据集的真正价值,最终通过解决产业实际问题来检验。据了解,一家传统钢铁企业曾通过专利数据库检索分析全球合金配方相关专利,在未增加成本的情况下优化工艺,产品性能反超原有技术,实现转型升级。
在资本决策场景中,专利数据正发挥“预警雷达”功能。李长青透露,曾有某制造企业因未做专利前置排查,产品投产后被判赔偿数亿元,凸显了数据审查在决策支撑中的关键价值。
从技术研发到资本决策,从风险规避到竞争态势研判,专利数据库与智能化分析平台正帮助企业将碎片化的专利信息转化为可执行的决策依据——这正是数据从“可用”走向“好用”的价值跃迁。(原文刊载于央广网)